Subnational Geocoding of Global Disasters Using Large Language Models

发布时间:2026/7/21 9:01:42

Subnational Geocoding of Global Disasters Using Large Language Models 一、文章主要内容总结该研究聚焦全球灾害数据的国家级以下地理编码问题,针对EM-DAT等灾害数据库中位置信息多为非结构化文本、粒度不一致、拼写不规范等痛点,提出了一种基于大型语言模型(LLM)的全自动地理编码工作流。核心流程包括四步:1)利用GPT-4o解析EM-DAT中的自由文本位置信息,转化为层级化JSON结构(区分Admin1/2/3三级行政单位);2)通过GADM、OpenStreetMap、Wikidata三个独立地理信息源并行地理编码,生成候选几何图形;3)跨源校验一致性,计算可靠性评分(0-4分,反映多源数据吻合度);4)将所有候选几何图形统一映射到GADM行政框架,形成标准化空间表示。研究应用该工作流处理了2000-2024年EM-DAT的15404条有效记录,成功地理编码14215条(覆盖率92%),涵盖17948个独特位置、31种灾害类型,构建了开源数据集LLM-GeoDis。通过与手动地理编码的EM-DAT GAUL数据集及半自动化的GDIS数据集对比,验证了方法的可靠性——超过97%的地理编码单元与基准数据集存在重叠,多源一致性评分较高,且在不同地区、灾害类型中无明显偏差。二、文章创新点首个LLM驱动的全自动化灾害地理编码方案:无需人工干预,首次将LLM(GPT-4o)应用于全球灾害数据的国家级以下地理编码,解决了传统方法依赖手动校对、效率低、覆盖不全的问题。多源交叉验证与可靠性量化:整合GADM、OpenStreetMap、Wikidata三个独立数据源,通过空间重叠度、包含关系等指标计

相关新闻