
语料口径GeoAI 与 GEOINT 定义来自论文和法条。四条技术路径及四条约束来自会议、预印本和两个专题的综合。四条约束是本文归纳不是某篇论文提出的现成分类。方法细节只沿用已核实内容缺失的基座、训练阶段、数据或开放状态不作推断。结论地理空间智能多了地球参照也多了四类工程约束地理空间智能不是把普通照片换成卫星图。它要求空间结果显式挂到地球参照系并处理四类会改变方法设计的约束局部坐标必须通过地理配准变成绝对坐标尺度从米到全球像素分辨率具有地面物理含义光学、光谱、SAR、矢量、轨迹、地名等数据不能按 RGB 图像统一处理确定性 GIS 与路网算法已经能精确计算大量空间关系模型需要与这些工具分工。公开工作由此形成四条主要路径地理空间基础模型、遥感多模态大模型、地理智能体与工具编排、跨视角定位与地理配准。它们分别强化表征、推理、行动和地理锚定。一、两个来源不同的定义GeoAI位置必须在模型中实际起作用Janowicz、Gao、McKenzie、Hu 与 Bhaduri 把 GeoAI 定义为空间数据科学的一个子领域。[1] 它用人工智能技术与数据实践支持地理知识发现以及下游方法、系统和服务。其关键限定是spatially explicit即“空间显式”。一个训练样本碰巧带有坐标不足以说明模型是空间显式位置要进入特征、关系、约束或评价并对输出发生作用。例如同一分类器在不同地区直接使用坐标先验需要说明坐标如何编码、是否造成地域偏差、离开训练区能否迁移。GEOINT分析带地理参照的地物与活动美国法典第 10 篇第 467 条把 geospatial intelligence 定义为对影像与地理空间信息的开发和分析。[2] 其用途是描述、评估和可视化地球上或近地的物理地物及有地理参照的活动。它包括影像影像情报即从影像提取的技术与地理解译地理空间信息即标识自然与人工地物位置和特征的数据与产品包括遥感、制图和测量来源。GeoAI 是学术方法范围GEOINT 是情报与测绘业务的法定范围。两者不能混成同一学科史但共同要求输出具有地理参照。本文所说的确定性 GIS 工具主要指 PostGIS 的空间数据库运算与 GDAL 的栅格、矢量和坐标转换能力。[3]二、四条技术路径分别解决哪一层问题地理空间智能地理空间基础模型多源观测 → 通用表征遥感多模态大模型影像 指令 → 可核验回答地理智能体问题 → GIS 工具链 → 结果定位与配准局部观测 → 地球坐标表征感知与推理行动地理锚定接口路径一地理空间基础模型压缩多源地球观测问题。用海量、少标注或无标注地球观测预训练通用编码器使分类、回归或分割任务能用较少标注适配。数据。光学与多光谱影像是主流部分模型加入时间、高程、雷达、激光雷达、气候或文本。不同工作不能仅按参数量比较因为输入模态、覆盖区域和下游任务不同。特点。产出可能是可下载模型也可能是预先计算好的全球嵌入产品。二者的复现门槛与下游接口不同。代表工作按原文信息列出SatMAE纯视觉地球观测基础模型在时间序列或多光谱卫星影像上以掩码自编码器做自监督预训练即随机遮挡图像块再重建。论文评测土地覆盖分类与语义分割代码和数据入口已公开。[4]Prithvi-EO-2.0基于视觉 Transformer 的掩码自编码器用三维图块和位置嵌入支持时空输入。[5] 它在 NASA HLS 档案上以 30 米分辨率预训练使用约 420 万条全球时间序列样本。论文提供 3 亿与 6 亿参数版本6 亿版在 GEO-Bench 上比前代平均高 8%。模型与代码通过 Hugging Face、TerraTorch 和 GitHub 开放。AlphaEarth Foundations多源地球表征模型公开产品是全球陆表约 10 米像元、每年一层的 64 维向量图层覆盖 2017—2024 年。[6] 输入包括光学、雷达、激光雷达、环境变量、已有标注和地理编码文本。论文在 15 项映射评测上报告无需针对每项任务重训编码器即可优于所列常用特征方法平均误差约低四分之一。这里的数字属于论文自报结果。OlmoEarthAi2 开放模型、代码、训练数据与应用平台的地球观测基础模型。[7] 原 09 记录其在 29 个任务中 19 个最优该计数来自当时版本后续版本结果需另行核对。这条路径的边界是通用表征能支持下游分类、回归、分割或检索不因此自动获得多步推理、工具行动或状态预测能力。路径二遥感多模态大模型把每步推理接到可核验依据问题。让模型依据遥感影像回答开放问题同时减少只靠文字先验或生成式答案造成的不可验证结果。数据。光学、多光谱、SAR 等遥感影像与语言问答、像素掩码或程序可计算的几何答案。特点。原语料中的四类做法都把中间步骤接到可计算对象GeoX程序验证奖励。单个多模态策略交替提出和解答由可执行程序表示的空间问题。[8] 面积、质心、距离等答案由程序执行得到不交给另一个大模型判分。论文报告以 LLaVA 和 Qwen 系列为基座通过强化学习联合优化提问者与求解者。RSGround-R1位置稠密奖励。先用合成推理数据做思维链监督微调再用带连续距离反馈的位置奖励做强化微调。[9]G-DRAGON约束地名检索与导航。系统用轻量语言模型生成式检索本地、版本化的 OSM 实体并以合法实体约束输出随后连接全局路径规划、SLAM 与末端探索。[10] 它不是单纯的遥感问答模型。TerraScope像素接地。模型在推理链生成[SEG]符号再由分割解码器产生掩码并把掩码信息送回语言推理。[11] 它同时支持光学、SAR 和多时相输入Terra-CoT 含约 100 万个带像素掩码的推理样本。四项工作分别约束奖励、位置、输出词表和像素证据。它们不能被合并成同一种训练方法但都在回答“答案如何核验”。路径三地理智能体把自然语言问题编排成确定性工具调用共同问题。把需要投影、空间连接、缓冲区、方向角、路网或真实环境 API 的任务分解成工具步骤并依据返回结果继续推理。工具身份。工具可以是 PostGIS、GDAL、检索、监督感知模型或环境数据 API模型主要负责理解请求、选择工具和编排参数。工具是外部确定性或受控模块不应把其计算结果记为基础模型参数内部能力。两个基准给出不同层面的证据GS-QA[12]解决什么问题检验模型能否联合处理地点锚定、距离与方向约束。具体做法基于 OSM 与 Wikipedia 构建 2,800 道题、28 个模板。代表题是“加州大学河滨分校往洛杉矶机场方向 50 公里内有哪些四星酒店”需要锚定坐标、范围查询并按方向角过滤。效果与补充实验记录 ChatGPT 忽略方向谓词把方向改成相反方向时答案不变。评测用相对距离与角度误差不用大模型裁判。加州大学河滨分校 Majid Saeedan 等合作者含 Ahmed Eldawy原文未给代码链接。GeoNatureAgent Benchmark[13]解决什么问题测量智能体能否编排真实环境地理 API并在不可解任务上拒绝生成结果。具体做法93 个环境地理分析任务ReAct 循环调用 16 个自托管 API设置 7 个只能显示不能统计的图层作为幻觉陷阱并加入不存在市镇等不可解任务。效果与补充Claude Sonnet 4 为 60.8% ± 0.8%论文报告该基准比所对照的通用 GIS 基准低 25—35 个百分点。近值比较任务为 0%。代码、评测框架与自托管 API 公开。路径四跨视角定位与地理配准把局部结果接到经纬度共同问题。从地面照片、无人机图像、街景或局部三维重建中确定地球坐标使结果能与卫星底图、OSM 或其他地理图层叠加。两种主要做法。几何路线用重建、天顶渲染和底图配准推理路线用视觉线索和地理知识逐级缩小候选位置。Wrivinder[14]解决什么问题从无序地面照片估计每张照片的 GPS且不依赖成对训练数据。具体做法用 SfM 与三维高斯泼溅重建场景渲染天顶视图再与卫星底图配准并反推照片坐标。效果与补充原文记录误差优于 30 米MC-Sat 数据集含 15 个场景、约 2 万张图代码与数据注明评审后发布。Mayachitra 与约翰霍普金斯大学作者含 Rama ChellappaCVPR 2026。原文未记录基座和完整训练身份。GeoAgent[15]解决什么问题从单张或少量地面图像中的建筑、文字和自然线索逐级确定位置。具体做法用地理专家和 GeoGuessr 高手的真实推理链训练模型例如“建筑形式 → 国家 → 地区 → 村庄”只微调 1.91% 参数。效果与补充原文记为当时基准最优但未在该节记录基座、训练集规模、具体分数、作者机构和代码地址本文不补写。几何路线提供连续坐标误差推理路线提供候选位置或语言推理链二者的评测单位不同。三、四条地理约束如何改变解法约束一绝对坐标需要地理配准VGGT 的结果位于局部坐标系。[16] DVGT 输出第一帧自车坐标系下的米制几何。[17] 两者都不自动等于经纬度。地理配准建立局部几何与地球参照系之间的变换之后结果才能与卫星影像、OSM 或行政区叠加。多视图图像相对局部坐标米制局部坐标地理配准经纬度或投影坐标可与地图图层叠加这一步是普通室内三维基准经常不考、地理系统不能省略的接口。约束二尺度跨度和地面分辨率具有物理含义地理任务从米级目标到公里级图幅再到全球覆盖。地面采样距离表示一个像素对应多少米缩放会同时改变目标像素占比和可辨识物理尺度。GeoViS 和 ZoomEarth 因此把超大影像定位改造成主动搜索GeoViS用 Qwen2.5-VL-3B 同时承担奖励评估、缩放动作选择和最终定位并以蒙特卡洛树搜索选择动作。[18] 每条查询进行 10 次模拟。DIOR-RSVG 上 Pr0.5 为 79.8%与表中通用多模态模型相比差距接近 30 个百分点。ZoomEarth针对超大图上预测框与真值框早期几乎无重叠的问题使用区域引导的稠密奖励训练主动裁剪与缩放策略。[19] 论文采用监督微调和 GRPO并在自建 LRS-GRO 与三个公开超高分辨率基准上评测。它们说明大图“看目标”实际包含搜索策略不能直接照搬单张固定分辨率图像的定位方法。约束三数据形态的物理机制不同地理数据至少包括光学、多光谱与高光谱、SAR、矢量地图、轨迹和地名文本。SAR 是合成孔径雷达主动发射微波并利用相干回波成像能穿云且不依赖日照它的像素统计与光学照片不同。Mai 等人 2023 年在四个子领域评测七项任务。[20] 任务包括地名与位置描述识别以及州级和县级痴呆症时间序列预测。其余任务是基于 POI 的城市功能分类、基于街景的城市噪声强度分类和遥感场景分类。输入包含文本、时间序列、POI、街景和卫星图说明“统一输入”本身就是问题。FUSAR-GPT 给出传感器差异的具体证据。[21] 论文指出光学预训练视觉语言模型迁移到 SAR 时会受相干成像、散射特征和文本数据不足影响。它将 AlphaEarth 时空特征按位置与年份嵌入视觉骨干并采用两阶段监督微调。原 09 记录检测 F1 从 47.1% 升至 74.8%Qwen3-VL-4B 为 45.5%8B 为 41.4%。这些数字只说明该实验设置下参数量增加未带来更高结果。约束四确定性 GIS 已能精确计算大量问题多边形相交、投影变换、最短路径、缓冲区和方向角都有成熟算法。若大模型近似生成这些数值会把可避免的误差带入系统更合适的分工是让模型解析意图、选择数据与工具让确定性程序计算再让模型解释结果。这并不表示工具编排已经解决。GS-QA 证明方向谓词可被忽略GeoNatureAgent 证明真实 API 的比较任务和不可解任务仍困难。评测必须同时检查选了什么工具、参数是否正确、调用顺序是否正确、结果是否与工具返回一致以及不可解时是否拒绝。四、为什么室内方法不能直接迁移原语料提供三组相互补充的佐证任务证据OpenBench 报告室内基准上的优势未稳定迁移到开放世界运动与度量任务表现下降。[22]方法证据室内研究常在固定房间尺度、相对坐标和 RGB 视频上训练地理工作必须加入配准、地面分辨率、多源传感器和超大图搜索。语料证据原《00 总览篇》观察到室内与地理尺度论文的相互引用和方法迁移较少两个社群的训练方法没有形成稳定交叉。这三组证据的范围不同OpenBench 是实验结果四条约束是本系列归纳引用分离是限定语料内的观察。它们共同支持“地理空间智能不是换数据集”但不能推成“所有室内方法都无法迁移”。几何前端、视觉编码器和强化学习仍可迁移只是需要补地理接口并重新验证。五、四条约束与四条路径的对应地理约束主要受影响路径典型应对绝对坐标与配准跨视角定位、几何模型底图配准、地标锚定、坐标变换尺度与地面分辨率遥感多模态、基础模型多尺度输入、主动缩放、覆盖区采样多源数据物理差异基础模型、遥感多模态传感器专用编码、按时空位置融合确定性 GIS 工具地理智能体、可核验推理约束解码、程序判分、外部工具编排对应关系不是一对一。基础模型也要地理配准智能体也要理解尺度表格只标最直接的技术反应。小结地理空间智能的共同判据是空间结果具有地理参照。四条技术路径分别解决通用表征、可核验推理、工具行动和地理锚定。四条约束说明普通视觉或室内空间方法迁移时需要补哪些接口。总关系见《00 概览篇》空间能力层见《02 空间智能篇》。参考文献[1] Janowicz, K.; Gao, S.; McKenzie, G.; Hu, Y.; Bhaduri, B.GeoAI: spatially explicit artificial intelligence techniques for geographic knowledge discovery and beyond. 2020. https://geography.wisc.edu/geods/wp-content/uploads/sites/28/2022/05/2020_IJGIS_GeoAI_editorial.pdf。[2] U.S. House of Representatives.10 U.S.C. §467: Definitions. 现行法条页面. https://uscode.house.gov/view.xhtml?reqgranuleid%3AUSC-prelim-title10-section467num0editionprelim。[3] PostGIS Project; GDAL/OGR Contributors.PostGIS DocumentationGDAL Documentation. 持续更新. https://postgis.net/documentation/https://gdal.org/。[4] Cong, Y. et al.SatMAE: Pre-training Transformers for Temporal and Multi-Spectral Satellite Imagery. 2022. https://arxiv.org/abs/2207.08051项目https://sustainlab-group.github.io/SatMAE/。[5] Szwarcman, D. et al.Prithvi-EO-2.0: A Versatile Multi-Temporal Foundation Model for Earth Observation Applications. 2024. https://arxiv.org/abs/2412.02732代码https://github.com/NASA-IMPACT/Prithvi-EO-2.0。[6] Brown, C. F. et al.AlphaEarth Foundations: An embedding field model for accurate and efficient global mapping from sparse label data. 2025. https://arxiv.org/abs/2507.22291。[7] Allen Institute for AI.Introducing OlmoEarth Platform: Powerful open infrastructure for planetary insights. 2025. https://allenai.org/blog/olmoearth模型入口https://allenai.org/olmoearth。[8] Ahn, K.; Lee, S.; Gummadi, K. P.; Cha, M.GeoX: Mastering Geospatial Reasoning Through Self-Play and Verifiable Rewards. 2026. https://arxiv.org/abs/2605.20006。[9] Huang, S.; He, S.; Wen, B.RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning. 2026. https://arxiv.org/abs/2601.21634。[10] Wang, D. et al.G-DRAGON: Geospatial Reasoning and Dynamic Planning for Retrieval-Augmented Outdoor Navigation. 2026. https://arxiv.org/abs/2605.25646。[11] Shu, Y. et al.TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation. 2026. https://arxiv.org/abs/2603.19039。[12] Saeedan, M.; Rashid, M. S.; Eldawy, A.; Hristidis, V.GS-QA: A Benchmark for Geospatial Question Answering. 2026. https://arxiv.org/abs/2605.22811。[13] Diaz-Ireland, G. et al.GeoNatureAgent Benchmark: Benchmarking LLM Agents for Environmental Geospatial Analysis. 2026. https://arxiv.org/abs/2606.12821代码https://github.com/gabrielireland/GeoNatureAgent_Benchmark。[14] Gudavalli, C. et al.Wrivinder: Towards Spatial Intelligence for Geo-locating Ground Images onto Satellite Imagery. 2026. https://arxiv.org/abs/2602.14929。[15] Jin, Y. et al.GeoAgent: Learning to Geolocate Everywhere with Reinforced Geographic Characteristics. 2026. https://arxiv.org/abs/2602.12617代码https://github.com/HVision-NKU/GeoAgent。[16] Wang, J. et al.VGGT: Visual Geometry Grounded Transformer. 2025. https://arxiv.org/abs/2503.11651。[17] Zuo, S. et al.DVGT: Driving Visual Geometry Transformer. 2026. https://arxiv.org/abs/2512.16919。[18] Zhang, J. et al.GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding. 2026. https://openaccess.thecvf.com/content/CVPR2026/papers/Zhang_GeoViS_Geospatially_Rewarded_Visual_Search_for_Remote_Sensing_Visual_Grounding_CVPR_2026_paper.pdf。[19] Liu, R. et al.ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks. 2025. https://arxiv.org/abs/2511.12267。[20] Mai, G. et al.On the Opportunities and Challenges of Foundation Models for Geospatial Artificial Intelligence. 2023. https://arxiv.org/abs/2304.06798。[21] Zhang, X. et al.FUSAR-GPT: A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery. 2026. https://arxiv.org/abs/2602.19190。[22] Wu, M. et al.From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs. 2025. https://arxiv.org/abs/2512.19683。