ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

LongEarth-R1: 为长时域对地观测推理进行视觉-语言模型的基准测试与对齐

LongEarth-R1: 为长时域对地观测推理进行视觉-语言模型的基准测试与对齐 大家读完有帮助记得关注和点赞摘要长时域对地观测推理要求模型组织多阶段地理演变、定位空间变化、检测时间异常并从扩展的图像序列中推断未来。然而现有的遥感视觉-语言模型主要关注单张图像、图像对或短序列限制了在相关帧和区域中的可靠定位。我们介绍了 LongEarth-Bench一个包含约 12 万个问答样本的基准数据集这些样本源自 11.7 万张独特图像。其序列平均长度为 15.14 帧最长可达 30 帧涵盖了跨演变总结、空间推理、异常识别和逻辑预测的 12 项任务。一个包含 3 万个样本的子集进一步提供了结构化的推理轨迹将关键帧和变化区域与最终答案联系起来。我们通过使用显式序列标识符和结构化的思维链监督进行监督微调开发了 LongEarth。在此基础上LongEarth-R1 应用了带有格式、时间和空间奖励的组相对策略优化。LongEarth-R1 在所有 12 项长序列任务上均取得了最佳结果同时在标准的遥感基准测试上保持了竞争力。引言遥感分析正日益超越孤立观测转向理解地理区域如何随时间演变Weng, Pang, and Xia 2025。随着高重访周期对地观测图像日益普及现在可以观测诸如城市建设、灾害演变和生态系统恢复等多阶段过程Liu et al. 2026a; Irvin et al. 2025; Jain et al. 2026。例如给定洪水前、洪水中和洪水后的观测图像模型应识别其爆发和受影响区域追踪其演变并推断恢复阶段。这不仅需要成对的变化检测模型必须恢复一个时间轨迹定位支撑帧和区域并将地理演变与季节性和采集引起的变化区分开来Li et al. 2024; Soni et al. 2025; Luo et al. 2026。我们将这种能力称为长时域对地观测推理从扩展的对地观测序列中推理多阶段地理演变。最近的遥感视觉-语言模型已逐步将语言引导的解释从单次观测扩展到图像对和时间序列。单时相模型通过图像描述、视觉问答和视觉定位将单次观测与语言联系起来Zhang et al. 2024a; Hu et al. 2025。双时相模型进一步比较成对观测以描述和定位地理变化Yang et al. 2025; Liu et al. 2024a。更新的时间序列遥感视觉语言模型接受多次观测并支持序列级对话或变化理解Irvin et al. 2025; Soni et al. 2025; Xuan et al. 2025。然而这些能力仍不足以进行长时域推理。单张图像不包含演变轨迹图像对主要暴露变化的端点而当前的序列模型通常强调识别或描述性问答而非重构完整的多阶段过程。因此它们在追踪关键转变、在帧和区域间定位结论以及推断演变过程可能如何继续方面仍然受限。为解决这些局限我们将长时域对地观测推理定义为对扩展序列的推理。这种能力要求模型识别地理实体如何演变定位和表征它们的变化评估观测到的演变在时间上是否一致并推断未观测到的状态。因此我们将其组织为四个递进的认知维度1演变总结将主要阶段组织成连贯的时间轨迹2空间推理定位变化并建模其演变的空间关系3异常识别检测时间顺序违反、重复和上下文干扰4逻辑预测从累积证据中推断后续或缺失状态。图 1(a) 通过 12 个细粒度任务说明了这一层级。基于这四个认知维度我们构建了 LongEarth-Bench一个大规模的长时域遥感时空推理基准。它包含约 12 万个问答样本源自 11.7 万张图像平均序列长度为 15.14 帧。该基准涵盖了多样的地理区域、土地覆盖类别、时间跨度、变化率和多阶段过程。其问答样本基于分割注释、几何关系和时间变化轨迹生成。此外3 万个样本包含结构化的推理注释连接帧选择、时间定位、空间证据和最终结论。图 1(b) 根据平均序列长度和对四个认知维度的覆盖范围比较了 LongEarth-Bench 与现有基准。图1LongEarth-Bench与LongEarth-R1的任务分类、基准定位及模型能力对比。a归属于四个认知维度的12个任务的代表性示例。b平均序列长度与认知维度覆盖范围的对比气泡大小表示最大序列长度。c代表性遥感方法的能力覆盖范围包括长序列理解、演化描述、空间定位、时序诊断、逻辑预测与思维链CoT为使遥感视觉语言模型具备长时域时空推理能力我们首先通过监督微调开发了 LongEarth使用了显式序列标识符和结构化的思维链轨迹将关键帧、时间变化和变化区域与最终答案联系起来。前者建立了稳定的帧级时间锚点而后者教会模型选择相关观测并整合序列中的时间和空间证据。在此基础上LongEarth-R1 应用了组相对策略优化使用互补的格式、时间和空间奖励以优化输出的完整性、演变阶段定位、时间顺序、关键帧选择和变化区域一致性而不仅仅是最终答案的正确性。LongEarth 和 LongEarth-R1 共同在 LongEarth-Bench 上建立了可复现的监督学习和强化学习基线。图 1(c) 在六种模型能力上比较了 LongEarth-R1 与代表性遥感方法LongEarth-R1 覆盖了全部六种能力。本文的主要贡献如下我们将长时域对地观测推理定义为对多阶段地理演变的推理通过四个认知维度涵盖演变总结、空间推理、异常识别和逻辑预测。我们介绍了 LongEarth-Bench一个包含约 12 万个样本的大规模基准。它涵盖了多样的地理过程并包含 3 万个带有证据基础推理的结构化注释样本。我们通过监督微调开发了 LongEarth并通过基于组相对策略优化的时间和空间奖励开发了 LongEarth-R1并系统地评估了当前遥感视觉语言模型在序列长度、演变过程和推理维度上的表现。相关工作从单时相到多时相遥感视觉语言模型遥感视觉语言模型已从静态图像-语言对齐发展到时间域对地观测理解。早期的模型如 RemoteCLIP (Liu et al. 2024b)、GeoRSCLIP (Zhang et al. 2024c)、GeoChat (Kuckreja et al. 2024) 和 EarthGPT (Zhang et al. 2024a) 专注于将单次观测与语言对齐。VHM (Pang et al. 2025) 将此能力扩展到场景分类、视觉问答和视觉定位而 EarthVQA (Wang et al. 2024a) 则推进了关系型视觉问答和空间推理。在遥感之外SpaceVLLM (Wang et al. 2026) 研究了特定帧的时空视频定位。RSICCformer (Liu et al. 2022)、GeoLLaVA (Elgendy et al. 2024)、Change-Agent (Liu et al. 2024a) 和 CCExpert (Wang et al. 2024b) 通过变化描述、检测或差异感知集成将基于语言的分析扩展到双时相图像对。DisasterM3 (Wang et al. 2025) 提供了一个用于灾害评估和响应的双时相遥感视觉语言数据集和基准。然而现有的双时相设置无法明确表示演变地理过程的中间阶段。最近的多时相遥感视觉语言模型处理扩展的对地观测序列。EarthDial (Soni et al. 2025) 支持多光谱、多时相和多分辨率对话输入TEOChat (Irvin et al. 2025) 支持对时间观测的对话和问答其序列平均长度为 2.07 帧最长可达 8 帧而 UniRS (Li et al. 2024) 统一了单图像、双时相和视频任务。TimeSenCLIP (Jain et al. 2026) 从 Sentinel-2 时间序列中学习光谱-时间表示而 DynamicVL (Xuan et al. 2025) 则用平均 6.73 帧、最长 10 帧的多时相场景对动态城市理解进行基准测试VLRS-Bench (Luo et al. 2026) 则使用平均 1.59 帧、覆盖最多八个时间阶段的序列来评估认知、决策和预测。这些研究为多时相遥感理解奠定了重要基础。然而跨越许多演变阶段的扩展轨迹研究较少特别是当评估需要异常定位、跨阶段空间推理以及识别支持结论的观测时。遥感视觉语言模型中的推理强化学习最近的遥感视觉语言模型已纳入结构化推理和强化学习以支持更具可解释性和证据基础的地理空间分析。多模态思维链将推理生成与答案推理分离 (Zhang et al. 2024b)而 Geo-CoT 构建感知基础的推理轨迹并通过监督微调后接组相对策略优化来训练 RSThinker (Liu et al. 2026b)。在遥感之外IAD-R1 (Li et al. 2026b) 同样结合了基于思维链的监督微调与结构化组相对策略优化以实现一致的视觉-语言推理。SAMChat (Köksal and Alatan 2026) 采用思维链监督和组相对策略优化进行小尺度遥感分析而 RemoteReasoner (Yao et al. 2026) 将强化学习应用于覆盖对象级、区域级和像素级地理空间推理的统一工作流程。GeoReason (Li et al. 2026a) 通过逻辑一致性强化学习对齐推理和答案而 GeoChain (Yerramilli et al. 2025) 研究多模态思维链地理推理。与此同时VLRS-Bench 评估了在单时相和多时相遥感输入上的复杂推理 (Luo et al. 2026)。这些研究显示了中间监督和任务特定奖励对于超越最终答案预测的推理的价值。然而现有方法主要对单次观测或受限的时间设置进行推理而没有明确地将中间推理与分布在长对地观测序列中的证据对齐。图2LongEarth-Bench的组成、地理覆盖范围及序列长度统计。a四个认知维度内圈和12个任务外圈的样本分布。b地理覆盖范围颜色表示五个源数据集标记大小表示局部平均序列长度。c各来源的序列长度分布附标注的平均值。d总体长度分布柱状图显示计数曲线表示至少达到各长度的序列占比。e任务条件化的长度分布每行在每个子任务内进行了归一化。LongEarth-Bench 数据集LongEarth-Bench 通过 12 个细粒度任务定义了此层级。我们将四个认知维度缩写为演变总结、空间推理、异常识别和逻辑预测。图 2(a) 报告了样本分布。120,367 个样本在演变总结 (26.6%)、空间推理 (22.8%)、异常识别 (26.7%) 和逻辑预测 (23.9%) 之间大致平衡同时保持了 12 个任务的多样性。图3LongEarth-Bench的构建流程。数据集构建图 3 展示了 LongEarth-Bench 的构建流程多源数据整合、序列过滤和认知任务构建然后是质量受控的结构化推理注释。具体来说LongEarth-Bench 源自 SpaceNet 7 (SN7) (Van Etten et al. 2021)、SDSU MidWest Flood (SDSU) (Jang et al. 2024)、DynamicEarthNet (DynEarth) (Toker et al. 2022)、FLAIR#2 (FLAIR) (Garioud et al. 2023) 和 PASTIS-R (PASTIS) (Sainte Fare Garnot, Landrieu, and Chehata 2022)。这些来源涵盖了城市建设、洪水动态、自然土地覆盖演变、云雪干扰和作物物候。如图 2(b) 所示它们跨越北美、南美、欧洲、非洲、亚洲和大洋洲减少了对单一地理区域或演变过程的依赖。坐标系统被归一化同时空间分辨率、时间元数据和注释格式被标准化以构建时间有序且空间对齐的遥感图像序列。过滤掉存在严重观测损坏、时间覆盖不全、配准失败或长期变化不足的样本。任务注释从时间轨迹以及分割、多边形、土地覆盖和图像级洪水证据中生成。阶段边界、趋势、位置、方向、范围、观测质量和物候状态从跨帧变化中导出。受控的顺序扰动、重复帧插入和上下文干扰被用于构建异常任务而预测任务则由历史轨迹和相邻时间状态构成。基于规则的验证验证序列完整性、答案一致性、帧索引、空间标签和图像路径随后进行人工审查以确保视觉支持和消除歧义。为补充答案级监督我们构建了一个包含 3 万个样本的平衡子集涵盖 12 个任务的结构化推理。初始轨迹由 Qwen3-VL-8B-Thinking (Bai et al. 2025a) 以统一格式生成think字段包含视觉扫描、特征识别和综合分析answer字段保留参考答案。我们自动验证标签完整性、阶段排序、非空推理字段和答案一致性无效输出被重新生成。然后人类专家评估视觉基础、链连贯性和潜在答案泄露。最终子集为学习时间阶段、空间动态、异常和逻辑预测提供了可靠的过程级监督。LongEarth-Bench 的统计分析图 2(c) 代表了五个数据源互补的时间机制。SDSU 提供最短的序列平均长度为 6.24 帧而 DynEarth 提供最长的平均为 21.31 帧。SN7、FLAIR 和 PASTIS 覆盖了中长上下文平均长度分别为 14.15、15.84 和 18.56 帧。这些源特定的分布保留了灾害事件、城市建设、自然地表演变和作物物候的时间特征。如图 2(d) 所示LongEarth-Bench 总共包含 120,367 个样本平均序列长度为 15.14 帧中位数为 16 帧最大为 30 帧。与 TEOChatlas (Irvin et al. 2025)、DVL-Instruct (Xuan et al. 2025) 和 VLRS-Bench (Luo et al. 2026) 相比LongEarth-Bench 的平均长度分别是它们的 7.3 倍、2.2 倍和 9.5 倍并支持的最大序列分别长 3.75 倍、3.0 倍和 3.75 倍。此外21.1% 的样本包含至少 24 次观测。因此LongEarth-Bench 覆盖了从紧凑事件序列到扩展多阶段轨迹的广泛范围为评估序列基础的长时域推理提供了一个受控环境。图 2(e) 总结了 LongEarth-Bench 每个任务的序列长度分布并显示所有 12 个任务都覆盖了多个序列长度区间而它们主导的时间范围因其证据需求而异。变化方向推理和空间位置预测依赖于扩展观测分别有 53% 和 57% 的样本落在 22-25 帧区间内。相比之下上下文鲁棒性和范围评估包含更紧凑的以事件为中心的序列。任务间的大量重叠也防止了序列长度成为简单的任务捷径。方法图4LongEarth与LongEarth-R1的概述。第一阶段通过序列感知的有监督微调训练LongEarth使用显式的序列标识符Seq. IDs以及来自30k样本子集的结构化推理轨迹。第二阶段以LongEarth为初始化应用GRPO并结合格式、时间和空间奖励得到LongEarth-R1本节提出了一个用于长时域时空推理的两阶段框架。如图 4 所示该框架基于 Qwen2.5-VL-7B (Bai et al. 2025b) 构建。阶段 1 应用带有两种互补形式监督的监督微调。序列感知的答案监督使用显式序列标识符建立稳定的帧级时间锚点而结构化的思维链监督教会模型选择相关观测并整合序列中的时间和空间证据从而产生 LongEarth。阶段 2 从 LongEarth 初始化并应用带有互补格式、时间和空间奖励的组相对策略优化以改进推理结构和时空一致性从而产生 LongEarth-R1。监督式序列基础与推理第一阶段包含两个监督组件。第一个组件执行序列感知的答案监督使基础模型适应长期遥感输入并建立帧级时间锚点。第二个组件注入结构化的推理轨迹进一步引导模型在产生最终答案前组织跨帧证据。序列感知答案监督。 此组件使基础模型适应长期遥感数据并建立从图像序列和问题到答案的基本映射。给定一个包含 T 个时间观测的遥感序列 X {I₁, . . . , I_T} 和一个问题 q模型需要基于整个序列生成答案 a。由于长期任务既需要单帧识别也需要跨帧变化理解我们为每张图像分配一个显式序列标识符序列ID如图像 1, 图像 2, . . ., 图像 T。令 Vₜ fᵥ(Iₜ) 表示由视觉编码器 fᵥ 编码的第 t 帧的视觉标记。有序的多模态输入表示为这种表示提供了稳定的帧级锚点并减少了关键帧参考、时间间隔定位和跨帧关系建模中的歧义。在训练期间视觉编码器被冻结而低秩适应模块被应用于语言模型层以实现参数高效的对齐 (Hu et al. 2022)。对于仅答案的样本此目标主要约束最终答案并不明确监督模型如何选择跨帧证据或组织中间推理。结构化思维链监督。 在监督阶段内我们使用 LongEarth-Bench 的结构化推理子集来监督基于证据的响应。对于每个推理样本 (X, q, r, a)目标响应包含推理轨迹 r 和最终答案 a格式为think r /think answer a /answer。推理轨迹遵循三个步骤视觉扫描、特征识别和综合分析。视觉扫描描述时间观测中的主要土地覆盖状态和空间布局。特征识别提取与问题相关的关键帧、变化区域、方向或异常。综合分析结合跨帧证据并产生最终结论。这种设计将模型从直接答案学习转变为过程级监督。具体来说给定目标序列 y (y₁, . . . , y_N)结构化推理目标为此目标联合监督推理轨迹和最终答案但仅参考轨迹模仿无法直接惩罚时间顺序错误或空间不一致。因此第二阶段应用组相对策略优化以进一步优化结构有效性和时空基础。通过组相对策略优化进行时空对齐从 LongEarth 开始第二阶段应用组相对策略优化以获得 LongEarth-R1并使推理与长期遥感目标对齐 (Shao et al. 2024; Shen et al. 2025)。与拟合单个参考输出的监督微调不同组相对策略优化比较同一输入的一组候选响应并使用相对奖励更新策略。因此它提高了答案质量以及推理结构和时空一致性。对于多模态输入 H旧策略 π_θ_old 采样 G 个响应 yᵢ (rᵢ, aᵢ)每个响应包含推理轨迹和最终答案。我们为每个响应分配一个加权奖励其中三项分别衡量格式有效性、时间基础性和空间一致性。格式奖励检查所需的推理-答案结构和任务特定的答案可解析性。时间奖励结合了引用帧的匹配及其时间顺序一致性而空间奖励评估变化位置、方向和范围的一致性。对于没有时间或空间标签的任务不适用的项被省略剩余权重被重新归一化详细的奖励定义在补充材料中提供。组相对策略优化在响应组内将奖励归一化为 Aᵢ (Rᵢ − μ_R)/(σ_R ϵ)并使用策略比率 ρᵢ π_θ (yᵢ | H) / π_θ_old (yᵢ | H)。令¯ρᵢ clip(ρᵢ, 1 − ε, 1 ε)。裁剪后的目标为其中 ε 是裁剪系数β 是 KL 权重π_ref 是监督阶段后获得的策略。KL 项保持了监督微调期间获得的视觉-语言能力。这些奖励共同将学习从答案模仿转向结构化、时间有序和空间基础的推理。实验实验设置实现细节。 我们在 8 块 NVIDIA A800 GPU 上训练 LongEarth-R1在两个阶段中都冻结视觉编码器并调整语言侧的 LoRA 模块秩 r128α256。监督微调运行两个周期使用 bfloat16、梯度检查点、余弦衰减、峰值学习率 2e-5、预热比例 0.03且无权重衰减。输入限制为 8,192 个标记并将正方形调整大小的图像与时间前缀和指令交错排列。组相对策略优化从监督微调检查点开始优化相同的 LoRA 模块使用组采样响应和所提出的奖励。评估指标。 我们使用准确率、时间 F1 和空间 F1 评估最终答案。准确率适用于封闭集答案包括分类判断、单帧定位、固定空间标签和离散范围级别。时间和自由形式的空间答案使用预测和参考元素上的基于集合的 F1。时间 F1 作用于解析的帧索引而空间 F1 使用 S {对象, 变化, 区域, 方向, 范围}。时间 F1 评估 T1、T3、T8 以及 T7、T9、T12 的时间集变体空间 F1 评估自由形式的 T4-T6 和 T11。其余任务使用准确率。实验结果在 LongEarth-Bench 上的表现。 我们评估了跨越演变总结、空间推理、异常识别和逻辑预测的 12 个 LongEarth-Bench 任务。表 1 显示 LongEarth-R1 在所有任务上均排名第一在异常识别和需要远程时间证据的任务上尤其有显著提升。一致的改进表明序列基础、结构化推理和基于奖励的对齐共同加强了时间理解、空间基础和预测能力。图 5 进一步显示LongEarth-R1 通过将其答案基于多帧证据避免了时间错位的区间。图5长周期时间推理的定性比较。​ EarthDial和TEOChat预测了错误的时间区间而LongEarth-R1识别出了正确的枯水期并将其答案建立在多帧视觉证据的基础之上在标准遥感任务上的表现。 我们进一步测试了针对长期推理的专业化是否保持了通用的遥感理解能力。遵循标准评估协议 (Irvin et al. 2025)我们在 AID 和 UCM 上评估单图像场景识别 (Xia et al. 2017; Yang and Newsam 2010)在 ABCD-CD、CDVQA-QA、xBD 和 S2Looking 上评估双时相变化理解 (Fujita et al. 2017; Yuan et al. 2022; Gupta et al. 2019; Shen et al. 2021)以及在 Qfabric 和 fMoW 上评估短序列多图像推理 (Verma, Panigrahi, and Gupta 2021; Christie et al. 2018)。对于每个基准LongEarth-R1 在相应的训练分割上进行微调并使用任务原生协议进行评估详细来源和任务描述在补充材料中提供。表 2 显示LongEarth-R1 在九个数据集的六个上取得了最佳结果包括所有双时相变化理解基准表明长期监督能有效迁移到常规变化分析。它在其余基准上的表现接近最强的专用模型表明所提出的训练在单图像、双时相和短序列设置中保持了通用的遥感理解能力。时间鲁棒性分析。 图 6 区分了时间难度的两个来源模型处理的输入帧数量以及问题所需的证据的时间跨度。在上图中所有方法在输入序列变长时性能都会下降反映了抑制不相关观测和定位信息帧的需求日益增长。然而LongEarth-R1 在每个输入长度区间内仍领先 10.7-31.9%在 26-30 帧输入上保持了 51.4 的得分在 2-5 帧输入上达到 87.8 后。这一趋势表明显式序列基础和基于奖励的对齐提高了对长上下文干扰的鲁棒性尽管非常长的输入仍然具有挑战性。下图显示了不同的模式。LongEarth-R1 在七个真实证据跨度区间中的六个取得了最佳分数并且其性能通常会随着答案可以由分布在更宽时间跨度上的证据支持而提高。因此广泛的证据跨度不一定有害当多个观测提供互补的演变线索时跨帧推理可以从中受益。唯一的例外是 23-30 帧区间其中 TEOChat* 获得了更高的分数。核心组件的消融分析。 我们跨 LongEarth-Bench 的四个认知维度进行了累积组件和奖励消融。组件研究逐步添加 SFT、Seq. IDs、R1 和 GRPO而奖励研究则从完整目标中一次移除一个项。表 3 显示完整配置 LongEarth-R1 在所有四个维度上实现了最强的宏观平均和最平衡的性能。相对于 LongEarth添加 GRPO 产生了一致的增益在异常识别上改进最大 (12.61)表明基于奖励的优化加强了异常敏感的证据选择和时空推理。移除任何奖励都会使宏观平均降低 5.19-6.68%尽管移除格式奖励略微改善了逻辑预测但完整目标整体仍然最佳证实了三个奖励的互补性。结论长期遥感理解需要对演变的地理证据进行推理而非孤立的观测。我们提出了 LongEarth-Bench它通过四个认知维度和结构化推理监督来定义此场景。我们进一步通过监督序列基础开发了 LongEarth并通过奖励驱动的时空对齐开发了 LongEarth-R1。结果在 12 个长序列任务上提升了性能同时保持了对常规遥感任务的可迁移性。这些发现支持对长时域对地观测推理中的时间顺序、中间证据和空间一致性进行显式建模。
返回列表