ACL 2026 | RSMeM: 中科院地理所联合清华大学提出知识增强的遥感智能体记忆进化框架

 

 

遥感智能体如何正确理解地学概念、⁠组织多步分析,⁠并从执行错误中积累经验?⁠中国科学院地理科学与资源研究所联合清华大学、⁠AI9Stars 等机构提出 RSMeM,⁠将领域知识与失败经验融入遥感分析流程,⁠相关工作已被 ACL 2026 Main 录用。⁠代码与在线 Demo 已开放,⁠欢迎体验。

题目:⁠RSMeM: Knowledge-Enhanced Memory Evolution for Remote Sensing Agents with Systematic Evaluation

会议:⁠ACL 2026 Main (第 64 届国际计算语言学年会)

论文:⁠https:⁠//arxiv.⁠org/pdf/2607.⁠24772

代码:⁠https:⁠//github.⁠com/AI9Stars/RSMeM

在线体验:

https:⁠//www.⁠modelscope.⁠cn/studios/wbx929/RSMeM

年份:⁠2026

单位:⁠中国科学院地理科学与资源研究所、⁠清华大学、⁠AI9Stars 等

在线体验:⁠从遥感影像到有据可循的答案

为了让读者直观了解知识检索、⁠工具执行与经验改进如何衔接,⁠团队开放了 RSMeM Studio 在线 Demo。⁠读者可以围绕遥感影像提出分析问题,⁠从内置案例开始,⁠了解智能体如何结合地学知识规划分析,⁠并跟踪工具调用、⁠观测结果与执行进度。

体验入口:⁠

https:⁠//www.⁠modelscope.⁠cn/studios/wbx929/RSMeM

RSMeM Studio 首页

图 1|RSMeM Studio 首页,⁠以「知识、⁠证据、⁠记忆」串联遥感分析:⁠以领域知识规划分析,⁠查看执行证据,⁠从尝试中积累经验。

在工作台中,⁠读者可以输入自己的遥感分析问题,⁠或选择内置的 13 个案例作为起点。⁠影像输入区支持 GeoTIFF、⁠TIFF、⁠PNG、⁠JPEG 格式及多文件上传,⁠并提供首张影像预览,⁠便于组织分析输入。

RSMeM Studio 问题输入与影像上传工作台

图 2|任务输入工作台,⁠支持自然语言问题输入、⁠内置案例选择、⁠多文件影像上传与预览。

创新点

  • 以地学知识指导分析流程。
     检索与当前任务相关的地学概念和执行建议,⁠为智能体理解任务、⁠规划步骤和选择工具提供依据。
  • 将执行失败转化为可复用经验。
     从失败轨迹中提炼错误原因与修正方案,⁠在后续执行中检索调用,⁠让分析经验持续积累。
  • 让知识检索与失败反思协同工作。
     层级知识接地(HKG)提供任务级指引,⁠失败感知经验精炼(FAR)形成实例级纠错经验,⁠共同支持多步遥感分析。
  • 以紧凑经验改善执行效果。
     在 DeepSeek-V3.⁠2 上,⁠端到端准确率由 51.⁠82% 提升至 57.⁠89%,⁠提高 6.⁠07 个百分点,⁠额外引入的经验 token 不到 1%;⁠在其他主干模型上也取得一致提升。
  • 同时评价分析过程、⁠最终结果与执行效率。
     从工具调用、⁠端到端结果和效率三个维度,⁠系统刻画遥感智能体的任务完成能力。

背景

从植被指数计算、⁠地表温度反演到灾害变化检测,⁠遥感分析往往需要串联多源数据与多个处理步骤。⁠大模型驱动的智能体开始承担这些工作,⁠但正确使用工具还需要对地学概念和处理关系的理解。⁠例如,⁠在本文的 Landsat 8 案例中,⁠智能体将大气层顶亮温(BT10)直接用于地表温度(LST)的阈值统计,⁠导致分析偏离了任务目标。⁠这类错误一旦进入工作流,⁠就可能沿后续步骤累积,⁠影响最终答案。

现有方法或直接依赖通用模型规划,⁠或使用专家预设模板,⁠或通过反思尝试纠错。⁠它们分别面临领域知识不足、⁠模板适用范围有限、⁠失败原因诊断不准等问题。⁠RSMeM 围绕「如何让遥感智能体积累分析经验」展开:⁠先以结构化地学知识指导执行,⁠再将失败转化为可检索、⁠可复用的修正经验,⁠让知识与经验在任务执行中形成闭环。

三类遥感智能体架构对比

图 3|遥感智能体架构对比。⁠RSMeM 将层级领域知识与失败感知记忆结合起来,⁠支持分析流程的迭代改进。

数据

研究以 EarthBench 为主评测基准,⁠并在 ThinkGeo 上开展扩展评估。

EarthBench:⁠多类型对地观测任务

  • 任务规模
    包含 248 道专家标注题。
  • 数据类型
    覆盖 RGB 影像、⁠光谱数据和地球观测产品(Earth Products)三类输入。
  • 评估设置
    采用 DeepSeek-V3.⁠2、⁠Kimi-K2、⁠Qwen3-32B 和 Qwen3-8B 四个主干模型,⁠以 EarthAgent 为对比基线;⁠标准工具步骤与答案仅用于评分,⁠不向智能体提供。

ThinkGeo:⁠面向遥感任务的工具使用与多步规划

ThinkGeo 是面向工具增强遥感智能体的评测基准,⁠围绕卫星与航空影像设计分析问题,⁠覆盖城市规划、⁠灾害评估、⁠变化分析、⁠环境监测等应用,⁠考察智能体的工具使用、⁠多步规划与空间推理能力。⁠输入包含光学 RGB 和 SAR 影像,⁠并同时评价执行步骤与最终答案。

方法

总体框架

RSMeM 围绕知识与经验检索、⁠任务执行、⁠反思与记忆更新形成闭环。⁠领域知识为当前任务提供分析依据,⁠失败经验为具体执行问题提供修正方案,⁠两类信息共同参与后续规划与工具调用。

RSMeM 总体框架

图 4|RSMeM 总体框架。⁠离线组织层级地学知识与任务卡,⁠在线检索任务知识和失败经验,⁠并通过执行后的反思持续更新记忆。

关键模块

层级知识接地(HKG):⁠为规划与工具选择提供依据

面对用户问题,⁠HKG 根据任务分类体系检索相关知识。⁠检索时同时考虑语义相似度,⁠以及任务标题、⁠领域关键词和卡片内容的词法匹配,⁠使TVDI、⁠emissivity 等专业术语能够参与匹配,⁠为智能体提供与当前任务相关的知识指引。

失败感知经验精炼(FAR):⁠从执行错误中提炼修正方案

FAR 将一次失败转化为后续可调用的经验,⁠主要包含三个步骤:

  1. 失败诊断
    通过启发式规则检测执行轨迹中的异常,⁠例如错误的动作路径、⁠缺失的答案标签等。
  2. 轨迹压缩
    ⁠压缩冗长的工具输入输出,⁠减少重复文件列表等信息,⁠同时保留关键推理与错误信号。
  3. 经验蒸馏
    分析失败原因,⁠将诊断结论和可执行的修正方案写入失败感知记忆,⁠供下一轮检索与执行使用。

通过这套机制,⁠任务级的领域知识逐步转化为实例级、⁠可复用的执行经验,⁠支持遥感智能体持续改进分析流程。

支撑资源:⁠面向分析任务的地学知识

为支持知识检索,⁠RSMeM 将地学概念与执行建议组织为任务卡,⁠按应用领域、⁠子领域和原子任务逐级索引。⁠每张卡片包含任务标题、⁠领域定义和执行建议,⁠供智能体在分析时调用。

面向分析任务的地学知识组织

图 5|知识资源的组织方式,⁠覆盖 3 个应用领域、⁠12 个子领域和 64 个原子分析任务。

结果与分析

多个主干模型上的分析结果持续改善

RSMeM 在四个主干模型上均提升了端到端准确率,⁠并在多项工具调用指标上取得改善。⁠DeepSeek-V3.⁠2 的端到端准确率由 51.⁠82% 提升至 57.⁠89%;⁠Kimi-K2、⁠Qwen3-32B 和 Qwen3-8B 分别提升约 5.⁠7、⁠3.⁠6 和 2.⁠8 个百分点

论文表 1:⁠工具调用与最终结果对比

表 1|EarthBench 上的工具调用与最终结果对比。⁠主评测部分以相同 R@3 配置下的 EarthAgent 与 RSMeM 为比较对象。⁠各工具调用指标的变化因模型而异,⁠四个主干的最终结果准确率均有提升。

在 DeepSeek-V3.⁠2 上,⁠额外引入的经验 token 不到 1%。⁠轨迹冗余度接近 1.⁠0,⁠结合准确率的提升,⁠体现出紧凑、⁠可复用经验对执行效率的价值。

地学知识与失败经验协同发挥作用

消融实验表明,⁠HKG 为全局规划提供帮助,⁠FAR 则改善执行轨迹的鲁棒性。⁠两者结合时,⁠性能随迭代持续提升。⁠在 DeepSeek-V3.⁠2 上,⁠经过两轮进化,⁠准确率累计提高 6.⁠07 个百分点,⁠经验密度同步上升。

多模型迭代与消融结果

图 6|不同主干模型上的迭代与消融结果。⁠完整 RSMeM 通过知识检索与失败经验的协同,⁠持续改善任务执行效果。

典型案例:⁠从变量混淆到完整的地表温度分析

案例要求智能体基于死亡谷国家公园的 15 期 Landsat 8 数据,⁠统计「LST 高于 315 K 的区域占比超过 50%」的日数。

第一轮执行中,⁠智能体调用了不存在的工具,⁠仅处理部分日期,⁠并将统计对象从 LST 切换为 BT10。⁠BT10 是由 TIRS Band 10 数据换算得到的大气层顶亮温;⁠该任务中的地表温度反演还需要地表发射率等处理,⁠直接在 BT10 上进行阈值判断会改变统计对象。

RSMeM 从失败中提炼出明确的修正经验:⁠对全部 15 期数据执行单通道 LST 反演,⁠利用 Band 4 和 Band 5 计算 NDVI 并估计地表发射率,⁠生成各日期的 LST,⁠再统一进行阈值统计。⁠下一轮执行据此修正了变量混淆与日期遗漏,⁠最终得到正确答案 「5 天」

Landsat 地表温度分析案例

图 7|Landsat 热红外时序分析中的记忆进化。⁠RSMeM 将变量混淆与执行遗漏转化为具体纠错经验,⁠帮助智能体完成地表温度反演与统计。

与通用检索增强方法的对比

在 50 道 EarthBench 子集的实验中,⁠研究采用 DeepSeek-V3.⁠2,⁠对比了基于向量相似度的 Simple RAG、⁠网页检索增强(Web Retrieval)与 RSMeM。⁠RSMeM 的最终结果准确率达到 53.⁠06%,⁠分别比 Simple RAG 和网页检索增强提高 16.⁠33 和 4.⁠08 个百分点,⁠同时在 EM 与 WS 指标上取得更高得分,⁠体现了领域知识与失败经验协同对遥感分析的帮助。

论文表 9:⁠与通用检索增强方法的对比

表 2|DeepSeek-V3.⁠2 在 50 道 EarthBench 任务上的检索增强方法对比。⁠EM、⁠WS 衡量工具调用过程,⁠Acc. 为最终结果准确率。

不同地学应用领域的收益

按领域细分,⁠标准化多步流程占主导的任务收益更明显,⁠其中灾害管理领域提升超过 10 个百分点。

论文表 10:⁠不同应用领域的准确率变化

表 3|DeepSeek-V3.⁠2 在 EarthBench 不同应用领域的准确率对比。⁠灾害管理、⁠环境监测、⁠城市规划与发展分别提升 10.⁠25、⁠6.⁠68 和 1.⁠49 个百分点;⁠Δ(pp)表示准确率的百分点变化。

研究启示

回头看,⁠RSMeM 为遥感智能体的持续改进提供了三点启示:

  • 地学知识让自动分析有据可依。
     RSMeM 将地学概念与处理规范组织为可检索的任务指引,⁠帮助智能体正确理解分析目标、⁠选择合适工具,⁠并规划合理的处理流程。
  • 分析中的错误可以沉淀为可复用的经验。
     变量混淆、⁠步骤遗漏、⁠工具误用,⁠都包含着改进流程的线索。⁠RSMeM 从失败轨迹中提炼具体的纠错经验,⁠并在后续执行中调用,⁠让一次任务中的教训成为下一次分析的参考。
  • 领域知识与执行经验共同推动工作流改进。
     知识检索回答「这项分析应遵循哪些原则」,⁠失败反思回答「这次执行应如何修正」。⁠二者形成闭环,⁠将任务级的地学知识逐步转化为具体、⁠可执行的处理经验,⁠帮助智能体更可靠地完成多步遥感分析。

我们相信,⁠让地学知识融入执行、⁠让分析经验持续积累,⁠是推动遥感智能体从「会用工具」走向更「懂地学」的一条现实路径。

 

转自:遥感与深度学习