
遥感智能体如何正确理解地学概念、组织多步分析,并从执行错误中积累经验?中国科学院地理科学与资源研究所联合清华大学、AI9Stars 等机构提出 RSMeM,将领域知识与失败经验融入遥感分析流程,相关工作已被 ACL 2026 Main 录用。代码与在线 Demo 已开放,欢迎体验。
题目:RSMeM: Knowledge-Enhanced Memory Evolution for Remote Sensing Agents with Systematic Evaluation
会议:ACL 2026 Main (第 64 届国际计算语言学年会)
论文:https://arxiv.org/pdf/2607.24772
代码:https://github.com/AI9Stars/RSMeM
在线体验:
https://www.modelscope.cn/studios/wbx929/RSMeM
年份:2026
单位:中国科学院地理科学与资源研究所、清华大学、AI9Stars 等
在线体验:从遥感影像到有据可循的答案
为了让读者直观了解知识检索、工具执行与经验改进如何衔接,团队开放了 RSMeM Studio 在线 Demo。读者可以围绕遥感影像提出分析问题,从内置案例开始,了解智能体如何结合地学知识规划分析,并跟踪工具调用、观测结果与执行进度。
体验入口:
https://www.modelscope.cn/studios/wbx929/RSMeM

RSMeM Studio 首页
图 1|RSMeM Studio 首页,以「知识、证据、记忆」串联遥感分析:以领域知识规划分析,查看执行证据,从尝试中积累经验。
在工作台中,读者可以输入自己的遥感分析问题,或选择内置的 13 个案例作为起点。影像输入区支持 GeoTIFF、TIFF、PNG、JPEG 格式及多文件上传,并提供首张影像预览,便于组织分析输入。

图 2|任务输入工作台,支持自然语言问题输入、内置案例选择、多文件影像上传与预览。
创新点
- 以地学知识指导分析流程。
检索与当前任务相关的地学概念和执行建议,为智能体理解任务、规划步骤和选择工具提供依据。 - 将执行失败转化为可复用经验。
从失败轨迹中提炼错误原因与修正方案,在后续执行中检索调用,让分析经验持续积累。 - 让知识检索与失败反思协同工作。
层级知识接地(HKG)提供任务级指引,失败感知经验精炼(FAR)形成实例级纠错经验,共同支持多步遥感分析。 - 以紧凑经验改善执行效果。
在 DeepSeek-V3.2 上,端到端准确率由 51.82% 提升至 57.89%,提高 6.07 个百分点,额外引入的经验 token 不到 1%;在其他主干模型上也取得一致提升。 - 同时评价分析过程、最终结果与执行效率。
从工具调用、端到端结果和效率三个维度,系统刻画遥感智能体的任务完成能力。
背景
从植被指数计算、地表温度反演到灾害变化检测,遥感分析往往需要串联多源数据与多个处理步骤。大模型驱动的智能体开始承担这些工作,但正确使用工具还需要对地学概念和处理关系的理解。例如,在本文的 Landsat 8 案例中,智能体将大气层顶亮温(BT10)直接用于地表温度(LST)的阈值统计,导致分析偏离了任务目标。这类错误一旦进入工作流,就可能沿后续步骤累积,影响最终答案。
现有方法或直接依赖通用模型规划,或使用专家预设模板,或通过反思尝试纠错。它们分别面临领域知识不足、模板适用范围有限、失败原因诊断不准等问题。RSMeM 围绕「如何让遥感智能体积累分析经验」展开:先以结构化地学知识指导执行,再将失败转化为可检索、可复用的修正经验,让知识与经验在任务执行中形成闭环。

图 3|遥感智能体架构对比。RSMeM 将层级领域知识与失败感知记忆结合起来,支持分析流程的迭代改进。
数据
研究以 EarthBench 为主评测基准,并在 ThinkGeo 上开展扩展评估。
EarthBench:多类型对地观测任务
- 任务规模
包含 248 道专家标注题。 - 数据类型
覆盖 RGB 影像、光谱数据和地球观测产品(Earth Products)三类输入。 - 评估设置
采用 DeepSeek-V3.2、Kimi-K2、Qwen3-32B 和 Qwen3-8B 四个主干模型,以 EarthAgent 为对比基线;标准工具步骤与答案仅用于评分,不向智能体提供。
ThinkGeo:面向遥感任务的工具使用与多步规划
ThinkGeo 是面向工具增强遥感智能体的评测基准,围绕卫星与航空影像设计分析问题,覆盖城市规划、灾害评估、变化分析、环境监测等应用,考察智能体的工具使用、多步规划与空间推理能力。输入包含光学 RGB 和 SAR 影像,并同时评价执行步骤与最终答案。
方法
总体框架
RSMeM 围绕知识与经验检索、任务执行、反思与记忆更新形成闭环。领域知识为当前任务提供分析依据,失败经验为具体执行问题提供修正方案,两类信息共同参与后续规划与工具调用。

图 4|RSMeM 总体框架。离线组织层级地学知识与任务卡,在线检索任务知识和失败经验,并通过执行后的反思持续更新记忆。
关键模块
层级知识接地(HKG):为规划与工具选择提供依据
面对用户问题,HKG 根据任务分类体系检索相关知识。检索时同时考虑语义相似度,以及任务标题、领域关键词和卡片内容的词法匹配,使TVDI、emissivity 等专业术语能够参与匹配,为智能体提供与当前任务相关的知识指引。
失败感知经验精炼(FAR):从执行错误中提炼修正方案
FAR 将一次失败转化为后续可调用的经验,主要包含三个步骤:
- 失败诊断
通过启发式规则检测执行轨迹中的异常,例如错误的动作路径、缺失的答案标签等。 - 轨迹压缩
压缩冗长的工具输入输出,减少重复文件列表等信息,同时保留关键推理与错误信号。 - 经验蒸馏
分析失败原因,将诊断结论和可执行的修正方案写入失败感知记忆,供下一轮检索与执行使用。
通过这套机制,任务级的领域知识逐步转化为实例级、可复用的执行经验,支持遥感智能体持续改进分析流程。
支撑资源:面向分析任务的地学知识
为支持知识检索,RSMeM 将地学概念与执行建议组织为任务卡,按应用领域、子领域和原子任务逐级索引。每张卡片包含任务标题、领域定义和执行建议,供智能体在分析时调用。

图 5|知识资源的组织方式,覆盖 3 个应用领域、12 个子领域和 64 个原子分析任务。
结果与分析
多个主干模型上的分析结果持续改善
RSMeM 在四个主干模型上均提升了端到端准确率,并在多项工具调用指标上取得改善。DeepSeek-V3.2 的端到端准确率由 51.82% 提升至 57.89%;Kimi-K2、Qwen3-32B 和 Qwen3-8B 分别提升约 5.7、3.6 和 2.8 个百分点。

表 1|EarthBench 上的工具调用与最终结果对比。主评测部分以相同 R@3 配置下的 EarthAgent 与 RSMeM 为比较对象。各工具调用指标的变化因模型而异,四个主干的最终结果准确率均有提升。
在 DeepSeek-V3.2 上,额外引入的经验 token 不到 1%。轨迹冗余度接近 1.0,结合准确率的提升,体现出紧凑、可复用经验对执行效率的价值。
地学知识与失败经验协同发挥作用
消融实验表明,HKG 为全局规划提供帮助,FAR 则改善执行轨迹的鲁棒性。两者结合时,性能随迭代持续提升。在 DeepSeek-V3.2 上,经过两轮进化,准确率累计提高 6.07 个百分点,经验密度同步上升。

图 6|不同主干模型上的迭代与消融结果。完整 RSMeM 通过知识检索与失败经验的协同,持续改善任务执行效果。
典型案例:从变量混淆到完整的地表温度分析
案例要求智能体基于死亡谷国家公园的 15 期 Landsat 8 数据,统计「LST 高于 315 K 的区域占比超过 50%」的日数。
第一轮执行中,智能体调用了不存在的工具,仅处理部分日期,并将统计对象从 LST 切换为 BT10。BT10 是由 TIRS Band 10 数据换算得到的大气层顶亮温;该任务中的地表温度反演还需要地表发射率等处理,直接在 BT10 上进行阈值判断会改变统计对象。
RSMeM 从失败中提炼出明确的修正经验:对全部 15 期数据执行单通道 LST 反演,利用 Band 4 和 Band 5 计算 NDVI 并估计地表发射率,生成各日期的 LST,再统一进行阈值统计。下一轮执行据此修正了变量混淆与日期遗漏,最终得到正确答案 「5 天」。

图 7|Landsat 热红外时序分析中的记忆进化。RSMeM 将变量混淆与执行遗漏转化为具体纠错经验,帮助智能体完成地表温度反演与统计。
与通用检索增强方法的对比
在 50 道 EarthBench 子集的实验中,研究采用 DeepSeek-V3.2,对比了基于向量相似度的 Simple RAG、网页检索增强(Web Retrieval)与 RSMeM。RSMeM 的最终结果准确率达到 53.06%,分别比 Simple RAG 和网页检索增强提高 16.33 和 4.08 个百分点,同时在 EM 与 WS 指标上取得更高得分,体现了领域知识与失败经验协同对遥感分析的帮助。

表 2|DeepSeek-V3.2 在 50 道 EarthBench 任务上的检索增强方法对比。EM、WS 衡量工具调用过程,Acc. 为最终结果准确率。
不同地学应用领域的收益
按领域细分,标准化多步流程占主导的任务收益更明显,其中灾害管理领域提升超过 10 个百分点。

表 3|DeepSeek-V3.2 在 EarthBench 不同应用领域的准确率对比。灾害管理、环境监测、城市规划与发展分别提升 10.25、6.68 和 1.49 个百分点;Δ(pp)表示准确率的百分点变化。
研究启示
回头看,RSMeM 为遥感智能体的持续改进提供了三点启示:
- 地学知识让自动分析有据可依。
RSMeM 将地学概念与处理规范组织为可检索的任务指引,帮助智能体正确理解分析目标、选择合适工具,并规划合理的处理流程。 - 分析中的错误可以沉淀为可复用的经验。
变量混淆、步骤遗漏、工具误用,都包含着改进流程的线索。RSMeM 从失败轨迹中提炼具体的纠错经验,并在后续执行中调用,让一次任务中的教训成为下一次分析的参考。 - 领域知识与执行经验共同推动工作流改进。
知识检索回答「这项分析应遵循哪些原则」,失败反思回答「这次执行应如何修正」。二者形成闭环,将任务级的地学知识逐步转化为具体、可执行的处理经验,帮助智能体更可靠地完成多步遥感分析。
我们相信,让地学知识融入执行、让分析经验持续积累,是推动遥感智能体从「会用工具」走向更「懂地学」的一条现实路径。
转自:遥感与深度学习
