SMA:无需微调与外接工具,程序性空间记忆让VLM提升16.4分

Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence

在具身智能、机器人规划和多模态助手的技术演进中,空间智能(Spatial Intelligence)正被视为大模型迈向物理世界的核心基石。然而,即便是当前顶尖的视觉语言模型(VLM),在面对三维空间关系推理、遮挡判断、坐标定位和深度估计时,依然暴露出明显的脆弱性。二维图像中像素的投影变换、视点变化与尺度歧义,常常让模型在没有真实几何结构辅助的情况下产生严重的幻觉。

ArXiv URL:https://arxiv.org/abs/2608.12743v1

为了给 VLM 补齐空间短板,学界目前主流的解决范式清晰地分化为两条路线:第一条是“参数后训练”(Post-training),即通过监督微调(SFT)或强化学习(RL)将空间先验强行注入模型权重,如 SpatialVLM 与 RoboSpatial,但这种方式成本高昂且容易破坏模型的通用通用多模态能力;第二条是“工具调用智能体”(Agentic Tool Use),例如 S-Agent 或 SpaceTools,让模型在推理时挂载外部的深度估计网络或 3D 点云重建工具,但外部工具不仅严重推高了推理延迟,在工具预测出现几何误差时也无法自愈。

来自上海创新研究院、上海交通大学与浙江大学的研究团队提出了一条被长期忽视的新技术路径:如果既不更新模型参数,也不在推理阶段依赖任何外部专家级几何工具,一个冻结参数的 VLM 能否仅靠自身经验的自我演进(Self-Evolution),大幅提升空间推理能力?

该研究给出的答案是 Spatial Memory Agent(SMA)。它构建了一套基于物理与几何可验证环境的经验驱动运行时框架。SMA 让冻结的 VLM 在可验证任务中进行试错,通过“验证器引导的反思”把探索轨迹提炼为高密度的“程序性空间经验教训”(Transferable Lessons),并引入在线校准的“迁移可靠性评分”(Transfer Reliability Score, TRS)。在面对未知测试集进行只读部署时,模型仅凭检索出的程序性教训进行上下文推理,便在宏平均指标上全面超越现有记忆机制,相较于训练驱动的自演进基准 SpatialEvo-7B 取得了高达 16.4 个百分点的准确率提升。

概念概览:基于 SMA 的无训练空间智能演进

空间推理为何不能直接套用传统 RAG?

在纯文本智能体领域,记忆驱动的自我演化早已成为热门方向。智能体通过与环境交互,把成功案例或失败反思写入向量数据库,下次遇到相似问题时检索出来作为少样本提示(Few-Shot Prompts)。然而,直接将这种传统的文本 RAG 或简单实例记忆搬到空间多模态推理场景中,几乎注定会失效。

核心障碍在于空间视觉任务的高维敏感性与低容错率。空间问题具有强烈的几何特异性:在一个房间里,“把红色杯子放到微波炉左侧”的成功坐标和具体动作,在另一个场景或换一个相机视角后,完全无法直接复用。如果记忆库中存储的是具体问题、具体图像以及预测坐标(即原始 Rollout),检索模块只能依赖表面层面的语义相似度或视觉图像特征进行匹配。这种表层相似性往往极具欺骗性——两张看起来都是厨房台面的图像,其相机内参、透视仰角和相对深度关系可能截然相反。模型盲目套用上一次的具体数值,反而会引发严重的负迁移。

SMA 的核心假设在于:在空间推理中,能够跨越不同视觉场景发生迁移的,从来不是具体的几何数值或实例答案,而是解决特定空间几何问题时应当遵循的“认知程序与检验规范”。例如,判断两物体前后遮挡时优先寻找接触面阴影、在多视角下通过静态背景参考物对齐坐标轴、在抓取前预先进行运动范围反向模拟等。这类程序性知识脱离了具体的像素坐标,却能稳定地为冻结的大模型提供几何推理约束。

为此,SMA 放弃了死记硬背历史答题轨迹的粗暴做法,转而将记忆库设计为由高抽象度“程序经验卡片”构成的外部长效智库。

SMA 核心架构:程序性经验的提炼、校准与部署

SMA 的完整生命周期清晰地切分为两个阶段:在可验证空间环境($\mathcal{X}$)中的“经验获取阶段”,以及在未知测试场景($\mathcal{D}$)中的“只读部署阶段”。整个过程中,底座 VLM 的权重始终完全冻结。

SMA 系统架构与工作流

记忆卡片的数据结构设计

为了承载通用的空间推理逻辑,SMA 为每条记忆项 $m_i$ 定义了严密的数据结构:

\[m_i = (t_i, s_i, l_i, n_i, c_i, v_i)\]

其中,$t_i$ 是原始任务的自然语言描述,$s_i$ 是执行过程的高层抽象总结,$l_i$ 则是最具价值的核心载体——可迁移教训(Transferable Lesson)。为了防止信息泄露,检索时仅暴露任务描述、总结和教训这三个字段,历史的具体预测值和真实标注一律被物理隔离。

后面的三项则是 SMA 维持系统动态可靠性的关键状态量:$n_i$ 记录该记忆卡片在后续探索中被调用的总访问次数,$c_i$ 为调用该卡片后模型答题所获得的累计奖励总和,而 $v_i$ 则是经过贝叶斯思想校准的迁移可靠性评分(TRS)。

经验获取与单趟写入协议

在经验获取阶段,环境提供视觉输入 $\mathcal{V}_i$、任务描述 $t_i$ 以及可验证目标 $y_i^\star$。模型首先根据当前任务检索已有记忆 $\mathcal{G}_i$,冻结的 VLM 结合当前图像与检索出的程序建议生成答案:

\[o_i = F(\mathcal{V}_i, t_i, \mathcal{G}_i), \qquad \hat{y}_i = \mathrm{Parse}(o_i)\]

环境中的验证器随即给出一个标量奖励 $r_i = \mathrm{Eval}(\hat{y}i, y_i^\star)$。此时,反思模型 $R\phi$(可以直接由同一个冻结 VLM 担任)入场,输入包含了任务、模型原始推导过程、标量奖励以及真实标注目标 $y_i^\star$:

\[(s_i, l_i) = R_\phi(o_i, t_i, y_i^\star, r_i)\]

引入真实标注进行反思至关重要。许多强化学习或纯奖励反思机制只告诉模型“做对还是做错”,大模型在面对复杂的空间几何失效时,仅凭一个负向奖励往往只能瞎猜错误原因。提供真实目标后,反思模型能够精准对齐几何推导过程中的逻辑断点。同时,系统施加严格的反泄漏规范,要求反思模型输出严密的 JSON 结构,提取出的教训必须聚焦于“解题模式、易错陷阱与验证核查清单”,禁止复述具体答案数值。

值得注意的是,在记忆写入策略上,研究团队发现了一种反直觉的现象:如果采用传统智能体常见的“持续写入”(Continual Writing),即每一轮迭代都不断写入新的反思,记忆库的体积会迅速膨胀,并充斥大量高度同质化、冗余的规则卡片。这不仅浪费检索算力,更会导致每张卡片被调用的频次被严重稀释,使得置信度评分难以收敛。

因此,SMA 确立了单趟记忆写入协议(One-Pass Memory Writing):仅在遍历训练环境的第一趟中生成固定规模的高质量记忆卡片;在随后的迭代轮次中,完全封存记忆库的写入通道,让多轮探索纯粹服务于卡片被调用后的“访问证据积累”,集中校准每张卡片的可靠性状态。

访问证据校准:从均匀先验到动态置信

在初始生成时,任何一条经验教训在未来的泛化能力都是未知的。即便某条规则是从一次成功的解题中总结出来的,它也可能是一条过度拟合的伪规律;反之,从一次失败解题中总结出的避坑指南,却可能具备极强的普适防御价值。

因此,SMA 彻底打破了“正确答题产生的记忆更高级”的成见,为所有记忆卡片赋予完全相同的均匀初始可靠性评分 $v_0$(重置 $n_i \leftarrow 0, c_i \leftarrow 0$)。在随后的验证轮次中,当某组记忆 $\mathcal{G}_i$ 被检索并用于辅助解决新问题时,根据新问题的验证器奖励 $r_i$,SMA 对被选中的所有卡片执行在线贝叶斯平滑更新:

\[\forall m_j \in \mathcal{G}_i: \quad n_j \leftarrow n_j + 1, \quad c_j \leftarrow c_j + r_i, \quad v_j \leftarrow \frac{\lambda v_0 + c_j}{\lambda + n_j}\]

参数 $\lambda$ 充当先验强度伪计数。如果某张卡片被频繁调用,且只要它参与指导,模型的答题成功率就显著保持在高位,其实际可靠性评分 $v_j$ 就会迅速上升;相反,如果某条规则检索相关度很高,但每次指导模型时都导致答题失败,其评分就会被无情压低。

两阶段检索:语义过滤与 TRS 联合重排

到了面向全新场景的只读部署阶段,系统进入完全冻结状态,不新增任何卡片,也不再更新 $n_j$ 与 $v_j$。面对输入的空间任务 $\xi_i$,SMA 运行两阶段检索:

\[S_{ij} = (1-\eta) z(\mathrm{rel}_{ij}) + \eta z(v_j)\]

加权系数 $\eta$ 调节着“表面相关度”与“历史迁移可靠性”的平衡。得分排名前 $k$ 的卡片,将其提炼出的程序建议拼入当前模型的 Prompt 头部,作为即插即用的几何思维链模板,引导冻结模型完成端到端的推理。

实验评测:五大多模态空间基准上的系统验证

为了严谨测试 SMA 的实际表现,研究人员选择了 5 个极具代表性的多模态空间推理基准,全面覆盖了不同的空间能力维度:

  1. RoboSpatial:侧重机器人具身环境下的三维感知与开集空间指向;

  2. ERQA:聚焦物理世界多视角场景认知与空间推理;

  3. Omni3D:复杂的 3D 物体相对空间位置关系判断;

  4. SAT:抽象三维几何形态、折纸与空间智商测试;

  5. EmbSpatial:结合指令执行的具身空间导航与动作推理。

测试底座选用了四款不同尺寸和架构的开源顶尖 VLM:Qwen3.5-9B、Qwen3.5-122B-A10B、Qwen3.6-35B-A3B 以及 Qwen3.6-27B,使用 vLLM 部署保持零温度确定性推理。对比基线涵盖了无记忆推理(No memory)、传统 RAG、文本程序记忆基线 MemP,以及当前先进的强化学习记忆机制 MemRL 的多种变体。

在全部 20 组端到端评测组合(4 款模型 $\times$ 5 个基准)中,SMA 在绝大多数子任务上拔得头筹,并在每一个底座模型家族中均创下了宏平均准确率(Macro Average)的最高纪录。

以主力模型 Qwen3.6-27B 为例,无任何外部记忆辅助时,其宏平均准确率为 63.3%;引入标准 RAG 后微升至 65.9%;引入通用智能体记忆 MemP 后达到 66.8%;即使是带真实答案反思的强基线 MemRL-GT 也仅获得 68.1%。而 SMA 将整体宏平均直接推高至 69.8%,相较于无记忆基线绝对提升了 6.5 个百分点。

在具身感知最具挑战性的 RoboSpatial 基准上,Qwen3.6-27B 的基线得分仅为 54.1%,而挂载 SMA 记忆库后,准确率跃升至 68.5%,单项提升达到惊人的 14.4 个百分点;在 Omni3D 上从 41.6% 提升至 47.6%;在 EmbSpatial 上亦从 85.7% 稳步提升至 87.9%。尤为关键的是,这种收益在紧凑型的 9B 模型到超大规模的 122B MoE 模型上展现出高度一致的单调提升趋势,证明程序记忆的赋能机制与模型底座规模正交。

更具突破意义的对照在于与训练驱动方案的直接对决。过去业界普遍认为,不更新模型参数的 Prompting 方案很难抗衡针对空间数据专门做过 SFT 的模型。研究者将参数量相当的 Qwen3.5-9B + SMA 组合,与公开发布的参数更新自演化模型 SpatialEvo-7B 进行了横向对比。

结果显示,SpatialEvo-7B 在这五个基准上的宏平均准确率为 47.1%,而冻结参数的 Qwen3.5-9B 在 SMA 的辅助下达到了 63.5%。SMA 在所有 5 个评测集上实现全面领先,平均胜出幅度达到 +16.4 个百分点。这强有力地说明:对于复杂空间几何问题,高质量外部结构化认知程序的上下文注入,在推理效能上完全能够匹敌、甚至大幅超越小规模参数微调带来的收益。

机制剖析:为什么“最相关的记忆”往往不是“最好的记忆”?

消融实验与深层统计分析揭示了 SMA 之所以奏效的核心动力学特征。

组件消融:缺少反思结构与可靠性校准会发生什么?

在针对 RoboSpatial 和 Qwen3.6-27B 的细致消融实验中,研究团队逐一剥离了系统的各个组件:

在超参数敏感度测试中,TRS 权重 $\eta=0.5$ 恰好构成最优平衡点;检索深度 $k=3$ 能够提供最充沛且无冗余的约束指引。

核心洞察:相关性与准确率的反向脱钩

在传统检索增强系统中,工程师普遍信奉“向量距离越近越好”。但 SMA 揭示了一个完全相反的实证现象:在空间推理迁移中,最好的记忆往往不是语义上最近的记忆。

通过将以纯语义相似度为核心的 MemP 与 SMA 进行成对追踪,研究人员记录了检索出记忆的文本相似度与下游任务准确率的变化轨迹。在全部 5 个基准测试中,SMA 检索出的记忆条目,其与当前任务的平均语义相似度从 MemP 的 0.792 主动下降 到了 0.698;然而,下游的宏平均准确率却从 66.8% 反向攀升 到了 69.8%。

这背后的机理极富启发性:高语义相似度的记忆卡片,往往只是因为提到了相似的家具名词(如“餐桌”、“台灯”),但在空间几何拓扑上,那次交互提炼出的程序并不稳健;而经过多次访问证据检验的高 TRS 记忆,哪怕它源自一个完全不同的物体类别(例如从“判断书架层板间距”中提炼出的“基于边缘水平视差的深度核查法则”),其底层空间认知程序却能极其可靠地迁移至当前任务。TRS 成功将检索范式从表层的“语义贴近”扭转为深层的“经验实证有效性”。

数据进一步显示,当检索到的记忆平均 TRS 处于 $[0.2, 0.3)$ 的低置信区间时,模型的推理准确率仅有 19.3%;而当平均 TRS 进入 $[0.9, 1.0]$ 的高置信区间时,模型的准确率飙升至 97.3%。校准后的访问证据建立起了高度可信的性能预测屏障。

记忆沉淀效率:单趟与持续写入的对比

长程测试对比了 10 轮循环中单趟写入(One-Pass)与持续写入(Continual)的轨迹走向。持续写入由于不断制造新卡片,导致记忆库规模暴增十倍,其中重复记忆占比(冗余度)急剧攀升了 21%,且超过一半的卡片因为检索稀释而得不到充足的访问校验。单趟写入不仅让记忆库保持极度轻量(仅为前者的十分之一体积),而且让绝大多数卡片获得了两次以上的后续实测校验,TRS 更新覆盖率达到了持续写入的两倍之多。用有限的精炼经验进行充分检验,远胜于无限堆砌未经检验的记忆碎片。

跨界迁移与原子空间能力提升

记忆库是否只能在“同模型、同任务”的温室中工作?研究团队进行了跨模型与跨基准的严苛迁移探针测试。

在跨模型迁移实验中,研究者用超大尺寸的 Qwen3.5-122B-A10B 在环境中探索并沉淀出一套空间记忆库,然后原封不动地直接挂载给尺寸小得多的 Qwen3.6-27B 进行测试。结果表明,这种“大模型沉淀智慧、小模型只读享用”的方式在所有基准上均带来了显著的正向增益,在 RoboSpatial 和 SAT 上带来的提升幅度甚至逼近 27B 模型自己探索校准的记忆库。

在跨基准迁移实验中,即便将从 RoboSpatial(机器人具身场景)沉淀的记忆库直接跨界喂给 Omni3D 等完全不同来源的数据集,推理表现依然稳定优于无记忆的空白基线。这证明提炼出的程序性规则具备跨越不同数据分布的通用几何哲学。

从空间认知细分维度来看,研究将任务解构为 10 项原子级空间能力:物体对应(Correspondence)、属性感知(Attribute)、运动模拟(Object motion)、坐标定位(Localization)、空间关系(Relation)、距离/深度估计(Distance/depth)、心理旋转模拟(Mental simulation)、多目标追踪(Tracking)、相机视点推理(Camera reasoning)以及动作可承受性分析(Affordance)。

评估结果显示,SMA 在这 10 个原子能力维度上实现了全方位的普遍正向增长,没有任何一项出现负迁移。其中,提升幅度最为显著的是“物体与视点对应”(Correspondence),因为这类任务最依赖严密的背景锚定与几何核查流程,而这恰好是 SMA 提炼的程序性规则最擅长覆盖的盲区。

案例研究:高可靠性程序性记忆指导冻结模型解题

定性案例透视:程序性记忆究竟教了模型什么?

上图展示的五个真实测试案例,生动呈现了高 TRS 程序性记忆是如何在关键时刻将模型从幻觉边缘拉回来的:

  1. 尺寸核查与边界对齐(Size Checking):在复杂的开集指向任务中,原始模型极易将视觉关注点游离在物体周边的杂乱纹理上。检索到的程序明确提示:“不要依赖第一眼直觉框选边缘,优先定位物体底部的承托接触面,并使用场景已知参考物进行比例反推。”模型依此修正了预测边界框的纵深,完成精准定位。

  2. 多视角坐标锁定(Coordinate Localization):当视点发生斜切变换时,程序卡片提醒模型在二维平面上预先建立局部相对坐标系,而非直接猜测全局绝对坐标。

  3. 深度差额对比(Depth Comparison):在平视场景中,模型常常混淆距离摄像机更远还是更近。程序教导其寻找物体底部接地点与地平线的相对高度差,利用单目透视几何规律排除了反直觉选项。

  4. 心理旋转与运动模拟(Motion Simulation):面对折叠与位移类问题,高分经验卡片提供了标准化的核查步态——分解为“初始位姿判定、顺时针/逆时针轴向单步投影、终态几何冲突检查”,让模型按部就班地输出思维链,避免一步跳向错误结论。

  5. 背景基准锚定(Background Anchoring):在缺乏深度标记的环境里,经验规则指引模型寻找不可移动的墙角、门框或天花板线段作为垂直与水平基准,极大地减少了因广角镜头畸变带来的空间误判。

这些真实的推理轨迹清晰表明,SMA 没有给模型喂任何形式的“标准答案”,它传递的是一整套经过实战检验的、系统化的“几何解题规范与自检程序”。

空间智能演进的新支点

空间推理能力的匮乏,一直是制约通用大模型走向实体物理世界的核心瓶颈。SMA 的研究成果提供了一个极具吸引力的工程与理论视角:我们或许并不一定需要每次都通过昂贵的大规模 3D 数据合成去重训多模态模型的几十亿参数,也无需在部署端强行堆砌臃肿易错的 3D 重建与深度估计外部工具链。

通过将模型解题过程中的经验闭环沉淀为结构化的外部程序性记忆,并引入基于环境实证反馈的动态置信度校准机制,完全冻结参数的通用 VLM 也能在运行时实现惊人的空间能力自主演进。

这种设计理念对于未来的具身机器人部署尤为友好:机器人可以带着固化的基础大模型进入新环境,在低风险的初始化交互中快速生成并筛选出针对该物理空间的高可靠性认知程序库;在此后的日常运行中,仅需通过高效的轻量检索与上下文提示,就能让机器人展现出如同经过深度特化训练一般的敏锐空间洞察力。解耦“模型通用基础认知”与“特定场景经验程序”,或许正是通往轻量、可解释且高鲁棒性空间具身智能的下一条关键演进支线。