NeSy-Spatial:告别盲目规划与死板流水线,空间推理技能实现自演进

Self-Evolving Neuro-Symbolic Skills for Tool-Augmented Spatial Reasoning

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

大型视觉语言模型(LVLM)在通识图文问答、跨模态对话等任务中展现出了极高的综合水平,但在面对细粒度的空间几何推理时,常常暴露严重的短板。空间推理不仅仅需要语义层面的模式识别,更高度依赖于亚像素级或三维空间的目标感知,以及严格保真的解析几何运算。仅仅依靠自回归生成,模型极易产生视错觉,甚至连相对距离、空间朝向或视角旋转这类逻辑都难以保证正确。

ArXiv URL:https://arxiv.org/abs/2608.07955v1

为了打破大模型端到端生成的计算瓶颈,引入外部专业视觉工具与代码执行器的“工具增强”方案逐渐成为主流。然而,南京大学与四川大学的研究团队指出,目前已有的空间智能体在工具调用范式上陷入了两极化的困局。一种范式是在每次推理时让模型完全动态规划工具序列,这种做法虽然灵活,但极易破坏工具之间的严格输入输出依赖;另一种范式则是针对特定空间问题编写一套固定的工具流水线,虽然流程合法,但面对不同复杂度的任务时往往带来巨大的冗余开销,泛化性极差。

针对这一核心痛点,研究团队提出了名为 NeSy-Spatial 的神经符号空间技能自演进框架。该框架放弃了从零临时规划或套用僵化模板的做法,而是将工具交互与几何算法解耦并抽象为可执行的原子指令,进一步组合成 Tool-Use Skills(工具调用技能)与 Geometry Skills(几何推理技能)。更重要的是,智能体能够从每一次推理的成功与失败轨迹中归纳、提炼经验,动态更新自身的技能库,从而在多项空间推理评测中兼顾了推理精度与工具利用率。

图1:现有工具增强空间推理智能体的局限性对比

动态规划与固定流水线的两难

现有工具增强型多模态智能体之所以在空间任务上频频碰壁,根源在于空间几何计算对先验依赖的严格要求。在纯动态规划框架中,智能体面对复杂问题往往像无头苍蝇一样从整个工具箱里探索。由于缺乏显式的依赖关系约束,语言模型经常在尚未获取物体真实三维包围框或点云分割结果之前,就直接调用 Python 执行器试图计算几何距离,导致整个下游推理链路直接报错崩溃。

反观手工定制的固定流水线(Fixed Pipelines),虽然保证了工具执行的依赖顺序绝对安全,却带来了沉重的计算负担。现实场景中的空间问题难度差异极大,有的提问只需轻量级的二维语义边界定位即可给出回答,而流水线却依旧会机械地触发深度估计、三维点云重建、多视角投影等全套庞大流程。这种机械执行不仅耗费了高昂的推理算力,其僵化的流程在迁移到其他未定义空间拓扑场景时也几乎无法复用。

这种现象表明,高效的空间推理系统既不能完全无拘无束地“自由发挥”,也不应该被锁死在“静态脚本”当中。人类工程师在解决复杂空间几何问题时,往往依赖一套结构化的技能库:在什么场景下先调什么感知模型、中间产物如何格式化、后续调用何种几何计算公式进行验算,这些经验应当以某种显式的符号化结构被保存下来,并在面对新问题时灵活组合与调用。

神经符号双轨技能的结构抽象

NeSy-Spatial 的核心创新在于将多模态感知与几何符号计算统一整合为一套类型化的神经符号架构。智能体维护的技能库并非简单的提示词缓存,而是由底层的原子指令(Atomic Instructions)与高阶技能(High-Level Skills)共同构成的双层图结构。

在微观层面上,原子指令被形式化定义为带有局部校验器的可执行单元 $a = (e_a, v_a)$。其中算子 $e_a$ 负责将符合特定输入类型的数据映射为输出结果,而布尔函数 $v_a$ 则对输出合法性进行自动化验证。整个系统的原子指令被清晰地划分为两类:控制器可见的工具原子指令 $\mathcal{A}{\mathrm{tool}}$,以及仅在 Python 解释器内部执行的几何原子指令 $\mathcal{A}{\mathrm{geo}}$。前者将各类外部视觉感知模型封装为独立步骤,后者则包含坐标变换、向量点乘、距离测算、平面拟合等可复用的底层数学运算块。

图2:NeSy-Spatial 框架总览

在此基础之上,高阶技能被进一步构建为有向无环图结构 $s = (V, E, \kappa)$。其中节点集合 $V$ 来源于原子指令,边集合 $E$ 则显式约束了指令之间的数据传递与时序依赖关系,$\kappa$ 记录了执行所需的上下文规范。针对多模态感知与纯符号运算的不同属性,NeSy-Spatial 构建了两套互补的高阶技能树:

  1. Tool-Use Skills(工具调用技能):主要负责外部多模态感知工具与计算引擎的时序编排。其节点对应具体的视觉工具(如目标检测、深度估计、三维重建)及代码调用。这一层技能显式锁定了工具执行的拓扑顺序,避免出现“前置感知未完成就强行调用后端运算”的荒谬现象。

  2. Geometry Skills(几何推理技能):主要负责结构化的几何运算逻辑。这些技能运行在 Python 执行器内部,节点由几何原子指令拼接而成,边代表几何变量(如坐标系原点、旋转矩阵、欧氏距离)的数据依赖流动。高阶几何技能将原本零散散落在提示词中的大段临时生成代码,转化为诸如“相机与世界坐标系转换”、“视线遮挡判定”、“双物体相对方位角校验”等模块化且可复验的确定性算法流程。

通过将工具级操作与代码级计算分离,主控制器的动作空间得以维持在极其紧凑且易于管理的尺度内,避免了语言模型在动作过多时产生严重的幻觉或决策混乱,同时又让深层的几何数值计算具备了确定性的数理保障。

闭环自适应的推理循环机制

在单次推理阶段(Inference Episode),NeSy-Spatial 采用闭环执行控制架构。如图 2 所示,智能体在处理具体图文输入 $(I_t, q_t)$ 时,并不是一次性生成完整的计划,而是以步进形式在工作记忆(Working Memory)的支撑下自适应推进。

整个推理过程遵循由四个阶段组成的交互回路。首先是技能检索(Skill Retrieval)。检索模块接收当前的输入图像、问题文本以及累积的工作记忆,结合特定设计的模板抽取目标物体、参考物体、空间拓扑关系及所需几何操作,从庞大的技能库中检索出最相关的少量候选技能子集。这一步大幅压缩了大模型的搜索空间,使得决策过程具备明确的方向感。

紧接着是动作选择(Action Selection)。主控大模型根据工作记忆中的证据链与候选技能,选择触发某一个高阶技能中的就绪节点,或者单独执行某一个基础工具指令,亦或在信息完备时做出停止决策。

第三步是工具与代码执行(Execution)。如果选择的是视觉工具原子,系统会调度对应的外部模型执行感知运算;如果控制器选定了包含几何技能的 Python 工具原子,系统则会在 Python 解释器内将工作记忆中的空间证据自动绑定到底层几何代码块中,按依赖拓扑完成计算并触发局部校验器。每个步骤的输出结果和合法性状态都会即时抛出,系统可以根据需要随时中断未完成的高阶技能链路,防止错误级联扩散。

最后是状态更新(State Update)。工作记忆动态吸纳新的感知结果与几何数值校验结论。如果未触发终止条件,更新后的记忆状态会直接启动下一轮技能检索与决策闭环。整个机制兼具了固定流水线的拓扑严谨性,又保有动态决策框架随时根据中间观测进行纠偏和提前终止的灵活性。

图3:NeSy-Spatial 技能引导空间推理与自演进定性示例

从失败与成功中实现双向技能自演进

很多自学习智能体往往只沉淀成功的轨迹,但空间推理的特殊性决定了:成功的轨迹中可能包含大量冗余步骤,而失败的轨迹里却常常隐藏着局部正确的几何逻辑。NeSy-Spatial 创新性地采用“先测试再更新”(Test-then-Update)的批处理演进范式。

在推理过程中,当前技能库保持静态不变,每一次预测完全独立输出以保证评估的绝对公正。推理完成后,系统将包含状态转移、工具动作、执行反馈和真值评估的完整轨迹缓存至轨迹池中。当累积的样本数达到设定的阈值时,自演进模块正式介入。

自演进流程涵盖三个深度分析环节:

通过这种自诊断、拓扑融合与剪枝机制,NeSy-Spatial 不仅能够从海量任务中自发形成应对特定空间关系的专用子程序,还能在没有人工干预的情况下逐步纠正初始设计中的依赖逻辑缺陷。

实验评测与多维表现分析

为了全面验证 NeSy-Spatial 在处理多形态复杂空间问题时的泛化能力,研究团队在涵盖多视角推理、三维拓扑以及几何定量的三个重要空间基准——MMSI、MindCube 以及 OmniSpatial 上进行了深入评估。评测不仅涵盖最终的问答准确率,更细化考察了智能体在视点变换、距离估算、空间包含与排布等多重能力群上的表现。

对比基线既包括静态无工具辅助的基础视觉语言模型,也涵盖了典型的动态规划智能体(如 SpaAge-ReAct、LAST)以及固定流程智能体(如 SpatialCLAW)。实验数据显示,NeSy-Spatial 在不同底座模型上均取得了显著超越各类基线方法的平均准确率提升。

特别是在涉及深度几何计算和多步推导的子任务中,自演进机制的优势体现得尤为明显。静态端到端模型在面对视角切换任务时准确率往往出现大幅滑坡,而动态规划基线由于经常在坐标尚未对齐前就强行进行数值计算,调用错误率居高不下。NeSy-Spatial 借助其逐步构建起来的 Tool-Use Skills,确保了目标检测、视差估计与几何计算的严格协同。

在工具调用的精确度与执行效率方面,NeSy-Spatial 同样表现突出。相较于无论任务难易一律拉满全流程的固定流水线方案,NeSy-Spatial 在结构更简单的样本上平均工具调用步数缩减了数倍。消融实验进一步证实,如果在框架中移除 Geometry Skills 而完全依赖大模型现场写 Python 代码,计算崩溃率将显著上升;若关闭基于轨迹诊断的自演进机制,技能库便会迅速被无序的冗余节点充斥,导致检索效率与决策准确度双双退化。

走向程序化沉淀的空间智能

NeSy-Spatial 的提出,为解决多模态大模型的空间局限性指明了一条兼具实用性与理论深度的新路线。当前具身智能与大模型空间计算领域普遍面临“端到端黑盒精度不足”与“专家代码管道难以泛化”的拉锯战。这项研究给出的回答是:不必将所有压力都压在神经网络的权重记忆中,也不必倒退回完全由人工手写规则的传统专家系统。

将多模态大模型的长处——语义理解、自适应决策与反思归纳能力,与符号系统的高确定性、可执行性与严格可验证性结合起来,使智能体具备在与环境交互中自主提炼“程序化技能”的能力,是构建真正通用的空间具身大脑的必经之路。随着这类神经符号演进机制进一步拓展到动作控制、机械臂操作和自动驾驶场景中,具备自主经验沉淀与工具进化能力的智能体,将在三维现实物理世界的理解与交互中展现出更强的实用价值。