别再只让大模型写代码了!Meta与斯坦福联合提出“代码即脚手架”,重构AI智能体引擎
Code as Agent Harness
长期以来,业界对大模型代码能力的关注点,大多停留在“AI写代码”这一单一结果上。
ArXiv URL:http://arxiv.org/abs/2605.18747v1

论文原图:用于辅助理解核心方法或实验结果。
人们惊叹于模型能通过算法竞赛,或者能写出精妙的前端网页。
但在Meta、斯坦福大学和UIUC的最新联合研究中,这一固有认知被彻底打破。
他们提出了一种名为 代码即智能体脚手架(Code as Agent Harness) 的全新范式。
在这套理论中,代码不再仅仅是需要生成的最终产品。
它已经演变为智能体进行推理、行动、环境建模以及验证的底层执行介质。
告别“缸中之脑”:为什么是代码?
纯文本的 大语言模型(Large Language Models, LLMs) 就像是一个极其聪明的“缸中之脑”。
它能进行深度的思维推演,但却无法直接感知和改变外部的物理与数字世界。
为了让它成为真正能干活的智能体,我们需要为其穿上一套精密运转的“数字外骨骼”。
这套外骨骼包含了API接口、记忆系统、执行沙箱和反馈通道,学术界称之为Harness(脚手架)。
该研究敏锐地指出:代码,正是构建这套外骨骼神经系统最完美的材质。
相比于模糊的自然语言,代码具备三个无法替代的杀手级特性。
首先是 可执行性(Executability),模型的输出直接转化为具有确定结果的操作。
其次是 可检查性(Inspectability),复杂的中间计算过程被暴露为结构化的追踪日志。
最后是 状态性(Statefulness),不断演进的程序维持着任务跨步骤的持久化进度。
围绕这三个特性,该研究将代码在系统中的作用划分为三个紧密相连的层级。
接口层:为外骨骼接入神经元
在第一层,代码充当了智能体与任务环境之间最基础的接口。
它将大模型的输出,转化为可执行、可检查的结构化介质。
1. 用代码武装推理(Code for Reasoning)
纯文本的 思维链(Chain-of-Thought, CoT) 在复杂数学计算中极易产生幻觉。
通过 程序委托推理(Program-Delegated Reasoning),模型不再自己做算术题。
它将计算逻辑写成可执行的程序,交给外部解释器去运行求值。
更进一步,引入 形式化验证(Formal Verification) 语言(如 $Lean$ 或 $Coq$)。
这相当于给AI的推理大脑加上了一把绝对严谨的“逻辑锁”。
每一个推导步骤都可以被数学定理证明器无情地审核,从而杜绝逻辑断层。
2. 用代码驱动行动(Code for Acting)
当智能体需要操控机械臂或浏览网页时,代码就成了行动的直接指令。
它不再只是输出“向前移动”这样的自然语言,而是生成可编程的策略代码。
在 具身智能(Embodied AI) 系统中,这些生成的程序包含了控制逻辑与反馈循环。
甚至,像 Voyager 这样的智能体,能在沙盒游戏中不断编写新的技能代码。
这些代码被沉淀为可复用的技能库,让外骨骼的“运动神经”实现了终身进化。
3. 用代码表征环境(Code for Environment Modeling)
物理世界和复杂的软件环境是动态且难以直接理解的。
通过代码库、测试套件和执行日志,智能体建立起对世界状态的结构化认知。
例如在 软件工程基准测试(SWE-bench) 中,环境不再是一段文字描述。
而是由成千上万行代码、单元测试和 Git 提交记录组成的真实沙箱。
运行测试产生的 $Trace$ 报错信息,就是环境给予智能体最真实的触觉反馈。
机制层:让外骨骼自动运转
完成了神经元的接入,智能体还需要在没有人类干预的情况下长期存活。
这就来到了第二层:代码驱动的脚手架机制。
这一层解决了长周期任务中的规划、记忆、工具调用和反馈控制问题。
在执行复杂软件开发任务时,智能体会利用代码将大目标拆解为子函数。
它不仅规划行动路径,还会主动编写测试脚本($Tests$)作为验证自己工作进度的锚点。
当执行出现异常时,基于代码的反馈控制循环便被激活。
智能体捕获运行时错误($Runtime\ Errors$)和静态分析警告,进行自我修正。
这种不断“编写-执行-报错-修复”的闭环,正是代码脚手架自适应能力的核心。
记忆机制同样被代码重塑。
过去的经验不再仅仅是对齐到向量数据库中的文本片段。
它们变成了版本控制系统中的提交记录,或者是经过验证的代码片段。
外骨骼的“记忆中枢”因此变得高度结构化且随时可被重新编译执行。
扩展层:多机甲联合作战
当单个智能体的能力达到瓶颈,系统便需要向多智能体协同演进。
在纯文本聊天中,多个智能体极易因为语义的模糊性而产生沟通歧义。
但在代码脚手架的理念下,协同的媒介变成了共享的代码制品。
这就像是多个机器人在同一个虚拟车间里围绕一份图纸协同工作。
一个智能体扮演架构师,负责定义 API 接口和数据模型($Schemas$)。
另一个扮演程序员,负责填充核心逻辑;还有一个则是冷酷的测试员。
它们通过审查 $Pull\ Requests$、合并代码和触发持续集成流($CI/CD$)来交流。
这种基于代码状态共享的协作模式,极大降低了群体智能的协调成本。
同时,代码的严格语法和编译规则,天然地为多体协同提供了防撞护栏。
确保了群体的每一次进化都是可审查、可验证、不发生灾难性回退的。
走向未来的工程启示与挑战
本文全面梳理了代码在编程助手、GUI自动化、科学发现等前沿领域的应用。
但在打造终极AI外骨骼的道路上,我们仍面临诸多严峻的工程挑战。
挑战一:超越最终结果的评估
如果智能体写出了一段能通过测试但效率极低的代码,算不算成功?
当前的评估体系往往只看最终成功率($Pass@k$),忽略了交互轨迹的质量。
我们需要能够评估执行效率、代码优雅性以及自我修复成本的全新维度。
挑战二:不完全反馈下的验证
在物理世界或不可逆的操作中,报错可能意味着灾难(如机械臂碰撞)。
如何在缺乏完整测试用例、反馈信号稀疏的环境下,确保代码策略的安全性?
这要求脚手架具备强大的前置模拟能力和风险预判机制。
挑战三:人类监督的无缝融入
对于关键安全操作,必须允许人类在代码执行前进行干预和审批。
如何设计既不阻断智能体自主性,又能保证人类拥有绝对控制权的混合脚手架?
半形式化的编程接口和严格的数据沙箱隔离,可能是未来的解法。
总而言之,“代码即智能体脚手架”这一范式,彻底改变了我们审视AI能力的视角。
代码不仅是大型语言模型的产出,更是它们赖以生存和进化的数字世界法则。
构建可执行、可验证、具备持久状态的智能体系统,必将是通向通用人工智能的重要阶梯。