PACE-Bench:直接给出物理参数,为何依然救不了大模型的机械重构?
PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments
评估一个自主进化智能体(Self-evolving Agent)的能力,学术界过去习惯于让它在静态规则下不断“刷题”或跨任务迁移。然而,在真实的物理世界或复杂的工程部署中,问题往往完全相反:任务目标和调用接口完全没变,但外部物理环境突然变了。比如一辆在粗糙地面上行驶自如的驱动小车,被突然抛到摩擦力趋近于零的冰面上,原有的结构设计瞬间报废。此时,模型能否根据沙盒反馈,自主推断环境剧变并重构代码设计?
ArXiv URL:https://arxiv.org/abs/2608.14441v1
由清华大学和浙江大学研究团队联合推出的 PACE-Bench(Physics Adaptation via Code Evolution),正是针对这一盲区设计的物理代码进化基准。该基准构建了涵盖 6 个物理领域的 144 组“源-目标环境自适应对”,测试智能体能否在原设计彻底失效后,于有限的 20 次尝试预算内完成机械改造与代码自愈。
实验得出了几个极具冲击力的结论:现有大模型与自进化框架在面对动态物理变化时表现极其脆弱,即便是表现最好的 Reflexion 搭配 Qwen3-14B,在全量基准上的通过率(Pass@2)也仅有 35.9%;即使换用 GPT-5.5 这类前沿大模型,在完备预算下的静力学子集上也仅达到 66.7%。更关键的是,消融实验显示,即便直接把突变后的精确物理参数“开卷”告诉模型,最终性能上限依然没有明显提高。这一发现指明了大模型当下的致命瓶颈:制约物理代码进化的核心障碍不是对环境隐变量的“参数推断”(Know-What),而是应对物理法则变化的“机制重构能力”(Know-How)。

从静态泛化到动态物理突变
现有的自进化 Agent 基准,大多聚焦在两类场景:一是长任务流中的经验积累与记忆调用,测试智能体在多次交互后能否越做越顺手;二是在提示词、代码库或工具 harness 层面做自修改,测试其能否泛化到未见过的异构任务中。但这些任务的底层假设往往是“运行规则固定”。只要物理规律、动作空间和判定逻辑保持不变,模型就可以依赖既有的逻辑模板通过试错不断微调。
但在真实的物理与工程世界中,环境往往是不请自来的“干扰变量”。结构工程师在设计建筑、机械装置或自动化控制算法时,往往要面对重力异常、部件磨损、接触面材料变异乃至流体力学环境突变。
PACE-Bench 选取的切入点,正是在任务目标(Goal)与程序接口(Interface)绝对恒定的前提下,引入隐式的物理环境突变。在基准设置中,智能体最初会拿到一个在源物理环境 $\mathcal{E}_0$ 中能够完美运行的 Python 代码设计 $x_0$。随后,沙盒无缝切换到目标环境 $\mathcal{E}_k$,物理引擎内部的滑动摩擦力、材料弹性模量、重力场甚至运动学耦合方式被系统性篡改。在新的物理法则下,原本的设计必然崩溃。模型必须在沙盒不直接提供任何修改建议、仅返回标量诊断与报错的前提下,自主通过代码迭代挽救设计。

三阶段严苛构建:保证“可解但极难”
要建立一个可信的物理进化基准,难点不仅在于怎么改参数,更在于如何确保目标环境存在确定可行的机械设计,同时又不能被简单的参数调优“蒙混过关”。为此,团队设计了三阶段数据生成与验证管线。
在第一阶段,研究人员依据经典力学与现代工程原理,设计了涵盖静力学(Statics)、运动学(Kinematics)、动力学(Dynamics)、控制(Control)、波动与流体(Wave & Fluid)以及特异物理(Exotic Physics)这 6 大领域的 36 个基础任务,并统一接入 2D 物理仿真引擎 Box2D。
在第二阶段,研究人员为每个任务设计了递进的变异环境 ${\mathcal{E}_1, \mathcal{E}_2, \mathcal{E}_3, \mathcal{E}_4}$。变异不仅是修改单一数字,而是涉及多维参数的组合突变,从第一阶段的 2 个变异参数逐步升级到第四阶段的 10 个联合突变参数。最关键的一环在于难度标定:为了避免题目过于简单,研究人员使用 Qwen3-4B 进行双独立运行测试,不断收紧约束余量(例如扩大地形跨度、降低构件断裂阈值),直到 Qwen3-4B 在两次独立测试中全部失败,同时由人类物理专家验证并提交一套确保可以通过的参考代码(Reference Design),以此保证所有变异环境在理论和工程上必定有解。
在第三阶段,所有任务都要经过自动化审计与多轮人工交叉排查。系统提示词严格隐藏重力、摩擦系数等数值,只暴露允许使用的 API 原语(例如 sandbox.add_beam 等底层物理对象构建函数)和显式几何约束。由具备物理学与工程学研究生背景的人员进行了三轮盲测与审查,第一轮发现的歧义和边界漏洞高达 86%,而在第三轮审查后漏洞全部清零,最终锁定了 144 个严谨的源-目标适应对。

四大自进化范式角逐,结果全员受挫
研究团队在统一的代码基底和 20 次交互预算下,横向对比了当前最具代表性的四大自进化技术范式:
-
上下文内反思(In-Context Reflection):以 Reflexion、Self-Refine 为代表,依靠上下文历史与自我评判循环推进;
-
基于记忆的检索增强(Memory-Augmented):以 ExpeL、ACE、Clin 为代表,通过外部记忆库沉淀成败经验并跨轮次检索;
-
推理期树搜索(Inference-Time Search):以思维树(Tree of Thoughts, ToT)、LATS 为代表,维护状态树并在分支间进行前瞻探索;
-
参数自更新(Parameter-Updating):以动态微调或强化适应为代表的在线更新机制。
横向对比实验首先在全量基准上以 Qwen3 系列模型(4B、8B、14B)展开,随后在静力学等典型子集上调用更大尺度的开源与商业前沿模型(包括 GPT-5.5、DeepSeek-V4-Pro、Claude-Opus-4.7、Gemini-3.1-Pro 等)。核心评测指标采用兼顾解法探索性的 Pass@2(两次独立尝试中至少成功一次的比例)以及综合任务进度的 Score@2。
实验呈现出非常反直觉的技术分化:
在主流框架中,Reflexion 取得了最稳健的适应表现。Reflexion 依靠仿真器返回的硬性数值诊断直接触发针对性反思,在 Qwen3-14B 上拿下了全量基准最高的 35.9% Pass@2。与之形成鲜明对比的是 Self-Refine,由于其依赖模型在没有经过执行器校验的前提下进行内部“自我精炼”(Inner Loop Revision),导致错误假说在上下文中层层叠加,整体表现甚至大幅跑输了最原始的暴力试错(Vanilla)基线。
推理期搜索方法如 ToT 展现出极高的时间利用效率,在较短的物理时钟内能快速探索多种拓扑,但它在复杂物理场景下的搜索空间过于庞大,往往陷入“盲目发散”而无法向可行解收敛。
更为尴尬的是外置记忆模块(Memory-Augmented)的全面滑铁卢。像 ExpeL 和 ACE 这种在常规任务中表现亮眼的方案,在面对物理突变时不仅没有形成正向助推,反而显著拉低了强模型的表现。通过代码相似度分析,研究人员发现外置记忆极易造成“设计固着”(Design Fixation):检索出来的历史先验,把模型牢牢锚定在源环境已经失效的旧架构里,让模型不断在错误的宏观结构上做毫无意义的微小参数微调。
为什么大模型改不对物理代码?
为了深究智能体失败的根本原因,研究团队对所有失败轨迹进行了细粒度的代码相似度演化分析与九类错误归因分类。
智能体的失败轨迹基本被两种截然相反的极端状态撕裂:设计固着(Design Fixation)与无向发散(Stagnation / Undirected Exploration)。
在控制类(Control)任务中,设计固着现象最为严重,错误占比高达 58.2%。智能体一旦在第 1 次或第 2 次尝试中写出了某种杠杆、齿轮或悬挂连接方式,在接下来的十几次尝试中,代码变动往往仅仅局限于调整连杆的长宽比例或质量参数。即便沙盒诊断反复报告“结构屈服断裂”或“扭矩完全不足”,模型依然拒绝推翻底层拓扑,陷入无休止的局部死循环。
而在动力学(Dynamics)和流体类任务中,模型则走向另一个极端——无向探索。由于缺少对动态力学耦合的时空推理能力,模型在每次失败后都倾向于推倒重来,随机生成完全不同的构型,导致多次尝试之间的代码相似度方差巨大,无法形成有意义的技术积累,最终在 20 次预算耗尽时依旧毫无进展。
更值得深思的是模型尺度扩展(Model Scaling)在物理进化任务上的局限。从 4B 扩展到 14B,在某些纯粹依赖几何与逻辑推断的“特异物理”子集上,模型的 Pass@2 提升了 16.3 个百分点;但在强耦合、高度依赖拓扑重构的运动学和动力学任务上,14B 相比 4B 的提升仅有极其微弱的 1.9 个百分点。这一现象表明:现有的参数尺度提升,强化的是单步因果逻辑推断与代码生成质量,但对于需要在大规模物理动作空间中进行组合搜索与机械构型重构的问题,单纯扩大参数规模带来的收益正在迅速递减。
给出答案也没用:重构能力才是真瓶颈
针对大模型在物理适应中的无力,往往存在一种直觉性推测:是不是因为沙盒反馈只给了错误信息,没有明确给出被修改的环境物理参数,导致模型“猜不出物理规律”?
为了检验这个猜想,研究人员进行了一组极具说服力的干预消融实验:打破隐式物理设定,直接把目标环境中发生突变的精确数值(例如:当前动摩擦因数由 0.8 降至 0.05、构件承受极限应力由 500N 降至 120N)显式追加在提示词中。
结果令人大跌眼镜:即便将真实物理参数完全透明化,前沿模型与自进化算法的性能上限并没有出现统计学意义上的显著跃升。在静力学等子任务中,模型的成功率几乎与完全隐式探索时持平。
这意味着,智能体在物理适应任务中遭遇的真正卡点,从来不是逆向推导环境隐变量的“参数推断能力”(Know-What),而是理解物理定律后彻底推翻既有机械拓扑的“机制重构能力”(Know-How)。模型可能在语言层面完全“知道”摩擦力变小了、支撑力不够了,但它无法在代码层面将这种力学感知映射为空间几何结构的重组——比如将滑动轮改为履带传动,或者将简单的悬臂梁重构为复杂的桁架分布式承重结构。
此外,研究人员还探索了引入视觉多模态反馈(VLM Video Feedback)的效果。他们使用 Gemma4-26B-A4B 将 Box2D 仿真的物理运行视频解析为文字描述,并拼接到诊断反馈中。这项干预呈现出了剧烈的范式极化现象:对于依靠记忆的智能体(如 ACE、ExpeL),生动的视觉失败描述成功打破了陈旧记忆带来的“设计固着”,使其成功率翻倍;但对于依赖纯上下文推理的方法(如 Vanilla、Reflexion),视觉反馈引入的冗长细节反而极大地分散了模型的注意力,使得原本专注的代码修改退化为盲目的发散探索,性能出现腰斩。
物理智能体进化的全新坐标系
PACE-Bench 的提出,给当前正热的自进化与代码智能体研究泼了一盆必要的冷水。长期以来,学术界容易沉浸在利用大语言模型解决纯文本、符号逻辑或标准化编程难题的胜利中,误以为结合简单的反思(Reflection)与记忆库即可实现通用的智能体自主进化。
然而,一旦将测试场平移到需要与物理世界法则严格对齐的动态环境中,现有技术的脆弱性便暴露无遗。真实的物理世界不会因为提示词的巧妙而妥协,微小的力学环境突变足以让此前积累的一切“优雅代码”化为乌有。
从工程与架构角度来看,PACE-Bench 证明了以下几点关键启示:首先,基于真实仿真器硬反馈的闭环验证(Grounding)是智能体自我迭代的生命线,未经验证的“自嗨式”反思只会加速幻觉累积;其次,盲目堆砌长期记忆与跨任务检索,往往会诱发严重的认知固着,如何在记忆检索中建立物理因果剪枝机制是未来记忆框架的核心课题;最后,也是最本质的一点,下一代物理智能体亟需超越简单的“代码补全”范式,向具备深层力学构想、空间拓扑创新与机制颠覆性重构的真正物理智能演进。