不写一行代码,SWE-Bench Pro提升5.8分:用办公任务解锁Agent通用执行力
Post-Training on Office Work Improves Software Engineering: A Behavioral Account of Cross-Domain Transfer
在现有的大模型后训练认知中,领域迁移通常遵循一种极为直观的“内容对应”逻辑:想让智能体修好代码,就必须喂给它海量的代码仓库、Git 提交记录和单元测试;想让它学会金融分析,就必须让它沉浸在财报与研报之中。
ArXiv URL:https://arxiv.org/abs/2608.01604
然而一项最新研究打破了这种经验直觉。研究团队在完全不包含任何软件工程任务、代码仓库语义或单元测试的纯“办公室日常工作流”上,对开源混合专家模型 Qwen3.5-122B-A10B 进行了后训练。令人惊讶的是,该模型在以严苛著称的真实代码基准 SWE-Bench Pro 上,单次通过率 pass@1 直接提升了 5.8 个百分点。
这项工作的核心价值,不仅在于这一反常识的跨领域性能迁移,更在于它向业界抛出了一个根本性问题:当我们在长程任务(Long-horizon tasks)中对智能体进行强化学习或监督微调时,模型究竟学到了什么?研究给出的答案是,模型学到的并不单单是具体的工具语法或特定领域的先验知识,而是一种跨越任务维度的底层组织机制——目标导向执行(Goal-Directed Execution,简称 GDE)。
从知识注入到行为习惯:什么是目标导向执行?
长程复杂任务与普通单轮问答最大的区别,在于前者必然伴随着深度嵌套与不断分支的子任务流程。面对一个需要几十步甚至上百步交互的实际问题,智能体不仅要在开局确立方向,更必须在多层工具调用的泥潭中,动态维护自身所处的状态,抵抗外界干扰,并在局部探索完成后准确回归更高维度的核心目标。

为了在行为层面对这一过程进行严密解构,研究团队借鉴了经典认知心理学中的 TOTE(Test-Operate-Test-Exit)模型与分层任务分析理论,将智能体的执行过程形式化为一个递归的目标循环(Goal Loop)。在这个框架下,智能体无需依赖任何外挂的硬编码符号堆栈,而是通过内生行为模式在四个核心维度上维持任务运转:
-
目标形成(Goal Formation):能够从全局顶层意图和当前所处的局部环境状态中,精准推导并剥离出当下最应当执行的具体即时子目标,而不是被环境中的细枝末节带偏。
-
状态构建(State Construction):在复杂环境中自主搜集、过滤、理解并保留关键信息,构建出足以支撑后续决策的高质量“工作记忆”,避免对上下文信息的遗忘或曲解。
-
目标稳定性(Goal Stability):在深入多层局部修障、遭遇报错或进行繁琐分支探索时,依然能够死死咬住上层父目标所施加的硬性约束,不发生意图漂移(Goal Drift)。
-
完成度验证(Verification):清醒地判断怎样的环境证据才能真正证明任务已经闭环,并在子任务边界与最终交付节点,主动通过外部工具获取确凿事实,拒绝“自欺欺人”式的虚假汇报。
这四个行为构成了智能体处理长程任务的通用基本功。一旦这四项能力在某一类极具挑战性的环境中被充分激活,即便将智能体置入一个完全未曾见过的陌生任务领域,它依然能展现出远超基座模型的稳健组织能力。
实验设计:用363个办公任务“跨界练兵”
为了严格验证这种行为能力的跨领域迁移假设,研究团队构建了极为严谨的控制实验。实验的训练源领域选用了名为 LHMTA(Long-Horizon Multi-Tool Agent)的数据集。该环境完全依托 MCP(Model Context Protocol)工具协议搭建,覆盖了 27 类真实的专业办公场景,包括复杂电子表格计算、幻灯片生成、文档批注与跨格式转换、多源信息检索整合、日程日程冲突协调以及本地文件批量管理等。
这些任务的共同特点是流程极长、上下文极深、异构工具组合极多。在处理这类高复杂度办公任务时,成功的轨迹往往需要消耗 80,000 到 100,000 个 Token,涉及数十次连续的工具调用。整个训练集共精选了 363 个高难度长程任务,并严格保证其中不包含任何软件工程、代码解析、算法编写或 Git 操作相关的样本。
被测试的基座模型为开源的 Qwen3.5-122B-A10B,总参数量为 122B,实际推理时每个 Token 激活约 10B 参数。研究者仅使用 LoRA 在模型的注意力层和前馈网络(MLP)投影矩阵上进行参数高效微调。尤为关键的是,微调过程完全由 LHMTA 任务生成的专家轨迹驱动,外部代码基准没有提供任何训练任务、奖励设计信号、检查点选择标准或超参数调优反馈,彻底杜绝了数据污染和间接信息泄露的可能。
评估阶段,除了考察模型在训练分布内的办公任务测试集以及综合工具基准 Toolathlon、函数调用基准 BFCL-V4 上的表现外,真正的重头戏落在了 SWE-Bench Pro 上。这个代码评估基准不仅要求智能体在真实的复杂开源仓库中复现 Issue、排查缺陷并提交补丁,还引入了更具实战要求的测试环境。在该基准上,后训练后的模型实现了 5.8 个百分点的绝对提升(Pass@1)。在完全不教代码的前提下,智能体竟在最具挑战的代码基准上取得了质的飞跃。
配对轨迹深度解剖:四大行为能力如何跨领域复用?
为了弄清模型到底在软件仓库中改变了什么,研究团队锁定了 103 个极具代表性的样本——基座模型(Base)完全失败、但微调后模型(Trained)成功通过的任务。通过对相同的 Prompt、相同的工具集以及完全受控的环境交互进行成对对比(Paired Trajectory Analysis),这四种通用行为能力的进化机制清晰地浮出水面。
在目标形成层面,未调优的基座模型极易产生“局部看似合理、全局彻底跑偏”的虚假目标。在软件仓库中,当基座模型检索到一个异常报错时,常常直接将修复该报错表面提及的次要变量作为当前目标,从而在错误的依赖关系上耗费大量调用步数;而经过 LHMTA 训练的模型则能够时刻以父目标为锚点,在相同的代码堆栈面前,准确推导出“先定位该异常在顶层模块中的注入路径”这一正确的子目标。这种推导逻辑,恰恰与它在处理“根据多张财务报表调整汇总展示项”时,先核实汇总表联动逻辑再修改单元格的行为如出一辙。
在状态构建方面,长程任务往往充斥着海量的冗余上下文和工具返回结果。基座模型在排查深层代码逻辑时,虽然也调用了大量检索工具,但往往“看过了却没记住”,一旦进入新的工具交互,前序关键信息就会被新吐出的日志覆盖;而经过长程任务训练的模型展现出了极高的数据提取与整合素养。它会主动将多处零散的代码片段和报错日志提炼为结构化的事实,并将其持续保留在工作记忆中,支持多步之后的补丁构建。
目标稳定性的差异在面对深度异常时尤为戏剧化。在复杂的 Issue 修复过程中,智能体常常需要修改底层工具库或辅助配置。基座模型在这一步极易出现“意图被替换”的现象——它为了让某个局部的辅助脚本跑通,竟然顺手删改了用户原始指令中明确要求的环境约束或行为规范;反观训练后的模型,即便在嵌套了五层子循环去修补临时依赖时,一旦回到主干流程,依然能够严格捍卫最高优先级的业务约束,体现出了极强的抗干扰韧性。
而在完成度验证上,两者的分水岭更为深刻。基座模型在漫长交互后,普遍存在一种“认知疲惫”,倾向于依赖自指性的断言(Self-referential Claims)宣布完工——只要补丁文件写进去了,它就会在内部推理中主观判定“问题已修复”,随即结束运行。而经历了复杂办公流磨砺的模型则深刻内化了外部验证的必要性:只要环境没有提供客观的执行成功凭证,它就不会闭环任务。在代码仓库中,这意味着它绝不满足于“无报错写入”,而是必须主动调用测试套件、构建复现用例,拿到绿色的测试通过反馈后才肯退出。
宏观行为数据印证:更高效的信息搜集与更克制的代码修改
除了定性的微观轨迹追踪,研究团队在 SWE-Bench Pro 上的全量执行遥测数据,也从宏观统计角度印证了模型行为结构的根本性重塑。这种重塑直接体现在信息搜集、代码实现与测试验证三个关键指标上。
首先是信息检索的重复率显著下降。在总检索量相当的前提下,基座模型经常陷入对同一目录、同一文件的来回反复查看,而训练后的模型不仅有效降低了重复读取的比例,而且能够更加精准地覆盖到最终参考补丁所真正修改的核心文件。这表明模型的“状态构建”更加高效,不再需要靠重复调用工具来唤醒上下文。
其次是补丁规模的惊人克制。在代码修改阶段,未训练模型往往倾向于大面积重写无关代码或盲目添加防御性逻辑,生成的补丁冗长而脆弱;而训练后的模型在命中参考补丁修改区域的同时,代码新增行数大幅缩减。这种“更少但更准”的修改风格,有力佐证了模型具备更强的“目标稳定性”——它能够精准锚定真正的问题节点,而不会在复杂的局部重构中破坏系统原有结构。
最后是主动运行正式测试的频率剧增。在整个 SWE-Bench Pro 的轨迹分析中,训练后模型执行正式测试命令(如 pytest 或定制测试入口)的比例,较基座模型几乎实现翻倍。模型不再将“工具调用结束”与“任务完成”划等号,而是将“通过环境验证”确立为关闭目标循环的刚性出口。这种在办公任务中培养出的验证本能,无缝迁移成了软件工程中对单元测试的严格依赖。
对大模型后训练范式的深远启示
这项工作为长程 Agent 的研发范式带来了极为重要的视角修正。长期以来,社区在进行模型对齐与任务调优时,极易陷入以“领域数据”为中心的思维定势,认为提升某项专业能力的唯一途径就是堆叠该领域的垂直数据。
这项研究用无可辩驳的消融结果表明:后训练数据不仅是领域知识的载体,更是一种塑造智能体底层行为习惯的“训练操场”。 当环境具备足够的交互深度、分支复杂度与约束严苛度时,智能体在其中所被迫演化出的目标拆解、状态维护与自检闭环能力,具有极其强悍的跨域普适性。
从工程落地的角度来看,这为突破高质量长程训练数据稀缺的瓶颈提供了一条全新的解题思路。在软件工程或尖端科研等领域,构建端到端、高度保真且可自动化评估的长程 Agent 轨迹成本高昂且充满安全隐患。如果能够通过结构高度相似、但安全性可控且更易构建的通用长程环境(如复杂办公流、仿真桌面操作系统等)来“孵化”模型的 GDE 能力,再结合少量的下游专业领域知识进行微调,将有望大幅降低下一代自主智能体的构建门槛。
对于大模型研究而言,真正决定智能体上限的,或许从来不是它记住了多少特定工具的参数格式,而是当面对一个长达百步的未知迷局时,它是否依然懂得如何立下正确的目标、如何审视周围的环境,以及在最终交卷前,如何严肃地跑一遍验证。