RST:递归合成长周期任务,0.05美元生成3.7万验证数据!
Recursive Synthesis for Long-Horizon Terminal Tasks
在大型语言模型向复杂智能体(Agent)演进的过程中,模型需要从单纯的“一次性文本生成”转向能够在真实或模拟环境中执行长周期多步骤任务。特别是在基于终端(Terminal)的任务中,智能体需要协调代码库上下文、命令行交互,并在漫长的执行周期中不断根据反馈进行调整。然而,阻碍这一愿景落地的最大瓶颈在于高质量训练数据的匮乏。
ArXiv URL:https://arxiv.org/abs/2608.05466v1
构建能够用于训练长周期终端智能体的数据极其昂贵。因为每一个有效的任务都必须保证“自然语言指令”、“可执行环境”、“参考解决方案”以及“验证器(Verifier)”这四者之间的高度一致性。如果完全依靠人工编写,单条任务的成本往往高达数百甚至数千美元,根本无法实现规模化;而如果直接使用大型语言模型进行端到端生成,又极易打破这四者之间的依赖关系,导致生成的任务在真实沙盒中根本无法运行或无法被准确验证。
为了打破这一数据获取的成本魔咒,来自香港理工大学、腾讯、马里兰大学等机构的研究人员提出了一种名为 RST(Recursive Synthetic Terminal Tasks)的递归验证合成框架。该框架不依赖人工编写,而是从已验证的种子任务出发,通过“先扩展解决方案、再对齐环境与验证器”的独特机制,在安全的沙盒中不断自我迭代。
核心结果显示了这种机制的巨大潜力:在连续十五轮的递归合成中,RST 以单条任务约 $0.05$ 美元的极低成本,生成了 $37,484$ 个高质量的终端智能体任务。随着迭代轮数的增加,任务难度呈指数级攀升。中位参考解决方案从初始的 $67$ 行代码暴涨至 $374$ 行,而强大基座模型 DeepSeek-V4-Pro 在这些任务上的通过率则从第一轮的 $90\%$ 骤降至第十五轮的 $2.5\%$。基于这些合成数据,研究人员通过监督微调(SFT)和强化学习(PPO),使得 Qwen3.5 模型的相对性能获得了最高 $41.2\%$ 的惊人提升,且在长周期终端基准测试中展现出极强的泛化能力。
终端智能体的数据困境与破局思路
要理解 RST 框架的价值,必须先看清终端智能体评估与训练的现状。当前的代码和系统级基准测试(如 SWE-Bench 或 Terminal-Bench)主要用于评估模型是否具备修改代码库或完成命令行工作流的能力。为了让模型具备这种能力,训练数据必须是“可执行”的。这意味着一条合格的训练数据不仅是一段对话记录,它必须包含一个完整的可运行工作区(Workspace)、明确的指令、执行反馈机制,以及一个能在最后客观判定任务是否成功的独立验证脚本。
此前的许多合成数据研究倾向于让语言模型直接输出新的任务描述和对应的测试用例。但在长周期的终端环境中,这种“顺向生成”逻辑往往会遭遇惨败。只要模型在环境变量配置、文件路径依赖或网络依赖上犯了一个微小的错误,整个任务就会沦为无法执行的废数据。
RST 采取了一种截然相反的演进哲学:基于行为进行逆向推导。研究人员认为,合成复杂任务最稳妥的方式,是先让一个可运行的解决方案变得更长、更复杂,然后再强迫环境、验证器和公共指令去适配这个新的解决方案。由于每一次扩展都建立在前一次已被验证为成功的代码路径之上,这种方法在数学上和工程上都极大提高了合成任务的存活率。
递归合成的核心机制:扩展、对齐与沙盒验证
RST 框架将整个数据合成过程定义为一个跨越多轮的递归管道。每一轮合成都以上一轮验证通过的任务作为种子,经过目标选择、分步重写、本地及沙盒验证,最终将合格的新任务再次投入下一轮的种子池和强化学习训练池中。
多样性控制下的种子注入
整个管道最初由 $639$ 个真实世界中验证过的终端任务作为基础种子启动(这些种子本身不计入合成轮次)。为了防止在多次递归中任务分布退化为单一的简单模式,系统在每一轮选取种子时都进行了严格的多样性控制。研究人员将原始类别合并为多个核心领域,通过测量归一化香农熵来监控分布。

从上图可以看出,从初始种子池一直到第十五轮($R_{15}$),任务的领域构成始终保持着广泛的分布。没有任何一个领域在任务池中占据绝对主导地位(最大领域占比始终低于四分之一),这为后续生成高难度且类型丰富的长周期任务奠定了基础。
解决方案主导的重写策略
当一个种子任务被选中后,合成引擎首先会对其现有工作流进行剖析,以决定如何进行合理扩展。RST 预置了涵盖配置控制、数据流处理、文件系统绑定、构建与缓存状态,以及运行时诊断等多个家族的算子。
真正的重写过程遵循“先扩展行为,再对齐契约”的原则。生成器首先修改原本的参考解决方案(例如向 solve.sh 中注入新的命令行指令),让任务执行额外的操作。这可能涉及衍生新变量、调用外部工具、生成中间制品或是执行更严格的校验。
在解决方案变长之后,环境必须同步更新以支撑这些新操作。例如,脚本中如果新增了对某个日志文件的解析,环境中就必须被配置为能提前生成或提供该日志文件,甚至需要安装相应的依赖包。当“新的解决方案 + 新的环境”构成了一条完整的执行路径后,引擎才会去更新私有验证器,确保验证器能够正确检查新状态,同时拒绝任何硬编码的作弊行为。最后一步才是重写对外的公共指令,把新增的目标用自然语言表达出来。
这种自下而上的重写顺序,确保了新任务在逻辑上的自洽性,也是整个框架能够连续运行十五轮而不崩溃的关键。
严格的双层验证网络
仅有生成的逻辑顺序是不够的。任何被纳入最终数据集的任务都必须经历双层验证。
第一层是静态过滤。系统会快速扫描候选任务,剔除那些与种子任务过于相似的“伪创新”数据,或者那些不慎将私有验证逻辑泄露到公共指令中的废品。
通过静态检查的候选任务会被送入一个完全隔离的全新沙盒中执行。在这里,环境被从头初始化,模型生成的参考解决方案被投入运行,随后执行私有验证器。如果在这个过程中出现可修复的错误(例如权限不对或缺少极个别的依赖),系统允许利用日志进行有限次数的自动修复。只有当候选任务的解决方案能够在沙盒中完美通过私有验证器,且新指令与验证器的检查点高度一致时,该任务才会被正式标记为“接受”。

如上图热力图所示,通过强制要求公共指令覆盖验证器所检查的内容,RST 在多轮迭代中始终保持着极高的指令-验证器对齐质量,防止了任务变得不可理解或陷入“黑盒要求”。
惊人的任务难度跃迁与稳定产出
在对 RST 框架的评估中,最令人瞩目的结果是系统在保持极高产出稳定性的同时,实现了任务难度的指数级跨越。
十五轮递归共产生了 $37,484$ 个被沙盒认可的验证任务。由于一切都在自动化沙盒中闭环完成,均摊到每个合格任务上的算力与 API 成本仅为 $0.05$ 美元。更为关键的是,即便到了第十五轮,系统每进行 $1,000$ 次种子尝试,依然能够稳定产出超过 $500$ 个合格任务,候选通过率维持在 $78\%$ 左右。这意味着递归合成并没有触及所谓的数据耗竭天花板。
与此同时,任务的结构复杂度和求解难度呈现出爆炸式的增长。最初始的种子任务,其参考解决方案中位数仅有数十行,而到了第十五轮,中位解决方案代码行数激增了 $5.6$ 倍,实际执行的命令数量更是增长了 $6.1$ 倍。相比之下,用自然语言描述这些任务的公共指令长度仅增加了 $1.4$ 倍。这说明任务并非通过堆砌冗长的文字描述来制造难度,而是其内在的执行链路变得更加深邃。
为了客观衡量这种难度跃迁,研究人员使用固定参数的 DeepSeek-V4-Pro 对各轮次提取的子集进行了直接测试。在严苛的零容错评判标准下,DeepSeek-V4-Pro 在第一轮任务上的四次内通过率(pass@4)高达 $90\%$;但面对第十五轮的任务,这一数值发生了断崖式下跌,仅剩 $2.5\%$。哪怕是在只看部分得分的宽松标准下,平均得分也从 $0.970$ 暴跌至 $0.170$。这充分证明了 RST 成功地从简单任务中孵化出了当前顶尖大模型也难以驾驭的长周期深水区任务。
激发智能体潜能:微调与强化学习实验
合成数据的终极使命是反哺模型。为了验证这数万条高难度数据是否真的能够教会模型掌握长周期终端能力,研究团队进行了详尽的训练实验。
他们利用开源模型在这些合成任务上进行自博弈式的推演(Self-rollout),收集那些成功完成任务的轨迹。随后,这些轨迹被用于对 Qwen3.5-27B 和 Qwen3.5-122B-A10B 进行标准的监督微调(SFT)。
结果显示,仅仅依靠基础的监督微调,两个规模的 Qwen3.5 模型在 Terminal-Bench 2、Terminal-Bench Hard 以及极其考验持久力的 Long-Horizon Terminal Bench 这三大主流基准上,均取得了高达 $10$ 个百分点的绝对性能提升。值得注意的是,这些基准测试的题目与 RST 合成任务在文本描述相似度上极低,这说明模型学到的是真正泛化的终端操作技能,而非通过死记硬背数据来刷榜。
在微调取得成效后,研究人员进一步探索了智能体强化学习(Agentic RL)的潜力。针对长周期任务,基于验证器的强化学习尤为重要,因为它能直接引导模型优化最终的执行结果,而不仅仅是模仿轨迹分布。
实验采用了 PPO(近端策略优化)算法,以微调后的模型作为行动器(Actor),并引入了一个预热过的评论家(Critic)网络进行价值评估。在完全禁用人工设计的熵惩罚机制、仅依赖任务本身验证器提供的密集奖励信号的情况下,强化学习将 Qwen3.5-27B 在基准测试上的表现推向了新的高度。在 Terminal-Bench Hard 这一独立构建的困难数据集上,经过 RL 训练的 Qwen3.5-27B 取得了 $32.00\%$ 的成功率,相较于其基座模型,相对提升幅度达到了惊人的 $41.2\%$。
这种从冷启动、到微调、再到基于验证器反馈进行强化学习的完整闭环,展示了 RST 提供的数据不仅在“量”上具备优势,其内部蕴含的“逻辑一致性”更是充当了强化学习算法不可或缺的、可靠的奖励函数来源。
任务进化的微观切片
为了让这种“难度增长”变得具象化,我们不妨审视一个特定的任务演化脉络。
在最初的种子阶段,有一个基础的 JSON 差异比对任务,要求智能体运行一个简单的命令行工具对比两个预置的 JSON 文件,并保存输出。
随着递归轮次的推进,这个任务的核心目标没有改变,但外围的复杂度开始指数级累加。在后续轮次中,任务环境中被注入了破损的配置文件、复杂的回归测试用例;智能体不仅要执行比对,还需要在执行失败时读取系统日志,诊断由于环境变量缺失导致的崩溃,手动修复配置文件中的依赖项,清理之前生成的错误制品,最后才能成功运行工具并生成包含动态发布说明的最终报告。
在不改变原任务核心领域的前提下,这种不断强迫智能体应对各种边缘情况、诊断异常状态并进行状态修复的拓展机制,完美契合了真实软件工程环境中的长周期工作流模式。这正是 RST 能够持续为大模型提供高质量认知挑战的秘密所在。
对未来智能体发展的启示
RST 框架向业界证明了一个非常关键的结论:在长周期智能体数据领域,人类并非必须亲自下场去编写成千上万行复杂的测试环境代码。只要确立了“以验证过的解决方案为核心,逆向对齐环境与指令”的工程原则,大模型完全具备利用沙盒进行无限自我拓展的能力。
经过十五轮的迭代,合成数据在领域覆盖、重写算子多样性上依然保持活跃,这表明系统的多样性护城河极其稳固,没有任何趋向饱和或崩溃的迹象。可以预见,随着算力的进一步充裕,这种递归合成机制可以被轻易扩展至数十万乃至数百万的数据规模。
对于那些渴望摆脱高昂数据标注成本、致力于训练下一代自主软件智能体与终端操作模型的团队而言,RST 无疑提供了一条极具操作性和经济效益的明路。当合成数据的边际成本无限逼近于零,而其所能承载的任务深度超越了人类编写的平均水平时,我们距离真正意义上的通用全自动智能体,又近了坚实的一大步。