State2State:告别人工任务与标注,清华阿里提出智能体环境自驱中训
State2State: Environment-Derived Mid-Training for LLM Agents
训练大语言模型智能体(LLM Agent)的主流路径,长期以来被两堵“无形的高墙”所阻隔:一堵是依赖专家示范轨迹的监督微调(SFT),另一堵则是依赖人类精心设计任务和验证器的强化学习(RLVR)。前者成本高昂且受限于教师模型的能力上限;后者虽然允许智能体自主交互,却将成本转嫁到了任务生成、奖励函数工程以及复杂测试用例的编写上。
ArXiv URL:https://arxiv.org/abs/2608.04934v1
面对这一困局,来自阿里巴巴和清华大学的研究团队提出了全新的解决思路:State2State。这项研究不再纠结于“如何让人类或更强的大模型生成更多任务”,而是退回智能体交互的最本质关系——智能体与环境。研究团队提出了“环境学习”(Environment Learning)这一中训(Mid-Training)范式,完全摆脱对外部任务指令与人工验证器的依赖,仅凭智能体在环境中的自由探索,将探索中可达的环境状态转化为自我挑战的目标状态,通过纯规则的状态匹配计算奖励。

实验表明,State2State 作为独立的环境学习阶段,能有效诱导出强大的底层环境感知与操控先验。在 ALFWorld、ScienceWorld 以及更具挑战性的 MobileWorld 移动 GUI 任务中,State2State 均展现出稳定的性能增益;更重要的是,将其作为下游人类任务强化学习的初始权重时,下游任务的学习效率与最终成功率大幅提升,甚至表现出宝贵的跨环境泛化能力。
困在人类任务分发器里的智能体
现阶段的大模型智能体训练,本质上仍然是一种高度中心化的“被动接受”模式。无论是通过高质量人类轨迹进行模仿学习,还是引入更强的教师模型(如 GPT-4)合成轨迹与指令,智能体所见识到的状态空间,都不可避免地被人为定义的任务分布所局限。
当我们将智能体置于强化学习框架下时,这一瓶颈变得尤为尖锐。智能体如果想要通过与环境交互获得策略提升,就必须有清晰的目标和可验证的反馈。以往的做法通常需要研究人员预先写好逻辑完备的验证器(Verifier),比如检查数据库某字段是否改变、特定文件是否被创建等。设计这些验证器耗时耗力,往往只能覆盖非常有限的操作路径。即便采用基于大模型的任务自动生成机制,也极易引入教师模型的偏见,不仅推理开销巨大,还难以在长序列交互中保证奖励信号的准确性与客观性。
这就引出了一个底层问题:如果不给智能体派发任何人类任务,也没有外部教师随时指点,智能体能否仅依靠与环境的直接互动,自发习得关于这个世界的物理规则与操控技能?
人类幼儿在成长初期正是如此——他们并不需要父母每时每刻下发诸如“把积木堆到三层高”的任务,而是在不断推倒、触摸、抓取物体的过程中,感知周围环境的状态变化。当幼儿意识到某种动作可以把世界从“状态 A”变为“状态 B”时,底层的环境操纵先验便已经建立。State2State 的核心愿景,正是把这种无监督、环境自驱的学习机制引入到大模型智能体的中训阶段。
从可达状态到训练目标:State2State 的运作机制
State2State 的设计核心在于将“探索中发现的可达环境状态”转化为“可验证的强化学习任务目标”。在整个过程中,环境本身同时充当了任务的设计者和结果的裁判。

该方法整体由三个环环相扣的阶段构成:
1. 无偏见的环境随机探索
为了收集足够丰富的目标状态候选池,系统首先需要一个探索策略(Exploration Policy)与环境展开自主交互。直觉上,调用高级大模型作为探索者似乎更具针对性,但作者团队在深入实验后发现,高级大模型在探索时自带强烈的“任务导向偏置”,往往只在人类预设的狭窄路径上打转,而且带来了高昂的推理成本与延迟。
相反,State2State 刻意采用了简单、高效的随机探索策略(Random Exploration)。智能体仅从当前步骤有效的动作空间中采样并执行。在状态空间较大的复杂环境(如科学实验环境 ScienceWorld)中,探索策略加入了轻量级的分段先验:前期倾向于选择移动和观察动作以提升探索广度,后期则倾向于选择改变物体状态的实验操作以挖掘交互深度。由于探索过程无需任何大模型推理,整个状态收集可以在数百条环境中高度并行,极低成本地构建起海量的状态池。
2. 状态过滤与任务重放构造
盲目收集的状态中夹杂着大量无效动作提示、歧义报错或无信息量的文本。State2State 建立了规则过滤管线,清洗掉不可复现与冗余的反馈,并对独立观察(Observation)设定采样上限以保证状态的多样性。
在绝大多数交互环境中,智能体并不能直接读取底层的完整物理变量(如内存绝对地址或隐藏变量),而是通过文本描述或结构化界面获取环境反馈。State2State 顺应这一现实,将智能体接收到的环境观察作为状态的操作化代理(Operational Representation)。每个被选中的目标观察 $o^{\star}$,都会与其初始环境配置配对,构成一个“状态达成任务”(State-Reaching Task):给定初始状态观察与目标状态观察,智能体必须自主规划动作序列,将当前环境精准推演至目标状态。
3. 基于规则匹配的强化学习中训
当任务形态被定义为“从状态 A 变为状态 B”时,奖励验证的难题便迎刃而解。智能体不再需要复杂的自然语言断言或测试用例,只需在每一步交互后,计算当前观察 $o(s_t)$ 与目标观察 $o^{\star}$ 的一致性:
\[r_{t}=\left\{\begin{array}[]{ll}1,&\mathrm{match}(o(s_{t}),o^{\star}),\\ 0,&\mathrm{otherwise}.\end{array}\right.\]在文本环境中,这一匹配通过规范化的精确文本匹配(Textual Normalized Exact Match)即可完成,属于确定性极强的硬反馈。
在优化算法上,State2State 采用群体相对策略优化(GRPO),并结合了动态采样机制(Dynamic Sampling)。由于环境自驱生成的任务难度天然存在跨度,部分状态可能极易达成,部分则属于当前策略无法企及的极难状态。动态采样机制会自动剔除那些所有 Rollout 得分完全相同(全对或全错)的无效组,强制系统不断采样,直到凑齐具有对比差异的批次。这相当于为模型自动构建了一条紧贴当前能力边界(Policy Frontier)的自适应学习曲线,极大提升了强化学习在宽泛目标下的训练稳定性。
实验印证:底层操控能力如何转化为实际生产力
为了验证 State2State 的通用价值,研究团队在代表家庭日常操控的 ALFWorld 和代表复杂科学实验流程的 ScienceWorld 上展开了系统评估,测试模型选用开源代表 Qwen3-4B 与 Qwen3-8B。
实验明确将 State2State 定位为中训阶段(Mid-Training),重点考察它能否为后续的人类任务下游微调注入更坚实的底座能力。
在 ALFWorld 这样高度依赖长程物品检索与容器操作的环境中,仅经过 80 步 State2State 中训的模型,在不接触任何人类下游任务的前提下,便在基础得分上带来了稳定的增长。这种增长在 Qwen3-8B 上尤为明显。而在科学实验场景 ScienceWorld 中,由于物理规律与状态依赖链极其繁杂,直接用目标匹配去评估 4B 模型的独立性能略显苛刻,但一旦进入完整的“State2State 中训 + 下游任务强化学习(RL)”链路,前期积累的潜能便被彻底激活。
对于 Qwen3-8B,在 ALFWorld 上,直接进行下游人类任务强化学习(RL-only)带来的提升幅度有限,而在加入 State2State 中训后,整体胜率获得了超过 5 个百分点的额外增长;在 ScienceWorld 上的提升幅度也接近 4 个百分点。这一对比揭示了一个深刻的训练机制:State2State 所学到的并不是特定人类指令的语言对齐,而是底层的因果感知与动作回馈直觉;后续的人类任务强化学习,其作用恰好是充当“意图对齐器”,将这些深植于模型内部的底层操作技能,迅速导向人类期望的目标输出。
训练管线的消融洞察:何时使用、如何搭配?
在实际工程落地中,我们最关心的是 State2State 应该摆在整体训练管线的什么位置,以及它与现有主流技术是否存在冲突。作者在分析章节给出了非常明确的实证指引。
SFT、State2State 与 RL 的最佳装配顺序
许多团队在构建智能体时都会先进行蒸馏 SFT。那么 State2State 是应该放在 SFT 之前,还是 SFT 之后?
消融实验给出了清晰答案:SFT 之后的 State2State 效果最好。如果先进行 State2State 中训再做 SFT,模仿学习阶段的强大损失信号会部分洗刷掉此前探索学到的技能先验;而如果在优质的 SFT 策略之后接入 State2State,智能体不仅能凭借更具韧性的初始理解力探索出更有价值的高阶状态,还能进一步打破专家轨迹的数据茧房。最终形成的“SFT $\to$ State2State $\to$ RL”三段式管线,在测试集以及分布外(OOD)评估中均取得了最高的成功率。
探索策略的哲学:无偏的随机胜过昂贵的大模型
在探索阶段对比 Qwen-Plus 驱动的智能探索与纯随机探索时,实验数据出现了一个反直觉的结论:纯随机探索训练出的最终策略显著优于大模型探索策略。
其深层原因在于,强大的 LLM 探索器本身受到大量人类语料对齐的影响,在探索时天然具备强烈的任务先验,这使得它总是倾向于在“看似有用”的子空间里行动,从而丢失了物理世界的大量冷门但关键的状态转变;而随机策略在轻量启发式规则的辅助下,反而能够触碰到了更加宽广甚至反常规的状态拓扑。再加上随机策略免去了巨大的 API 账单与推理延迟,在实用性上展现出了绝对优势。
与先进强化学习骨干的解耦兼容
当把基线算法从标准的 GRPO 切换为针对长序列细粒度奖励优化的智能体专用算法 GiGPO 时,State2State 依然展现出即插即用的正交兼容性。中训后的策略直接接入 GiGPO,能继续在分布内与分布外测试集上拉开明显差距,证明了环境学习带来的先验独立于下游优化算法的演进。
突破文本局限:跨环境泛化与移动 GUI 扩展
更具启发意义的成果体现在跨环境的迁移测试中。当智能体在 ScienceWorld 环境中仅接受 State2State 中训后,直接迁移到 ALFWorld 环境下进行下游人类任务的强化学习,其最终表现不仅超越了未经中训的底座,甚至超过了“先在 ScienceWorld 学习人类标准任务再迁移”的对照组。
这一现象说明,人类定义的具体任务(例如在科学环境中配制特定溶液)往往包含强烈的领域过拟合成分,迁移到家庭杂物整理任务时极易产生负迁移;相反,State2State 训练的目标是“如何理解状态转移,并利用动作缩小当前状态与目标状态的差距”,这种对环境动态逻辑的通用推理框架,具有天然的跨领域迁移潜力。
为了验证这一机制在更广阔领域的生命力,研究团队进一步将 State2State 推进到了极度复杂的真实场景——MobileWorld 移动端图形用户界面(GUI)基准。
在手机或操作系统的真实界面交互中,任务往往跨越多个 App,上下文极长。最让业界头疼的问题是:为成百上千个应用操作手动编写任务逻辑和断言判定代码几乎是不可能完成的任务,这直接卡死了 GUI 智能体的在线强化学习。
State2State 在 MobileWorld 的 GUI-only 子集(包含 117 个高难度复杂任务)上展现了独特的工程价值。在没有任何下游人类标注任务参与训练的情况下,研究人员仅利用界面操作探索收集目标界面状态,驱动专用界面模型 MAI-UI-8B 进行了 80 步 State2State 中训,便直接将模型的任务完成率从 27.5% 推进到了 30.8%。这一初步实验充分印证:只要一个系统具备可复现的状态空间以及可比对的观察接口,State2State 就能在零人工介入的条件下源源不断地供给训练养分。
走向更广袤的自驱进化
回顾大模型发展历程,语言模型能力的飞跃很大程度上得益于无监督预训练(Next-Token Prediction)摆脱了对昂贵人工标注的依赖。然而,当技术演进至具身智能体与通用助手阶段时,整个领域却在一定程度上“倒退”回了重度依赖人工标注轨迹与手写测试用例的农耕时代。
State2State 的核心启示在于,它向我们展示了一条让智能体在数字世界中进行“无监督交互预训练”的具象化路径。通过将可达状态转化为任务目标,它不仅巧妙绕开了奖励工程与任务合成的黑盒难题,更在智能体内部沉淀出了应对复杂动态系统的基础操控直觉。
尽管当前这项工作仍受限于文本环境与轻量级 GUI 的测试范畴,对前沿超大尺度基础模型的交互规律还有待更深入的规模化分析(Scaling Analysis),但它所开辟的“环境即监督源”的探索视角,无疑为构建未来能够自主探索网络世界、跨越异构软件系统的通用智能体,提供了一套轻量、严谨且极具可扩展性的工程范本。