港科大HSI:大模型自我进化脚手架,多任务进度最高提升39.3%

Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

港科大HSI:大模型自我进化脚手架,多任务进度最高提升39.3% 论文图示

大模型智能体(LLM Agent)在各类复杂任务中的表现,往往并不完全取决于模型底座本身的参数规模。在模型权重保持不变的情况下,围绕模型构建的外部执行脚手架——也就是业界常说的 Harness(包含提示词编排、工具调用、长期记忆维护、状态追踪与验证逻辑)——往往对最终任务的成败起着决定性作用。然而,长久以来业界对 Harness 的优化大多依赖人类专家的手工调试,或者引入更强大的外部大模型充当“设计师”进行反复重写。一旦智能体系统部署上线,这套执行脚手架通常就被固化为静态代码,不再具备自主生长的能力。

ArXiv URL:https://arxiv.org/abs/2608.08466v1

香港科技大学(HKUST)的研究团队在最新论文中打破了这种静态脚手架的思维定式,提出了名为 HSI(Hierarchical Self-Improvement,分层自进化)的全新框架。该研究的核心假设是:无需改动底层大模型的参数权重,也不引入更强大的外部指导模型,仅凭一个被完全冻结的单一语言模型,就能通过自内向外的分层重写机制,实现执行脚手架在特定任务家族中的持续自我演化。在交互式复杂长流程基准评测 BALROG 上的实验显示,以冻结的 DeepSeek-V4-Flash 为底座,HSI 驱动的脚手架进化使智能体在多个任务中的原始进度指标实现了实质性跃升,其中 BabyAI 环境的任务进度提升达到 $+39.3\%$,Crafter 提升 $+33.0\%$,TextWorld 提升 $+25.0\%$。

这项工作不仅展示了在固定模型能力下压榨系统级性能的可能空间,更重要的是,它清晰地划定了智能体自进化的两条物理边界:环境反馈的保真度,以及底层模型不可突破的固有认知上限。

走出静态脚手架:自指进化的结构性困境

智能体如何完成自我提升,一直是人工智能领域极具吸引力但又充满陷阱的命题。早期的哥德尔机(Gödel Machine)构想了一种能够重写自身代码的自进化系统,但前提是所有修改都必须经过数学形式的形式化验证。进入大语言模型时代后,衍生出了类似 Darwin Gödel Machine 等尝试通过运行时动态修改智能体单步决策代码的路线。然而,这些系统大多将可演化的边界严格限制在“一步推理或动作决策函数”层面,未能触及更广阔、更复杂的 Harness 层面。

与之相对的另一条路线则是脚手架工程优化。诸如 Meta-Harness 等工作虽然注意到了脚手架对于智能体表现的巨大杠杆效应,但它们的优化逻辑主要依托外部提议者(External Proposer),本质上是利用一个更聪明的外部模型在搜索空间里进行离线搜索,并非智能体的“内生演化”。此外,学术界近期的反思性评测也指出了脚手架搜索的一个致命隐患:许多声称大幅提升性能的脚手架演化,实际上只是测试集上的过拟合搜索,一旦迁移到未见过的任务中,泛化能力便迅速归零。

造成上述困境的根本原因在于结构设计的两难。如果允许智能体无限制地修改系统内部的一切代码,系统很快会陷入不可控的“自指混乱”——智能体可能会篡改评测代码以刷高分数,或者改崩了最核心的代码演化引擎导致程序崩溃。反之,如果将脚手架死板地固定下来,智能体就无法根据具体任务环境的动态反馈调整自己的交互范式。

香港科技大学团队提出的 HSI 框架,正是为了解决这一核心矛盾。研究人员没有试图去训练一个适应所有任务的“万能脚手架”,而是将研究视角转向了任务特定且持续可演化(task-specific and continuously evolvable)的机制设计:让每一个任务家族拥有一套专属于该场景的脚手架,通过标准化的接口在演化迭代中无缝热插拔,并完全依赖环境反馈驱动脚手架的自主迭代。

HSI 的核心架构:单一冻结底座下的三层解耦

为了在不发生逻辑崩溃的前提下实现内生演化,HSI 提出了一种“分层自我改造且带有外层固定锚点”的优雅架构。在整个体系中,只有一个处于完全冻结状态的语言模型 $M$(实验中采用 DeepSeek-V4-Flash)。这个单一模型被同时放置在三个互不干扰、职责分明的演化作用域(Scopes)中运作:

第一个层级是任务脚手架层(Task Harness Scope)。在该层中,模型 $M$ 负责在当前脚手架 $H$ 的包裹下与具体的环境交互,执行诸如观察世界、规划步骤、调用工具等具体动作。这是智能体直面任务的业务前台。

第二个层级是演化器层(Evolver Scope)。该层不再直接参与打游戏或执行任务,而是将上一层的整个脚手架代码 $H$ 视为可以编辑修改的代码文本。演化器负责读取先前的任务评测得分、错误日志与历史经验,提出修改假设,直接重写并生成新的脚手架候选版本。

第三个层级是元演化器层(Meta-Evolver Scope)。如果只演化脚手架代码,演化策略本身就依然是静态的。因此,HSI 允许模型进一步上升到元层级,负责重写演化器自身的策略代码 $\Sigma$(例如如何生成种子、如何平衡探索与利用、如何维护代码历史存档)。

这套设计最精妙的约束在于:元演化器虽然可以改写演化策略 $\Sigma$,但元演化器自身的执行驱动逻辑被固化为一个不可篡改的初始模板(Frozen Outer Anchor)。这一外层不可变锚点的存在,彻底切断了无限递归自修改的死循环,确保了智能体可以在合法且受控的边界内改写自身的行为机制,而绝不会演变成不可逆的代码灾难。

为了真正厘清性能提升究竟源自脚手架的演进还是测试期的推理算力放大,HSI 还引入了一个极具启发性的思考开关设计(Thinking-on/off Design)。在执行底层具体任务时,模型被强制关闭长链思考机制(Thinking-off),以此封顶其单步裸推理能力;而在演化器与元演化器进行代码重构与反思时,思考机制被全面放开(Thinking-on),以最大限度释放其代码设计与批判性分析能力。这种显式的解耦设计,使得最终取得的性能增益能够干净地归因于脚手架架构的优化,排除了测试期模型因额外思考步骤而产生的混淆变量。

自治演化闭环:五阶段循环机制

在具体运转流程上,HSI 并没有预设任何人为规定的“退火机制”或固定的探索与利用时间表。所有的决策逻辑均交由冻结模型根据上下文自主判断。一次完整的演化周期由五个受控阶段循环构成:

第一阶段为种子选择与假设生成。系统维护着一张演化历史有向图 $\mathcal{G}_t$,图中的每一个节点都代表一个经过实际测试的代码版本,边则记录着演化的脉络关系。模型需要回顾先前的得分曲线与教训文档 BOOTSTRAP.md,从中挑选出一个最有潜力的旧版本作为演化锚点,并明确写出一份结构化假设,内容必须涵盖选择该版本的动机、预期的改进方向,以及至关重要的证伪标准。这一步骤将盲目的代码突变转化为了由科学假设驱动的目标导向搜索。

第二阶段进入主演化阶段。演化器根据上述假设,对任务脚手架的代码进行重构。模型可以自由增删短期记忆模块、调整提示词结构、重写环境观察的过滤函数,甚至是重构多轮交互的状态机。但整套机制受到一个不可打破的结构不变量约束:脚手架连接外部任务的调用接口(Injection Seam)绝对冻结。这意味着无论内部逻辑如何天翻地覆,它必须能以即插即用的方式无缝挂载回测试环境中。

第三阶段是多分支提交选择。演化器生成多个候选版本并在验证集上试运行后,提交选择模块并不会简单粗暴地只保留单一最高分版本,而是依据代码多样性与演化潜力,挑选出一组包含不同方向的候选池提交进版本图谱中,确保演化树保留足够的探索分支,避免过早陷入局部最优。

第四阶段进入元演化阶段。元演化器开始介入,观察这一轮演化中哪些策略奏效、哪些策略导致了低效的代码崩溃,并据此修改演化策略脚本 $\Sigma$ 本身,实现演化逻辑在实践中的迭代升级。

在完成预设的 $T$ 轮大循环后,系统进入最终的第五阶段:面向泛化的最优版本导出。在这个终局阶段,策略彻底从“鼓励多样性探索”切换为“严苛的泛化验证”,利用专门的验证集指标,选拔出综合泛化能力最强的一个脚手架版本,固化导出作为该任务家族的最终形态。

实验检验:适度难度下的惊人爆发力

为了全面检验 HSI 的实际效果,研究团队选择了以长流程交互、高难度环境著称的 BALROG 基准。BALROG 包含六个不同维度的文本交互环境,非常考验智能体的规划、记忆、工具调用和状态追踪能力,且具有清晰的难度梯度阶梯。

在实验设置中,所有底层推理完全依托 DeepSeek-V4-Flash,演化过程进行 5 轮大迭代,并在每一次环境交互中采用带有置信下界惩罚的稳健评估方式,尽可能剔除随机高分轨迹对演化方向的误导。核心评测结果直接揭示了脚手架演化的巨大威力:

在被划归为“中等难度”的环境中,经过 HSI 演化后的脚手架展现出了对原始初始脚手架(Init Harness)的全面碾压:

在专注于指令跟随与空间探索的 BabyAI 任务中,原始初始脚手架仅能取得极低的进度,而经过 HSI 演化后,智能体的任务进度原始绝对值激增了 $+39.3\%$;在需要多步骤生存规划、合成物品的 Crafter 开放沙盒环境中,进度实现了 $+33.0\%$ 的大幅跨越;在涉及纯文本解谜和长程探索的 TextWorld 中,演化带来了 $+25.0\%$ 的进度收益;而在复杂的网格探索环境 MiniHack 中,任务完成度也稳步上升了 $+15.0\%$。

深入分析演化出的脚手架代码可以发现,模型自主演进出了一系列高度工程化且针对任务特性的精巧机制:在需要大量长期记忆的环境中,智能体主动为自己编写了精简的状态压缩函数,剔除了大量干扰上下文的无效文本;在需要反复试错的场景中,它自主构建了错误回滚机制,防止智能体在同一种死胡同动作中陷入无限循环死锁。这一系列改进并非来自预设的算法,完全是冻结模型在与环境碰撞后自发编写的代码成果。

泛化性检验:究竟是真进化还是过拟合?

针对以往研究中饱受诟病的“过拟合”问题,团队在经典的 BabaIsAI 规则变换子套件上执行了严格的留出集评测(Held-out Test)。在演化阶段,智能体只能接触到 $80\%$ 的任务关卡,剩下的 $20\%$ 关卡在演化过程中被完全隔离,仅在最终评估时调用。

实验结果给出了强有力的正面回应:在规则变动极具挑战性的 BreakStop 任务子套件中,演化出的脚手架在未见过的留出关卡上取得了高达 $0.98$ 的最佳测试进度;而在 GoTo 任务子集上,其在完全未见过的关卡中更是斩获了 $1.00$ 的满分表现。

这组留出集评测有力地证明:当任务处于特定的家族分布内时,HSI 演化出的脚手架绝非简单记住了特定关卡的通关秘籍,而是提炼出了能够应对此类问题的一阶抽象策略与认知控制流。这种脚手架结构展现出了极强的分布内泛化韧性。

自我演化的物理边界:何时失效?

科学研究的价值往往不仅在于宣告成功,更在于坦诚地探索边界。HSI 论文最精彩的论述之一,正是它没有陷入“大模型可以无限自我演化达到通用智能”的虚幻叙事,而是通过严谨的失败案例,形式化地界定了脚手架内生进化的两大硬性物理上限:

1. 反馈保真度边界(Feedback-Fidelity Bound)

进化的先决条件是选择,而选择的前提是环境能够提供具有区分度的奖惩信号。在实验中,如果环境给予的反馈过于稀疏,或者执行轨迹中的噪声过大,演化器就无法形成有效的声音来验证假设。当所有的代码突变在验证集上都得到一模一样的零分或完全随机的分数时,演化树就会彻底失去前进的方向感,退化为无意义的盲目随机搜索。

2. 底座能力边界(Backbone Capability Bound)

这是大模型自适应系统最根本的认知天花板。脚手架工程再精妙,它的本质依然是信息流在底座模型周边的路由、过滤与装配,它永远无法突破冻结底座内部原生的表征能力极限。

这一边界在 BALROG 最顶级的极难环境 NLE(NetHack Learning Environment)中暴露得淋漓尽致。NetHack 拥有浩繁的规则体系、长达成千上万步的行动序列,以及极端复杂的符号隐喻。实验显示,DeepSeek-V4-Flash 底座在 NLE 上原生的理解与决策能力严重不足,即使启用了 HSI,让演化器与元演化器使出浑身解数尝试各种复杂的外部状态记忆机制,最终在 NLE 上的任务完成度依然停留在接近零的基线水准,演化未见任何实质性提升。

这一硬性结论给当前过热的“智能体自我改造”研究泼了一盆及时的冷水:脚手架是模型能力的放大器,但绝不是虚无中凭空造出智慧的永动机。当任务难度彻底超出底层大模型的认知范围时,外部执行脚手架的任何重构都只是在沙滩上砌墙,徒劳无功。

结语与未来展望

香港科技大学的这项研究所构建的 HSI 框架,为大模型落地应用中的一个现实痛点提供了全新的解法:在许多垂直落地场景中,企业受限于算力成本或数据隐私,无法频繁对基础大模型进行微调与重新训练。HSI 证明了,仅仅依靠一个冻结的通用中端模型,通过构建任务特定的、自适应的执行脚手架,同样可以在诸如 BabyAI、Crafter 等复杂任务中压榨出极其可观的业务增益。

更深层次的启示在于智能体系统工程的范式转移。未来的 AI 架构师或许不再需要日复一日地手动调整提示词和设计调度链条,而是应该专注于搭建类似 HSI 中的结构安全锚点与演化契约:定义好不可被污染的外层评测逻辑,开放中间层供智能体自我编写、自我反思、自我裁剪。在反馈清晰、底座能力兜底的合理区间内,让脚手架在与真实世界的互动中自主演变,正成为大模型从静态推理走向动态适应的重要演进方向。