打破死板规则!CORAL让多Agent自主进化,探索效率飙升10倍

CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery

解决没有标准答案的开放性科学难题,一直被视为人工智能迈向更高级形态的试金石。面对复杂的物流调度或底层的系统内核优化,传统的“单次生成”模式早已捉襟见肘。

ArXiv URL:http://arxiv.org/abs/2604.01658v1

近年来,将大语言模型嵌入进化算法循环中,成为了破局的新希望。然而,该研究敏锐地指出,当前的系统依然像流水线上的牵线木偶,被固定的搜索规则死死限制住了自主性。

为了打破这种僵局,该研究提出了 CORAL 框架。这是首个面向开放性问题、由多智能体主导的自主进化框架Autonomous Multi-Agent Evolution)。

CORAL 让智能体真正翻身做主人。在极其严苛的 Anthropic 内核工程测试中,四个协同进化的智能体将历史最佳成绩从 $1363$ 个周期压缩至 $1103$ 个周期,效率实现了惊人的飞跃。

本文将深入拆解 CORAL 背后的运作机制,看看它是如何颠覆传统进化搜索的。

告别“牵线木偶”:传统进化搜索的瓶颈

在深入 CORAL 之前,我们不禁要问:以前的系统到底卡在哪里了?

像 FunSearch 或 AlphaEvolve 这样出色的系统,本质上采用的是固定进化搜索Fixed Evolutionary Search)范式。

Refer to caption

在这种模式下,系统通过外部写死的规则来决定怎么筛选候选方案、怎么构建上下文。大模型仅仅扮演一个被动的“突变生成器”,在接到提示词后完成一次前向推理。

这就好比让一位顶尖科学家去实验室打工,但他无权决定下一步查阅什么文献,无权决定何时暂停反思,更不能自己建立知识库。

而在多智能体领域,现有的合作大多依赖垂直扩展Vertical Scaling)。人类提前设定好“程序员”、“测试员”等角色和死板的沟通路线。这种预设对于未知的开放性难题来说,往往过于傲慢且局限。

该研究提出,真正的突破需要水平并行Horizontal Parallelism)。让多个独立的自主智能体并行探索,随时交流灵感,这正是 CORAL 诞生的初衷。

CORAL 核心机制:当 AI 掌握了进化的方向盘

CORAL 将决策权彻底交还给智能体。它抛弃了僵化的流水线,构建了一个支持长期运行的异步协作网络。

Refer to caption

在这个网络中,智能体可以在隔离的工作区中安全地试错。而支撑它们高效进化的,是两大核心设计:共享内存与心跳机制。

像文件系统一样的“共享持久化内存”

如何让多个自主探索的智能体既保持独立,又能站在彼此的肩膀上?CORAL 引入了共享持久化内存Shared Persistent Memory, $\mathcal{M}$)。

这就像是研究团队共享的云盘。它被设计成一个真实的文件系统,通过符号链接与每个智能体的私有工作区同步。

智能体可以通过命令行工具(CLI)或标准的 Bash 指令,在云盘中存取三种关键知识:

  1. 历史尝试:带有评分和反馈的具体方案代码。
  2. 研究笔记:智能体在探索过程中记录的实验心得。
  3. 可复用技能:被提炼出来的通用代码片段或工具脚本。

这种设计极其巧妙,不仅允许智能体按需读取上下文,避免信息过载,还能让它们自发地对文件夹进行分类整理。

三重“心跳”机制:拒绝盲目乱撞

赋予大模型过高的自主性,往往会导致它们在错误的兔子洞里越陷越深。为此,CORAL 设计了精妙的心跳干预机制Heartbeat-based Interventions)。

这就像是为研究员设定了三种不同节奏的复盘日程,强制它们停下来思考:

通过这三种心跳,CORAL 成功地在“充分放权”和“防止迷失”之间找到了平衡,让长期进化成为可能。

关键实验:全面碾压固定规则

该研究在涵盖数学优化(如圆形装箱)和系统优化(如GPU调度)的 11 个高难度任务上,对 CORAL 进行了全面评估。

单兵作战:少走弯路,效率倍增

即使只运行单个智能体,CORAL 的表现也足以令人惊叹。在与 EvoX 等采用固定进化搜索的 SOTA 基线对比中,单智能体 CORAL 拿下了全部 11 个任务的最高分。

由于原始表格数据庞大,本文重点提取其核心结论。

数据显示,CORAL 的改进率是基线方法的 $3$ 到 $10$ 倍。传统方法往往需要盲目评估 $60$ 到 $100$ 次才能收敛,而 CORAL 通常在 $5$ 到 $20$ 次评估内就能找到极佳解。

为什么会这样?因为固定的启发式规则会产生大量无效的“垃圾变异”。而 CORAL 的智能体会主动分析历史失败原因,判断方案成熟后再提交评估,极大地节省了算力浪费。

群狼战术:多智能体突破极限

多智能体的协同进化,则将探索边界推向了新的高度。

在 Anthropic 的内核工程这一压力测试中,单智能体往往会过早陷入局部最优。而当启用 4 个智能体协同进化时,它们通过共享持久化内存互相启发。

最终,4 智能体组合在没有外部网络搜索的辅助下,将优化周期从官方的最佳记录 $1363$ 推进到了 $1103$。

更有趣的是,这种协同不是靠算力堆出来的。消融实验(Ablation Studies)证明,4 智能体协同进化的成绩,显著优于“独立运行 4 个智能体并取最好成绩”的做法。这说明技术的自然扩散和灵感碰撞,确实在系统中自发产生了。

深刻的机制洞察与工程启示

我们究竟能从 CORAL 的成功中学到什么?

通过详细的轨迹分析,研究人员发现,表现最好的智能体不仅擅长“做题”,更擅长“做笔记”。它们会频繁地进行本地验证,积累测试用例,并主动翻阅之前的代码实现来寻找规律。

多智能体的贡献分布也展现出惊人的健康度。在内核优化任务中,四个智能体各自提交了百余次有效尝试,每个人都曾主导过历史最佳分数的突破,这是一种完美的分布式探索状态。

尽管 CORAL 展现了巨大的潜力,但该研究也坦诚地指出了局限性。高度自主的智能体在开放系统中运行,不可避免地带来了安全和资源管理风险。隔离的容器环境、严格的资源上限管控以及健康的会话管理,是系统落地必不可少的安全阀。

随着底层模型的不断强大,从被动生成走向自主进化,无疑是 AI 攻克硬核科学难题的必由之路。CORAL 框架不仅是一个出色的工程标杆,更为我们推开了通往通用科学探索智能的一扇大门。