打破死板规则!CORAL让多Agent自主进化,探索效率飙升10倍
CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery
解决没有标准答案的开放性科学难题,一直被视为人工智能迈向更高级形态的试金石。面对复杂的物流调度或底层的系统内核优化,传统的“单次生成”模式早已捉襟见肘。
ArXiv URL:http://arxiv.org/abs/2604.01658v1
近年来,将大语言模型嵌入进化算法循环中,成为了破局的新希望。然而,该研究敏锐地指出,当前的系统依然像流水线上的牵线木偶,被固定的搜索规则死死限制住了自主性。
为了打破这种僵局,该研究提出了 CORAL 框架。这是首个面向开放性问题、由多智能体主导的自主进化框架(Autonomous Multi-Agent Evolution)。
CORAL 让智能体真正翻身做主人。在极其严苛的 Anthropic 内核工程测试中,四个协同进化的智能体将历史最佳成绩从 $1363$ 个周期压缩至 $1103$ 个周期,效率实现了惊人的飞跃。
本文将深入拆解 CORAL 背后的运作机制,看看它是如何颠覆传统进化搜索的。
告别“牵线木偶”:传统进化搜索的瓶颈
在深入 CORAL 之前,我们不禁要问:以前的系统到底卡在哪里了?
像 FunSearch 或 AlphaEvolve 这样出色的系统,本质上采用的是固定进化搜索(Fixed Evolutionary Search)范式。

在这种模式下,系统通过外部写死的规则来决定怎么筛选候选方案、怎么构建上下文。大模型仅仅扮演一个被动的“突变生成器”,在接到提示词后完成一次前向推理。
这就好比让一位顶尖科学家去实验室打工,但他无权决定下一步查阅什么文献,无权决定何时暂停反思,更不能自己建立知识库。
而在多智能体领域,现有的合作大多依赖垂直扩展(Vertical Scaling)。人类提前设定好“程序员”、“测试员”等角色和死板的沟通路线。这种预设对于未知的开放性难题来说,往往过于傲慢且局限。
该研究提出,真正的突破需要水平并行(Horizontal Parallelism)。让多个独立的自主智能体并行探索,随时交流灵感,这正是 CORAL 诞生的初衷。
CORAL 核心机制:当 AI 掌握了进化的方向盘
CORAL 将决策权彻底交还给智能体。它抛弃了僵化的流水线,构建了一个支持长期运行的异步协作网络。

在这个网络中,智能体可以在隔离的工作区中安全地试错。而支撑它们高效进化的,是两大核心设计:共享内存与心跳机制。
像文件系统一样的“共享持久化内存”
如何让多个自主探索的智能体既保持独立,又能站在彼此的肩膀上?CORAL 引入了共享持久化内存(Shared Persistent Memory, $\mathcal{M}$)。
这就像是研究团队共享的云盘。它被设计成一个真实的文件系统,通过符号链接与每个智能体的私有工作区同步。
智能体可以通过命令行工具(CLI)或标准的 Bash 指令,在云盘中存取三种关键知识:
- 历史尝试:带有评分和反馈的具体方案代码。
- 研究笔记:智能体在探索过程中记录的实验心得。
- 可复用技能:被提炼出来的通用代码片段或工具脚本。
这种设计极其巧妙,不仅允许智能体按需读取上下文,避免信息过载,还能让它们自发地对文件夹进行分类整理。
三重“心跳”机制:拒绝盲目乱撞
赋予大模型过高的自主性,往往会导致它们在错误的兔子洞里越陷越深。为此,CORAL 设计了精妙的心跳干预机制(Heartbeat-based Interventions)。
这就像是为研究员设定了三种不同节奏的复盘日程,强制它们停下来思考:
- 单步反思心跳(Per-iteration Reflection Heartbeat):在每一次探索循环后触发,强制智能体趁热打铁,记录下当前的观察和灵感,存入笔记中。
- 周期巩固心跳(Periodic Consolidation Heartbeat):在进行了固定次数的尝试后触发。此时智能体会像写周报一样,整理杂乱的笔记,并将有价值的逻辑提炼为可复用的“技能”。
- 停滞重定向心跳(Stagnation-triggered Redirection Heartbeat):当系统检测到智能体连续多轮没有提升分数时触发。这会强迫智能体抬起头来,审视大方向,决定是继续死磕,还是彻底切换搜索路径。
通过这三种心跳,CORAL 成功地在“充分放权”和“防止迷失”之间找到了平衡,让长期进化成为可能。
关键实验:全面碾压固定规则
该研究在涵盖数学优化(如圆形装箱)和系统优化(如GPU调度)的 11 个高难度任务上,对 CORAL 进行了全面评估。
单兵作战:少走弯路,效率倍增
即使只运行单个智能体,CORAL 的表现也足以令人惊叹。在与 EvoX 等采用固定进化搜索的 SOTA 基线对比中,单智能体 CORAL 拿下了全部 11 个任务的最高分。
由于原始表格数据庞大,本文重点提取其核心结论。
数据显示,CORAL 的改进率是基线方法的 $3$ 到 $10$ 倍。传统方法往往需要盲目评估 $60$ 到 $100$ 次才能收敛,而 CORAL 通常在 $5$ 到 $20$ 次评估内就能找到极佳解。
为什么会这样?因为固定的启发式规则会产生大量无效的“垃圾变异”。而 CORAL 的智能体会主动分析历史失败原因,判断方案成熟后再提交评估,极大地节省了算力浪费。
群狼战术:多智能体突破极限
多智能体的协同进化,则将探索边界推向了新的高度。
在 Anthropic 的内核工程这一压力测试中,单智能体往往会过早陷入局部最优。而当启用 4 个智能体协同进化时,它们通过共享持久化内存互相启发。
最终,4 智能体组合在没有外部网络搜索的辅助下,将优化周期从官方的最佳记录 $1363$ 推进到了 $1103$。
更有趣的是,这种协同不是靠算力堆出来的。消融实验(Ablation Studies)证明,4 智能体协同进化的成绩,显著优于“独立运行 4 个智能体并取最好成绩”的做法。这说明技术的自然扩散和灵感碰撞,确实在系统中自发产生了。
深刻的机制洞察与工程启示
我们究竟能从 CORAL 的成功中学到什么?
通过详细的轨迹分析,研究人员发现,表现最好的智能体不仅擅长“做题”,更擅长“做笔记”。它们会频繁地进行本地验证,积累测试用例,并主动翻阅之前的代码实现来寻找规律。
多智能体的贡献分布也展现出惊人的健康度。在内核优化任务中,四个智能体各自提交了百余次有效尝试,每个人都曾主导过历史最佳分数的突破,这是一种完美的分布式探索状态。
尽管 CORAL 展现了巨大的潜力,但该研究也坦诚地指出了局限性。高度自主的智能体在开放系统中运行,不可避免地带来了安全和资源管理风险。隔离的容器环境、严格的资源上限管控以及健康的会话管理,是系统落地必不可少的安全阀。
随着底层模型的不断强大,从被动生成走向自主进化,无疑是 AI 攻克硬核科学难题的必由之路。CORAL 框架不仅是一个出色的工程标杆,更为我们推开了通往通用科学探索智能的一扇大门。