SynAct:闭环大模型 Agent 调优芯片逻辑综合,平均 WNS 降至 27%

SynAct: A Reasoning-Acting Large Language Model Agent for Adaptive Synthesis Optimization

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

SynAct:闭环大模型 Agent 调优芯片逻辑综合,平均 WNS 降至 27% 论文图示

在芯片数字前端设计流程中,逻辑综合(Logic Synthesis)承担着将 RTL 代码转化为门级网表的核心职能。这一环节既涉及布尔逻辑的大规模重构,也涉及标准单元库的技术映射。商业综合工具(如 Design Compiler、Genus 或 AltiSyn)内部封装了极为庞大的命令集与配置参数,覆盖组合逻辑、时序优化、寄存器重定时(Retiming)乃至物理感知优化等多个维度。由于综合命令的选择与执行次序对芯片最终的 PPA(性能、功耗、面积)结果具有高度敏感性,如何高效调优综合脚本一直是一项高维且昂贵的探索难题。时序指标尤其是最差负时序裕量(Worst Negative Slack, WNS)若发生严重违例,往往会导致后端布局布线反复迭代甚至推倒重来,直接拖垮整个流片进度。

ArXiv URL:https://arxiv.org/abs/2608.12751v2

针对逻辑综合调优,工业界与学界此前主要形成了两条技术路线:一类是基于传统算法或强化学习、贝叶斯优化的自动化黑盒搜索,这类方法通常局限在预设的固定动作空间中,搜索过程计算开销巨大且决策过程缺乏物理层面的可解释性;另一类则是近期兴起的大语言模型(LLM)驱动方法,通常采用一次性(One-shot)静态生成 Tcl 脚本的方式,模型无法获知底层电路在工具执行命令后的真实物理状态变化,面对复杂的时序违例往往力不从心。

来自香港中文大学(CUHK)的研究团队在论文中提出了 SynAct,一个专为芯片自适应逻辑综合调优设计的闭环推理-行动(Reasoning-Acting)大模型智能体。与以往割裂的方案不同,SynAct 将综合优化建模为带有状态反馈的动态交互过程。系统通过多轮循环实时诊断 EDA 工具吐出的详细时序与功耗报告,结合多层知识图谱检索(GraphRAG)与潜空间贝叶斯优化(BO),在大型商业综合工具中实现了时序违例的大幅收敛。在 7nm 工艺库与 14 个真实芯片设计的基准评测中,SynAct 将电路的平均 WNS 压缩到了初始基准综合状态的 27%,同时将面积与功耗开销严格限制在 1% 左右的极低波动范围内。

困局:为什么综合调优不能只靠静态生成或黑盒搜索?

要理解 SynAct 的技术切入点,必须看清逻辑综合调优面临的本质挑战。商业 EDA 工具提供的动作空间并非简单地在几个预设选项间做选择,而是允许工程师组合不同的变换策略、调节各类优化力度(Effort Level)、甚至针对特定模块设置约束属性。这种高度上下文相关的环境,导致了两个长期难以兼顾的难题。

一方面,传统黑盒搜索算法(如基于固定动作序列的遗传算法或多目标强化学习)主要依赖标量化的综合汇总数据作为反馈信号。例如仅凭一个总体 WNS 或面积数值来指导下一步策略。然而,标量摘要彻底抹杀了电路底层的拓扑信息:究竟是某条关键路径的组合逻辑级数过深,还是寄存器之间的数据建立时间无法满足?是时钟树未展开导致的延迟,还是特定功能模块的扇出(Fanout)过高?黑盒算法无法从标量中提炼出这些深层物理因果,只能在固定的命令集合中进行大量盲目试错,算力成本居高不下。

另一方面,早期的 LLM for EDA 方法大多聚焦于直接将自然语言需求“一步到位”翻译为 Tcl 脚本。大模型虽然在通识语义与通用脚本编写上表现亮眼,但逻辑综合是一个典型的多步状态转移过程:上一条优化命令执行后,网表内部的逻辑结构与关键路径可能已经发生戏剧性迁移。静态生成的长脚本无法预知这种动态演变,一旦前置命令引发局部拥塞或未达到预期效果,后续命令就会在错误的状态上继续累加,最终造成次优甚至劣质的网表输出。

SynAct 的核心逻辑,正是跳出“非黑即白的单次发散”与“固定动作的无脑搜索”,引入 ReAct(Reasoning-Acting)的自适应闭环机制。通过将电路诊断、知识增强、历史经验融合以及安全过滤深度解耦,让大模型在每一步都能依据当前网表的真实生理指标做出精准干预。

架构解剖:分析与优化的双 Agent 协同闭环

SynAct 将整个综合调优过程形式化定义为一个马尔可夫决策过程(MDP)。状态空间 $\mathcal{X}$ 不仅包含网表与 PPA 概览,还囊括了由商业工具生成的完备时序、面积与功耗分析报告;动作空间 $\mathcal{A}$ 则是工具支持的可执行综合命令;转移函数 $\mathcal{F}$ 由商业 EDA 综合工具在底层稳定驱动;奖励函数 $\mathcal{R}$ 则用于衡量时序改善与面积、功耗折中之间的权衡关系。

在执行流程中,系统首先基于默认约束运行一次基础综合(Bootstrap Synthesis),确立初始电路状态 $x_0$ 并记录基准数据。随后,系统进入多轮迭代的闭环循环,其核心由两个分工明确的智能体与一个候选评估机制驱动:

分析智能体(Analysis Agent) 扮演经验丰富的资深综合工程师角色。它摒弃了仅依赖标量摘要的粗放模式,专门解析工具输出的长篇详细文本。分析过程被拆解为两个阶段(Preprobe 与 Postprobe):前者在动作执行前对当前网表的时序瓶颈进行细致审查,识别出违反时序约束的具体模块和路径类型,并提出针对性的优化策略假设;后者则在动作执行后对比前后指标变化,评估前序决策的实际成效,形成反思机制(Reflection)。最终,分析智能体输出标准化的 JSON 诊断包,为下一步决策奠定精准输入。

优化智能体(Optimization Agent) 负责把分析智能体的定性诊断转化为底层可执行的具体 Tcl 综合命令。面对庞大的商业工具指令集,优化智能体并非依靠模型内部记忆自由发挥,而是同时接入了两个外部指导引擎:一个是提供精确领域文档支撑的多层 GraphRAG 知识图谱,另一个是利用历史执行数据在连续潜空间内探索的贝叶斯优化(BO)模块。两者结合,使优化智能体不仅能生成语法与语义完全合法的命令候选,还能针对性地覆盖当前电路最需要的优化类型。

候选选择与安全护栏(Candidate Selection) 则是保障全流程工程可靠性的关键阀门。大模型生成的多个命令候选会在工具的沙箱会话中先行尝试,随后系统执行严格的安全过滤规则:任何导致 WNS 剧烈恶化超过预设阈值(如 $-20\text{ ps}$)或综合奖励跌落至初始基准 $20\%$ 以下的动作都会被一票否决;若所有候选均未通过,系统将直接回滚至上一轮的健康检查点(Checkpoint)。在通过安全筛选的候选中,系统根据精心设计的非线性综合得分函数选出最优者正式提交:

\[\mathrm{score}(C) = r(C) + \kappa\sigma(z) - \rho(C)\]

其中奖励项 $r(C)$ 定义为:

\[r = \exp\!\left(-\sum_{i}w_{i}\log(1+\mathrm{err}_{i})\right)\]

该公式巧妙地引入了对数压缩机制,使得极端严重的违例指标不会在总体权重计算中过度主导或扭曲梯度,并在用户指定的首要目标(如 WNS)上分配更高权重。这种将物理约束直接编码进多目标打分体系的策略,杜绝了大模型在芯片设计调优中常见的“顾头不顾腚”现象。

推进器之一:多层 GraphRAG 破解离散知识孤岛

在优化智能体生成命令的过程中,检索增强生成(RAG)是必不可少的支柱。商业 EDA 工具的技术手册动辄数千页,普通向量检索(Vector RAG)由于仅计算语义嵌入相似度,常常在面对复杂场景时出现“断章取义”。芯片综合调优往往涉及深层因果链条——从特定的时序违例场景(Scenario),到对应的命令集(Command),再到命令下游挂载的各类控制变量与参数模式(Variable)。这三个实体在原生文档中通常分布在截然不同的章节,平铺直叙的检索很难跨越这层结构化断层。

为了攻克这一障碍,SynAct 构建了统一的跨层级知识图谱 $\mathcal{G} = (\mathcal{E}, \mathcal{R})$,将知识实体拆分为场景节点 $\mathcal{E}_S$、命令节点 $\mathcal{E}_C$ 与变量节点 $\mathcal{E}_V$:

  1. 层内关联(Intra-layer Relations):利用大模型预先分析命令与命令、变量与变量之间的逻辑关系,建立同层互联 $\mathcal{R}{CC}$ 与 $\mathcal{R}{VV}$,标示出哪些指令在逻辑上具备互补性或替代性。

  2. 层间映射(Inter-layer Relations):构建场景到命令的映射 $\mathcal{R}{SC}$ 以及场景到控制变量的映射 $\mathcal{R}{SV}$。例如,当遇到“数据建立时间违例严重且涉及多级进位链”这一特定场景时,图谱能够直接建立从该场景跨越到重定时指令及相关驱动强度控制变量的实体通路。

当分析智能体输出当前电路的诊断场景描述 $d_{\mathrm{scene}}$ 时,GraphRAG 首先在场景层计算语义相似度检索出前 $k$ 个最匹配的核心场景子集 $\mathcal{S}^*$;随后直接沿着预定义的图谱边拓扑展开,拉取关联的初始命令集 $\mathcal{C}_0$ 与变量集 $\mathcal{V}_0$,并在同层子图内通过 K 近邻(KNN)算法扩充上下文。这种将结构化图推理与向量召回相结合的方式,消除了大模型在调用底层 EDA 指令时瞎编参数或误用指令模式的可能。

推进器之二:GrammarVAE 结合置信区间贝叶斯探索

知识图谱解决了“先验知识从哪里来”的问题,但无法解答“在当前具体电路上该选择多大优化力度”。芯片设计的微架构千差万别,同一条优化命令在不同拓扑结构上的响应差异巨大。为了有效复用当前电路在多轮调优中的历史执行经验,SynAct 引入了基于 GrammarVAE(文法变分自编码器)的潜空间贝叶斯优化机制。

EDA 综合命令具备严格的上下文无关文法(CFG)。SynAct 利用离线预训练的 GrammarVAE 编码器 $\mathrm{Enc}(\cdot)$,将结构化的语法解析树压缩映射至连续的潜空间 $\mathcal{Z} \subseteq \mathbb{R}^d$。这一设计的精妙之处在于:在连续潜空间中几何距离相近的点,经过解码器映射后,恰好对应着语法结构、操作模式和配置参数高度相近的综合命令。这就将离散的、无法直接求导的 Tcl 文本搜索空间,转化为了光滑的数学空间。

在实际优化中,贝叶斯优化在围绕当前最优命令潜向量 $z_{\mathrm{best}}$ 构建的轴对齐置信区间(Trust Region $\mathcal{T}$)内展开。置信区间的半径会根据调优反馈自适应伸缩:若性能改善则外扩探索半径,若收益停滞则收缩聚焦局部。系统利用历史运行日志维护高斯过程先验,通过上置信界(UCB)采集函数:

\[\alpha(z) = \mu(z) + \kappa_{\mathrm{acq}}\,\sigma(z)\]

在置信区间内寻优生成下一个潜空间种子 $z_{\mathrm{next}}$,随后将其解码为命令骨架,交由优化智能体结合 GraphRAG 的上下文做最终的语法校验与参数对齐。

为了证实这一机制的物理真实性,作者团队在消融实验中专门验证了 GrammarVAE 的连续性假设。统计显示,在潜空间中彼此临近的命令对,其实际综合奖励的绝对差值 $\Delta r$ 平均仅为 0.188;而距离较远的命令对,该差值上升到了 0.238,降幅达 21.0%。这充分证明 GrammarVAE 成功捕捉到了综合命令语义的局部平滑特性,为贝叶斯优化提供了扎实的数学先验。

实验评测:商业综合工具上的硬核时序突破

评估 EDA 领域的 Agent 研究,最忌讳的是在简化、甚至脱离实际工艺库的开源玩具工具上刷榜。SynAct 的全套验证均搭建在全功能商业逻辑综合工具 AltiSyn(来自 ZeniSyn Design Systems)之上,并采用工业界主流先进工艺标准的 7nm ASAP7 标准单元库。基准测试覆盖了从算术逻辑单元、加解密引擎(sha3)到完整微处理器核心(arm9、linkruncca)共 14 个设计,时钟周期约束从 300 ps 到 2000 ps 不等。

在以 DeepSeek-V3.1 作为底层驱动模型的默认配置下,SynAct 展现出了强大的时序收敛能力:

评估指标 初始基准 (Bootstrap) SynAct (DeepSeek-V3.1) SynAct (GPT-5.2)
平均 WNS 比例 100.0% 27.03% 20.37%
平均 TNS 比例 100.0% 20.08% 13.69%
面积波动比例 100.0% 100.91% 100.46%
动态功耗波动比例 100.0% 100.86% 100.41%
静态功耗波动比例 100.0% 100.75% 100.32%

数据显示,仅经历 5 轮迭代,SynAct 便将 14 个设计的平均最差负时序裕量(WNS)大幅压缩至基准值的 27.03%,总负时序裕量(TNS)更是骤降至 20.08%。更为难得的是,这一剧烈的时序改善并没有付出常见的“面积爆炸”或“功耗失控”代价:各设计的平均门级面积、动态功耗与静态漏电功耗相较于基准综合结果,增幅均被严密锁定在 1% 以内,完美实现了关键 PPA 指标之间的平稳折中。

当将底层基座模型横向替换为更强大的 GPT-5.2 时,整个流水线展示出了良好的可扩展性:平均 WNS 比例进一步探底至 20.37%,TNS 比例降至 13.69%。这表明 SynAct 搭建的闭环推理-执行架构本身构成了坚实的底座机制,而更强大的基础模型能够更敏锐地读懂时序报告中的隐晦违例,从而拓宽系统的优化上限。

在组件消融分析中,去掉贝叶斯优化指导(w/o BO)会导致调优结果退化,而在去除 GraphRAG(改用传统扁平化检索 Vanilla RAG 或无检索的上下文长文本倾倒 w/o RAG)后,平均 WNS 比例分别反弹恶化至 28.6% 和 38.3%。尤其在 yacc 和 linkruncca 等拓扑复杂的处理器核心上,缺乏图谱引导会导致 WNS 产生超过 2 ps 的不可忽视的劣化。

在系统开销与代际收敛特性方面,SynAct 同样保持了工程化的克制。在默认的 5 轮迭代中,单个设计的全流程平均 Token 消耗稳定在 13.9 万左右。其中负责处理丰富图谱与候选生成的优化智能体占用了 69% 的 Token,而负责报告审阅的分析智能体占 31%,跨设计的调用方差极小。追踪时序轨迹可以发现,在第一轮“冷启动”阶段由于缺乏历史执行反馈,大模型容易给出次优探索动作;但随着多轮交互中物理状态反馈与置信区间的协同收敛,轨迹迅速平滑走强,在第 5 轮基本达到最佳性价比平衡点。

从写脚本到物理闭环:EDA Agent 的工程新范式

回顾 SynAct 的技术架构与实测表现,这项研究为大语言模型介入芯片设计自动化(LLM4EDA)提供了一个极具示范意义的样本。

长期以来,业内对生成式 AI 落地 EDA 的担忧主要集中在两个层面:一是大模型的幻觉可能破坏电路网表的严格确定性,二是静态的自然语言代码生成根本无法解决高维连续的物理优化难题。SynAct 的破局思路证明了:大模型在芯片设计中最具价值的角色,并非盲目替代底层经过数十年数学沉淀的 EDA 算法,而是充当高维控制台上的“智能操盘手”。

通过将商业综合工具视为环境感知端,利用 GraphRAG 将零散的技术文档编织为确定性的因果图谱,再通过文法 VAE 搭建起离散文本与连续数学优化之间的桥梁,SynAct 走出了一条融合符号逻辑、图推理与概率优化的闭环进化之路。对于数字前端设计与时序闭合工程师而言,这种具备透明诊断理由、能够从每一次试错中积累经验并严守安全边界的闭环 Agent,或许正是通向全自动芯片综合调优的一把关键钥匙。