KOPE:图记忆重塑算子优化,提速1.54倍且Token骤降93%!
Beyond Scaling: Self-Evolving LLM Agents for Hardware Kernel Optimization via an Experience-Driven Workflow and Experience Graph Memory

硬件算子(Hardware Kernel)的优化一直是一项高度依赖专家经验的密集型工程。为了充分榨取硬件性能,工程师需要综合考虑目标设备的内存层次结构、数据搬移策略、并行执行机制以及特定的硬件约束。每一次优化尝试,都必须经历编译、正确性测试、性能剖析(Profiling)和代码修订的漫长循环。
ArXiv URL:https://arxiv.org/abs/2608.25570v1
近年来,基于大语言模型(LLM)的智能体(Agent)试图通过强大的基础模型能力、更长的上下文窗口以及不断延长的执行轨迹来自动化这一过程。然而,香港城市大学与华为技术有限公司的研究人员在最新研究中指出了当前路线的致命隐患:仅仅依靠扩大模型规模或拉长上下文,无法让智能体真正从历史优化中“学习”。 现有的算子优化智能体大多受限于基础模型的预训练知识,一旦面对缺乏公开训练语料的新型硬件(如某些特定的神经网络处理器),其性能便会大幅衰减;同时,无节制地将历史执行轨迹塞入上下文,不仅会导致模型注意力涣散,还会引发灾难性的 Token 消耗。
为此,研究团队提出了一个名为 KOPE 的经验驱动硬件算子优化框架。该框架摒弃了传统的上下文堆叠策略,通过引入 Experience Graph Memory(经验图谱记忆)与主动上下文管理机制,让大模型在不更新自身参数的前提下,能够跨任务、跨步骤地复用目标硬件上的真实执行反馈。实验数据表明,在华为 Ascend 910C 硬件环境下,KOPE 不仅将基准算子的执行速度提升至最强竞品 CANNBot 的 $1.54$ 倍,更在全面消融实验中,将算子优化的 Token 消耗从惊人的 159 亿骤降至 11.13 亿,缩减幅度高达 93.0%,同时通过率大幅跃升。
这一研究清晰地向学术界与工业界传递了一个信号:在解决特定领域的长尾工程问题时,构建结构化的外部经验记忆并实施严格的上下文预算控制,远比盲目依赖长上下文模型更加高效且必要。
算子优化的核心痛点:知识匮乏与上下文爆炸
要理解 KOPE 方法的价值,首先需要明确目前大模型在算子优化领域面临的真实困境。
主流的自动优化框架(如 Astra、Makora 等)多依赖于领域适应、智能体强化学习或执行引导的迭代系统。这些系统在处理成熟的生态环境(如 NVIDIA GPU 的 CUDA 算子)时表现优异,因为模型在预训练阶段已经见过了海量的 CUDA 优化代码和讨论。但在实际工业界,自动化工具最能发挥价值的场景,恰恰是在新型芯片刚刚流片、软件生态尚未成熟、缺乏大量公开实现和优化轨迹的“冷启动”阶段。
作者在论文中通过跨生态对比验证了这一点。一个在 NVIDIA GPU 上取得顶尖成绩的强大优化工作流 CUDA-Agent,被原封不动地迁移至华为 AscendC 环境下进行测试。在相同的 GLM-5.2 模型驱动下,CUDA-Agent 在 Ascend 完整测试集上仅取得了 $14.7\%$ 的通过率,且未能彻底解决任何一个完整的算子测试用例。这极具说服力地证明了:当目标硬件缺乏特定的公开语料时,单纯依赖基础模型的泛化能力和单任务内的盲目试错是行不通的。
如果基础模型不懂新硬件,智能体能否在探索中自己学习?理论上可以。智能体可以将每一次编译报错、每一次性能测试结果作为上下文反馈给大模型,指导下一步修改。但这里隐藏着一个陷阱:随着优化步数的增加,历史记录会迅速膨胀。如果不加筛选地保留所有轨迹,膨胀的历史记录将与当前任务争夺有限的上下文窗口。这不仅会触发长上下文模型常见的“迷失在中间”(Lost in the Middle)现象,还会导致 Token 计费成本呈指数级上升。
因此,研究团队明确提出了他们的核心命题:如何在基础模型参数固定的情况下,将探索过程中获得的执行反馈转化为可复用的知识,并在有限的 Token 预算下,将其应用到跨任务的优化决策中?
双管齐下的解决方案:图结构记忆与主动上下文管理
KOPE 框架通过两个核心机制巧妙地回答了上述问题,将智能体从“无记忆的试错机器”升级为“具备经验沉淀的资深工程师”。
第一个核心机制是 Experience Graph Memory。传统的智能体记忆往往是线性日志或简单的向量数据库检索。但算子优化的本质是一个分支探索的过程。针对同一段基线代码,智能体可能会尝试多种不同的优化策略;而某一步决策的真正价值,往往需要等到后续几次迭代后才能彻底显现。
KOPE 并没有简单地记录这些尝试,而是将优化决策与实测结果构建成一个“有向无环森林”(Directed Acyclic Forest)。在这个图谱中,每一个节点记录了一次决策及其对应的结果。节点之间的边缘(Edge)不代表严格的因果关系,而是记录了执行的“溯源路径”(Provenance)。这意味着,如果当前尝试是基于先前的某个优化状态展开的,两者之间就会建立连接。
为了让检索更加精准,KOPE 为记忆设计了双重表征。一方面是采用 Markdown 格式的非结构化“叙事日志”(Journal),记录优化策略、代码变更、诊断信息以及智能体的推理过程;另一方面是采用 JSON 格式的结构化“案例”(Case),严格记录算子类型、绝对加速比、置信度以及节点间的拓扑关系。
在检索时,系统不仅会根据文本相关性进行匹配,还会引入基于图结构的客观性能信号。具体而言,节点 $v$ 的相对加速比被定义为 $r_v = a_v / a_{\operatorname{prev}(v)}$。基于此,系统计算节点的综合检索得分:
\[d(v) = w_{\mathrm{self}}r_v + w_{\mathrm{succ}}\gamma\sum_{u\in\operatorname{succ}(v)}d(u)\]这套启发式算法确保了那些不仅自身取得了加速,而且引出了优秀后续分支的决策节点,能够获得更高的检索权重。
第二个核心机制是基于严格预算的 Active Context Management and Injection(主动上下文管理与注入)。这是应对长上下文陷阱的直接手段。
KOPE 不再依赖模型自动消化冗长的对话历史,而是在每次迭代前,主动重构整个提示词(Prompt)。为了保证核心任务不受干扰,KOPE 将上下文划分为三个动态层级:
第一层是“热上下文”(Hot Context),包含算子规格、现有代码、最新的编译执行反馈以及当前的优化目标。这些是推进当前步骤的绝对刚需,必须占据优先级。
第二层是“暖上下文”(Warm Context),包含从经验图谱中检索出的与当前状态高度相关的成功动作、失败教训和结构化案例。
第三层是“冷上下文”(Cold Context),涵盖了更广泛的硬件文档或跨类别的基础经验。
系统的组装逻辑非常严密:假设模型的总窗口大小为 $W$,系统提示词占用 $S$,预留的生成长度为 $G$,近期历史保留量为 $R$,那么可用的外部知识预算 $B_{\mathrm{k}} = \max(0, W - S - G - R)$。系统会优先扣除热上下文的开销;如果预算允许,再按照设定的阈值上限,注入图谱排序得分最高的暖经验和冷知识。通过这种截断式的注入策略,KOPE 确保了模型每次看到的都是对当前任务最具有指导意义、且浓缩过的历史反馈。
需要强调的是,KOPE 的主动上下文选择发生在调用外部模型之前,这与当前研究中常见的 KV-Cache 驱逐机制(在推理过程中选择性丢弃内部状态)是互补的,而非互相排斥。
实验结论验证:效率与性能的双重飞跃
为了验证这套机制在缺乏公开数据的新硬件上的真实威力,研究团队选择在华为 Ascend 910C 硬件上,使用完整的 CANN Bench v0.4.0 评测基准(包含 53 个算子,共 1060 个测试用例)对 KOPE 进行了严格的评估。实验采用了两款主流的长上下文模型:GLM-5.2 与 Deepseek-V4-Pro。
在系统级对比中,KOPE 展现出了对当前领域基线 CANNBot 的全面压制。
在 GLM-5.2 环境下,CANNBot 返回了 49 个算子,而 KOPE 成功返回了全部 53 个算子。在涵盖所有 1060 个测试用例的严苛计算标准下,KOPE 的完整通过率达到了 $84.6\%$,比 CANNBot 高出 $26.8$ 个百分点;综合评分从基线的 1465.93 暴涨至 2004.49。更重要的是,在算子加速比的几何平均值这项核心性能指标上,KOPE 达到了 CANNBot 的 $1.54$ 倍。
在 Deepseek-V4-Pro 环境下,趋势依然一致。CANNBot 出现严重漏算,仅返回了 31 个算子,导致全集通过率跌至 $39.3\%$;而 KOPE 依然稳健地返回全部算子,取得 $73.9\%$ 的通过率与更高的综合得分。
然而,真正揭示 KOPE 框架核心价值的,是两组精心设计的消融实验。
第一组消融实验针对上下文管理策略。 作者对比了让智能体“被动”累积所有交互上下文,与启用 KOPE 的“主动”三层上下文管理策略的差异。
结果极其震撼:在 GLM-5.2 驱动下处理同样的 53 个算子,主动管理机制将测试通过率从 $60.0\%$ 大幅提升至 $84.6\%$,将正向加速比的几何平均值提升了 $1.73$ 倍。与此同时,整个优化流程消耗的 Token 数量,从被动累积模式下的 159 亿 Token,断崖式下跌至 11.13 亿 Token。
这强有力地证明了,仅仅把上下文喂给长文本大模型不仅极其昂贵,而且收效甚微。智能体真正需要的不是“更长的记忆”,而是“更精准、更相关的提炼”。
第二组消融实验针对图谱记忆结构。 研究人员对比了在禁用和启用 Experience Graph Memory 时的系统表现。
在完整的基准测试中,引入图结构记忆让全集通过率从 $55.2\%$ 飙升至 $84.6\%$,通过用例数增加了 312 个。在双方均产生有效计时的 412 个配对案例中,图结构记忆带来了 $1.434$ 倍的几何平均加速。特别值得注意的是,在难度最高的 L4 级别算子上,缺乏图记忆的系统几乎无法应对复杂的优化场景,而引入图记忆后的系统实现了几何级数的性能跨越。作者明确指出,这些提升正是来源于系统将早期的试错教训转化为图谱节点,并成功指导了后续高度复杂的优化决策。
从工程走向科学:对智能体架构的启示
KOPE 的研究工作为当前火热的 AI 智能体开发提供了一个极具反思价值的视角。
过去一年中,业界对“更长上下文窗口”的追求近乎狂热,似乎只要模型能吞下百万级 Token,一切多步推理和历史沿革问题都能迎刃而解。但 KOPE 在硬件算子优化这一典型的长上下文、高复杂度任务中证明了:“Scaling”(规模扩张)并非万能药。
在一个未知的硬件生态中,模型缺乏先验知识,必须通过反复编译测试来探索环境。如果缺乏一套系统级别的知识沉淀机制,智能体就会像无头苍蝇一样在同一个坑里反复跌倒;如果仅靠长窗口硬扛,又会被无关的历史噪音淹没。KOPE 的 Experience Graph Memory 与 Active Context Management 本质上是将计算机科学中经典的“图结构搜索”与“操作系统的内存换页机制”引入到了大语言模型的输入端。
这种设计思路不仅在芯片生态建设和底层软件编译中具有极高的应用价值,其核心理念同样适用于任何需要长时间探索、存在试错分支且反馈明确的复杂工程领域(如自动化软件测试、工业参数调优等)。当基础模型的参数被冻结时,赋予其一个结构化、可进化的外部“大脑”,或许才是通向真正自主智能体的必由之路。