代码Agent

写出一段代码、理解一个仓库、修复真实Issue是不同任务。这条路线先明确评测对象,再看检索、技能训练和自演化,最后检查代码与技能复用引入的安全风险。

从你的问题开始

判断一个代码Agent到底擅长什么

用Vibe Coding综述梳理交互方式,再读SWE-bench的任务定义。

比较时看:明确是代码生成、仓库问答还是Issue修复;不要混用不同基准和子集的分数。

仓库太大,Agent找不到关键代码

阅读Deep Agentic Search的仓库问答对照研究。

比较时看:同时测正确率、检索成本和任务交接损失;问答结论不自动等于修复任务结论。

想让Agent通过训练和经验持续进步

对照Kimi-Dev与Socratic-SWE,再用EvoMal检查复用风险。

比较时看:区分模型训练、技能提炼和运行时复用;单独核验数据来源、测试泄漏与供应链安全。

建议阅读顺序

按理解问题的顺序精选,非时间排名。下方日期为原文发表日期;不同论文的分数不作直接横比。

  1. 01 · 任务全景

    Vibe Coding综述:人和代码Agent如何协作

    先整理基于自然语言的编程交互及其研究问题,再确定你需要自动化的工作环节。

    阅读边界:综述中的不同交互方式不等价于生产可用性,仍需要自己的验收用例。

    论文原文 阅读解读
  2. 02 · 定义验收

    SWE-bench:真实Issue如何变成评测任务

    关注仓库状态、问题描述、补丁和测试之间的关系,理解真实软件工程任务的评测方式。

    阅读边界:原版、Lite、Verified等口径不能混合比较;通过测试也不覆盖全部工程质量。

    论文原文 阅读解读
  3. 03 · 获取上下文

    Deep Agentic Search:仓库检索的实证对照

    比较向量检索和子Agent探索,重点阅读任务交接、上下文压缩和成本分析。

    阅读边界:研究针对特定仓库问答设置,不应推广为所有多Agent架构都不如单Agent。

    论文原文 阅读解读
  4. 04 · 训练基础技能

    Kimi-Dev:Agentless训练如何提供技能先验

    阅读从工作流训练到多轮Agent应用的连接方式,关注先验技能如何迁移到交互任务。

    阅读边界:训练配方、底座模型和评测设置共同影响结果,不能只靠替换提示词复现。

    论文原文 阅读解读
  5. 05 · 迭代训练任务

    Socratic-SWE:从轨迹提炼训练技能

    跟踪执行轨迹、短板技能、任务生成和再次训练的循环,观察训练数据如何由失败驱动。

    阅读边界:需要区分真实能力增长与对生成任务分布的适应,并保留隔离测试集。

    论文原文 阅读解读
  6. 06 · 守住复用边界

    EvoMal:自演化代码的复用风险

    从安全研究视角检查生成代码和技能复用如何传播不可信内容,补上自演化流程的审查环节。

    阅读边界:这里用于理解风险和防护边界,不把单一攻击基准视为完整安全评估。

    论文原文 阅读解读