代码Agent
写出一段代码、理解一个仓库、修复真实Issue是不同任务。这条路线先明确评测对象,再看检索、技能训练和自演化,最后检查代码与技能复用引入的安全风险。
从你的问题开始
判断一个代码Agent到底擅长什么
用Vibe Coding综述梳理交互方式,再读SWE-bench的任务定义。
比较时看:明确是代码生成、仓库问答还是Issue修复;不要混用不同基准和子集的分数。
仓库太大,Agent找不到关键代码
阅读Deep Agentic Search的仓库问答对照研究。
比较时看:同时测正确率、检索成本和任务交接损失;问答结论不自动等于修复任务结论。
想让Agent通过训练和经验持续进步
对照Kimi-Dev与Socratic-SWE,再用EvoMal检查复用风险。
比较时看:区分模型训练、技能提炼和运行时复用;单独核验数据来源、测试泄漏与供应链安全。
建议阅读顺序
按理解问题的顺序精选,非时间排名。下方日期为原文发表日期;不同论文的分数不作直接横比。
-
01 · 任务全景
Vibe Coding综述:人和代码Agent如何协作
先整理基于自然语言的编程交互及其研究问题,再确定你需要自动化的工作环节。
阅读边界:综述中的不同交互方式不等价于生产可用性,仍需要自己的验收用例。
-
02 · 定义验收
SWE-bench:真实Issue如何变成评测任务
关注仓库状态、问题描述、补丁和测试之间的关系,理解真实软件工程任务的评测方式。
阅读边界:原版、Lite、Verified等口径不能混合比较;通过测试也不覆盖全部工程质量。
-
03 · 获取上下文
Deep Agentic Search:仓库检索的实证对照
比较向量检索和子Agent探索,重点阅读任务交接、上下文压缩和成本分析。
阅读边界:研究针对特定仓库问答设置,不应推广为所有多Agent架构都不如单Agent。
-
04 · 训练基础技能
Kimi-Dev:Agentless训练如何提供技能先验
阅读从工作流训练到多轮Agent应用的连接方式,关注先验技能如何迁移到交互任务。
阅读边界:训练配方、底座模型和评测设置共同影响结果,不能只靠替换提示词复现。
-
05 · 迭代训练任务
Socratic-SWE:从轨迹提炼训练技能
跟踪执行轨迹、短板技能、任务生成和再次训练的循环,观察训练数据如何由失败驱动。
阅读边界:需要区分真实能力增长与对生成任务分布的适应,并保留隔离测试集。
-
06 · 守住复用边界
EvoMal:自演化代码的复用风险
从安全研究视角检查生成代码和技能复用如何传播不可信内容,补上自演化流程的审查环节。
阅读边界:这里用于理解风险和防护边界,不把单一攻击基准视为完整安全评估。