清华提出GEIS:Agent技能改进闭环,长文生成击败STORM

GEIS: A Generation-Evaluation-Improvement Loop of Agent Skills for Long-Form Article Generation

清华提出GEIS:Agent技能改进闭环,长文生成击败STORM 论文图示

在当前的大模型能力版图中,短文本回答、代码生成或是日常对话的响应早已不是难点。然而,当我们把视线转向撰写维基百科级别的深度文章、行业技术报告或是长篇分析文档时,大模型的表现往往暴露出明显的局限性。这类任务在研究中被定义为“L3 级别”的长文生成任务,它们强制要求系统同时应对长上下文输入、长指令约束以及长篇幅的文本输出。

ArXiv URL:https://arxiv.org/abs/2607.11503v1

这种严苛的组合直接放大了单次自回归生成的根本弱点。长上下文极易引发信息丢失和注意力不均(即著名的“中间迷失”现象);而长篇内容的产出需要同时兼顾信息覆盖率、结构合理性、逻辑连贯性以及事实可靠性。在缺乏中间质量检测环节的情况下,一个发生在篇章早期的微小错误,往往会在后续段落中被无限放大,最终导致严重的幻觉和内容崩溃。

针对这一痛点,以往的解决方案倾向于利用多智能体协作来拆解写作流程。最典型的代表是此前备受瞩目的 STORM 框架,它通过模拟百科作者与领域专家的对话,从多视角收集信息以提升文章的深度与广度。但这类框架普遍存在一个致命的工程瓶颈:它们的能力往往高度纠缠在复杂的提示词模板和固定的流水线程序中。这种隐式的能力边界使得系统极难进行模块化检查、跨任务复用,更难以通过自动化的方式进行持续迭代改进。

为了打破这种僵化的多智能体流水线,清华大学与 TasiTech 联合提出了一项名为 GEIS 的最新研究成果。GEIS 是基于智能体技能的“生成-评估-改进”闭环框架(Generation-Evaluation-Improvement loop of agent Skills)。它不再依赖于分配固定的“人格角色”,而是将所有能力具象化为清晰的、声明式的独立技能。在 20 个维基百科特色条目的严格测评中,GEIS 不仅在综合质量上实现了 8.0 分的提升,更在结构与内容质量两大核心维度上全面击败了 STORM,向我们展示了模块化技能进化在长文生成领域的巨大潜力。

走出隐式提示词的泥沼:为什么我们需要真正的“技能”?

在探讨 GEIS 的具体运行机制之前,我们需要理解它与主流多智能体框架在设计哲学上的根本分歧。传统的角色扮演系统(Role-playing agents)通常将各类指令大杂烩式地塞进系统提示词中。系统既要时刻谨记自己是一个“资深专栏作家”,又要同时处理网络搜索、网页解析、甚至是图像渲染的复杂逻辑。

GEIS 选择彻底摒弃这种紧耦合模式,转而采用“渐进式披露”(progressive disclosure)的技能架构。在这一架构下,每一项具体能力都被封装为一个独立的技能文件(如 SKILL.md)。系统只会在当前任务场景真正需要某项能力时,才会将对应的技能指令加载到上下文窗口中。这种设计带来的最直接收益是大幅节约了宝贵的上下文预算,防止了无关指令对文章生成主线的干扰。

更为重要的是,这种显式的边界划分使得整个长文生成过程变得高度可审计。在 GEIS 中,负责写文章的组件不需要关心底层的网页导航协议,负责浏览器控制的组件也不需要知道如何构建文章大纲。当系统出现错误时,开发者可以精准定位是哪一个技能模块出了问题,而不是在一个长达数万 Token 的对话历史中徒劳地翻找问题根源。这种模块化思维正是 GEIS 能够实现系统自我进化的工程基石。

GEIS 的核心架构:从显式阶段到视觉解耦

GEIS 的生成侧核心由一个名为 article-writer 的技能主导。它将原本模糊的长文写作过程,强制拆解为六个高度受控且责任明确的语义阶段。

清华提出GEIS:Agent技能改进闭环,长文生成击败STORM 论文图示

如上图所示,这六个阶段构成了一条严密的生产流水线。任务首先进入 Request(请求)阶段,该阶段负责对用户的开放式需求进行标准化处理,提炼出明确的写作意图。紧接着是 Plan(规划)阶段,这或许是控制长文结构最核心的一步,系统必须在这里敲定包含多级标题的全局大纲。随后系统进入 Draft(起草)阶段,根据大纲填充实质性文本。

如果仅仅到这一步,它与常规的长文生成器并无太大差异。GEIS 的关键在于它引入了显式的质量门控机制:Audit(审计)与 Refine(润色)。在草稿完成后,系统不会立即交付,而是必须对照初始规则进行内部审计。如果发现某一小节内容过于单薄,或者事实陈述缺乏依据,系统会退回 Refine 阶段对薄弱环节进行定点重写,直到满足质量底线后,才会进入最终的 Deliver(交付)环节,输出排版完整的长文。

除了文本本身,一篇专业的长篇报告往往离不开网页证据的支撑以及图表的可视化呈现。在 GEIS 的技能库中,写作者技能主动将这些繁杂的任务委派给了 tasi-browser-automation(浏览器自动化技能)和 architecture-diagram(架构图渲染技能)。

特别值得一提的是,它的浏览器自动化并非简单地调用外部 API 搜索文本,而是通过 Chrome 开发者工具协议(CDP)驱动真实的浏览器实例。这意味着它可以准确地等待页面加载、提取语义快照,甚至捕获截图并保证信息回溯的准确性。同时,为了避免文本生成与复杂的图表渲染过程相互干涉,GEIS 使用了锚点机制。生成文本时只需在相应位置留下图像或图表的占位符锚点,后续的文档交付管道会自动解析这些锚点并插入视觉元素。这在根本上解决了大模型同时处理高频文字与复杂可视化指令时容易出现的逻辑崩盘问题。

闭环进化的奥秘:让评估真正转化为能力补丁

长文生成缺乏唯一的“标准答案”,传统的自动化文本评估指标(如 ROUGE)在衡量长篇幅文档的结构完整性、排版布局和视觉连贯性时显得苍白无力。GEIS 通过引入独立的 pdf-comparison-evaluation(PDF 级成对评估技能),建立了一套极其苛刻的诊断体系。

该体系不再仅仅对比纯文本内容,而是对最终导出的 PDF 进行多维度审视。评分维度不仅涵盖了结构质量与内容质量,更罕见地纳入了视觉质量(如图片相关性、图注一致性)和交付质量(如导航元数据、字体稳定性)。更为严谨的是,GEIS 采用了“非对称生成与对称评估”的设计:在实验中,生成文章使用的是 GPT-5.4 模型,而进行评估与诊断的则是另一套独立模型(Qwen 3.5 Plus),这种将“运动员”与“裁判员”物理隔离的做法极大程度地抑制了大模型的自我评估偏差。

然而,仅仅给出评分并不能让系统变得更聪明,GEIS 最精妙的设计在于它的终极组件:article-writer-improving(写作技能改进)。这就涉及到了 GEIS 所谓的“闭环”到底是如何运转的。

清华提出GEIS:Agent技能改进闭环,长文生成击败STORM 论文图示

如上图展示的闭环流程,评估报告并不仅仅是一张成绩单,它更像是一份可执行的医学诊断书。改进技能会自动阅读这些诊断报告,从中甄别出哪些缺陷是属于写作者主观能力不足造成的(例如段落缺乏过渡、缺少对结论的归纳、引用的格式混乱),哪些缺陷仅仅是底层 PDF 导出工具包的 Bug(例如书签丢失)。

对于被判定为写作能力缺陷的问题,系统并不会去尝试玄学般的“模型微调”或“强化学习”,而是采用了一种极具工程智慧的做法:它会将这些反复出现的错误,直接翻译为具体的“写作规则补丁”,并永久性地写入到 article-writer 的技能描述文件中。比如,如果系统在 20 个主题中频繁被批评“内容单薄”,改进闭环就会强行在写作技能中植入一条新规则:强制要求深入拓展子章节的预算分配。这种将外部评价直接映射为未来行为约束的机制,使得大模型的经验得以持续沉淀。

实验验证:结构化约束如何击败 STORM?

GEIS 的实验部署在 Tasi Harness 平台上运行,选取了 20 个维基百科特色条目(Featured Articles)作为评测主题。这些被维基百科社区严苛审核过的条目涵盖了丰富的历史、科学与人物背景,为测试系统在复杂约束下的生成能力提供了绝佳的试炼场。

在与基础设定的直接较量中,GEIS 展现出了压倒性的优势。通过启用完整的技能流程,其综合评分从 74.1 分跃升至 82.1 分。这一提升并非依靠文字游戏,而是实打实地反映在结构质量(提升2.6分)、内容质量(提升3.2分)以及视觉质量(提升2.2分)上。评测报告一致显示,GEIS 生成的文章拥有清晰得多的层级结构,对相关主题的覆盖更为全面,并且由于视觉锚点技能的存在,其对图片的把控也远超基础模型。

最受关注的对决无疑是 GEIS 与 STORM 的正面交锋。由于 STORM 是一个纯文本导向的框架,不涉及排版与图表,研究团队在结构和内容这两个纯粹的写作维度上对两者进行了对比。结果显示,GEIS 在结构质量上领先了 STORM 整整 5.6 分,在内容质量上也领先了 2.2 分。

为什么一个以“多视角检索”闻名的系统会在结构上输得如此彻底?数据的背后印证了 GEIS 设计的正确性:STORM 虽然凭借专家对谈能发掘出很深的技术或历史盲区,但它那套基于 DSPy 和固定模板的流水线,根本无力约束最终文章的全局边界。它很容易虎头蛇尾,或者彻底忘记写一段有分量的总结。反观 GEIS,其显式的 Plan 和 Audit 阶段像是一道铁闸,死死守住了文章的骨架,确保每一篇长文都有完整的组块与清晰的边界。这意味着在严肃文体生成中,一个高度可控的进程机制,甚至比天马行空的检索发散更为关键。

在最后进行的 20 个主题的自我改进实验中,经过评估报告自动反馈并打好“补丁”的写作技能,在重新生成文章后,将平均分从 82.90 直接拉升至 86.95。更令人瞩目的是,20 个主题中有 17 个获得了实质性的提升,且分数增益主要集中在核心的内容质量维度($\Delta_B$)。系统通过闭环自主总结出的 8 项永久规则(包括强制内联引用、要求更稳定的图像来源、强制要求结论等),起到了立竿见影的效果。这种不改变任何模型权重,仅靠流程修正就达成的大幅进步,证明了轻量级技能进化的可行性。

总结与启示

GEIS 的出现,为陷入参数内卷的大模型长文生成领域提供了一条极其清醒的工程路线。它向行业证明了一件事:想要让大模型写出逻辑缜密、经得起推敲的数万字长文,一味地拉长上下文窗口或者设计花哨的隐式提示词,往往只会事倍功半。

真正的突破口在于对“能力”本身的解耦与重塑。通过将模糊的长文撰写过程分解为独立的技能模块,明确从大纲规划到多模态视觉处理的职责边界,再辅以严苛的成对评估诊断机制,系统获得了在报错中寻找规律、在规则层面上实现自我修补的能力。未来的专业级长文生成,或许不再是期待模型在一次推理中创造奇迹,而是构建一套像 GEIS 这样模块化、可审计且持续反馈的工业级技能进化流水线。