DocsChisel:复旦提出自适应工具文档优化,让智能体成功率提升95%
DOCSCHISEL: Adaptive Tool Documentation Optimization Framework for LLM Agents

在构建基于大语言模型的智能体(LLM Agent)时,业界普遍将研发精力倾注于模型基座的微调、更复杂的规划策略(如 ReAct 或多智能体协作框架)以及检索增强等环节。然而,对于智能体与现实环境交互的核心媒介——工具文档(Tool Documentation),多数系统却默认将其视为一成不变的“静态先验输入”。无论是 OpenAI 的 Function Calling,还是各类开源 Agent 平台,开发者通常假设只要把 API 的参数定义与简要描述写进系统 Prompt,智能体就能理解并正确调用。
ArXiv URL:https://arxiv.org/abs/2608.10037v1
复旦大学团队的一项最新研究打破了这一假设。他们在对 14 个代表性数据集、24,955 个工具的文档进行大规模实证分析后发现,现存工具文档存在严重的字段异构性,且不同信息字段对智能体的影响具有高度的不确定性:在某种特定模型或任务下能够提升性能的字段,换一个场景可能反而会严重误导模型。
为此,研究团队提出了自适应工具文档优化框架 DocsChisel。该框架通过分析智能体在实际任务中的失败执行轨迹,在字段级别自适应地对工具文档进行“增、删、改”,从而打破“静态文档通吃所有场景”的固有假设。实验表明,DocsChisel 优化后的工具文档使智能体的端到端任务成功率(Task Success Rate, TS)相比原始文档提升了 95.89%,相比现有前沿基线方法平均提升了 75.15%。

文档字段的“双刃剑”效应:没有放之四海皆准的黄金模板
为了搞清楚工具文档中究竟包含哪些信息、这些信息又如何影响智能体,研究人员首先从 14 个主流智能体数据集中归纳出 17 类核心信息字段。这些字段既涵盖基础标识(工具名 TN、功能描述 FD),也包括调用约束(输入参数类型 IPT、必填标识 PRF、调用约束 IC),以及输出定义(返回参数类型 RPT、响应模板 RT)和辅助信息(代码实现 CI、使用示例 UE 等)。
实证分析揭示了两个残酷的技术事实:
现存文档在字段构成上存在极大的跨数据集差异。尽管单一数据集内部往往遵循固定的编写模板,但跨数据集之间几乎没有任何标准化规范。有的文档详尽描述了返回值的嵌套结构,有的文档却连参数是必填还是选填都未曾标注。
更关键的是,信息字段的有效性与任务领域、模型底座以及智能体交互范式高度耦合。增加信息并不总是带来正向收益。例如,在 GPT-4o 搭配 ReAct 框架的实验中,在 17 个评估字段中,仅有 6 个字段在不同领域表现出一致的作用方向(如删除工具名、任务领域或返回值类型会稳定导致任务成功率下滑,而补充调用约束 IC 则能普遍带来增益)。
其余 11 个字段的作用方向在不同场景下频繁反转。以“必填参数标识(PRF)”为例,在数据分析领域引入该字段后,任务成功率提升了 2.5 个百分点;但在邮件管理场景中,加入相同的字段反而让任务成功率骤降 5.61 个百分点。深入执行日志可以发现,过分强调参数的必选属性,有时会诱导模型在上下文信息不足时产生幻觉,强行填充臆造的参数值,进而引发工具调用链的崩溃。
这种字段级别的敏感性表明:试图依靠人工编写出一套适用于所有大模型基座与交互架构的“标准 API 文档”,在工程上是不切实际的。工具文档必须针对目标智能体系统进行自适应调整。
DocsChisel 架构解构:基于失败轨迹与经验记忆的闭环优化
针对静态文档的局限性,DocsChisel 确立了一种全新的闭环优化范式:将工具文档视为一种随智能体交互反馈动态演进的“软件配置”,以执行失败的上下文轨迹为驱动,自适应雕琢文档的字段构成。

整个 DocsChisel 的优化流程由四大核心环节构成:领域感知执行剖析、记忆引导的文档优化、候选评估与反馈更新,以及最终文档抉择。
1. 领域感知与执行轨迹归因
智能体在解决现实复杂问题时,往往需要串联调用同一任务领域内的多个工具。单个工具文档的语义模糊不仅影响当前调用,还会污染后续工具的输入推断。DocsChisel 首先按任务领域组织工具与查询样本,将样本划分为优化集与验证集,并记录智能体在原始文档下的执行轨迹(包含用户请求、推理步骤、调用序列、输入输出及底层报错)。所有的失败轨迹被抽取为文档优化的直接实证依据,而成功轨迹则被完整保留,用于在后续迭代中监控文档退化风险。
2. 三重记忆引导的文档“增删改”
传统的文档重写往往依赖 LLM 对单个 API 进行字面润色,极易丢失关键约束或引入无用冗余。DocsChisel 在生成候选文档时,引入了显式的“字段级演进记忆机制”,拆分为三类记忆库:
-
诊断记忆(Diagnostic Memory):总结历史迭代中频繁导致调用的典型错误模式(如参数类型误判、前置条件不满足)。
-
规划记忆(Planning Memory):记录在当前领域下哪些字段操作(增加某字段、剔除干扰字段)曾带来正向收益。
-
生成记忆(Generation Memory):积累优质文档片段的重写范式与文本规范。

在优化某个具体工具时,DocsChisel 将原始文档、该工具涉及的最新失败轨迹以及当前领域的记忆信息统一输入至优化模型。模型不再盲目重写整篇文档,而是明确执行三类原子操作:补充缺失字段(如追加容易被忽略的调用约束)、删除干扰或冗余字段(如剔除导致模型注意力分散的底层实现代码片段)、精炼模糊字段(修正存在歧义的参数语义解释)。
3. 规避“解决一个 bug,引发三个退化”的验证机制
修改工具文档极易出现“修复了 case A,却导致原本能跑通的 case B 失败”的副作用。DocsChisel 在评估候选文档时,不仅在优化集上评估新失败轨迹的减少量,还会回放该工具此前的成功轨迹集合(Regression Set),严格检验是否存在性能退化。只有在整体收益为正的情况下,新文档才会进入候选池,并同步将本次修改中行之有效的经验提炼回传给领域记忆模块。
在达到预设的最大迭代轮数后,系统会从候选池中挑选验证集任务成功率最高的版本;当成功率持平时,则依据奥卡姆剃刀原则优先挑选文本长度最短的文档,以最大限度减少智能体运行时的 Context Window 开销与推理延迟。
实验评测:不仅调用更准,更关键的是任务跑通
为了验证框架的泛化能力,研究团队在涵盖 9 个业务领域(如工作流自动化、金融管理、智能家居、信息检索等)、74 个工具、2,072 条用户真实查询的基准数据集(基于 WorkBench 与 API-Bank)上展开全面评测。评估涵盖了 GPT-4o、Claude-3.5-Sonnet 以及开源的 Qwen2.5-72B-Instruct 等不同梯度的模型底座,并跨越了 ReAct 与 Plan-and-Solve 两种典型智能体范式。
对比基准不仅包含原始工具文档(OG),还涵盖了近年最具代表性的两类优化方法:基于模板压缩的 EasyTool,以及基于反思迭代微调的 DRAFT。为排除 LLM 推理的内在随机性干扰,所有实验均重复 3 次完整优化流程,并在独立的测试集上进行 5 次独立评测(即每个配置下运行 15 次测试),结合非参数统计检验(Mann-Whitney U 检验与 Holm 校正)确保差异显著。
评测结果表明,DocsChisel 展现出了全面的领先优势:
-
端到端成功率的大幅跨越:相比原始文档,DocsChisel 带来的工具调用正确率(Tool Invocation Correctness, TC)平均提升了 34.69%,而任务成功率(TS)更是跃升了 95.89%。
-
显著超越前沿基线:相比于仅仅对文档做精炼压缩的 EasyTool 和常规微调的 DRAFT,DocsChisel 在任务成功率上实现了 75.15% 的平均相对提升。即便与各设置下表现最好的基线版本相比,任务成功率依然高出 46.11%。
-
开源模型的收益尤为突出:当模型推理底座为参数量较小的模型或相对较弱的开源模型时,静态文档中的歧义和冗余造成的负面影响被进一步放大。DocsChisel 通过剔除干扰噪声、精准显式化关键字段,使轻量级模型能够展现出接近未优化前顶级商业模型的工具使用水平。
而在消融实验中,如果移除框架内的领域记忆引导机制(即退化为普通的单轮或无状态 LLM 轨迹反思),工具调用的正确率将下滑 13.64%,最终的任务成功率则大幅下跌 76.47%。这一对比强有力地证明:智能体工具文档的优化不能做孤立的字面修补,跨工具、跨任务的错误模式沉淀与字段级决策沉淀,才是驱动性能收敛的关键。

工程落地视角:开销、权衡与智能体生态的演进
从工程部署的角度审视,DocsChisel 并非没有成本。由于引入了多轮“执行-失败归因-生成-验证”的闭环迭代,DocsChisel 在文档构建阶段需要投入更高的离线时间。测试显示,优化单个工具文档的平均耗时约为 12.65 分钟。
然而,这是一种典型的“离线重计算换取在线高收益”的系统权衡。首先,在优化阶段的 Token 总消耗上,由于 DocsChisel 的记忆机制大幅减少了无意义的盲目试错,其消耗的 Token 甚至比基线方法 DRAFT 少了 6.35%;其次,在优化完成后,所产出的工具文档可以直接固化到系统的 API 配置库中。在实际服务在线请求时,智能体完全不需要挂载庞大的优化引擎,仅凭精简且高度适配的静态文本即可直接运转,既没有增加运行时的首字延迟(TTFT),也避免了输入上下文的膨胀。
这项研究为当下的智能体工程化实践提供了一个至关重要的启示:在模型能力遭遇边际效应、提示词工程逐渐触碰天花板时,重新审视环境界面的设计质量,往往能带来超乎预期的产出。
过去的软件工程花了数十年时间探讨如何为“人类工程师”编写规范易读的 API 文档;而在大模型原生软件时代,面向“大模型 Agent”的接口规范究竟该如何定义,目前行业依然缺乏标准。DocsChisel 表明,模型需要的文档形态可能与人类习惯大相径庭——它不需要繁复的修辞与层层嵌套的抽象代码,而是需要根据模型自身的认知盲区,精准提供调用边界、参数取值陷阱与确定性的格式约束。通过自适应反馈机制让文档与智能体协同演进,或将成为未来复杂智能体系统上线前不可或缺的标准基底工序。