看教程学操作:Resource2Skill让Agent性能飙升11.9%

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

当前的大模型(LLM)不仅需要能言善辩,正越来越被期望能够直接操作软件、调用工具并生成高质量的复杂产物,例如幻灯片、3D场景、CAD设计等。然而,在面对UE5引擎或Blender这种重度依赖操作经验的专业软件时,模型仅凭预训练阶段积累的静态知识往往捉襟见肘。如何让大语言模型像人类一样,通过看一段视频教程,就能瞬间掌握一套复杂的软件操作连招?

ArXiv URL:http://arxiv.org/abs/2606.29538v1

来自微软等机构的最新研究提出了Resource2Skill框架,打通了从人类多模态资源(尤其是视频教程、代码库、技术文章)到智能体可执行技能的提炼链路。在7大复杂软件创作领域中,该框架让Agent的整体表现相比无技能状态跃升了11.9个百分点,并在绝大多数场景下击败了主流的Agent基线。

核心痛点:纯文本技能库的感知盲区

在Agent时代,将解决特定任务的经验抽象为可复用的“技能Skills)”已经成为一种共识。现有的技能库系统(如Voyager等)证明了这种抽象的价值,但它们往往受限于构建方式:要么由专家手工编写,要么从Agent自身的探索轨迹中总结,且绝大多数都是纯文本或纯代码形式。

这就导致了一个巨大的知识宝库被浪费了——人类创造的视频教程和多模态演示。对于复杂的商业软件,人类学习的最自然方式是观看教学视频,因为视频能直观展现操作的时间顺序、编辑步骤前后的视觉变化以及单靠文本难以描述的设计巧思。如果强行将视频压缩成纯文本摘要,就会丢失空间布局、动画质量、工具交互时序等最关键的“程序性信号”。Resource2Skill正是为了填补这一空白而生。

机制剖析:从多模态资源到技能维基

Resource2Skill的核心思想是将技能的构建和使用视为一个统一的流水线。为了讲透这个机制,我们不妨将Agent视作刚入职的“新员工”。过去,我们只能给新员工一本干巴巴的纯文本《操作手册》,一旦遇到需要感知空间布局或时序交互的复杂任务,新员工往往不知所措。而Resource2Skill则是为新员工自动生成了一套图文并茂、包含操作录像和代码片段的“多媒体标准作业程序Standard Operating Procedure, SOP)”。

该系统主要分为以下几个关键阶段:

层级化多模态技能维基

研究人员没有采用传统的扁平化向量检索库,而是构建了一个层级化的“技能维基Skill Wiki)”。在数学定义上,每一个技能被表示为一个多元组: $s = (p, x_{text}, x_{visual}, x_{code}, m)$

其中,$p$ 表示技能在层级分类树中的路径,$x_{text}$ 解释了适用场景和机制,$x_{visual}$ 提供了视觉示例(如UI截图或动图),$x_{code}$ 是可执行的工具代码,而 $m$ 则是元数据。这种设计完美保留了不同资源的互补信号:视频捕捉了时序操作,代码提供了底层执行模式,而文章则提供了概念基础。

Resource2Skill架构图

两阶段的发现与选择机制

面对海量的技能维基,Agent如何精准找到当前任务所需的技能?该研究设计了名为MetaBrowse的两阶段选择策略。这类似于新员工查阅SOP时的逻辑: 首先,通过词法打分器(基于BM25)缩小候选范围。这里的打分不仅考虑技能名称和描述,还特别加入了分类路径 $p(s)$ 的匹配。 接着,通过语言模型 $\pi_{\phi}$ 从候选池中进行精准的子集选择。模型可以同时阅读文本、视觉和代码视图,如果发现没有合适的技能,它甚至可以选择0个技能,避免了传统Top-K检索中经常出现的强制“凑数”问题。

离线与在线的统一构建

当面临全新的用户需求,且离线构建的技能库无法覆盖时,Resource2Skill可以复用相同的构建算子进行“在线学习”。Agent会在网上搜索新教程,实时提炼出临时技能并验证,从而让这套多模态记忆系统具备了持续生长和维护的能力。

核心实验与发现

该研究在7个高度依赖操作经验的创作领域进行了全面评估:幻灯片设计(PPT)、2D制图(CAD)、网页生成(Web)、电子表格(Excel)、3D场景(Blender)、实时3D(UE5)以及音频制作(Reaper)。

技能接入的全面碾压

实验结果显示,在四种不同的GPT模型后端下,接入Resource2Skill的Agent(w Skills)在全部28个测试单元中均击败了无技能的基线Agent(w/o Skills),平均总分从45.0%飙升至56.8%。特别是在UE5这种API极其复杂、完全依赖专业操作约定的领域,无技能Agent几乎无法产出合格的场景,而接入技能库后性能暴涨了30到40个百分点。 即便与市面上成熟的Agentic Harness基线(如ClaudeCode-H和Codex-H)相比,Resource2Skill也展现出了统治力,在28个测试中赢下了26个,证明其性能提升主要归功于多模态技能维基的质量,而不仅仅是执行框架的封装。

消融实验:视频资源不可替代

研究人员对技能库的“数据源”进行了一项非常有趣的消融实验。他们尝试在构建技能库时移除视频资源(仅保留代码、文章和参考产物),结果发现平均得分从68.9%暴跌至59.4%。特别是在Excel和Web这两个对时间序列和视觉变化敏感的领域,性能衰减分别达到了12.1和9.8个百分点。这强有力地证明了,仅仅靠爬取代码库和纯文本说明,根本无法还原复杂软件操作中的隐性知识,视频资源是提取Agent高级技能时不可替代的基石

技能库的扩展定律

技能库越大越好吗?实验表明,Agent的表现确实随着技能库规模的扩大而单调上升,但在达到约200个技能时开始趋于饱和。前200个技能通常覆盖了高频的通用操作和错误恢复流程,带来了最核心的性能飞跃(在Excel中提升高达14.2%);而在此之后的长尾技能虽然能填补特定领域的空白,但边际收益显著递减。

在线获取的奇效

在针对“库外能力”的压力测试中,固定规模的离线库表现平平(41.2%)。但一旦允许系统进行在线技能获取(最多补充100个实时提炼的技能),性能瞬间飙升至62.8%(提升了21.6个百分点)。这表明,将离线沉淀的体系化知识与在线的按需学习结合,是构建鲁棒性Agent的必由之路。

局限性与工程启示

Resource2Skill为复杂软件Agent的落地提供了极具价值的范式参考。它给我们带来了深刻的工程启示:

  1. 停止迷信纯文本Prompt:在构建垂直领域的Copilot或Agent时,不要试图把所有的操作规程都写成干瘪的文本说明。保留UI界面的视觉变化图、保留步骤的前后对比,能大幅降低大模型在空间和布局任务上的“幻觉”。
  2. 结构化比扁平化检索更有效:不要把所有技能扔进一个巨大的向量数据库中求Cosine Similarity。像维基百科一样,保留知识的层级目录和树状结构,先基于目录树进行宏观定位,再用大模型做微观筛选,能极大提升技能调用的准确率。

尽管效果惊艳,该框架在实际部署中仍面临挑战。在线处理长视频并提炼高优代码片段,对模型的上下文窗口和多模态处理成本提出了较高要求。此外,当前框架主要关注离散的软件创作用例,对于需要在物理世界或高速动态环境中连续决策的任务,该提炼算子的延迟和泛化能力仍有待进一步验证。未来,如何进一步压缩多模态技能的存储开销,将是这一方向走向大规模商用的关键。