ToolArtist:统一多模态模型自主搜图与绘制,拿下开放基准非商业第一
ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

文生图模型在过去两年中展现出令人惊叹的视觉表现力与构图美感,但在面对开放世界中严苛的事实约束时,往往迅速暴露出致命短板。无论是特定历史事件中人物的服饰与道具、长尾小众物种的生物学解剖特征,还是包含多跳逻辑推理的现实场景,现有的纯文本条件扩散或自回归生成模型都极易陷入“构图精美却完全失实”的幻觉怪圈。其根源在于,文生图模型被长久地视作静态知识库,一旦用户的提示词缺少关键细节,模型无法主动向外探索,只能凭空编造。
ArXiv URL:https://arxiv.org/abs/2608.04436v1
为了打破这种闭门造车的局限,学术界近期将智能体能力引入了图像生成。现有的主流方案大致分为两派:一类是写死步骤的固定工作流,即预先规定好“先搜索文本、再归纳特征、最后统一送入生成器”;另一类是“提示词优化”范式,让大语言模型充当搜索中介,在搜集完事实后把改写好的长提示词扔给一个独立的扩散模型。然而,这两种做法都只是把生图管线的部分环节交由智能体控制。生成动作本身并不是模型自主决策链条上自然产生的一个动作,推理、调用工具与像素生成被割裂在不同的策略之下。
由香港科技大学、新加坡国立大学、中国人民大学及都柏林大学学院等机构组成的研究团队,提出了名为 ToolArtist 的全新框架。与以往“外挂式拼接”的生成智能体完全不同,ToolArtist 基于原生统一多模态模型(Unified Multimodal Model, UMM)进行后训练,将自主思考推理、调用外部搜索工具、整合检索证据以及最终的原生视觉生成,全部统摄在同一个自回归策略网络之下。在开放知识生成基准 WorldGenBench-Humanities 上,ToolArtist 斩获了非商业模型的最佳平均分 22.10,在涵盖自然科学与社会常识的 WISE 基准上也达到了 0.79 的综合评分。

从外挂流水线到单策略闭环
想要理清 ToolArtist 的突破点,首先必须审视此前 Agent 辅助图像生成在架构上的妥协。

在上图展示的对比中可以清晰看到三种范式的演进路径。最顶部的“工作流范式”虽然让多模态模型获得了工具调用能力,但整个执行序列是人工预设的固化流程,什么时候该搜、搜几次、何时结束搜索全部由代码硬性规定,缺乏因题制宜的动态弹性。中间一类的“提示词优化范式”本质上是一个纯文本或多模态的搜索助手,它在完成信息收集后,将扩写后的生成指令单向丢给一个完全脱节的外置生成器(如特定的扩散模型)。在这个阶段,负责思考的智能体并没有真正掌握画笔,一旦外置生成器无法准确还原扩写文本中的特定构图或细节,系统无法在内部完成自我反思与多模态修正。
ToolArtist 采取了最底部的全新范式:将图像生成视作与工具调用平级的自回归动作。
在形式化定义中,ToolArtist 将开放世界图像生成视作智能体与动态环境之间的多轮 ReAct 交互。给定用户指令 $q$,策略网络 $\pi_\theta$ 在每一步生成的输出可以是中间思考文本 $r_t$,也可以是具体的行动 $a_t$。至关重要的是,这里的行动空间由两部分组成:
\[a_t \in \mathcal{A}_{\mathrm{tools}} \cup \mathcal{A}_{\mathrm{draw}}\]如果模型判定当前参数内的知识不足以支持高保真图像绘制,它可以自主选择调用网络文本搜索或多模态图像搜索工具,从外部世界知识空间中获取观察反馈 $o_t$;如果模型认为收集到的视觉和文本事实已经完备,它便自主发起绘制动作 $a_t \in \mathcal{A}_{\mathrm{draw}}$。该绘制动作在底层表现为生成一段对齐意图的视觉描述(Visual-caption span),紧接着直接自回归输出该图像的原生离散视觉标记(Visual-token span)。
这意味着,底座模型必须是一套能够原生吞吐图文混合标记的统一多模态模型。研究团队选择了基于自回归架构的 Emu3.5 作为基座。Emu3.5 将连续图像量化为离散的视觉 Token,并在统一的词表下通过“预测下一个 Token”(Next-token prediction)同时建模理解与生成任务。这为 ToolArtist 实现“思考—调用工具—观察—绘制”的一体化单策略闭环奠定了不可替代的结构基础。
巧借教师轨迹:SFT 数据转换的巧妙构思
直接训练这样一个同时掌握复杂多步检索与原生像素绘制的统一多模态模型,面临极其严重的冷启动难题。如果让初始基座盲目在开放环境中摸索,模型极难同时学会“该何时停下搜索”以及“如何把检索到的参考图事实忠实转化为生成的视觉 Token”。
为此,研究团队设计了一套将教师智能体(Teacher Agent)轨迹向 UMM 原生数据格式平滑迁移的两阶段后训练方案。

在数据合成的第一阶段(Rollout),研究者构建了一个拥有完备工具集的强大教师智能体。这个教师智能体配备了经过专门增强的文本搜索工具(TextSearch)、图像搜索工具(ImageSearch),以及一个顶级的商用外部生图工具(实验中使用 gemini-3-pro-image-preview)。面对复杂的开放世界指令,教师智能体可以自主展开多轮思考、发起检索并调用外部生图模型得到参考成品。为了保证外部证据的严密性,搜索工具链被打磨得极为讲究:文本搜索引入了大语言模型阅读器(LLM Reader)进行跨网页总结与降级回退;图像搜索则不仅会清洗无法下载的死链,还会通过大模型过滤语义不相关的图片,并为每一张保留下来的参考图打上结构化的源网页摘要。
至关重要的创新发生在第二阶段(Convert)。如果直接使用包含外部生图工具调用的轨迹训练 UMM,模型学到的依然只是“如何调用外部 API 画图”。转换流水线执行了一次“偷梁换柱”式的结构重塑:将显式的生图工具调用语法剥离隐去,但将生图工具最终产出的图像完整保留,并将其序列化转化为基座模型原生的图像视觉 Token 序列。同时,当时传给生图工具的提示文本,被平滑重写为绘制动作前的视觉引导描述(Visual-caption span)。
经过严格的上下文长度筛查、离散分词校验与坏样本清洗后,团队仅保留了 7,132 条极高质量的多轮交互轨迹。这些样本绝非普通的数据对,其平均上下文长度超过 20k Token,平均每条轨迹包含 4.0 次动态工具调用。
在监督微调(SFT)阶段,损失函数的计算被精确限制在模型策略产生的标记上:
\[\mathcal{L}_{\mathrm{SFT}}(\theta)=-\mathbb{E}_{(x_i,y_i)\sim\mathcal{D}_{\mathrm{SFT}}}\left[\frac{\sum_{j=1}^{L_i}M_{i,j}\log P_\theta\left(u_{i,j}\mid u_{i,<j}\right)}{\sum_{j=1}^{L_i}M_{i,j}}\right]\]其中指示掩码 $M_{i,j}$ 仅对策略生成的推理文本、工具调用指令、视觉描述以及生成的视觉图像 Token 置 1,而将环境返回的检索网页片段和检索参考图完全排除在损失之外。这 7k 余条高质量微调轨迹,成功使基座模型一举掌握了在单一策略下交织推理、多步查证并在合适节点原生落笔生图的基础能力。
RAD-GRPO:意图与质量协同的双奖励强化学习
静态的监督微调固然建立了完备的交互模式,但它本质上是在模仿教师的既定行为,无法自主探索出面对未知查询时最优的搜索与权衡路径。此外,多模态生成模型在完成长程推理后,极容易在最终绘图环节出现意图漂移或细节失真。
为了彻底打通推理与生成的端到端优化,团队构建了一套专用于统一多模态模型的智能体强化学习基础设施,并提出了 RAD-GRPO(Reason-Act-Draw Group Relative Policy Optimization) 算法。
该算法继承了 GRPO 免除独立价值评估网络(Critic)的轻量化优势,针对同一个输入指令 $q$,利用旧策略网络与外部开放环境采样生成包含 $B$ 条完整交互的候选轨迹组 ${\mathcal{H}i}{i=1}^B$。每条轨迹均自主决定何时停止搜索并生成最终视觉图像 $(g_{T_i}, v_{T_i})$。RAD-GRPO 的核心精髓在于设计了互为表里的双重核心奖励函数:
\[R_i = \alpha R_i^{\mathrm{I}} + (1-\alpha)R_i^{\mathrm{Q}}\]第一重是意图奖励(Intent Reward, $R_i^{\mathrm{I}}$)。它针对最终生成的视觉描述文本 $g_{T_i}$ 进行评估,考量模型在经历了多轮搜索与逻辑推理后,是否准确、完整地将用户最初的意图与外部收集到的核心事实证据,凝聚成了一份具有可执行性的视觉构图规划。
第二重是质量奖励(Quality Reward, $R_i^{\mathrm{Q}}$)。它直接对最终自回归生成的离散视觉 Token 所还原出的实体图像进行全面打分,严格审查图像是否切实遵从了前面规划的视觉意图,是否违背初始指令的物理常识,并在美学构图与真实感上予以量化。
在默认 $\alpha=0.5$ 的设定下,意图奖励在长程文本推理与视觉落地之间架起约束桥梁,而质量奖励则杜绝了“规划完备却画不出来”的执行脱节。计算得到的轨迹级相对优势值 $\widehat{A}_i$,被一体化广播至整条交互轨迹中所有属于该策略生成的 Token 上,辅以格式遵循等辅助奖励项以及严格的 KL 散度约束,促使整套涵盖思考、调用工具、聚合证据到最终落笔的复杂连续行为链条协同进化。在实际训练中,演员网络的生成熵从初始的 12.03 稳步收敛至 11.87 至 11.91 之间,轨迹学习过程平稳,完全规避了传统强化学习在混合模态场景中极易出现的熵坍塌。
基准表现:开放世界知识生成的实力检验
评测开放世界生成能力,必须依赖高难度的知识密集型基准。研究团队在考察多领域世界知识融合的 WISE,以及专为多步推理世界知识设计的 WorldGenBench-Humanities(人文社科全集)上对 ToolArtist 展开了严密测试。
在 WISE 基准中,系统需要经受文化常识、时空推理、物理、化学与生物等 6 个维度的严苛考察。ToolArtist 取得了 0.79 的总分,超越了此前所有的开源多智能体图像生成方案。尤其是在对外部长尾知识依赖极重的自然科学领域,ToolArtist 展现出了单策略智能体的巨大优势:其在物理学(Physics)维度拿下 0.81,在化学(Chemistry)维度拿下 0.79,其知识对齐准确度已经能够正面硬抗顶级的商业专有模型。
在涵盖全球 244 个国家和地区、依赖严苛知识清单打分的 WorldGenBench-Humanities 基准上,ToolArtist 的表现更为抢眼:其平均知识清单达成率(KCS)跃升至 22.10,力压业界一众强劲基线(如 Qwen-Image 的 21.76,以及同类 Agent 系统 Unify-Agent 的 15.58 和 GenSearcher 的 13.66),成为该基准上综合得分最高的非商业模型。从地域细分指标来看,ToolArtist 在文化与地理信息极其繁复的非洲(AF)、南极洲(AN)和亚洲(AS)大区均摘得非商业类第一。
为了剖析其真实推理轨迹的质量,论文重点展示了一个极具代表性的历史地理案例:用户要求生成一张“1955年索科特拉岛上采集龙血树树脂”的历史照片。

面对这一高度专业、涉及多重长尾事实的请求,没有自主搜索能力的传统模型立刻暴露出知识盲区。常规模型或者完全无法画出索科特拉岛特有的伞状龙血树(Dracaena cinnabari),或者对 1955 年当地居民的传统服饰、采集树脂所使用的原始手工陶器与开采划痕一无所知,生成出充满现代感或纯粹西装革履的怪异画面。
而 ToolArtist 在接收到提示后,策略自主触发了连续推理:它首先判断“索科特拉岛上的龙血树采集有何独特的外观与历史工艺”,随后主动调用文本搜索锁定了 1950 年代该地区的地理风貌与原住民劳作特征;紧接着,为了防止纯文本理解偏差,它自主调用多模态图像搜索获取了真实的伞状龙血树形态与古老采脂划口照片。最终,模型将这些跨模态证据内化为自身生成策略的一部分,准确生成了粗糙原始的陶罐、带有特殊切口的龙血树干,以及符合特定年代地域特征的劳作者形象。整个证据链条自始至终在同一个模型的上下文工作区内流动,展现出极高的一致性。
细节定成败:源感知图像搜索摘要的消融启示
在 ToolArtist 的诸多微观架构设计中,有一处极具工程与认知启发的消融实验:图像搜索工具附带的“源感知摘要”(Source-Aware Summaries)。
在常规的搜图工具调用中,搜索引擎通常只将缩略图或高分辨率参考图片直接返回给多模态模型。然而团队在实验中发现,仅凭图片外观极易对多模态模型产生误导——模型常常因为“看起来像”而错误采纳了实际上张冠李戴的参考物。
因此,ToolArtist 的图像搜索工具设计了一道前置工序:调用大语言模型阅读器同步提取图片宿主网页的内容,为返回的参考图强制附带一段关于其真实来源、拍摄主体及上下文事实的文字摘要。
消融实验揭示了这一细节的巨大威力:
-
当移除图像的源感知摘要、仅依赖纯视觉图像作为工具返回结果时,ToolArtist 在 WISE 基准上的综合得分直接从 0.79 暴跌至 0.61。
-
跌幅最为惨烈的正是对细粒度物种鉴别要求极高的生物学(Biology)领域,其单项得分断崖式下跌了整整 0.50。
这一严峻的数据表明,在开放世界视觉任务中,图像本身往往蕴含着语义歧义,一张形态相似的花朵可能属于完全不同的亚种。如果模型在引入视觉观察时缺乏精确的事实源信息锚定,其自主推理逻辑链条就会被错误的视觉表象带偏,最终导致生成的画面“看似合理实则事实崩塌”。为参考图像装上文本维度的“身份证明”,是保障 Agent 视觉决策不出轨的核心基石。
总结与展望
ToolArtist 的价值不仅在于刷新了几个榜单的数字,更在于它完成了对 Agent 图像生成底层技术路线的一次关键纠偏。
长期以来,业界习惯于将智能体视作“胶水”,用以拼接现成的大语言模型与闭源或专有的绘图模型。这种修修补补的工作流固然容易上手,却人为割裂了认知逻辑与视觉物理实现的内在连续性,模型始终学不会“在看到不合规的笔触时自主决定继续查资料并修正”。ToolArtist 证明了:依托原生能够吐出离散图像 Token 的统一多模态模型(UMM),将推理、搜寻证据与绘图绘制全部包揽在同一个自回归策略之内,配合针对多模态轨迹的端到端强化学习,才能真正演化出具备自主世界常识的高保真视觉创造力。
团队在本文发布的同时,全面开源了这套包含 7,132 条长程多模态轨迹的数据集,以及适配 UMM 的全套 SFT 与 RAD-GRPO 强化学习训练代码架构。随着多模态统一基础模型在分辨率与上下文长度上的持续演进,这种将“眼、脑、手”融为一体的单策略智能体,无疑指明了开放世界内容生成从“被动对齐提示词”迈向“主动探索世界真实”的下一代演进方向。