提示词越长画质反而倒退?视觉生成首次揭示文本条件扩展律
Scaling Properties of Text Conditioning in Visual Generation
在大语言模型(LLM)的发展轨迹中,扩展律(Scaling Laws)早已成为整个行业的指路明灯:算力、参数量与高质量 Token 数量的增长,能够稳定且可预测地降低预训练损失。文生图(Text-to-Image, T2I)领域随后也复制了这套思路,不断堆叠扩散模型的参数量,从 UNet 转向 Diffusion Transformer(DiT),并在数以十亿计的图文对上展开大规模训练。然而,这条看似顺理成章的演进路径,却掩盖了一个长期被忽视的基础性不对称:语言模型直接从文本流本身汲取密集的自监督信号,而扩散模型学习的却是一对跨模态映射。
ArXiv URL:https://arxiv.org/abs/2607.29679
在传统的文生图训练中,当文字描述无法精准绑定画面中的几何关系、空间排布与细粒度属性时,扩散模型只能接收到微弱且充满歧义的条件引导;那些被文字彻底忽略的视觉细节,即便原原本本地呈现在像素阵列中,也完全无法转化为可学习的条件先验。

这就引出了一个困扰工业界与学术界的核心问题:当我们不断把自然语言提示词(Prompt)写长、写细,模型真的能够生成更符合预期的复杂图像吗?近期一项关于视觉生成中文本条件扩展特性的研究,给出了令人警醒却又极具建设性的答案。研究团队系统评估了当前主流的开源扩散模型,发现如果只是盲目拉长自然语言文本,模型的排布、属性对齐与整体质量不仅不会持续上升,反而会迅速见顶甚至掉点,最终的生成质量普遍低于模型在最短提示词下的表现。
究其根源,能够遵循扩展律的从来不是无节制膨胀的“Token 数量”,而是提示词中真正与图像像素严格绑定的“结构化信息量”。论文基于这一发现,首次量化并确立了视觉生成中的文本条件扩展律(Scaling Properties of Text Conditioning),并由此重构了包含结构化提示词(Structured Prompt)、可扩散性(Diffusability)与可提示性(Promptability)在内的全套技术范式。
为什么自然语言长提示词无法扩展?
长期以来,无论是在社区实践还是在各类文生图产品的工程实现中,最常见的优化手段都是借助大语言模型充当“提示词扩写器”(Prompt Enhancer),把用户输入的简短指令拓展成一段数十乃至数百词的华丽散文。然而,细致的控制实验表明,这种做法在根本机制上存在致命缺陷。

为了把提示词所包含的信息量与单纯的词元长度彻底剥离,研究人员设计了一个固定骨干网络的重建探针实验。实验选用相同的 Qwen-Image 骨干网络与随机种子,尝试从不同形式的描述文本中重建同一张留出的基准参考图像。在自然语言(NL)分支中,针对图中固定的实体与相互关系,人类标注员或大模型给出了从短到长四档不同长度的散文式描述。令人惊讶的是,随着自然语言文本大幅度变长,图像重建的特征相似度(DINOv3/SigLIP2 余弦相似度)和感知距离(LPIPS)曲线几乎完全走平。
这意味着,自然语言的修辞性扩写仅仅是在反复咀嚼、重新叙述那些早已明确的先验概念,并没有向模型注入任何新的、可被像素化锚定的实体关系或几何约束。模型面对冗长的文字表述,不仅无法获得更有力的去噪引导,反而要在自注意力机制中处理大量无关的语法虚词与修辞词元,导致关键属性与布局信息被严重稀释。
与此形成鲜明对比的是结构化提示词(Structured Prompt, SP)。当实验采用结构化字段,循序渐进地补充全局场景(Scene)、物体级属性与边框几何(Element Bounding Boxes)、以及跨实体空间与逻辑关系(Relations)时,三项重建指标均呈现出稳定、单调的显著改善。这表明,扩散模型并非无法理解复杂条件,而是现有的自然语言叙述方式存在严重的信息传输瓶颈。
量化信息量:GPG 与 ED 双重指标的确立
要确立严格的扩展律,首要任务是找到能够客观量化“提示词中包含多少有效视觉信息”的数学标尺。单纯依靠 Token 长度显然无效,而现有的图文匹配指标(如 CLIPScore)通常只打出一个粗粒度的全局分数,无法度量细粒度条件的增益。为此,研究团队引入并改造了两个互补的信息量度量指标:白盒的“以图像为锚定的困惑度增益”(Grounded Perplexity Gain, GPG)与黑盒的“有效细节度”(Effective Detailness, ED)。

GPG 是一种白盒度量方式,它通过观察冻结的视觉语言模型(VLM,实验采用 Qwen3.5-397B-A17B)在看到与看不到配对图像时,对提示词中内容 Token 预测概率的变化幅度来衡量信息量。其数学表达式为:
\[\mathrm{GPG}(y,I)\;\triangleq\;\sum_{t=1}^{T}m_{t}\Bigl[\,\log p_{M}(y_{t}\mid I,y_{<t})\;-\;\log p_{M}(y_{t}\mid\varnothing,y_{<t})\,\Bigr]\]式中 $I$ 代表图像,$y_{1:T}$ 为规范化后的提示词序列,$m_t \in {0, 1}$ 为针对实质内容 Token 的掩码。直观来看,如果提示词里写的都是画面中真实存在的特定细节,那么在给 VLM 输入图像后,该模型生成对应文本的对数似然就会大幅跃升;反之,如果一段提示词充斥着空洞的形容词或与画面无关的套话,图像的有无并不会对其生成概率产生太大影响,GPG 分数也就趋近于零。

作为互补,ED 则是一种完全无需访问模型内部 Logits 的黑盒语义度量。它借鉴了现代图文评测的细粒度分解思路,分别在图像侧与文本侧提取出包含实体、属性与关系的四元组,随后调用前沿语言模型作为无偏匹配器,判断文本中的属性有多少在图像中有据可查(精确率 $P_A$),以及图像中的关键属性有多少被文本准确覆盖(召回率 $R_A$)。最终的 ED 分数定义为偏向精确率的加权调和平均数:
\[\mathrm{ED}(y,I)\;\triangleq\;F_{0.5}\bigl(P_{A},\,R_{A}\bigr)\]这里的权重设定极为考究:在文生图的训练过程中,提示词的精确度远比召回率更加关键——一条包含虚假、幻觉属性的高召回描述,会对扩散模型的梯度更新造成严重干扰,而一条精确且经过严格几何锚定的局部描述,却能提供干净的学习信号。
扩展律浮出水面:收敛损失遵循线性与幂律趋势
在拥有了精确度量信息量的标尺后,研究团队在完全控制训练变量的前提下,执行了大规模的条件消融训练。他们保持底层图像数据集、网络架构(BAGEL 与 Qwen-Image)、参数初始化以及总训练算力完全一致,仅仅变换提示词的格式与信息粒度,涵盖了自然语言长度阶梯、嵌套的结构化字段子集、不同粗细的空间网格离散化表示以及核心字段消融等共 15 种受控配置。
实验得出了文生图领域极为罕见、极具规律性的拟合曲线:
-
GPG 与最终收敛的扩散均方误差(MSE Loss)之间呈现极强的负线性相关,拟合相关系数达到惊人的 $r = -0.984$:
\[\mathrm{MSE} \;=\;0.4549\;-\;8.45\times 10^{-5}\,\cdot\,\mathrm{GPG}\] -
ED 与扩散收敛损失之间则严格遵循经典物理与深度学习中常见的幂律衰减(Power Law),拟合相关系数高达 $r = -0.971$:
\[\mathrm{MSE} \;=\;0.4200\,\cdot\,\mathrm{ED}^{-0.2073}\]
这两条经验扩展律的发现,第一次打破了“扩散模型损失函数无法对文本条件产生规律性响应”的行业刻板印象。它明确揭示出:过去大家之所以看不到文本维度的 Scaling 效应,是因为把自变量选错了。只要跳出词元数量的迷思,转而以经过严格校验的结构化信息量作为坐标轴,生成质量与训练效率的持续提升就具备了可计算、可预测的理论支撑。
核心范式:提升“可扩散性”与“可提示性”
确立了扩展律之后,如何将这一理论规律转化为端到端的生成性能?本文提出了一个清晰的双轮驱动框架:生成系统的最终表现,本质上取决于“可扩散性”(Diffusability)与“可提示性”(Promptability)的乘积。

所谓的可扩散性,指的是一种文本表示格式在多大程度上能够高效、无损、结构化地把像素背后的监督信号暴露给扩散模型。传统的自由文本格式将物体身份、位置坐标、遮挡关系混杂在连续的长句中,导致交叉注意力机制必须自行承担复杂的实体解析与空间解缠任务。
研究团队构建的结构化提示词(SP)采用了类型严格的 JSON Schema,将视觉场景拆解为三大核心模块:
-
全局场景字段:规范化标注光照条件、视点透视、艺术媒介与构图风格。
-
实体级别字段:为画面中的每一个前景元素赋予唯一 ID,并绑定标准化的归一化边界框(Bounding Box)、类别标签、材质与姿态。
-
跨实体关系字段:显式描述物体之间的空间拓扑、接触状态及交互因果。
在训练阶段,团队通过结合前沿 VLM 与专门针对人体姿态、深度估计和语义分割的冻结领域专家模型,构建了全自动的“图像到 SP”反标流水线。这使得扩散模型在预训练与微调阶段,接收到的全部是高密度、低歧义的结构化视觉变量。
然而,在推理测试阶段,系统面对的往往是普通用户简短、抽象甚至模糊的自然语言输入,此时并无参考图像来生成精准的 SP。这就涉及到了第二重关键能力——可提示性:LLM 能否在严格保留用户原始意图的前提下,合理、逼真地补全未说明的视觉变量,并输出符合格式规范的结构化提示词?
为了大幅提升 LLM Prompter 的生成质量,研究者构建了三阶段演化链路:
-
监督微调(SFT)与冷启动蒸馏:利用合成与人工精修的高质量图文样本,教会 LLM 熟悉结构化 Schema,掌握从粗略需求到精细字段映射的基础语法。
-
基于验证器门控的在策略自蒸馏(Verifier-Gated On-Policy Self-Distillation, OPSD):为了解决大模型在自回归生成结构化字段时的幻觉与几何冲突问题,训练引入了一个能看到真实图像的“教师模型”作为基准,同时构建空间一致性与逻辑验证器。只有通过几何与语义双重检验的采样子集,才会被用于在策略强化微调,迫使 Prompter 学会规划合理、无重叠冲突的边界框与物理属性。
-
Agentic 闭环细化:在最终推理部署中,系统支持“细化—渲染—评判”(Refine-Render-Judge)的动态循环。评判模型对初次生成的图像进行视觉排查,若发现局部属性未对齐或排布失误,直接精准回滚并局部修改 SP 中的特定 JSON 字段,再让扩散模型重新渲染,无需推翻整张图像重新抽卡。
零样本编辑与全基准突破
这套由扩展律指导构建的生成系统,在实际落地中展现出了双重优势:极致的细节把控力与近乎天然的可控编辑能力。
由于结构化提示词将图像中的每个实体及其位置、材质、环境完全解耦为具名键值对,这使得零样本局部编辑变得极其直观。如图 2 所示,当用户希望修改画面中某个物体的位置时,无需绘制复杂的 Inpainting 蒙版或引入脆弱的 ControlNet 外部引导,只需直接更新对应实体的 bbox 坐标;若要改变某个物品的材质或局部风格,也只需在 JSON 文本中完成对应字段的“局部差分”,其余画面构图便能得到极其稳定的保留。

在宏观评测层面,该系统在所有参与对比的开源权重模型中脱颖而出。在多物体组合生成、复杂空间推理与世界知识等对文本对齐要求极高的基准测试中,基于 SP 训练与推理的模型几乎全面击败了包括 FLUX.1 Dev、HunyuanImage 3.0 以及 Emu3 在内的前沿系统。更具里程碑意义的是,在绝大部分严苛的图文一致性评测维度上,该开源架构展现出的语义遵从度,已经达到甚至超越了以 DALL-E 3 和 Midjourney 为代表的最强闭源商业模型。
重新思考文本驱动生成的未来路径
这篇论文的价值不仅在于刷新了若干评测榜单的分数,更在于它向整个计算机视觉与多模态社区提出了一个需要严肃正视的认知转向。
过去几年,文生图领域在很大程度上沉湎于“扩散模型规模即一切”的粗放式发展,把提示词理解的瑕疵归咎于网络层数不够深或注意力头数不够多。然而这项研究明确证实:生成式 AI 的瓶颈往往出在信息传输的接口标准上。自然语言是一门高度压缩、充满语用省略与上下文推论的人类交流媒介,它天生不是为了精确描述高维像素矩阵而设计的。
通过将自由散文重构为面向机器友好的结构化协议,研究者在扩散模型与大语言模型之间架起了一座信息无损传输的立交桥:由具备常识推理能力的 LLM 负责“想象并填补”合理的物理世界结构,再由专门擅长纹理去噪的扩散模型负责将这些结构“高保真渲染”为像素。
当“文本条件扩展律”这一此前隐匿的物理规律被推导至台前,未来的文生图架构或许将不再需要耗费海量算力去死磕“如何让 DiT 读懂上千字的自然语言小说”。让语言模型做语言的规划,让结构化数据做精确的引导,让扩散模型专注高质量的渲染——这种遵循信息扩展法则的模块化协同,很可能才是下一代视觉生成技术真正走向成熟的破局之匙。