VibeWorlding:腾讯等开源3D构建框架,RL让开源Agent超越GPT-5.5

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

VibeWorlding:腾讯等开源3D构建框架,RL让开源Agent超越GPT-5.5 论文图示

在游戏开发、物理仿真以及具身智能等前沿领域,根据用户的自然语言指令快速构建可交互的开放式3D世界,一直是一项极具挑战性的核心任务。近年来,随着多模态大语言模型(MLLM)的爆发,学术界和工业界开始尝试利用多模态 Agent 来实现3D世界构建的自动化。然而,目前的研究大多停留在理想化、结构简单的查询指令上,极少触及真实世界中复杂且开放的用户意图。更关键的是,由于缺乏一个统一且开源的框架,研究人员很难系统性地评估多模态 Agent 在理解用户意图、调用3D工具以及对图文信息进行空间推理时的真实表现。

ArXiv URL:https://arxiv.org/abs/2608.15265v1

香港科技大学与腾讯的联合团队在最新发布的研究中,敏锐地指出了当前3D世界生成领域的痛点,并提出了一个名为 VibeWorlding 的端到端开源框架。这项工作不仅提供了一个包含超过2600个高质量3D资产和近7000个多模态查询的基准测试集 VWE-Bench,还构建了一个支持强化学习(RL)后训练的统一沙盒环境 VibeWorlding-Gym。

作者在研究中得出了一个非常关键的判断:当前最前沿的闭源多模态大模型在解决端到端3D世界构建任务时依然举步维艰,即便是 GPT-5.5 和 Qwen3.8-Max,其成功率也未能突破60%。研究团队将这一性能瓶颈精准定位在了“精确的3D世界编辑”能力上。更令人瞩目的是,通过在该框架下进行多模态强化学习后训练,开源模型能够有效克服这一弱点,甚至在整体表现上超越了顶级的闭源模型。在这项研究中,基于开源底座微调的 VibeWorlder-30B-A3B 模型,最终在所有参与评估的模型中夺得了最高的 Pass@1 成绩。

从碎片化工具到端到端 Agent 的跨越

要让一个多模态 Agent 像人类设计师一样从零开始搭建或修改一个3D场景,它必须具备极强的自主规划能力、工具调用能力以及对环境反馈的反思能力。然而,现有的基于 MLLM 的3D构建工作通常面临两个巨大的阻碍。

3D资产环境的极度碎片化是阻碍 Agent 走向实用的第一座大山。在真实的工作流中,高质量且符合物理常识的3D资产很难成规模地获取。同时,Agent 需要执行的资产检索、空间编辑和图像渲染等操作,往往散落在互不兼容的软件和工具链中。这种割裂的状态导致 Agent 很难在一个统一的沙盒接口下完成端到端的构建。

3D世界构建的验证难题则构成了第二座大山。一个合格的3D世界不仅需要满足严苛的物理约束(例如物体不能悬空、资产之间不能发生穿模碰撞),还需要在语义和审美上契合用户的开放式意图。这种多维度的评价标准,既无法单纯依赖程序员手工编写的代码规则来判定,也无法放心地完全交给一个通用大语言模型来做裁判。

VWE-Bench和VibeWorlding-Gym概览

为了彻底打通这一链路,VibeWorlding 框架将3D世界构建任务重新定义为一个多轮次、多模态、深度集成工具的推理过程。无论是接收到一句简单的“从零搭建一个舒适的书房”,还是接收到一个现有的3D场景并附带“在桌子旁边加一个书架”的修改指令,Agent 都需要自主推断意图、规划场景布局,并在不断的“调用工具-观察多模态反馈”的循环中完善场景,直到输出最终的交互式3D世界。

构建 VWE-Bench:人类艺术家与 AI 的协同数据工厂

为了给 Agent 提供一个极具挑战性且贴近真实应用场景的试炼场,研究团队构建了 VWE-Bench(VibeWorlding 评估基准)。这个基准的构建过程摒弃了纯依赖网络爬虫的低质量数据收集方式,而是采用了一条由人类艺术家引导、生成式 AI 辅助的高质量生产线。

在3D资产的准备阶段,艺术家负责定义资产的属性、类别并把控质量,而生成式模型则负责批量合成参考图像和3D网格。这种协同模式最终沉淀出了2616个高质量、物理属性一致的3D基础资产。这些资产不仅包含精细的几何表面,还附带了严格的物理包围盒定义,为后续的精确碰撞检测奠定了基础。

随后,专业艺术家使用这些资产手动搭建了323个种子3D世界。这些种子世界被刻意设计为功能完整但尚未极尽精雕细琢的粗糙场景。保留这种“粗糙感”是为了给后续的“世界优化”指令留出充足的操作空间。

VWE-Bench的数据分布

有了资产和种子世界,研究团队利用 MLLM 进行逆向合成,生成了高达6828条多模态查询指令。这些指令被巧妙地划分为两大类:一类是要求从无到有构建场景的“从零构建”查询;另一类则是针对现有种子世界提出修改意见的“编辑优化”查询。为了确保评估的严谨性,数据集被进一步划分为拥有绝对标准答案的 Verified(已验证)查询,以及依靠精心设计的量规进行评估的 Unverified(未验证)查询。

VibeWorlding-Gym 与双重约束验证器

为了弄清楚如何通过训练来提升 Agent 的核心能力,研究团队基于构建的数据集开发了 VibeWorlding-Gym。这不仅是一个支持可扩展强化学习的训练平台,更是整个研究的机制核心。

环境的核心是一个统一的3D沙盒。Agent 在这里可以调用五种标准化的工具:资产检索、添加、旋转、平移和删除。其中,资产检索工具基于 Qwen3-Embedding-4B 训练而成,能够将用户的自然语言意图精准映射到合法的3D资产库中,确保 Agent 拿到的每一个部件都是真实可用的。而 Blender 渲染服务的引入,则让 Agent 在执行完每一步操作后,都能立刻获得包含前、后、左、右、俯视五个固定视角的渲染图像。这种视觉反馈对于 Agent 确认物体空间位置关系至关重要。

在训练和评估的奖励机制上,作者提出了一个极具创新的“双重约束验证器”(Dual-Constraint Verifier)。这是解决3D生成结果难以评估这一历史难题的关键手段。

一方面是严苛的物理可行性验证。由于大模型普遍缺乏原生的三维物理直觉,极易生成悬空或互相穿透的物体,系统会通过基于 Python 的几何算法对场景进行硬性检查。任何未贴合有效表面(如悬空)的资产,或是不同资产包围盒之间发生的非法重叠碰撞,都会被精准捕获并判定为失败。

另一方面则是基于量规的意图满足度验证。当场景在物理层面无懈可击时,MLLM 裁判会介入,从生态合理性(比如室外植物不该长在室内床上)、3D理解与推理准确度,以及资产检索的相关性等多个维度对生成的场景进行打分。对于没有唯一标准答案的 Unverified 查询,只有当物理检查和意图检查全部通关时,才算构建成功。而对于有标准答案的 Verified 查询,系统则直接比对 Agent 修改的世界与真实答案的资产差异比例来给出连续的奖励分数。

多模态强化学习如何激发 Agent 的空间潜能

有了可靠的反馈机制,VibeWorlding 框架打通了从监督微调(SFT)到强化学习(RL)的完整后训练链路。研究团队采用 GRPO(Group Relative Policy Optimization)算法,让 Agent 在纯文本构建指令和多模态编辑指令中进行联合训练。

在奖励设计上,作者做出了一个非常克制的取舍:摒弃了手工设计的密集中间奖励,完全采用基于结果(Outcome-based)的奖励机制。Unverified 任务采用 0/1 的二元奖励,而 Verified 任务则提供 [0,1] 的细粒度准确率得分。这种设计有效地防止了 Agent 在复杂的3D空间操作中钻规则漏洞(Reward Hacking)。

实验结果揭示了几个极其重要的结论。

首先,即便是当下最顶级的模型,在未经专门训练的零样本(Zero-shot)状态下面对 VWE-Bench 时,也显得力不从心。无论是 GPT-5.5 还是 Qwen3.8-Max,其通过率均低于60%。作者通过详细的能力雷达图分析指出,这些模型其实能够很好地理解用户意图并看懂3D世界的整体布局,但它们的致命弱点在于“精确的3D工具执行”。当需要将一个物体精确移动到特定坐标并旋转特定角度时,通用大模型的空间想象力往往会彻底崩塌。

各模型在Verified和Unverified任务上的Pass@1表现

然而,多模态强化学习展现出了扭转乾坤的力量。通过 RL 训练,模型在精确编辑上的短板被大幅补齐。以 Qwen3-VL-8B 为底座训练而成的 VibeWorlder-8B,在体量极小的情况下,其表现直接追平了 Gemini 3.1-pro。而以 30B 规模模型为基础打造的 VibeWorlder-30B-A3B,不仅一举抹平了开源与闭源之间的鸿沟,更是在 Verified 和 Unverified 任务的综合评估中超越了 GPT-5.5,拿下了全场最高的 Pass@1 成绩。

更有意思的是,作者通过追踪 RL 训练过程发现,训练信号的可靠性直接决定了能力提升的上限。在具有确定性标准答案的 Verified 查询上,模型获得的奖励信号极其清晰,因此其性能提升曲线非常平滑且幅度巨大,泛化能力也得到了实质性增强。而在依赖 MLLM 打分的 Unverified 查询上,虽然性能也有显著增长,但由于 MLLM 裁判本身存在一定的判断波动,导致训练曲线呈现出明显的震荡。这也从侧面印证了,在具身智能和3D生成的 RL 训练中,拥有一个确定的、基于物理规则的奖励引擎是何等重要。

前沿 Agent 为什么会失败?

为了帮助未来的研究者避开暗礁,作者不仅展示了成功,还通过具体的案例深度剖析了前沿 Agent 最容易陷入的两种失败模式。

第一种典型的失败是“3D距离编辑不精确”。当面对诸如“将石头向前移动7米”这种指令时,模型往往能够准确理解位移的标量大小(7米),但在方向矢量的判断上却经常南辕北辙。由于在复杂的3D坐标系中发生了方向性倒置,本该微调位置的石头被抛到了距离目标点极远的地方。这说明当前的大模型在将自然语言的相对方位关系转化为绝对3D坐标时,依然缺乏足够鲁棒的映射能力。

前沿Agent在VWE-Bench上的两种主要失败模式

第二种更隐蔽的失败则是“过度编辑”(Overediting)。在一个多轮交互的场景中,用户可能仅仅要求“在箱子旁边加一棵树”。Agent 的规划模块完美地理解了指令,并且在指定位置成功添加了新树。但在执行过程中,Agent 却莫名其妙地调用了删除工具,将场景中原本存在的一棵大树抹除了。这种失败并非源于对当前指令的误解,而是暴露出 Agent 对3D世界现有状态的“记忆力”极其薄弱。它们在执行局部修改时,很容易忽视或破坏周围未被提及的元素,这凸显了在交互循环中持续引入高质量渲染图像反馈,以维持场景状态一致性的极端重要性。

VibeWorlding 的开源,不仅为 3D Agent 提供了一块极其严苛的试金石,更通过清晰的实验证明:只要拥有高质量的交互沙盒和合理的强化学习反馈循环,开源多模态模型完全有能力在复杂的空间推理与3D构建任务中,击败那些不可一世的闭源巨兽。随着相关数据、代码和模型的全面开放,端到端3D开放世界的自动构建无疑将迎来一波新的研发热潮。