DiG-bench:人类通关100%的未知规则游戏,大模型为何卡在主动探索?
DiG-bench: Discovery in Games

在人工智能迈向通用智能与科学发现(AI for Science)的进程中,一个最核心但长期缺乏定量评估的能力,就是主动发现(Discovery)。所谓的科学发现,绝非单纯在海量已知文献中检索关联,也不是在既定规则明确的棋盘上穷举搜索,而是在面对一个机制未知、目标未知的黑盒系统时,能够自主提出假设、设计实验、进行干预,并根据反馈归纳出普适规律。
ArXiv URL:https://arxiv.org/abs/2608.12593v1
来自英国牛津大学、美国普林斯顿大学、麻省理工学院、法国国家信息与自动化研究所(Inria)等多家顶级科研机构的研究团队,针对这一长期被忽视的盲区提出了全新基准:DiG-bench(Discovery in Games)。该基准由 70 个完全原创、未在互联网公开的纯文本互动游戏组成,涵盖 7 个递进的难度梯度。在这些游戏中,不仅系统的运行规律完全隐藏,连每一关的通关条件都必须由智能体自行摸索。
测试结果揭示了一个耐人寻味的鸿沟:所有 70 款游戏均由人类玩家在首次尝试中成功通关;然而,当前最顶尖的语言模型在标准测试环境下遭遇断崖式阻碍,最强大的闭源模型在基础测试中仅能解出 50 款,最难的两个梯度中甚至集体陷入停滞。更有启发性的是消融对比实验:当研究团队把精炼的自然语言规则直接提供给 Gemini 3.1 Pro 时,其通关数瞬间从 18 款飙升至 69 款。这一巨大落差无可辩驳地证明,当前大模型真正匮乏的不是符号规划与执行能力,而是在未知环境中通过主动实验构建新世界模型的探索能力。
为什么现有基准测不出真正的“科学发现”?
评估自主探索能力的难点,在于如何把“发现规律”与其他干扰变量干净地剥离。回顾现存的 AI 评测基准,多数被冠以“推理”或“发现”之名的测试,往往混杂了大量非核心变量。
第一类以经典的 ARC-AGI-1、ARC-AGI-2 或 Bongard 题集为代表。这类基准本质上是“离线归纳”,系统拿到几组固定的输入输出网格样例,直接推断潜在规则。这种模式完全割裂了科学探索中最关键的一环——主动干预。智能体无法根据当前的疑惑去自主决定下一步要试探什么输入,缺少了“假设—验证”的闭环迭代。
第二类是以 ARC-AGI-3 或各类强化学习虚拟世界为代表的动态环境。这些环境虽然引入了交互,却不可避免地引入了复杂的二维或三维视觉感知、空间导航与操作延迟。大模型之所以解不出题,往往是因为多模态视觉编码丢失了局部细节,或者是长程路径规划超出了上下文负荷,而非其抽象推理机制失效。视觉先验的混杂,让研究者无法准确定位失败的根因。
第三类则是以科学实验模拟器为代表的环境,如 DiscoveryWorld 或各类化学、物理引擎。这类环境常常深度绑定人类现有的科学常识,模型往往依赖预训练语料中的记忆走捷径,而非即时发现未知的物理定律;部分基准甚至将“发现”降维成在一个预设的菜单中勾选既定假设,退化成了多项选择题。
DiG-bench 的立论核心正在于此:如果想纯粹测试大语言模型在未知环境中的主动实验与规律抽象能力,就必须构建一个纯文本符号化、无预训练泄露、规则与目标双重隐匿的极简受控沙盒。
游戏架构与机制设计:单行字符串里的宇宙
DiG-bench 包含的 70 款微型世界,均由人类专家纯手工设计,并且严格遵循大语言模型的原生交互方式。每一次环境给出的观测值都是简短的文本字符串,绝大多数只占据单行,没有任何视觉或空间渲染的干扰。
每一个游戏不仅是一道逻辑谜题,更是一套拥有独立底层法则的形式系统。环境隐藏了两个关键信息:第一是动作转换法则(操作指令对状态的具体影响),第二是关卡获胜判定(达到什么状态才算赢)。智能体在每一关只能看到当前观测字符、剩余步数、剩余生命以及合法动作列表,必须完全依靠交互反馈来推断背后的规律。
为支持深度的假设检验,研究团队在机制设计中引入了三大支柱:
-
创造模式(Creative Mode)与沙盒实验机制:许多游戏设计了专门的“创造模式”。在该模式下,智能体不受通关死亡威胁与严苛步数上限的约束,可以自由构造边界输入,尽情测试特定符号的交互特性。例如在特定游戏中,玩家可以专门测试某个符号是否具有放大、消除或逆转功能,验证完毕后再切回生存模式通关。这种设计直接映射了现实科研中“在实验室做受控对照实验,再应用到实际生产场景”的流程。
-
跨关卡抽象转移与递进挑战:每个游戏包含多个连续关卡,后序关卡通常建立在前序关卡发现的底层机制之上,但会引入非平庸的组合或反常边界。例如在某款游戏中,前两关让智能体理解“激活符号 $n$ 可以铺设桥梁”,但第三关横亘着三倍宽度的障碍,常规桥梁根本无法跨越。智能体必须进一步探索发现符号 $\sim$ 具有三倍增益的催化特性,并将两个此前孤立的规则进行复合推理,才能达成最终目标。
-
多样化与反直觉的底层规律:70 款游戏的底层机制跨越了符号逻辑、状态机、代数变换、生态竞争等极其丰富的领域。在公开示例中,机制差异极大:有的是“每关分为两个镜像结构,两部分呈现同态映射”;有的是“当骑士数量多于恶棍时,恶棍开始说真话”;还有的是“某种生物只在另一种生物消失后的残骸上诞生”。智能体无法依赖固定套路一劳永逸,必须在每个游戏中重新进行原初的科学归纳。
梯队划分与严谨评估方案
为了避免数据污染并实现长期追踪,DiG-bench 采取了公开与私有隔离的评测标准。整个基准被分为 7 个难度梯度(Tier 1 至 Tier 7),每个梯度公开 3 款游戏(共 21 款,代号 P-1 至 P-21),其余 49 款全部封闭留存,用于不受污染的私有评估。
在智能体接入层,评测团队提供了两套测试环境:
-
基础脚手架(Basic Harness):将模型作为原生智能体直接与游戏环境循环交互。为了最大程度激发模型的推理潜力,评测保留了各大提供商的原生思维链与思考状态延续机制,例如 Gemini 的思维签名(thought signatures)、Anthropic 的思考签名(thinking signatures)以及 OpenAI 的加密推理项。上下文管理采用极小干预,仅在极少数步数爆炸的长游戏中截断最旧历史。
-
智能体脚手架(Agentic Harness):针对难度最高、探索空间极大的第 6 和第 7 梯队,评测引入了当下的主流自主代理框架,包括配合 Claude Code、Codex、Kimi Code 的模型上下文协议(Model Context Protocol,MCP)架构,以及面向代码执行的 Prime Agent 和 PRO-LONG 代理沙盒。每个运行实例都在独立的 Docker 容器中执行,赋予其完整的工具调用与代码分析权限。
评测覆盖了业界顶尖的闭源与开源模型,包括 Claude Opus 5、GPT-5.5、Gemini 3.1 Pro、Kimi K3、GLM-5.2、DeepSeek V4 Pro、DeepSeek V4 Flash 以及 Qwen 3.6 27B 等,同时设定了统一的计算成本上限(单游戏 200 美元)与时间上限(单游戏最长 12 小时),超时或超额均判为失败。
人类金标准则来自多位人类受试者的首次尝试(First-exposure),受试者包括数学学术研究者、学生及高阶谜题爱好者,全程记录其操作步数、思考日志与笔录反馈。
评测结果:大模型与人类的鸿沟究竟在哪里?
实验数据给出了极其清晰且富有冲击力的对比。
全集 70 款游戏,人类受试者的首次尝试通关率为 100%。虽然人类玩家在主观反馈中普遍表示谜题极其费脑,许多关卡单局连续游玩超过一小时,甚至需要动用草稿纸记录推演状态机,但人类始终展现出了强大的针对性实验能力与直觉假设修正确认能力。
反观大语言模型,整体表现呈现阶梯式崩溃。在基础脚手架测试中:
-
表现最弱的模型 Qwen 3.6 27B 仅在全集 70 款游戏中通关了 1 款。
-
综合能力强劲的 Gemini 3.1 Pro 仅攻克了 18 款游戏。
-
登顶基础脚手架的 Claude Opus 5 通关了 50 款。
-
若在每款游戏中选取基础脚手架下各模型的最好成绩,聚合总分也仅达到 57/70 款。
更关键的是按难度的分层剖析。在 Tier 1 梯度中,诸如 Gemini 3.1 Pro 这一代模型基本能够轻松解决;但随着梯度攀升至 Tier 6 和 Tier 7,即便是调动了外部工具、支持持久化记忆与代码编写的智能体脚手架,模型的成功率依然极低。在最高难度的 20 款游戏中,所有基础模型合力也仅仅拿下了 9 款。
为了进一步查明模型究竟是“无法根据规则制定规划”,还是“无法从零发现规则”,研究团队进行了一组至关重要的对照实验:他们将 70 款游戏背后的真实底层法则与获胜条件,提炼成精炼的自然语言直接写入系统提示词,然后再让 Gemini 3.1 Pro 进行闯关。
结果极具启发性:在已知底层规则的前提下,Gemini 3.1 Pro 的通关数量直接从 18 款飙升至 69 款。这不仅反衬出 DiG-bench 谜题在规则已知时绝非无法攻克,更用无可辩驳的数据锚定了当前前沿大模型的核心短板:模型的瓶颈根本不在于规划引擎或逻辑解题器,而在于无法在与黑盒系统的真实交互中,通过自我设计的实验去归纳并收敛出正确的世界模型。
此外,对比人类与 Gemini 3.1 Pro 共同通关的关卡步数分布可以发现,在那些最终被模型攻克的关卡中,模型的解题步数与人类极其接近。这表明一旦规律被识别,模型的执行效率并不逊于人类;真正的鸿沟全在于发现阶段的探索策略:人类懂得主动设计具有最大信息增益的试探动作,而模型往往陷入低效的随机漫步,或者过早固守在一个错误的先验假设中反复碰壁,直到消耗完宝贵的步数或生命值。
科学发现基准为未来 AI 研究敲响的警钟
DiG-bench 的实验结论,不仅是对当前大模型智能水平的一次精准切片,更对大模型训练与智能体演进路径提出了深层反思:
其一,测试基准去视觉化并不等于降智,反而是对纯粹认知能力的深层提炼。长期以来,学术界普遍存在一种直觉假设,认为文本环境天生简单,多模态网格或三维仿真才是高级智能的试金石。DiG-bench 强有力地打破了这一迷思:只要抽象逻辑足够精妙、交互空间足够广阔,短短几行纯文本所构成的形式世界,依然能让当前算力规模最庞大的 frontier 模型束手无策。剥离视觉先验,反而排除了视觉骨干网络的干扰,真正直击智能体假设生成的软肋。
其二,强化学习与思维链的泛化盲区。当前主流的大模型强化学习(如通过思维链解决代码和数学问题)高度依赖明确的验证器(Verifier)和清晰的确定性目标。在这种范式下,模型训练出的是“在已知规则边界内搜索解法”的技巧。然而在真实科学研究中,从来没有人提前写好测试用例或目标函数。面对 DiG-bench 这种目标与因果律隐匿的双重黑盒,依赖静态验证机制训练出的模型表现出了明显的脆性。
其三,主动实验(Active Experimentation)机制亟待重构。在 DiG-bench 的沙盒创造模式中,模型的行为暴露了其与科学家思维的本质差异。人类在沙盒中会系统性地进行单变量控制实验;而大模型在调用工具时,往往倾向于为了行动而行动,缺少清晰的“证伪”意识。如何让智能体学会主动寻找最具鉴别力的对抗性样本,不仅是跨越 DiG-bench 高难度梯队的钥匙,更是 AI 真正介入分子生物学新靶点发现、新型材料合成与未知数学猜想破题的先决条件。
科学的发展史就是人类不断在混沌现象中提炼简洁定律的历史。DiG-bench 的出现,在看似完备的模型评测版图上凿开了一扇通往真实世界探索的窗口。当大模型终于能像人类受试者那样,在面对一片未知的字符序列时,克制盲目操作的冲动,有条不紊地搭建实验、推导出背后的隐秘定律,通用人工智能才算真正迈出了成为自主科学家的关键一步。