GABench:首个大模型图分析Agent基准,万级任务测出能力断层

GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

在大模型逐步迈向自主智能体(LLM Agent)的演进过程中,让模型走出单纯的对话框,进入真实工具环境进行规划、调用与多步推理,已经成为评测大模型综合能力的核心标尺。然而,长期以来图数据分析领域的研究大多停留在一种相对“静态”的评测模式:研究者把小型子图的拓扑关系或节点属性序列化为长文本,直接丢给大模型的 Prompt,再要求其回答连通性、最短路径或属性预测。这种评测本质上依然是“做题家”式的文本问答,完全割裂了现实中面对数百万节点、千万条边的工业图数据时,分析师必须借助外部系统、执行复杂脚本、依据中间结果调整分析策略的真实工作流。

ArXiv URL:https://arxiv.org/abs/2608.01684

为了打破这种纸上谈兵的局限,一项针对自主智能体图分析能力的新研究推出了 GABench。该基准不再要求模型死记硬背图的上下文,而是将 13 个涵盖 6 大领域的真实图数据集接入外部环境,配备了包含 84 个涵盖检索、图论计算与图机器学习操作的可执行工具集。通过前置依赖与执行轨迹反向合成管线,GABench 构建了包含 10,400 个兼具复杂性与可验证标准答案的端到端 Agent 任务。

实验评估了包含 Qwen3-235B、GLM-5-turbo、DeepSeek-V4-pro、GPT-5-mini 等在内的前沿模型,并横向比较了主流智能体运行框架(Agent Harness)。实验揭示了一个冷酷的现状:即便顶尖大模型在基础检索任务上表现尚可,但在图机器学习和开放式业务问答等高阶图分析任务中,模型成功率急剧下坠,绝大多数甚至不足 40%;同时,智能体脚手架的交互架构对最终性能起到了决定性作用,而盲目增加工具调用次数往往适得其反,精准的高质量调用才是图分析成功的核心。

GABench 总体框架

从文本做题到环境交互:图分析评测范式的重构

现实世界中的图结构极其庞大且异构。无论是包含数亿条转账关系的金融反欺诈网络,还是承载数百万商品交互的电商网络,其规模和非欧氏几何特性决定了大模型不可能直接把整张图吞进上下文窗口。真正的图分析流程必须依赖外界环境交互:分析师需要先检索特定节点的局部邻域,根据返回的结构计算中心度指标,必要时调用图神经网络(GNN)执行链路预测或节点分类,再结合业务逻辑综合得出结论。

在形式化定义中,GABench 将图分析任务建模为一个部分可观测马尔可夫决策过程(POMDP),其五元组包含状态空间 $\mathcal{S}$、动作空间 $\mathcal{A}$、观测空间 $\mathcal{O}$、状态转移函数 $\mathcal{T}$ 以及任务指令空间 $\mathcal{U}$。智能体接收到用户输入的任务目标 $x_{q}$ 后,并不直接给出终验答案,而是生成规划序列 $P = {p_{1}, p_{2}, \dots, p_{n}}$,随后分步执行子任务。在每一步中,模型根据历史观察 $y_{t_{<j}}$ 生成对应的工具调用参数,接收环境返回的观察值 $o_{t}$,并在轨迹 $\tau = (s_{0}, u, a_{0}, o_{1}, a_{1}, \dots, a_{T-1}, o_{T}, s_{T})$ 中不断调整下一步动作,直到发出提交动作(Submit)或耗尽步数预算。

这种交互范式对基准设计提出了极高的要求。评测平台必须不仅提供数据,更要提供一个能够即时响应 API 调用、容纳多轮次交互并能验证中间与最终状态的沙箱环境。

多维异构与 84 项工具:GABench 的资源矩阵

为了全面覆盖现实应用中的图模态差异,GABench 从电商、引文网络、化学分子、金融、社交网络与司法等 6 个垂直领域收集了 13 个真实图数据集,规模从 26 个节点的极小子图横跨至超过 370 万个节点、1.23 亿条边的工业级网络。针对现实中节点与边属性的多样性,GABench 明确划分了三种图数据类型:

第一类是数值属性图(Numerical-Attribute Graphs, NAGs),以节点维度的密集连续特征矩阵 $\mathbf{X} \in \mathbb{R}^{\lvert \mathcal{V} \rvert \times d}$ 为核心,常见于金融风控(如 DGraph-Fin)与司法判决(如 Bail)数据集;第二类是文本属性图(Text-Attributed Graphs, TAGs),每个节点绑定特定自然语言文本描述 $\mathcal{T} = {t_{1}, \dots, t_{\lvert \mathcal{V} \rvert}}$,如 Arxiv 论文摘要图与 Reddit 论坛发帖图;第三类是文本配对图(Text-Paired Graphs, TPGs),整个分子或网络对应一段全局宏观描述 $(\mathcal{G}, d_{\mathcal{G}})$,如 HIV 分子活性预测数据集。

在数据基底之上,GABench 部署了一套由 84 个可执行工具构成的工具池,划分为四大能力版块:

  1. 图检索工具(10 项):支持 Agent 查询特定节点属性、判断边连接状态、抽取指定跳数的子图以及统计基础拓扑规模;

  2. 图论算法工具(54 项):涵盖度中心性、介数中心性、聚类系数计算、连通分量遍历与环路检测等局部及全局结构分析算子;

  3. 图机器学习工具(10 项):支持对不同图类型执行节点分类、链路预测与图级别分类,为兼顾评测的高并发效率与稳定性,底层模拟标准 GNN 训练的参数校验逻辑并返回确定性结果;

  4. 开放式图问答工具(10 项):将最短路径分析、社群发现与全局统计融为一体,支撑高阶推断。

执行驱动与反向合成:10,400 个任务如何做到答案绝对可验

在智能体评测中,最令人头痛的问题莫过于任务的幻觉评估与答案的非确定性。如果直接由大模型“自由出题”,往往会出现逻辑死锁、无解或缺乏客观真值的情况。GABench 提出了一套“执行在先、出题在后”的反向合成管线。

开放式图问答任务生成管线

为确保每个任务在逻辑上必然存在一条可执行路径,管线首先对工具之间的输入输出依赖关系进行严格拓扑分层。设工具 $t$ 的直接前置依赖集合为 $\mathcal{P}(t)$,其在执行流中的阶段编号 $s(t)$ 递归定义为:

\[s(t) = \begin{cases} 1, & \mathcal{P}(t) = \emptyset, \\[3.0pt] 1 + \max\limits_{u \in \mathcal{P}(t)} s(u), & \text{其他情况}. \end{cases}\]

系统依据这一依赖图,在特定图数据上自底向上按阶段抽取并执行工具序列,记录下真实的工具调用轨迹与终态执行结果,将其作为不可动摇的黄金答案(Ground Truth)。

在此基础上,系统才开始基于调用链生成用户问题。对于图检索、图论计算与图机器学习这类标准任务,系统利用结构化模板直接合成规范查询。而面对现实中极为棘手的开放式图问答,研究团队设计了一套大模型情境注入流程:针对 TAGs 提供局部子图文本,针对 NAGs 和 TPGs 提供领域宏观背景,提示 GPT-4o-mini 基于刚才实际执行过的工具链和真实业务场景,润色出一个高度贴合实际业务、自然流畅但不泄露任何内部工具名称的复杂分析提问。

所有生成的任务在入库前必须经历三重清洗门槛:执行沙箱回放校验工具可用性与耗时;规则过滤剔除泄露中间变量或答案的提问;最终引入人工质检对任务的一致性、语义清晰度与合理性进行把关。最终沉淀下来的 10,400 个任务,构成了涵盖多元难度梯度的高质量评测集。

在评估指标层面,GABench 兼顾了过程与结果:一方面采用工具选择准确率(Tool Selection Accuracy, TSA),借助最长公共子序列(Longest Common Subsequence, LCS)比对 Agent 实际生成的工具调用序列与黄金轨迹之间的保序重合度;另一方面采用任务成功率(Success Rate, SR),由 DeepSeek-V4-Flash 作为 Judge,在严格的语义一致性约束下对最终输出给出二元评定。

实验结果深度剖析:三大反常识发现

借助标准容器化评估框架 OpenClaw 以及其他主流智能体架构,多款前沿闭源与开源大模型在 GABench 上接受了严格检验。实验数据打破了过去许多人在文本基准上对大模型能力的乐观预期。

发现一:复杂图分析遭遇断崖,模型深陷“结构盲区”

在基础的图检索任务中,得益于明确的属性对应关系,多数优秀模型能够取得相对理想的成绩。然而,一旦任务进阶到图机器学习和图开放式问答,模型表现便遭遇毁灭性打击。

在图机器学习任务中,横跨多种模型、任务与图类型的 30 组实验配置里,有 24 组的模型成功率(SR)直接跌破 40%,全行业平均成功率仅为 30.91%。更令人震惊的是图开放式问答任务,在全部 36 组测试设置中,模型成功率全部低于 40%,平均成功率仅有 6.64%。

这种断层式暴跌反映出当前大模型的一个底层缺陷:虽然模型理解工具的文本说明书毫无压力,但在面对包含复杂拓扑依赖、高维特征融合以及需要根据上一步探索动态缩小候选节点的图任务时,模型缺乏对“结构隐喻”的深度抽象推理能力。它们极易在多步复杂的工具组合中迷失方向,陷入错误的参数调用或逻辑死循环。

发现二:脚手架(Harness)不仅仅是外壳,更是能力的放大器

许多评测习惯将所有功过归于底层基座 LLM,但 GABench 的跨框架测试证实:智能体框架的交互编排能力,对图分析这类多步任务具有甚至超过模型版本迭代的颠覆性影响。

在保持底层基座模型(GLM-5-turbo)、系统提示词、工具定义完全一致的前提下,研究团队横向评测了 OpenClaw、Hermes Agent 与 Claude Code 三大框架在最具挑战性的两类任务中的表现:

Claude Code 展现出的显著优势,主要源于其在代码交互式执行、状态上下文精细管理以及错误自愈(Error Recovery)机制上的深度优化。复杂的图分析任务从来不是单轮简单的 API 抛接,模型往往需要根据运行时的控制台报错或空返回进行容错重试。一个优秀的框架能够有效消化中间噪音,为模型保留清晰的推理主线;而简陋的脚手架则会迅速让上下文充斥低信噪比的堆栈报错,加速模型的上下文退化。

发现三:工具调用并非“多多益善”,质远重于量

在很多人的直觉里,智能体调用的工具步骤越多,意味着它进行了越深度的“思考”与探索。但在真实的图分析世界中,结论恰恰相反:冗长的调用链路往往是模型规划能力失控的表象。

效率分析表明,在 TAG 检索任务中,GPT-5-mini 仅耗费约 10 次工具调用,便拿下了 69.09% 的平均成功率;而同台竞技的 GLM-5-turbo 和 GLM-4.5-flash 平均消耗了高达 22 次工具调用,成功率却分别只有 32.88% 和 37.29%。在 TPG 检索任务中,DeepSeek-V4-Pro 以约 20 次精简的调用斩获 67.95% 的成功率,大幅领先那些平均尝试了 30 余次调用的模型。

数据清晰地说明:一旦智能体在一开始选错了拓扑遍历的工具,或者填错了前置依赖的参数,后续追加再多的工具调用也只是在错误的轨迹上越陷越深。高水准的图分析 Agent,核心竞争力在于第一次路由选择的精确性、对中间输出维度的准确理解以及迅速收敛解空间的能力,而不是盲目刷步数。

对未来智能体与图智能结合的启示

GABench 的诞生,不仅为学术界和工业界提供了一套严谨、可复现、规模化的图分析评测基础设施,更直接刺破了大模型在图分析领域的虚假繁荣。过去那些在纯文本对话中看似游刃有余的“图解题大模型”,一旦被扔进必须自主探索真实图结构、调用工具、处理异常的环境中,立刻暴露出系统级规划与图拓扑认知的短板。

基于 GABench 展现出的实验现象,未来的技术探索显露出三个极具确定性的方向:

首先是图基础模型(Graph Foundation Models, GFM)与大语言模型的深度嫁接。纯粹依赖通用 LLM 的常识推理去驾驭复杂的拓扑结构已经被证明效率低下。将具备图归纳偏置(Inductive Bias)的专业图表征模型封装为智能体的高阶感知器,使 LLM 专注做宏观规划,由图模型承担结构计算,是跨越当前性能悬崖的可行路径。

其次是探索图分析专属的 Agent Harness。实验表明通用脚手架在处理多阶段、依赖强、数据异构的图任务时依然捉襟见肘。如何针对图算法执行流设计更加敏捷的状态暂存机制、图缓存索引以及拓扑感知的自愈策略,将成为下一代智能体工程架构的兵家必争之地。

最后是优化工具调用的策略与决策边界。盲目扩充工具箱或单纯堆叠上下文步数并不能带来图分析能力的飞跃。未来的微调与对齐技术,应当更侧重于引导模型掌握工具的前置拓扑依赖、严密的参数自校验机制,以及在面对不完全观测时的主动剪枝能力。

从纸面上的文字游戏,到环境中的自主操刀,GABench 标志着大模型图分析评测真正走入了现实工业图计算的深水区。唯有直面这道不到 40% 成功率的技术断层,真正的图智能体系才有可能破局而生。