Business Arena:大模型独立开店实测,15款前沿模型净资产相差9倍

Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

论文原文 ↗ 论文发布 解读发布 解读:AI前沿分享

Business Arena:大模型独立开店实测,15款前沿模型净资产相差9倍 论文图示

让大语言模型写代码、搜资料、操作网页早已屡见不鲜,但如果给大模型一笔启动资金,让它全权接管一家跨境电商独立店铺,独自面对波动的市场需求、供应商拉扯、合规门槛、甚至关税突变,它能否真正赚到钱?

ArXiv URL:https://arxiv.org/abs/2608.08621v1

由阿里巴巴集团与耶鲁大学联合推出的新基准 Business Arena,把大模型智能体推向了这样一道大考。这是一个基于 Alibaba.com 真实选品与供应链数据搭建的高仿真长程商业运营竞技场。智能体必须自主完成市场调研、选品采购、清关合规、动态定价、广告投放、买家客服乃至坏账清算的全流程。

评测结果揭示了一个残酷的商业现实:在对 15 个主流前沿大模型进行的综合测试中,模型的平均最终净资产呈现出高达 9 倍的断层差距;多达 51% 的测试轮次最终以亏损告终;即便综合表现最优的模型,平均收益依然不足人类专家预设策略的一半。商业决策不仅需要逻辑推理,更需要面对非平稳环境下的延迟反馈与跨维度容错能力,这依然是当前大模型智能体最薄弱的盲区。

模型最终净资产表现

从静态基准到真实物理商业闭环

大模型智能体的评估范式正在经历从“确定性任务”向“开放性任务”的转移。早期的评估多聚焦于代码修补、文本问答或单页面导航,这些场景有着近乎不可动摇的评判标准:代码是否通过单元测试、网页元素是否被正确点击、答案是否命中标准字段。即便到了长上下文的测试,环境的核心逻辑依然是静止的——外部世界不会因为智能体迟疑了两个思考步骤而发生结构性崩塌。

真正的商业运作逻辑完全相反。它具备四大致命特性:证据不完备且充满噪音经济后果强延迟且难以归因市场环境持续非平稳演化、以及持续存在的刚性运营合规与沉没成本

在现实生意中,智能体无法直接读取任何“真实需求曲线”。它看到的只有 Google Trends 的滞后指数、竞争对手的调价试探、以及供应商真假难辨的产能口径。更致命的是,资本承诺先于销售结果产生:今天订购的一批高货值电子产品,需要经历海运周期、清关报备才能上架,其最终是售罄还是滞销,受到多天后对手压价、关税上调或平台扣点等多重交错影响。此外,固定租金按日扣除,未合规申报直接面临巨额罚款,库存积压到结算日甚至只能以废品折价处理。

此前的商业类评测,如 VendingBench、ShopBench 或侧重模拟 SaaS 运作的 CEO-Bench,大多对这一链路做了极度抽象,要么只考核单一客服议价,要么把采购与销售压缩在即时结清的理想沙盒内。Business Arena 的突破,在于第一次把完整的物理贸易供应链连贯地搬进了智能体的输入输出空间。

拆解商业竞技场的运行机制

Business Arena 的核心场景被设定为一个面向全球买家的跨境 B2B 店铺。系统基于阿里巴巴真实外贸商品池构建,涵盖真实的起订量(MOQ)、批发梯度价、货运交付周期与质量参数,并结合中美关税波动与历史海运事件注入外部宏观冲击。

在仿真环境启动的初始准备期(Setup Phase),智能体拥有初始资金池,需明确店铺主营类目,决定首批现货采购配置还是预留流动性。当仿真时钟以天(Simulated Day)为单位向前推进时,智能体通过标准化模型上下文协议(Model Context Protocol,MCP)调用 60 余种工具接口,自主规划当天的动作。

这些接口绝不是死板的机械命令,而具备极高的策略组合自由度。在采购端,智能体可以对海量供应商设定多重筛选排序;在销售端,智能体不仅能直接修改标价,还能定义基于购买数量的分级批发折扣(Tiered Pricing)。更重要的是,环境为智能体提供了一个完全隔离的 OpenClaw Linux 沙箱,智能体拥有独立的持久化工作区,可以随时在本地编写 Python 脚本清洗销售流水、绘制需求回归曲线或设立定时自动化调度。

智能体完成当日决策后,竞技场推进外部世界的自动化演进。买家代理群根据价格、运费、店铺信誉与竞品表现独立完成撮合决策;竞争对手自动调价与补货;货物在物流管网中前行并逐步扣减仓储物流费;市场随机事件(如港口拥堵、新规出台)逐步显现。智能体必须在第二天面对这些完全由系统自主推演出来的不可逆账单。


    ┌────────────────────────────────────────────────────────┐

    │                     Business Arena                     │

    ├───────────────────┬────────────────────────────────────┤

    │  非平稳市场环境   │  全流程业务工具集 (60+ Tools)      │

    │  - 动态买家/竞品  │  - 市场调研 (Google Trends/日历)   │

    │  - 供应商周期/MOQ │  - 采购与库存 (阶梯价/海运排程)    │

    │  - 宏观冲击/关税  │  - 销售与合规 (资质准入/阶梯定价)  │

    └─────────┬─────────┴──────────────────┬─────────────────┘

              │ 产生延迟反馈与隐式损失     │ 驱动智能体动作

              ▼                            ▼

    ┌────────────────────────────────────────────────────────┐

    │             智能体在 Linux 沙箱中持久化运作            │

    │      自主编写脚本分析流水 ── 制定决策 ── 推进交易日    │

    └────────────────────────────────────────────────────────┘

为了让评测不沦为模型对模拟器漏洞的“刷分游戏”,研究设计了严格的机制消融与因果归因工具。评测体系并未止步于最终净资产这一个聚合数值,而是下潜至广告投放回报率(ROAS)、库存周转速度、合规罚款率、弃单挽回率等具体的技能诊断维度,并借助保存-分叉-加载(Save-Fork-Load)的状态快照技术,支持在同一商业关键节点分叉运行不同模型或策略,做真正控制变量的同态对照。

15款模型交锋:两倍差距与惨烈亏损

研究团队选取了涵盖商业闭环中最具代表性的 15 款大模型进行深度评测,包括闭源体系的 GPT-5.6 Sol(开启 Pro Reasoning 深度思考模式)、GPT-5.5、Claude 系列(Fable 5、Opus 4.6/4.8)、Gemini 系列(3.1 Pro、3.5 Flash),以及开源生态的代表如 DeepSeek V4 Pro、Kimi K3、Qwen-3.8-Max-Preview 等。每个模型均在相同的宏观基准条件下独立运行 10 轮。

主榜单模型与人类专家策略对比

主榜单展现了前所未有的分化格局。表现最差的模型平均最终净资产仅剩 $20,856 美元,而第一名 GPT-5.6 Sol 达到了 $188,488 美元,二者差距达到 9.0 倍。

更为关键的发现是,全场景下大模型的整体经营失败率高达 51%。在所有 150 次测试运行中,超过半数的轮次最终结算金额低于初始分配的本金,许多模型直接因为无法应付刚性日常开销和库存贬值而陷入技术性破产。在全部参测模型中,仅有 4 款模型能够在所有 10 次重复试验中完全保住初始本金。

即便夺得模型组冠军的 GPT-5.6 Sol,与人类专家设计的基准策略相比依然相形见绌。研究者构建的基于贝叶斯需求估计与自适应资产配置的专家策略,在完全相同的公开信息环境下跑出了 $436,195 美元的净资产,超过最佳模型平均分的两倍以上。这说明现有前沿模型虽能完成单点工作,但在长期跨周期资本调配上,与人类系统性商业策略相比依然存在巨大的认知代差。

大模型在生意场上的三种典型死因

结合技能层面的诊断指标和细粒度行为归因,研究揭示了导致模型在商业世界遭遇溃败的核心逻辑。大模型的亏损并非源于“不懂商业概念”,而是无法在复杂的约束空间里实现端到端的因果闭环。

首先是流动性死锁与资本效率低下。表现较弱的模型往往走入两个极端:一种是保守到极致,由于对不确定性的畏惧,模型在初始阶段采购极少量库存后便陷入停滞,眼睁睁看着每日固定的运营底噪成本(Overhead)一点点吞噬账户现金;另一种则是盲目铺货,完全忽视起订量与交期造成的沉没成本,将大笔资金锁定在高货值但长尾低频的商品上,后期因缺乏周转资金无法应对突发需求,最终在关账日承担高昂的残值清算折价。

其次是洞察与执行的脱节(Insight-to-Action Misalignment)。许多模型在沙箱工作区内通过推理生成了极具洞察力的分析报告,能够准确指出某类节日用品即将迎来暴跌,或判断出关税政策将削弱某条航线的毛利。然而,在将这一战略共识转化为具体的工具调用时,动作链条发生了灾难性的崩解。有的模型继续沿用上周的历史采购单据,有的在改价时漏掉了海运费和平台佣金的分摊,甚至计算出“每卖出一件亏损 5 美元”的自杀式定价。

最后是对隐性与非对称惩罚的忽视。在物理商业中,合规与服务不是附加题,而是准入线。部分模型在未取得目标市场合规认证的前提下强行上架销售,直接触发监管模块的大额阶梯式罚款,将此前数周积累的商业毛利瞬间清零;另一些模型在面对买家精准询价时,反复生成格式化、无增量信息的废话回复,导致买家迅速流失至竞品店铺。

有趣的是,在中高梯队的大模型中,评测捕捉到了鲜明的“经营流派”分野。部分模型天然倾向于做“高溢价精品卖家”,严格咬死毛利率底线,宁可牺牲动销率也要获取单件超额收益;另一部分模型则表现出“批发跑量商”的特征,偏好通过阶梯降价追求极限库存周转与现金回流速度。这表明长程竞技场不仅能够给智能体分出高下,更能内生出符合真实经济学直觉的异构商业偏好。

商业智能体评测的范式重构

Business Arena 的价值不仅在于建立了一个更硬核的排行榜,更在于它向业界展示了大模型评测应该如何走出“合成选择题”与“代码单元测试”的舒适区。

现实世界的商业任务是残酷的,它要求行动者在一个信息不透明、外部主体有自主意识且环境随时间单向流逝的系统里持续承担风险。如果一个智能体只会调用 API 却算不清全部落地成本(Landed Cost),或者只能写出漂亮的经营报告却无法将其落地为连贯的采购执行链,它就无法在真实经济活动中创造价值。

通过引入阿里真实的跨境贸易数据、构建涵盖 60 多种真实经营行为的 MCP 工具链,并结合基于贝叶斯策略的上限对齐与状态分叉因果归因,Business Arena 为下一代面向真实经济生产力的 Agent 训练提供了极为珍贵的高密度反馈信号。当大模型从“被动完成提示词的工具”走向“需要为资产盈亏承担最终责任的经营者”,真正的通用人工智能(AGI)才算迈出了进入实体经济的第一步。