Business Arena:大模型独立开店实测,15款前沿模型净资产相差9倍
通过引入阿里真实的跨境贸易数据、构建涵盖 60 多种真实经营行为的 MCP 工具链,并结合基于贝叶斯策略的上限对齐与状态分叉因果归因,Business Arena 为下一代面向真实经济生产力的 Agent 训练提供了极...
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
PAPER INSIGHTS
通过引入阿里真实的跨境贸易数据、构建涵盖 60 多种真实经营行为的 MCP 工具链,并结合基于贝叶斯策略的上限对齐与状态分叉因果归因,Business Arena 为下一代面向真实经济生产力的 Agent 训练提供了极...
MobileJudgeBench:研究团队提出的第一个现实检验场景是: 裁判质量的提升,是否能真实保全 Agent 之间的排名关系?如果在基准测试中,裁判给出略带偏差的分数,是否会导致排行榜名次完全颠覆?
来自 KAIST、首尔大学、伦敦大学学院(UCL)、阿姆斯特丹大学、海法大学与耶鲁大学的研究团队提出了首个端到端自动化开展 AI Agent 行为科学研究的多智能体系统 AEROBAT (Automated Exper...
针对这一根本性断层,来自香港大学、清华大学与 LMMs-Lab 的研究团队提出了 Aero Realtime 。这是一个参数量为 4B 的流式多模态大模型,核心在于打破了非全双工(Non-Duplex)的技术藩篱。
针对这一瓶颈,来自卡内基梅隆大学(Carnegie Mellon University, CMU)的研究团队提出了一种更加逼近全自主进化的新范式—— 极简数据自适应(Minimal-Data Adaptation, M...
针对这一严峻挑战,来自香港城市大学、伦敦大学学院(UCL)、小米集团以及浙江大学的研究团队正式提出了 ActBench 。这是首个专门针对协同智能体“行为安全”(Behavioral Safety)的自演化评测基准。
本文提出的架构则走出了一条轻量级的动态编排路线。整个系统由 Manager 角色主导,但 Manager 不负责硬编码的流水线,而是维护一个共享文件空间作为工作记忆。针对输入的代码难题,Manager 首先调用生成式提...
针对端到端策略这一根本缺陷,论文《World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models》提出了...
来自 UC Berkeley、Stanford、Caltech、AWS 等机构的研究团队提出了 Vero ,这是业内首个面向真实仓库级(Repository-scale)、要求智能体联合合成“代码实现与机器可检查证明”...
为了彻底复原这种复杂性,VAKRA 基于 BIRD-SQL 衍生出的真实数据库生态,构建了覆盖金融、医疗、供应链等 62 个领域的 8000 余个可执行 API。
Terminal:该工作首次从工作负载级边界出发,明确将终端 Agent 界定为“任务核心推进闭环依赖于命令行执行、文本反馈与有状态环境交互”的智能系统,并提出了覆盖执行全生命周期的七维终端能力画像(Competenc...
StartupBench 提出了一套基于细粒度规则的自动化评测机制。平均每个任务包含 25.3 条 相互独立的评测规则,跨越格式规范性、结构完整性、计算与逻辑正确性、领域专业事实深度等 6 个维度,并划分为 3 种重要...
哈佛大学、斯坦福大学、华盛顿大学与 Raycaster AI 等机构的研究团队近期联合提出了 StagedWorkspace ,首次将工作区状态明确确立为知识工作 Agent 的核心实验变量,并引入了“工作区状态契约”...
RSIBench-Data:弱势智能体在面对评估失败时,往往给出泛化的诊断,例如简单归咎于“模型代码生成能力不足”,随后盲目堆砌合成数据量;而表现出色的轨迹中,智能体能够精确阅读沙箱返回的具体异常栈,识别出基座模型究竟...
为了系统性测量并攻克这一难题,研究团队构建了包含 3,000 道审计评测的高难度长基准 SCALE-QA ,并提出了 时序-语义交错记忆重构 (Temporal-Semantic Interleaved Memory ...
PACE-Bench 的提出,给当前正热的自进化与代码智能体研究泼了一盆必要的冷水。长期以来,学术界容易沉浸在利用大语言模型解决纯文本、符号逻辑或标准化编程难题的胜利中,误以为结合简单的反思(Reflection)与记...
来自南密西西比大学(University of Southern Mississippi)的研究团队在论文中提出了一种全新架构—— Outcome Monitors (结果监控器)。它打破了传统的“拦截纠错”思维,构建...
AI 评估机构 Epoch AI 近期发布了名为 OEIS Open 的开源基准,基于来自“在线整数序列百科全书”(OEIS)中由数学家提出且此前悬而未决的 492 个数学猜想。
为了打破这种“单兵死磕”的局部最优困境,来自 IMEC 与 AILabs 的研究团队提出了名为 KernelArc 的多 Agent GPU 内核协同优化架构。
来自斯坦福大学(Stanford University)、Prentis AI 以及 Titan Holdings 的联合研究团队在最新工作中提出了 AutoResearchEval 评测基准与实证失效分类法 ARFT...
研究团队在系统梳理了 2023 至 2026 年间 52 个代表性记忆增强智能体系统后,指出了当前评测的三大结构性缺陷。超过六成的评测指标被完全集中在 LoCoMo 和 LongMemEval 等纯对话问答基准上,而真...
研究团队提出了名为 SocialRL 的完整训练架构,仅用一个 4B 参数规模的小语言模型,在六大典型博弈环境中展开训练。实验结果表明,经过领域内博弈训练的 4B 模型不仅在多项谈判指标上超越了未微调的基线,甚至在平均...
由 UIUC、亚马逊、宾夕法尼亚州立大学、埃默里大学等机构联合提出的 Evo-Harness 框架,正是为了击破这一瓶颈。该研究重新定义了“在线脚手架学习”(Online Harness Learning)范式,不再把...
DDBench:同时,研究人员设计了一组严格对照实验:一边只给模型故障现象与仓库(Symptom-only),另一边额外喂入轻量且受控的调试上下文(Context-augmented,包含日志、追踪、运行时快照等,中位...