最新发布
不是模型越大越好:Zero-Shot自编排以1/5成本逼平顶级模型
本文提出的架构则走出了一条轻量级的动态编排路线。整个系统由 Manager 角色主导,但 Manager 不负责硬编码的流水线,而是维护一个共享文件空间作为工作记忆。针对输入的代码难题,Manager 首先调用生成式提示词生成初步方案与头脑风暴,建立待办任务清单(Task Ledger)。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
本文提出的架构则走出了一条轻量级的动态编排路线。整个系统由 Manager 角色主导,但 Manager 不负责硬编码的流水线,而是维护一个共享文件空间作为工作记忆。针对输入的代码难题,Manager 首先调用生成式提示词生成初步方案与头脑风暴,建立待办任务清单(Task Ledger)。
PAPER INSIGHTS
为了彻底复原这种复杂性,VAKRA 基于 BIRD-SQL 衍生出的真实数据库生态,构建了覆盖金融、医疗、供应链等 62 个领域的 8000 余个可执行 API。
Terminal:该工作首次从工作负载级边界出发,明确将终端 Agent 界定为“任务核心推进闭环依赖于命令行执行、文本反馈与有状态环境交互”的智能系统,并提出了覆盖执行全生命周期的七维终端能力画像(Competenc...
StartupBench 提出了一套基于细粒度规则的自动化评测机制。平均每个任务包含 25.3 条 相互独立的评测规则,跨越格式规范性、结构完整性、计算与逻辑正确性、领域专业事实深度等 6 个维度,并划分为 3 种重要...
哈佛大学、斯坦福大学、华盛顿大学与 Raycaster AI 等机构的研究团队近期联合提出了 StagedWorkspace ,首次将工作区状态明确确立为知识工作 Agent 的核心实验变量,并引入了“工作区状态契约”...
RSIBench-Data:弱势智能体在面对评估失败时,往往给出泛化的诊断,例如简单归咎于“模型代码生成能力不足”,随后盲目堆砌合成数据量;而表现出色的轨迹中,智能体能够精确阅读沙箱返回的具体异常栈,识别出基座模型究竟...
为了系统性测量并攻克这一难题,研究团队构建了包含 3,000 道审计评测的高难度长基准 SCALE-QA ,并提出了 时序-语义交错记忆重构 (Temporal-Semantic Interleaved Memory ...
PACE-Bench 的提出,给当前正热的自进化与代码智能体研究泼了一盆必要的冷水。长期以来,学术界容易沉浸在利用大语言模型解决纯文本、符号逻辑或标准化编程难题的胜利中,误以为结合简单的反思(Reflection)与记...
来自南密西西比大学(University of Southern Mississippi)的研究团队在论文中提出了一种全新架构—— Outcome Monitors (结果监控器)。它打破了传统的“拦截纠错”思维,构建...
AI 评估机构 Epoch AI 近期发布了名为 OEIS Open 的开源基准,基于来自“在线整数序列百科全书”(OEIS)中由数学家提出且此前悬而未决的 492 个数学猜想。
为了打破这种“单兵死磕”的局部最优困境,来自 IMEC 与 AILabs 的研究团队提出了名为 KernelArc 的多 Agent GPU 内核协同优化架构。
来自斯坦福大学(Stanford University)、Prentis AI 以及 Titan Holdings 的联合研究团队在最新工作中提出了 AutoResearchEval 评测基准与实证失效分类法 ARFT...
研究团队在系统梳理了 2023 至 2026 年间 52 个代表性记忆增强智能体系统后,指出了当前评测的三大结构性缺陷。超过六成的评测指标被完全集中在 LoCoMo 和 LongMemEval 等纯对话问答基准上,而真...
研究团队提出了名为 SocialRL 的完整训练架构,仅用一个 4B 参数规模的小语言模型,在六大典型博弈环境中展开训练。实验结果表明,经过领域内博弈训练的 4B 模型不仅在多项谈判指标上超越了未微调的基线,甚至在平均...
由 UIUC、亚马逊、宾夕法尼亚州立大学、埃默里大学等机构联合提出的 Evo-Harness 框架,正是为了击破这一瓶颈。该研究重新定义了“在线脚手架学习”(Online Harness Learning)范式,不再把...
DDBench:同时,研究人员设计了一组严格对照实验:一边只给模型故障现象与仓库(Symptom-only),另一边额外喂入轻量且受控的调试上下文(Context-augmented,包含日志、追踪、运行时快照等,中位...
来自深圳国际工业与应用数学中心、中大深圳、深数院以及中山大学等机构的研究团队提出了 ERSkill(Evolving Retrieval Skill) 框架。这项工作跳出了“只优化记忆构建或推理引导”的旧范式,首次将 ...
针对这一问题,来自香港科技大学、IDEA 研究院和 DataArcTech 的联合团队提出了 Envs-FORGE 。该研究放弃了静态的 Prompt 模板,转而将环境合成形式化为一个由验证器奖励驱动的 动作决策问题 。
该研究整合了 164 篇学术成果、100 份工业界实践记录、29 个主流基准及 17 个真实运行系统案例,提出了一个串联评测与运行的“可靠性依赖链”(Reliability Dependency Chain)架构,并提...
基于这些长周期数据,EgoMonth 提出了一个受到认知心理学与工作记忆理论启发的 14 任务评估体系,将其清晰地划分为由浅入深的三个认知层级: 1. 图式巩固(Schema Consolidation) :评估模型从...
然而,伊利诺伊大学厄巴纳-香槟分校(UIUC)的最新研究提出了一个截然相反且直击痛点的论断: Agent 在长程交互中犯错,往往不是因为“找不到事实”,而是因为“记错了版本”。随着交互时间推移,现实世界中的事实、用户约...
为了系统性评估资源劫持威胁的广泛程度,研究团队首先打破了“资源仅指 API 密钥与算力”的狭隘认知,提出了一个覆盖六大维度的智能体高价值资源分类框架: 1. 物质资源(Material Resources) :包括智能...