最新发布
大模型编排到底划算吗?消耗2到4倍Token仅换来4.6%提升
结果表明: 多调用编排带来的平均准确率提升极其有限(最高仅 4.6 个百分点),但付出的 Token 资源代价却高达 2 到 4 倍;更关键的是,编排带来的收益并没有随着任务难度的增加而扩大,且不同模型之间的适配表现极度分化。评估多智能体或编排工作流最大的痛点在于基准不公。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
结果表明: 多调用编排带来的平均准确率提升极其有限(最高仅 4.6 个百分点),但付出的 Token 资源代价却高达 2 到 4 倍;更关键的是,编排带来的收益并没有随着任务难度的增加而扩大,且不同模型之间的适配表现极度分化。评估多智能体或编排工作流最大的痛点在于基准不公。
PAPER INSIGHTS
实验结果给出了干净的阴性结果:检索并拼接其他任务的成功代码,对当前任务的通过率没有任何统计学层面的影响,性能波动被严格限制在 个百分点以内。这强有力地证实:上下文单纯变长并不会直接摧毁模型的推理能力,自我修复带来的断崖...
来自上海交通大学与香港理工大学的研究团队提出了 HYSET (HYperedge-based SEt-level Tool retrieval)。该研究首次将大模型智能体的工具检索重构为 基于工具共调用超图的条件超边预...
SWE-Touch:实验结果展现了极其明显的性能滑坡:在受到 Counter-Edit 干扰后,这 9 款模型的平均任务解决率直接下降了 7.7 个百分点。更值得警惕的是,这种性能折损在不同模型间表现出巨大的异质性。
华东师范大学与香港中文大学的研究团队提出了专门针对记忆增强个性化智能体的评测基准 Setoka 。这项工作直击现有记忆基准(如 LongMemEval、LoCoMo 等)的盲区:过去的研究过度关注单轮或多轮长文本对话中...
为了攻克这一瓶颈,该团队提出了 成本感知边际决策停机框架(Cost-Aware Marginal Decision-Focused Stopping,简称 CAM-DF) 。这是一种极为轻量的执行前插件,无需对底座大模...
针对这一症结,最新提出的 RRM(Reflective Retrieval Memory,反思检索记忆) 框架给出了破局思路。研究团队敏锐地捕捉到了长视频记忆系统的核心盲区: 模型跨任务真正需要复用的,不是“上一段视频...
这项研究对目前主流的复合 AI 系统设计提出了几项非常关键的工程警示: 1. 警惕“纯文本自反思”的算力浪费 :在没有外部反馈(如代码报错、测试用例、环境状态或知识库断言)的情况下,单凭 Prompt 要求模型反复“自...
从提出假设、编写实验代码到跑出基准测试分数,像 The AI Scientist、Agent Laboratory 等自动化科研系统正试图将科研探索闭环全部交给智能体。
针对这一瓶颈,一项名为 Mirror Learning (镜像学习)的研究提出了全新的解题思路。研究者没有遵循传统方法去依赖已知的相机外参标定或显式的几何重建,而是直接调用经过大规模预训练的视频扩散世界模型,让模型学会...
针对这种“重型审计太慢、轻量模型太噪”的矛盾,最新的研究提出了一种名为 MIND (Memory Intent-Aware Neural Denoising)的防御框架。
针对这一核心矛盾,最新研究提出了名为 COVE (Channel Orchestrated Volatility-aware Evolution,通道编排与易变性感知自进化)的全新框架。
Hunyuan3D-Buffalo 1.0 采取了混合解耦架构:以专门构建的 Hunyuan3D-VLM 作为多模态语义与空间认知中枢,以基于 Hunyuan3D-2.1 初始化的 3D-DiT 作为底层高保真几何扩散...
来自阿尔伯特·爱因斯坦医学院、香港中文大学(深圳)以及伊利诺伊大学厄巴纳-香槟分校的研究团队提出了一种全新解法: GuideSkill 。他们没有选择继续“卷微调”或“堆检索”,而是构建了一个模型外部的解耦推理层,将死...
ExtractBench 设计了一套三轨并行的严苛工程化标注管线。针对 真实商业文档 (如 SEC 13F 文件、市政水电账单),团队引入多模型集成一致性裁决机制。首先根据样本起草初始 Schema,再让来自不同模型家...
研究团队提出了一种全新的具身控制范式,将世界模型在去噪与生成过程中展现的多层级时空计算,完整“折叠”(Enfold)进一个仅依赖当前视觉和语言指令的预测性表征中。在部署阶段,策略完全无需运行沉重的视频生成器,仅靠轻量级...
针对这一顽疾,来自香港科技大学、浙江大学、东南大学等机构的研究团队提出了全新的自演化框架 DREvo (Distilling Recalibrated Historical Experience)。该研究指出,历史经验...
针对这一确定性表征的结构局限,阿里、高德、奇瑞、南京大学、上海交通大学及浙江大学等机构的联合研究团队提出了 DLAM (Distributional Latent Actions with Temporal Const...
为此,团队提出了认知偏见注入框架 CogBias ,仅凭 12 个比特的翻转,便在 Llama-3.2-3B 上实现了高达 85.0% 的定向立场偏转攻击成功率,而模型在通用基准上的性能表现几乎毫发无损。
香港科技大学与腾讯的研究团队提出了 CoSA(Proxy-Kernel Co-Designed Sparse Attention),直接指出了这种困境的症结所在:以往的优化将“上层算法代理”与“底层计算核函数(Kern...
Context:有人会提出质疑:现代存储介质极其廉价,Agent 难道不能把全部历史完整保存在本地数据库中,每次需要调用大模型时,再重新对全量历史做一次检索或动态摘要吗?这在工程经济学和系统延迟上是一笔注定破产的账。
来自德国波恩大学与 Lamarr 研究所的研究团队提出了一种名为 Contact Flow(接触流)的跨本体动作表征。该方法的核心直觉非常纯粹:在物理操作中,决定物体运动趋势的并非施动者长成什么模样,而是外力施加在物体...