最新发布
TANGLE:当个人记忆没有标准答案,清华与蚂蚁提出大模型不可化约冲突评测
清华大学与蚂蚁集团的联合研究团队指出了现有记忆基准的这一结构性盲区,并提出了全新的评测基准 TANGLE (Testing Agents’ Navigation of Genuine, Latent, and Entangled Memory Conflicts)。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
清华大学与蚂蚁集团的联合研究团队指出了现有记忆基准的这一结构性盲区,并提出了全新的评测基准 TANGLE (Testing Agents’ Navigation of Genuine, Latent, and Entangled Memory Conflicts)。
PAPER INSIGHTS
针对这一系列落地痛点,腾讯云与浙江大学的研究团队提出了名为 SkillEvo 的智能体技能自进化框架。研究的核心判断在于: 制约技能持续自进化的瓶颈,从来不是大语言模型的文本重写能力,也不是迭代轮数的多少,而是评估反馈...
来自微软研究院和东北大学的研究团队在最新论文中提出了一个跳出传统思路的解法: SHAPER 。该框架指出,现代具身智能体本质上是一个围绕基座模型构建的复杂系统,其执行表现不仅由模型权重决定,更受外部程序化指导(技能 S...
由诺基亚、香港理工大学以及佐治亚大学联合提出的 Code-with-Image 框架,彻底推翻了以往“工具提供视觉碎片、语言产出最终答案”的协作逻辑。研究团队给大模型配置了一个纯粹的 Python 解释器,没有任何预设...
针对这一矛盾,上海交通大学的研究团队提出了一种名为 ReTree 的自纠错树状工作记忆机制。ReTree 并没有将搜索历史简单视为线性文本流或单向压缩的草稿,而是将搜索过程建模为带有依赖演化关系的证据树。
针对这一问题,本文提出了无需额外训练的推理期框架 Second Thought 。该方案巧妙地在每个 Thought 阶段收尾的瞬间分叉出 4 个轻量级辅助分支,利用执行与等待环境反馈的时间差并行推演,并在 Obser...
针对这些根本缺陷,来自 MBZUAI、麦吉尔大学等机构的研究团队提出了 SCAFFOLD 框架。通过多实例参数化抽象、递归组合、基于最小描述长度(MDL)的库压缩,以及周期性的权重蒸馏,SCAFFOLD 彻底打通了从“...
针对这一落地痛点,来自亚马逊(Amazon)的研究团队提出了名为 BENCH2ROBUST 的通用注入评测与训练框架。该研究的核心价值在于两点:首先,它打破了传统随机注入噪声的含糊性,构建了“场景可控求解度”(Scen...
针对这一瓶颈,来自东方理工大学、上海交通大学与西安交通大学的研究团队提出了 ReCache 。该框架通过三大递进机制打破了工具调用的缓存困局:用“资源级注意力”切断不同工具之间的横向交互,赋予每个工具完全独立的局部坐标...
为了系统衡量这种穿越任务周期的暗流,研究团队搭建了首个贯穿“生成—检索—执行”全生命周期的评估套件 SkillMisevo-Gym 与基准 SkillMisevo-Bench,并提出了一套即插即用的防御封装方案 Saf...
针对这一困境,研究团队提出了首个以智能体玩家模拟人类闭环交互的世界模型评测基准——PlayWorld。该基准构建了 171 个带有明确长程目标的交互场景,引入具备多模态感知能力的 Agent Player 实时调整控制...
为了实现生成过程中的无缝感知,MOSS-VL 并没有沿用当前主流将视觉 Token 与文本 Token 混排自回归(Interleaved Autoregressive)的老路,而是重新设计了门控交叉注意力架构,使得外...
这项来自 Anthropic 与 EPFL 的先驱性研究给行业敲响了警钟:在构建大规模自主多智能体系统时,安全框架绝不能仅停留在单体模型的输入输出过滤与工具权限白名单上。
为了在系统工程上支撑这一目标,Macaron-V1 提出了 Mixture-of-LoRA(MoL)架构,将一个超大规模基座模型完全冻结,在其上挂载并动态调度多个领域专精的 LoRA 适配器。
为此,研究团队提出了全新的训练框架 LoongReflect 。该方法跳出了将反思视为自由文本批判的传统思路,将反思形式化为一种显式的 内存控制策略(Memory-Control Policy) 。
由阿里巴巴、清华大学、中国科学院等机构联合发布的研究给出了新的解法:研究团队构建了包含 1,140 条真实长程失败轨迹的基准数据集 LongRCA Bench ,并提出了名为 RCTA (Root-Cause Traj...
他们提出了 隐式在线自蒸馏(Latent On-Policy Self-Distillation,简称 LOPD) 。该方法将特权上下文重构成一个端到端可学习的隐空间连续向量,不仅彻底摆脱了人工规则对经验形态的束缚,更...
上海人工智能实验室提出的 Intern-S2-Mobius (基于全新架构 Mobius-v0 )尝试打破这一数十层层叠的旧秩序:它将知识存储彻底从层级绑定中剥离,构建全局共享的记忆模块,同时让多个推理算子在连续隐状态...
Handoff-H1:实验结果呈现出了极其鲜明的断层阶梯。七款采用主流前沿商业闭源模型与开源权重模型搭建的标准 Agent 框架,其综合得分集中在 35% 至 61% 的平庸区间内。这些通用模型在面对跨页面的尺寸链汇总...
论文在最后一节提出了一个极具前瞻性的问题:随着未来 AI 生成代码的占比呈指数级增长,Code2Skill 的模式能否持续运作,还是会陷入“模型近亲繁殖导致质量劣化”的困境?
针对该痛点,来自清华大学、中国科学院、北京交通大学、上海理工大学及 GigaAI 等机构的研究团队提出了 GigaBrain-WBC-0.5 ,这是业内首个面向人形机器人全身控制的“行为世界模型”(Behavior W...
为了在无人值守的前提下批量生产高拟真环境,EnvCraft 构建了端到端的自动化管线,主要由环境合成引擎与数据生成引擎协同运作。在 环境合成阶段 ,研究团队首先从开源社区与实际应用中梳理出 41 个通用工具场景与 42...