最新发布
$\pi\mathbf{R}^2$:CMU 让大模型流策略跑出 25Hz 闭环,实机操作成功率提升 30%
来自卡耐基梅隆大学(Carnegie Mellon University)的研究团队提出了 框架,在保留大型预训练主干、多模态表达力与动作分块优势的前提下,通过“快慢感知解耦”与“自适应单步去噪调度”,打破了高延迟与低响应度之间的恶性循环。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
来自卡耐基梅隆大学(Carnegie Mellon University)的研究团队提出了 框架,在保留大型预训练主干、多模态表达力与动作分块优势的前提下,通过“快慢感知解耦”与“自适应单步去噪调度”,打破了高延迟与低响应度之间的恶性循环。
PAPER INSIGHTS
为了打破这一僵局,研究团队提出了 WaiT (Wavelet-aware image Transformer)。其核心思想异常直观而精妙:名副其实地“等待信号”(Wait for the Signal)。通过可逆且无损...
本文提出了因果评估框架 BACKTRACE,并构建了包含逻辑推理与竞赛数学等任务的基准测试集 BACKROOMBench,横跨 Qwen、DeepSeek 以及 GPT 系列的 12 款主流模型,涵盖单智能体与多智能体系统。
最新提出的 SKILL-KD 框架打破了这一僵局。它将外部技能库重新定义为跨能力智能体之间的 显式蒸馏介质 :不依赖参数微调,而是直接对比教师与学生在同一任务中的 行为落差 (Actionable Discrepanc...
针对这一核心冲突,最新研究提出了 SG-WAM (Self-Guided World Action Model)。该框架摒弃了繁重的未来像素生成,也不引入外部异构的未来表征编码器,而是直接在策略自身的表征空间内建立动力...
针对这一未被充分探索的真实现实痛点,上海人工智能实验室与同济大学等机构的研究团队提出了全新的任务范式—— 深度科学数据探索 (Deep Scientific Data Exploring),并推出了端到端轨迹合成框架 ...
针对这一困境,最新研究提出了 RoMeRL(Reduced-Order Memory Reinforcement Learning) 。它放弃了给每一条历史轨迹单独赋予效用值的传统做法,而是将无限膨胀的轨迹级状态空间映...
针对这一本质瓶颈,中国科学院自动化研究所(CASIA)多模态人工智能系统全国重点实验室(NLPR)提出了全新的物理世界模型框架 PhiZero 。PhiZero 的核心逻辑是摒弃直接在像素空间做隐式预测的旧范式,转而构...
最新提出的基准测试 PAUSE (Personal AI Assistants in Unified Service Environments)直截了当地揭穿了这种繁荣表象:在包含持久化用户状态、严格权限隔离和动态系统...
OmegaUse-OfficeVal:整个任务集的构建经历了严格的工程与伦理闭环: 1. 真实需求采集与脱敏 :研究团队从不同岗位的办公从业者处征集真实的业务委托与初始输入素材,模拟一名初级行政助理、财务实习生或数据分...
MMShopBench:在交互工具层面,沙盒为 Agent 提供了两项互补的检索手段: 1. 基于 BM25 的文本检索 :覆盖商品标题、属性、类目及店铺字段,在用户以自然语言明确提出品牌、材质、特定型号等参数时发挥主...
面对这一结构性缺陷,本文提出了 MemTxn 。它的核心主张非常鲜明: Agent 的可写记忆不能再被当作随意的键值缓存,而必须建立起严格的“应用级事务边界(Transaction Boundary)” 。
为了缓解庞大 KV 缓存带来的显存墙,架构层面的探索逐渐分化:DeepSeek-V2 等提出的多头潜在注意力(MLA)通过低秩投影将 Key 和 Value 联合压缩至低维隐空间,改变了记忆的存储粒度与传输效率,但在架...
为了解决这一问题,研究团队提出了 MemArbiter 。它不再使用传统“混作一团”的扁平记忆流,而是在决策时刻引入动态仲裁机制:将交互历史拆解为原子记忆,按五种功能明确的 Memory Bank(记忆库)进行分流管理...
针对这一系统瓶颈,东北大学(Northeastern University)的研究团队提出了 InferScale 。InferScale 抛弃了在文本层(Token Layer)机械拼接记忆的做法,改为直接在注意力层...
针对这一问题,最新研究提出了 “听、调用、理解” (Hear–Invoke–Understand,简称 HIU )的全新范式,并开发了具备技能调度能力的多模态音频 Agent —— SpeechAgent-R 。
针对这一系统性缺陷,本文提出了 Harness-G 框架。它彻底重构了策略与检索环境之间的交互接口,将开放式的“自由写 Query”转变为在“段落-句子-实体”三部图上的“有限离散动作选择”。
针对这一系统性痛点,来自北京集成电路高精尖创新中心、北京大学、西南交通大学与腾讯的研究团队提出了 GoGoTB。这是一个面向数字芯片 RTL 功能验证的自主智能体(Agentic)框架。
针对这一困局,来自工业界的研究团队提出了全新审查系统 ARCTIC 。这项工作的核心立意,是将以往针对语法和样式的机械式“代码审查”(Code Review),重构为面向全局架构与关键风险的“代码批判”(Code Cr...
为了精确锁定 Agent 的能力边界,FinDeepIndicator 提出了一个过程级(Process-level)评估体系,将指标构建切分为四个清晰的生命周期阶段: 1. 公式规范化(Formula Specifi...
实验表明,即便换上顶尖的闭源基础模型(如 Opus-5),在 FinanceGym 上的综合得分依然低于 45%,暴露了金融研究对于复杂逻辑推理的苛刻要求;而借助 FinanceHarness 的专业分层设计,同尺寸开...
中国科学院与中国科学院大学的研究团队提出了 EvoPINN ,首次将 PINN 的自动化构建推进为 可执行算法的闭环自主发现 (Agentic Discovery of Executable Algorithms)。