Agent渐进式披露买的不是智能而是上下文:港大等首测揭示深度陷阱
这一发现为当下狂热的 Agent 架构设计泼了一盆清醒的冷水。要把一本数十万字的长篇书籍交给 Agent 解答,工程上有多种不同的组织形态。以往的经验分享往往将文件切分颗粒度、目录索引存放位置与递归深度混为一谈。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
PAPER INSIGHTS
这一发现为当下狂热的 Agent 架构设计泼了一盆清醒的冷水。要把一本数十万字的长篇书籍交给 Agent 解答,工程上有多种不同的组织形态。以往的经验分享往往将文件切分颗粒度、目录索引存放位置与递归深度混为一谈。
研究者从理论上严格证明了 Token 级与轮次级强化学习在策略梯度目标上的数学等价性,并在此基础上提出了全新的 HyGAE 框架。该框架不仅巧妙融合了两者的优势估计,还通过理论证明消解了训练两个独立价值网络的算力负担。
由蚂蚁集团、北京邮电大学与中国移动研究院联合提出的 HiSkill 框架,为这一难题提供了一套系统性的图结构解决方案。该研究打破了将经验视为纯文本片段的传统范式。
在此诊断之上,团队提出了带有硬件感知稀疏特性的残差量化机制 Rollout-ResQ,并结合三级层次缩放的 HiFloat4(HiF4)格式,在 Qwen2.5-3B 和 Qwen2.5-Math-7B 上,将全链路 ...
研究团队借鉴自监督学习(Self-Supervised Learning, SSL)“从无监督数据中构造辅助代理任务(Pretext Task)以获取标签”的核心思想,提出了 RLSVR(Reinforcement L...
为了兼顾环境的逼真度与评测的完全可控性,E-Bench 采取了“全合成(Fully Synthetic)”的底层设计方案,并提出了核心原则: 将环境合成与任务合成彻底解耦 。许多传统合成评测往往采用“为任务定制快照”的...
研究团队提出了名为 DocAtlas 的文档交互外壳(Document Harness),让检索树索引、笔记库和已探索页面随着 Agent 的探索实时演化。该框架在业界引发关注的核心在于两组数据:在极具挑战的多模态长文...
CoTinyVLA 提出的三个组件到底各自发挥了什么作用?作者在 Spatial 套件上进行了细致的因果消融与测试期干预,结果展示出清晰的正交性: 1. 时序输入决定运动学抗扰度 :当把双视角 8 帧历史缩减为单帧时。
HybridDeepResearch 的提出,给当前过热的“智能体深度研究”浪潮浇下了一盆及时的冷水。它清晰地表明,能够在单一模态下刷出高分的大模型,一旦被置于需要多系统无缝衔接的真实生产力场景下,其表现依旧脆弱不堪。...
针对这一瓶颈,该团队提出了 AutoMem ——一个基于“文本梯度”(Text-Gradient)递归自优化的自动化记忆架构搜索框架。该方法将记忆系统解耦为编码(Encode)、存储(Store)、检索(Retriev...
英伟达团队的技术假设在于:自然语言的广阔表达空间更符合高阶数学的探索本质,而消除逻辑谬误的关键,不在于引入外部编译器,而在于构建专门化的后训练模型组合,并设计高算力驱动的测试时搜索与纠错机制。
针对这一前沿交叉地带,一项名为 ABLE (Agentic BAIM–LLM Evaluation)的评估基准正式提出。该基准专门设计用于测试大模型智能体调用专业生物 AI 工具完成蛋白质设计全流程的能力。
基于此,作者团队提出了一种轻量且高效的防御范式 AGRI(Action-Guiding Reasoning Intervention),通过实时探测模型的隐层状态动态激活思维链干预,在极难的 AgentDojo 基准上...
腾讯的研究团队在论文中提出了名为 WikiLoop 的反馈耦合框架,尝试打破这一长期存在的单向壁垒。该方案的核心思路在于:构建一套专为智能体机器导航设计的原生维基知识库(Agent-Native Wiki),并将知识库...
基于这一洞察,作者提出了 CoMem(Comprehension Memory,理解记忆) 架构。该方法放弃了在 Token 轴上硬扛完整深度 KV 的传统思路,转而沿 模型层深(Depth Axis) 对长文本记忆进...
TREK 的诞生不仅为旅行规划这一细分场景提供了高难度的压力测试场,更对大模型智能体评估的方法论提出了新的范式转移。它向整个社区传递了一个明确的信号:依赖大模型裁决软性评分的时代应当被重新审视,特别是在那些关乎真实业务...
为了让 TransMem 学习到通用的“信息提取与利用能力”,而非特定的事实知识,作者提出了一种优雅的训练策略: 证据条件自蒸馏(Evidence-Conditioned Self-Distillation, ECSD...
基于这一底层机理,研究团队提出了一个极为简洁却极其有效的轻量防御方案 SafeKeep :在推理时将“安全审计”与“工具执行”彻底解耦。在安全评判环节,把原本结构化的 Schema 剥离成扁平的自然文本叙述,瞬间唤醒模...
从 CanItDelete 暴露出的断层,到仅需 0.7% 数据微调便能大幅缓解的实验结果,论文指向了一条清晰的演进路径:未来的代码大模型后训练,必须将“减法能力”提升到与“加法能力”对等的战略高度。
针对这一问题,本文提出了一种轻量且通用的后训练框架—— TAPO (Transition-Aware Policy Optimization)。该方案的核心突破在于: 不采集任何额外的专家数据,不增加任何多余的在线采样...
面对一台已经被攻击者通过网络渗透拿下的云主机,Agent 能否像资深安全专家一样,根据告警日志与底层只读磁盘快照,层层抽丝剥茧还原整个入侵链路,找齐所有隐蔽后门,并提出一套真正可用且完成闭环验证的处置修复方案?来自阿里...
针对这一系列痛点,来自开源社区的研究者提出了 SearchMaster ,这是一个兼具“落地约束(Grounded)”与“行为规范(Regulated)”的搜索智能体自我博弈框架。
近期发表的这项工作提出了 SciDisco 框架,试图彻底改变这一现状。其核心思路不是在推理阶段堆叠复杂的 Prompt 工作流,而是构建了一个原生支持过程验证与多轮信用分配的训练闭环。
针对这一评估盲区,来自学术界的最新研究提出了首个专门用于受控评估终身智能体路径依赖特性的评测框架 PATH-Bench 。该框架利用多模型上下文学习(ICL)预先估计任务之间的有向迁移关系,构建以固定“探针任务”(Pr...