最新发布
WML:从粗暴重写到精准归因,Agent技能优化突破90%准确率
针对这一根本瓶颈,这项最新研究提出了 工作流局部机制学习 (Workflow-Localized Mechanism Learning,简称 WML )。该框架告别了将技能当成整块文本或黑盒代码的盲目修改方式。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
针对这一根本瓶颈,这项最新研究提出了 工作流局部机制学习 (Workflow-Localized Mechanism Learning,简称 WML )。该框架告别了将技能当成整块文本或黑盒代码的盲目修改方式。
PAPER INSIGHTS
加州大学伯克利分校等机构的研究者在论文《Twin Agent: Context Residual Compression for Privilege Separated Agents》中提出了一个破局视角: 智能体的安...
为此,他们提出了 State-Path Tool Menu 框架,将工具菜单的本质重新定义为针对执行路径的“执行先验”(Execution Prior)。在完全不改动下游 Agent 架构、不调整在线执行循环、也不增加...
来自抖音集团(Douyin Group)与上海交通大学的研究团队提出了 SWE-Pruner Pro,推翻了这种“依赖外部判别器”的惯性路径。他们发现了一个极具启发性的现象: 当代码大模型在阅读环境返回的工具输出时。
为了解决这个顽疾,快手电商团队提出了工业界首个面向重排策略调优的闭环智能体框架: SR-Agent 。这项工作最值得关注的地方在于,它没有随波逐流地让大语言模型(LLM)去重写推荐模型的底层代码,也没有停留在简单的“L...
清华大学与北京邮电大学的研究团队打破了这种“预训练管通用常识,后训练才学工具调用”的惯性思维,提出了名为 SPT (Skill Pre-Training)的中间训练(Mid-Training)范式。
针对这一系统性难题,该研究团队提出了 Self-speculating Agent(自推测智能体) 。他们放弃了外部小模型,直接让部署的目标智能体自身兼任“推测者”,在单一模型内通过联合强化学习(Joint Agent...
来自新加坡国立大学(NUS)、Sea AI Lab 等机构的研究团队提出了名为 STP(State Transition Pretraining,状态转移预训练) 的全新扩展范式。该方法巧妙地绕开了对端到端任务指令的依...
华为与独立研究者共同提出的 SAP(State-Guided Data Synthesis with Argument Provenance) 框架,正是为了补齐这块拼图。
来自 Futurewei、普渡大学与德州大学奥斯汀分校的研究团队提出了 RoboPhys-3D 。这项工作构建了首个以 3D 重建为锚点的具身世界模型评测基准,覆盖 50 个机械臂操作任务、5,000 个交互片段以及 ...
针对这种“无从下手”的极端攻防环境,亚利桑那州立大学(Arizona State University)的研究团队在一篇前沿论文中开创性地提出了 无盒漏洞分析(No-Box Vulnerability Analysis...
NCP-ArchPreview:实验结果显示,仅仅对这 17M 权重在 Magicoder、Orca-Math 等特定语料上进行低成本迭代,模型便能在完全不遗忘通用能力的前提下,迅速完成对目标领域的概念重对齐。其数学与...
由 Apple、香港中文大学(CUHK)、EPFL 等机构联合提出的 Modus ,直接打破了这一工程惯例。它证明了: 不需要为每个模态定制专门的预测头,也不需要外挂专有损失函数或复杂的任务管道,完全基于统一的单解码器...
作者团队提出了模型无关的中间件协议 MemTX ,首次将数据库经典的事务机制、隔离级别与信念提交管线引入智能体记忆架构,实现从未成熟记忆到动作执行、再到撤销级联修复的全生命周期治理。
为了解决长程机器学习工程中的上下文膨胀与搜索效率低下问题,来自佐治亚理工学院(Georgia Institute of Technology)的研究团队提出了名为 Matryoshka Agent 的全新分层智能体框架。
最新研究提出了一个截然相反的互补范式:以知识为中心的自我改进(Knowledge-Centric Self-Improvement)。在这个架构中,核心假设被彻底颠倒——执行具体任务的 Agent 不再是长期维护、日益...
这一发现为当下狂热的 Agent 架构设计泼了一盆清醒的冷水。要把一本数十万字的长篇书籍交给 Agent 解答,工程上有多种不同的组织形态。以往的经验分享往往将文件切分颗粒度、目录索引存放位置与递归深度混为一谈。
研究者从理论上严格证明了 Token 级与轮次级强化学习在策略梯度目标上的数学等价性,并在此基础上提出了全新的 HyGAE 框架。该框架不仅巧妙融合了两者的优势估计,还通过理论证明消解了训练两个独立价值网络的算力负担。
由蚂蚁集团、北京邮电大学与中国移动研究院联合提出的 HiSkill 框架,为这一难题提供了一套系统性的图结构解决方案。该研究打破了将经验视为纯文本片段的传统范式。
在此诊断之上,团队提出了带有硬件感知稀疏特性的残差量化机制 Rollout-ResQ,并结合三级层次缩放的 HiFloat4(HiF4)格式,在 Qwen2.5-3B 和 Qwen2.5-Math-7B 上,将全链路 ...
研究团队借鉴自监督学习(Self-Supervised Learning, SSL)“从无监督数据中构造辅助代理任务(Pretext Task)以获取标签”的核心思想,提出了 RLSVR(Reinforcement L...
为了兼顾环境的逼真度与评测的完全可控性,E-Bench 采取了“全合成(Fully Synthetic)”的底层设计方案,并提出了核心原则: 将环境合成与任务合成彻底解耦 。许多传统合成评测往往采用“为任务定制快照”的...