DIVE:用多样性技能进化打破冻结模型上限,推理成本降低42.5%
来自思科研究院(Cisco Research)与佐治亚理工学院(Georgia Institute of Technology)的研究团队提出了名为 DIVE (Diversity-Driven Skill Evolu...
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
PAPER INSIGHTS
来自思科研究院(Cisco Research)与佐治亚理工学院(Georgia Institute of Technology)的研究团队提出了名为 DIVE (Diversity-Driven Skill Evolu...
为此,该研究设计了三组对照条件: 1. 原始基线(Raw) :智能体在没有任何先验经验的环境中独立解题。2. 工作流记忆(Workflow Memory) :将过去执行中经过清洗的操作轨迹原样注入上下文,提供真实发生过...
这项研究提出了名为 Convergent Detour Hijacking (收敛绕路劫持,简称 CDH )的新型攻击范式。攻击者不需要入侵底层系统,无需注入恶意可执行脚本,更不用在运行时与智能体动态交互,仅仅依靠发布...
面对这种防御盲区,安全研究领域提出了一种大胆的防御构想:防御性投毒(Defensive Poisoning)。防御者人为向模型中植入一个已知触发器和良性动作的新后门,然后再通过微调或遗忘算法将其抹除,期望在这个“以毒攻...
为了打破这种“一步走错、全盘皆输”的单向死局,来自中科院自动化所、清华大学交叉信息研究院以及中关村学院的研究团队提出了 AgentRewind 。这是一个面向长程智能体的运行时恢复框架。
针对这一系统性痛点,字节跳动与中国人民大学联合提出了 ACTS-SQL (Agentic and Critic-Oriented Tree-Structured SQL Correctness)。该工作完全不需要额外微...
针对这一根本瓶颈,这项最新研究提出了 工作流局部机制学习 (Workflow-Localized Mechanism Learning,简称 WML )。该框架告别了将技能当成整块文本或黑盒代码的盲目修改方式。
SIDEL:为了支撑评测,作者团队手工构建了一个包含 400 个样本的高质量恶意注入数据集,全面覆盖四大攻击类型: 1. 恶意代码执行 (100 例):包括反向 Shell、特权提升、后门植入与系统破坏。2. 错误代码...
很多团队寄希望于“等待下一代更强的前沿大模型来解决一切”,而企业级商业分析 Agent 公司 Leni 提出的研究却给出了不同的视角: 大模型的可靠性并不主要依赖模型本身的智商跃迁,而是取决于包裹在模型外部的架构设计 。
加州大学伯克利分校等机构的研究者在论文《Twin Agent: Context Residual Compression for Privilege Separated Agents》中提出了一个破局视角: 智能体的安...
为此,他们提出了 State-Path Tool Menu 框架,将工具菜单的本质重新定义为针对执行路径的“执行先验”(Execution Prior)。在完全不改动下游 Agent 架构、不调整在线执行循环、也不增加...
来自抖音集团(Douyin Group)与上海交通大学的研究团队提出了 SWE-Pruner Pro,推翻了这种“依赖外部判别器”的惯性路径。他们发现了一个极具启发性的现象: 当代码大模型在阅读环境返回的工具输出时。
为了解决这个顽疾,快手电商团队提出了工业界首个面向重排策略调优的闭环智能体框架: SR-Agent 。这项工作最值得关注的地方在于,它没有随波逐流地让大语言模型(LLM)去重写推荐模型的底层代码,也没有停留在简单的“L...
清华大学与北京邮电大学的研究团队打破了这种“预训练管通用常识,后训练才学工具调用”的惯性思维,提出了名为 SPT (Skill Pre-Training)的中间训练(Mid-Training)范式。
针对这一系统性难题,该研究团队提出了 Self-speculating Agent(自推测智能体) 。他们放弃了外部小模型,直接让部署的目标智能体自身兼任“推测者”,在单一模型内通过联合强化学习(Joint Agent...
来自新加坡国立大学(NUS)、Sea AI Lab 等机构的研究团队提出了名为 STP(State Transition Pretraining,状态转移预训练) 的全新扩展范式。该方法巧妙地绕开了对端到端任务指令的依...
华为与独立研究者共同提出的 SAP(State-Guided Data Synthesis with Argument Provenance) 框架,正是为了补齐这块拼图。
来自 Futurewei、普渡大学与德州大学奥斯汀分校的研究团队提出了 RoboPhys-3D 。这项工作构建了首个以 3D 重建为锚点的具身世界模型评测基准,覆盖 50 个机械臂操作任务、5,000 个交互片段以及 ...
针对这种“无从下手”的极端攻防环境,亚利桑那州立大学(Arizona State University)的研究团队在一篇前沿论文中开创性地提出了 无盒漏洞分析(No-Box Vulnerability Analysis...
NCP-ArchPreview:实验结果显示,仅仅对这 17M 权重在 Magicoder、Orca-Math 等特定语料上进行低成本迭代,模型便能在完全不遗忘通用能力的前提下,迅速完成对目标领域的概念重对齐。其数学与...
由 Apple、香港中文大学(CUHK)、EPFL 等机构联合提出的 Modus ,直接打破了这一工程惯例。它证明了: 不需要为每个模态定制专门的预测头,也不需要外挂专有损失函数或复杂的任务管道,完全基于统一的单解码器...
作者团队提出了模型无关的中间件协议 MemTX ,首次将数据库经典的事务机制、隔离级别与信念提交管线引入智能体记忆架构,实现从未成熟记忆到动作执行、再到撤销级联修复的全生命周期治理。
为了解决长程机器学习工程中的上下文膨胀与搜索效率低下问题,来自佐治亚理工学院(Georgia Institute of Technology)的研究团队提出了名为 Matryoshka Agent 的全新分层智能体框架。
最新研究提出了一个截然相反的互补范式:以知识为中心的自我改进(Knowledge-Centric Self-Improvement)。在这个架构中,核心假设被彻底颠倒——执行具体任务的 Agent 不再是长期维护、日益...