ERSkill:让Agent记忆检索学会自我进化,综合表现最高提升31.3%
来自深圳国际工业与应用数学中心、中大深圳、深数院以及中山大学等机构的研究团队提出了 ERSkill(Evolving Retrieval Skill) 框架。这项工作跳出了“只优化记忆构建或推理引导”的旧范式,首次将 ...
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
PAPER INSIGHTS
来自深圳国际工业与应用数学中心、中大深圳、深数院以及中山大学等机构的研究团队提出了 ERSkill(Evolving Retrieval Skill) 框架。这项工作跳出了“只优化记忆构建或推理引导”的旧范式,首次将 ...
针对这一问题,来自香港科技大学、IDEA 研究院和 DataArcTech 的联合团队提出了 Envs-FORGE 。该研究放弃了静态的 Prompt 模板,转而将环境合成形式化为一个由验证器奖励驱动的 动作决策问题 。
该研究整合了 164 篇学术成果、100 份工业界实践记录、29 个主流基准及 17 个真实运行系统案例,提出了一个串联评测与运行的“可靠性依赖链”(Reliability Dependency Chain)架构,并提...
基于这些长周期数据,EgoMonth 提出了一个受到认知心理学与工作记忆理论启发的 14 任务评估体系,将其清晰地划分为由浅入深的三个认知层级: 1. 图式巩固(Schema Consolidation) :评估模型从...
然而,伊利诺伊大学厄巴纳-香槟分校(UIUC)的最新研究提出了一个截然相反且直击痛点的论断: Agent 在长程交互中犯错,往往不是因为“找不到事实”,而是因为“记错了版本”。随着交互时间推移,现实世界中的事实、用户约...
为了系统性评估资源劫持威胁的广泛程度,研究团队首先打破了“资源仅指 API 密钥与算力”的狭隘认知,提出了一个覆盖六大维度的智能体高价值资源分类框架: 1. 物质资源(Material Resources) :包括智能...
针对这一顽疾,研究团队提出了 多样性感知提案采样框架(Diversity-Aware Proposal Sampling,简称 DAPS) 。在严格隔绝的“闭环-审计-双盲”三层验证协议下,DAPS 将算法语义聚类的衰...
针对这一困境,来自 NVIDIA 与加利福尼亚大学圣克鲁兹分校(UC Santa Cruz)的研究团队提出了 BaT(Benchmark-as-Teacher) 。该方法颠覆了传统基准测试只作为静态考卷的固有定位,将其...
回溯整篇论文的工作,AsymSpec 的价值不仅在于提出了一个精巧的推测解码新变体,更在于它向大模型工程界传达了一个深刻的认知升级: 在长文本与智能体时代,“让所有模型处理相同输入”是一场巨大的算力浪费。现代 Agen...
然而,来自 Salesforce AI Research 与 伊利诺伊大学厄巴纳-香槟分校(UIUC) 的研究团队在最新论文《AI4AI at Test-Time: Strong-to-Weak Capability ...
ADeptS-Bench:实验结果揭示了各家模型在安全架构底层逻辑上的三条分水岭: 第一种是 工具依赖型防御(Tool-dependent) ,典型代表为 Gemini 3.1 Pro。在移除拒答工具后,该模型的恶意被...
为彻底解决这一问题,ABot-World-0 提出了核心训练创新—— LongForcing 。LongForcing 的本质是在更长的时序跨度上,对 Student 自身的长程自推演轨迹(Self-rollouts)...
WeatherNext 3 选择在模型内部彻底打通这一环节,提出了针对离散观测的“站点输出头”(Station Output Head)。这一机制的本质是将天气预报转化为连续时空的函数查询任务: 在给定预报时刻,模型提...
SWE-Bench:论文中举出了一个极具代表性的案例:在 NASA 的 F'Prime 飞行软件框架中,一项将单体头文件拆分为全新统一定义入口的重构任务,要求 Agent 同时协同修改跨越自动化代码生成器、设备驱动、操...
他们提出了一种具备自我修改能力的 Lean 证明智能体框架,核心亮点在于打破了“固定评测基准评判自修改代码”的传统范式,引入了智能体与基准题库的 协同进化(Coevolution)机制 。
LinkedIn 建立了一套高度解耦的模块化评估框架,将客服交互质量拆解为互不干扰的独立维度,并分别设计评估策略: - 接地性与事实依据(Groundedness) :专门校验 Agent 生成的每一条事实性断言是否严...
为打破这一僵局,来自北京航空航天大学、京东科技与北京大学的研究团队提出了可扩展的数据合成管线 MAGE ,并基于其构建了首个大规模家电操作规划数据集 UseAppliance 。
针对此瓶颈,最新提出的 RoboBRIDGE 框架给出了一种模块化编排方案:它不对底层 VLA 进行伤筋动骨的重训,而是在控制策略外层构建了一套由监控器(Monitor)、感知器(Perceptor)、规划器(Plan...
针对这一威胁,来自 ELLIS 研究所、苏黎世联邦理工学院(ETH Zurich)、马克斯·普朗克智能系统研究所(MPI-IS)以及阿姆斯特丹大学等机构的研究团队提出了专为自动化 AI 研发设计的控制评估框架 Rese...
北京智源人工智能研究院、香港理工大学、中国人民大学与中国科学技术大学的研究团队在近期工作中指出了这一结构性缺失,并提出了名为 DisCo 的技能驱动型科研智能体框架。
由百度与华中科技大学联合团队提出的 RILA (Rendering-In-the-Loop Agent),正是为了斩断这一死结。RILA 首次将真实的浏览器端到端渲染与运行交互深度引入大模型开发回路,构建了“动作交互验...
作者团队在涵盖 LangGraph、AutoGen 以及自研框架,横跨 Qwen-2.5-7B/3B、Llama-3.1-8B 以及商用 Gemini-2.5-flash API 的 2823 个真实智能体轨迹上,构建...
由 Scale AI、加州大学圣克鲁兹分校(UC Santa Cruz)与范德堡大学医学中心(Vanderbilt University Medical Center)联合提出的 READY (Reliable Ent...
来自华为技术有限公司、北京大学与东南大学的研究团队提出了自动化多跳网络靶场编排框架 RangeFactory 。该框架将复杂的靶场构建本质抽象为“依赖解析”问题,利用多智能体流水线从孤立的真实漏洞环境中自动提取能力与运...