Antares:3B参数逼近GPT-5.5,单任务2秒搞定代码库漏洞定位
这项研究最引人注目的实验结果在于:在涵盖 500 个真实工业任务的基准测试 VLoc Bench 上,仅有 30 亿参数的 Antares-3B 在定位文件 F1 分数上达到了 0.223,不仅逼近了顶尖闭源模型 GPT-5.5,更直接击败了参数量比自身大出 200 倍以上的众多通用开源大模型。
这项研究最引人注目的实验结果在于:在涵盖 500 个真实工业任务的基准测试 VLoc Bench 上,仅有 30 亿参数的 Antares-3B 在定位文件 F1 分数上达到了 0.223,不仅逼近了顶尖闭源模型 GPT-5.5,更直接击败了参数量比自身大出 200 倍以上的众多通用开源大模型。
针对这一本质缺陷,本文提出了对比强化策略优化(Contrastive Reinforced Policy Optimization,简称 CRPO)。CRPO 彻底跳出传统蒸馏单纯拟合分布的旧思路,将智能体自蒸馏重构为一个对比学习问题。
中国科学院与中国科学院大学的研究团队提出了 EvoPINN ,首次将 PINN 的自动化构建推进为 可执行算法的闭环自主发现 (Agentic Discovery of Executable Algorithms)。
为了精确锁定 Agent 的能力边界,FinDeepIndicator 提出了一个过程级(Process-level)评估体系,将指标构建切分为四个清晰的生命周期阶段: 1. 公式规范化(Formula Specification) :评估模型是否能准确理解自然语言指令背后的金融概念,并转化为...
针对这一系统性痛点,来自北京集成电路高精尖创新中心、北京大学、西南交通大学与腾讯的研究团队提出了 GoGoTB。这是一个面向数字芯片 RTL 功能验证的自主智能体(Agentic)框架。
针对这一系统性缺陷,本文提出了 Harness-G 框架。它彻底重构了策略与检索环境之间的交互接口,将开放式的“自由写 Query”转变为在“段落-句子-实体”三部图上的“有限离散动作选择”。
针对这一问题,最新研究提出了 “听、调用、理解” (Hear–Invoke–Understand,简称 HIU )的全新范式,并开发了具备技能调度能力的多模态音频 Agent —— SpeechAgent-R 。
为了解决这一问题,研究团队提出了 MemArbiter 。它不再使用传统“混作一团”的扁平记忆流,而是在决策时刻引入动态仲裁机制:将交互历史拆解为原子记忆,按五种功能明确的 Memory Bank(记忆库)进行分流管理,并借助“焦点-环境”双粒度表达与时序门控。
面对这一结构性缺陷,本文提出了 MemTxn 。它的核心主张非常鲜明: Agent 的可写记忆不能再被当作随意的键值缓存,而必须建立起严格的“应用级事务边界(Transaction Boundary)” 。
MMShopBench:在交互工具层面,沙盒为 Agent 提供了两项互补的检索手段: 1. 基于 BM25 的文本检索 :覆盖商品标题、属性、类目及店铺字段,在用户以自然语言明确提出品牌、材质、特定型号等参数时发挥主要作用。
OmegaUse-OfficeVal:整个任务集的构建经历了严格的工程与伦理闭环: 1. 真实需求采集与脱敏 :研究团队从不同岗位的办公从业者处征集真实的业务委托与初始输入素材,模拟一名初级行政助理、财务实习生或数据分析员接到的工作。
针对这一困境,最新研究提出了 RoMeRL(Reduced-Order Memory Reinforcement Learning) 。它放弃了给每一条历史轨迹单独赋予效用值的传统做法,而是将无限膨胀的轨迹级状态空间映射为 每个任务仅保留 4 个固定语义坐标的降维效用状态 。
最新提出的 SKILL-KD 框架打破了这一僵局。它将外部技能库重新定义为跨能力智能体之间的 显式蒸馏介质 :不依赖参数微调,而是直接对比教师与学生在同一任务中的 行为落差 (Actionable Discrepancy),将其转化为能够动态验证并迭代修正的“文本技能补丁”。
本文提出了因果评估框架 BACKTRACE,并构建了包含逻辑推理与竞赛数学等任务的基准测试集 BACKROOMBench,横跨 Qwen、DeepSeek 以及 GPT 系列的 12 款主流模型,涵盖单智能体与多智能体系统。
最新提出的 Zero-Mem 正面挑战了这种主流的生成式记忆范式。这项工作提出了 零 Token 记忆操作 (Zero-Token Memory Operations)的新标准:除了在最终根据检索证据回答用户问题的 Reader 阶段调用一次 LLM。
为了打破这种“模拟器内很漂亮,一上街就抓瞎”的困境,来自东京大学的研究团队提出了全新基准 360CityArena 。该工作直接利用 602 段连续拍摄的 360 度全景视频,在 Unity 引擎中高保真重建了日本东京著名的秋叶原核心街区。
来自亚利桑那州立大学(Arizona State University)与独立研究者的最新工作提出了 AndroidReality 。该工作没有止步于笼统地感叹“现实很残酷”,而是从马尔可夫决策过程(MDP)的形式化视角出发。
来自网易与独立研究者团队提出了名为 CodeGrep 的专用代码检索智能体,试图从架构层彻底重塑这一交互链路。他们基于 Qwen3-14B 模型,通过 GRPO(Group Relative Policy Optimization)强化学习端到端训练了一个轻量化检索专职模型。
腾讯与厦门大学联合提出的 CommitKV 指出,现存算法的根本症结在于采用了“单点快照式”的重要性评估逻辑:当前轮次注意力权重低的上下文,不代表未来就永远用不上。将“暂时休眠”的背景事实与“已彻底完结”的工具调用混为一谈,会导致关键记忆被过早误删。
Canary:这项研究表明,工具描述中的“吹嘘”行为是一种极其危险的系统性隐患。哪怕是公认最聪明的基础模型,也会被带有“高级”、“全功能”标签的工具误导。因此,在平台层对工具的描述进行格式化清洗、限制夸大修辞,并对重叠功能的工具实行严格的颗粒度约束,应当成为基础设施建设的标准规范。
针对这一断层,来自韩国京畿道教育研究院、印第安纳大学、高丽大学等机构的研究团队提出了 EduClaw-Bench 。这是首个将智能体导师置于 30 天连续虚拟教学环境中的长周期评测基准。
为了打破这种“只管生成、不保求真”的流水线局限,研究团队提出了名为 EviGraph 的全新自主科研框架。EviGraph 将科研过程从单向的流水线执行,重构成以“有类型证据图”(Typed Evidence Graph)为核心操作状态的闭环系统。
为此,研究团队提出了 MemOPD (Memory-Aligned On-Policy Distillation)框架,在长程问答基准上使 3B 模型的 F1 值相比纯 PPO 基线最高跃升 416.2%,并在保证数值一致性的前提下带来了最高 1.63 倍的训练加速。
针对这一本质矛盾,研究团队提出了全新的视觉工具轨迹构建框架 OpenVisTool 。该工作的核心见解在于:一条有价值的教学轨迹,必须同时满足 结果正确性(Outcome Validity) 与 因果效用(Causal Utility) 两个硬性条件。