AI Agent 第3页

Antares:3B参数逼近GPT-5.5,单任务2秒搞定代码库漏洞定位

这项研究最引人注目的实验结果在于:在涵盖 500 个真实工业任务的基准测试 VLoc Bench 上,仅有 30 亿参数的 Antares-3B 在定位文件 F1 分数上达到了 0.223,不仅逼近了顶尖闭源模型 GPT-5.5,更直接击败了参数量比自身大出 200 倍以上的众多通用开源大模型。

FinDeepIndicator:公式能拿70分终答仅40%,金融Agent卡在哪?

为了精确锁定 Agent 的能力边界,FinDeepIndicator 提出了一个过程级(Process-level)评估体系,将指标构建切分为四个清晰的生命周期阶段: 1. 公式规范化(Formula Specification) :评估模型是否能准确理解自然语言指令背后的金融概念,并转化为...

SKILL-KD:把行为落差转化为文本补丁,对比蒸馏让弱Agent最高提升56%

最新提出的 SKILL-KD 框架打破了这一僵局。它将外部技能库重新定义为跨能力智能体之间的 显式蒸馏介质 :不依赖参数微调,而是直接对比教师与学生在同一任务中的 行为落差 (Actionable Discrepancy),将其转化为能够动态验证并迭代修正的“文本技能补丁”。

360CityArena:东京大学实景重建秋叶原,最强AI导航得分仅17.1%

为了打破这种“模拟器内很漂亮,一上街就抓瞎”的困境,来自东京大学的研究团队提出了全新基准 360CityArena 。该工作直接利用 602 段连续拍摄的 360 度全景视频,在 Unity 引擎中高保真重建了日本东京著名的秋叶原核心街区。

代码Agent找文件太费Token?CodeGrep精准检索缩减19%开销

来自网易与独立研究者团队提出了名为 CodeGrep 的专用代码检索智能体,试图从架构层彻底重塑这一交互链路。他们基于 Qwen3-14B 模型,通过 GRPO(Group Relative Policy Optimization)强化学习端到端训练了一个轻量化检索专职模型。

CommitKV:区分休眠与完结,让多轮Agent显存直降5倍、推理加速5.6倍

腾讯与厦门大学联合提出的 CommitKV 指出,现存算法的根本症结在于采用了“单点快照式”的重要性评估逻辑:当前轮次注意力权重低的上下文,不代表未来就永远用不上。将“暂时休眠”的背景事实与“已彻底完结”的工具调用混为一谈,会导致关键记忆被过早误删。

Canary Tools:用6类陷阱诊断Agent工具选择,高梯队模型未必更安全

Canary:这项研究表明,工具描述中的“吹嘘”行为是一种极其危险的系统性隐患。哪怕是公认最聪明的基础模型,也会被带有“高级”、“全功能”标签的工具误导。因此,在平台层对工具的描述进行格式化清洗、限制夸大修辞,并对重叠功能的工具实行严格的颗粒度约束,应当成为基础设施建设的标准规范。