推理 第3页

Argus:78%基准背后的长程Agent运行时与自演化机制

由微软、上海交通大学、清华大学、北京大学等机构联合提出的 Argus ,正是为了打破这一长期困境而设计的通用 Agent 运行时。Argus 的核心思想非常直接却极具颠覆性:长程推理的关键不在于更长地维持一个固定计划。

ACH:面包屑伪造互证链诱捕搜索Agent,攻击成功率达71.4%

研究提出的“权威链劫持”(Authority-Chain Hijack, ACH)策略,通过在智能体推进检索时动态投喂看似来自不同独立信源、实则彼此印证的协同证据,直接破解了智能体的多源交叉验证防线,在 SafeSearch 基准测试上的攻击成功率比既有基线高出 13.0 至 36.1 个百分点。

Earth-Agent-Pro:全链条遥感Agent,解耦规划与执行提升20.95分

为了打破这种“纸上谈兵”的困境,来自哈尔滨工业大学、上海人工智能实验室、上海交通大学、中山大学、天津大学与清华大学的研究团队联合推出了针对全链条对地观测的完整解决方案——不仅构建了首个覆盖全流程的评测基准 Earth-Bench-Pro ,还提出了执行自适应的智能体框架 Earth-Agent...

Code-with-Image:代码即推理,多模态准确率从30%升至67%

由诺基亚、香港理工大学以及佐治亚大学联合提出的 Code-with-Image 框架,彻底推翻了以往“工具提供视觉碎片、语言产出最终答案”的协作逻辑。研究团队给大模型配置了一个纯粹的 Python 解释器,没有任何预设的高层视觉 API:图像直接以底层数据形式进入沙箱。

TextCall:视觉大模型调工具,真正起效的原来源自文本而非像素?

为了严格证明这一点,研究团队提出了名为 TextCall (只调用、不返回图像)的训练与评测机制:模型照常生成完整的工具调用脚手架(Scaffold),但在工具执行完毕后,系统完全不回传裁剪后的新图像,而是直接用一个固定的文本占位符 [Image output skipped] 替代。

HybridDeepResearch:跨越SQL与搜索,顶尖模型Pass@8仅54%

HybridDeepResearch 的提出,给当前过热的“智能体深度研究”浪潮浇下了一盆及时的冷水。它清晰地表明,能够在单一模态下刷出高分的大模型,一旦被置于需要多系统无缝衔接的真实生产力场景下,其表现依旧脆弱不堪。解决这一难题,仅靠增加模型参数量或在上下文窗口中堆叠更多的步骤或许并不够用。

HAE-GEO:深度搜索Agent遭遇分层网页投毒,为何验证了也很难纠错?

针对这一空白,来自蚂蚁集团与浙江大学的研究团队提出了专门针对深度搜索 Agent 的端到端分层评估基准 HAE-GEO 。该基准将原本不可见的交互过程拆解为从“暴露”到“恢复”的五阶行为轨迹,并在控制变量的真实网页环境中,测试了 10 款主流模型面对由浅入深的三层投毒时的真实表现。

G-ReAct:图引导深度搜索打破线性困境,1.9K轨迹微调达79%精度

为了从根本上改变这一表征维度的瓶颈,本文提出了 G-ReAct (Graph-guided Reasoning and Acting)框架。该工作不再寄希望于依靠纯粹扩大模型规模或堆叠数万条轨迹的强化学习(RL)来硬抗长文本退化,而是重新设计了推理的承载基质:将深度搜索形式化为 固定拓扑查询图...