Search-G1:用内在表征探针破解搜索智能体的假检索难题
针对这一瓶颈,腾讯与复旦大学的研究人员在论文《Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards》中提出了 Search-G1 。
针对这一瓶颈,腾讯与复旦大学的研究人员在论文《Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards》中提出了 Search-G1 。
凭借这一范式与多项系统级协同设计,ZGCM-1-7B 在 16K 预训练中实现了约 4.2 倍的训练效率提升(Time-to-loss),支持原生 256K 上下文,并在数学推理与复杂 Agent 搜索基准上。
来自香港城市大学与香港宇唯科技的研究团队近日提出了 AgenticCANN 框架。这项工作并非简单地将提示工程搬运到国产硬件上,而是直击非 CUDA 架构低语料环境下的核心症结。
近期提出的一篇工作打破了这种设计定势,正式提出了从“方案中心式搜索”走向“信息范式”(Information Paradigm)的全新思路,并推出了名为 Iris 的自动化研究系统。
来自浙江大学等机构的研究团队提出了全新的框架 SpatialCLI ,给出了更深远的解决思路: 让模型先学会熟练调用空间感知工具,再通过成功的工具交互轨迹反哺自身,最终将专家的感知与度量能力“内化”为模型自身的原生推理能力。
针对这一黑箱困境,中国科学院与中国科学院大学的研究团队提出了系统剖析多轮长程规划“底层物理学”(Physics of Multi-Turn Long-Horizon Planning)的分析框架。
由微软、上海交通大学、清华大学、北京大学等机构联合提出的 Argus ,正是为了打破这一长期困境而设计的通用 Agent 运行时。Argus 的核心思想非常直接却极具颠覆性:长程推理的关键不在于更长地维持一个固定计划。
研究提出的“权威链劫持”(Authority-Chain Hijack, ACH)策略,通过在智能体推进检索时动态投喂看似来自不同独立信源、实则彼此印证的协同证据,直接破解了智能体的多源交叉验证防线,在 SafeSearch 基准测试上的攻击成功率比既有基线高出 13.0 至 36.1 个百分点。
针对这一根本性矛盾,来自微软亚洲研究院与北京大学的研究团队提出了一种名为 BCP(Bernoulli-Continuation Policy) 的轻量级即插即用框架。
为了打破这种“纸上谈兵”的困境,来自哈尔滨工业大学、上海人工智能实验室、上海交通大学、中山大学、天津大学与清华大学的研究团队联合推出了针对全链条对地观测的完整解决方案——不仅构建了首个覆盖全流程的评测基准 Earth-Bench-Pro ,还提出了执行自适应的智能体框架 Earth-Agent...
针对这一本质矛盾,基础设施团队 VideoDB 提出了一个明确判断:在物理与数字构成的视觉世界中进行搜索,本质上是一个系统架构问题,而非单纯依靠更大参数量训练出的端到端视频检索模型。
为了打破这种“吃大锅饭”式的轨迹级信用分配(Credit Assignment),百度与中国人民大学的研究团队提出了 TurnSight 。这是一种面向多轮工具推理的 轮次级后见自蒸馏框架(Turn-Level Hindsight Self-Distillation) 。
来自思科研究院(Cisco Research)与佐治亚理工学院(Georgia Institute of Technology)的研究团队提出了名为 DIVE (Diversity-Driven Skill Evolution)的全新框架。
上海人工智能实验室提出的 Intern-S2-Mobius (基于全新架构 Mobius-v0 )尝试打破这一数十层层叠的旧秩序:它将知识存储彻底从层级绑定中剥离,构建全局共享的记忆模块,同时让多个推理算子在连续隐状态中进行多轮迭代推演。
为此,研究团队提出了全新的训练框架 LoongReflect 。该方法跳出了将反思视为自由文本批判的传统思路,将反思形式化为一种显式的 内存控制策略(Memory-Control Policy) 。
针对这一问题,本文提出了无需额外训练的推理期框架 Second Thought 。该方案巧妙地在每个 Thought 阶段收尾的瞬间分叉出 4 个轻量级辅助分支,利用执行与等待环境反馈的时间差并行推演,并在 Observation 抵达时瞬间回收成果、拼入上下文。
由诺基亚、香港理工大学以及佐治亚大学联合提出的 Code-with-Image 框架,彻底推翻了以往“工具提供视觉碎片、语言产出最终答案”的协作逻辑。研究团队给大模型配置了一个纯粹的 Python 解释器,没有任何预设的高层视觉 API:图像直接以底层数据形式进入沙箱。
为了严格证明这一点,研究团队提出了名为 TextCall (只调用、不返回图像)的训练与评测机制:模型照常生成完整的工具调用脚手架(Scaffold),但在工具执行完毕后,系统完全不回传裁剪后的新图像,而是直接用一个固定的文本占位符 [Image output skipped] 替代。
HybridDeepResearch 的提出,给当前过热的“智能体深度研究”浪潮浇下了一盆及时的冷水。它清晰地表明,能够在单一模态下刷出高分的大模型,一旦被置于需要多系统无缝衔接的真实生产力场景下,其表现依旧脆弱不堪。解决这一难题,仅靠增加模型参数量或在上下文窗口中堆叠更多的步骤或许并不够用。
CoTinyVLA 提出的三个组件到底各自发挥了什么作用?作者在 Spatial 套件上进行了细致的因果消融与测试期干预,结果展示出清晰的正交性: 1. 时序输入决定运动学抗扰度 :当把双视角 8 帧历史缩减为单帧时。
针对这一困境,研究人员提出了全新的三值化 PTQ 框架 ScaleQ-1.58 。该框架的核心洞察非常尖锐:在极低比特的重构过程中,传统 PTQ 沿用通用网页文本进行校准的做法从根本上忽略了思维链(Chain-of-Thought, CoT)的本质。
针对这一空白,来自蚂蚁集团与浙江大学的研究团队提出了专门针对深度搜索 Agent 的端到端分层评估基准 HAE-GEO 。该基准将原本不可见的交互过程拆解为从“暴露”到“恢复”的五阶行为轨迹,并在控制变量的真实网页环境中,测试了 10 款主流模型面对由浅入深的三层投毒时的真实表现。
为了从根本上改变这一表征维度的瓶颈,本文提出了 G-ReAct (Graph-guided Reasoning and Acting)框架。该工作不再寄希望于依靠纯粹扩大模型规模或堆叠数万条轨迹的强化学习(RL)来硬抗长文本退化,而是重新设计了推理的承载基质:将深度搜索形式化为 固定拓扑查询图...
针对这一系列痛点,来自开源社区的研究者提出了 SearchMaster ,这是一个兼具“落地约束(Grounded)”与“行为规范(Regulated)”的搜索智能体自我博弈框架。