TREK:告别LLM裁判,最强Agent复杂规划完美率仅46.2%
TREK 的诞生不仅为旅行规划这一细分场景提供了高难度的压力测试场,更对大模型智能体评估的方法论提出了新的范式转移。它向整个社区传递了一个明确的信号:依赖大模型裁决软性评分的时代应当被重新审视,特别是在那些关乎真实业务落地的严肃场景中,唯有完全客观、零裁判的确定性规则以及经过实证可达的黄金上限。
TREK 的诞生不仅为旅行规划这一细分场景提供了高难度的压力测试场,更对大模型智能体评估的方法论提出了新的范式转移。它向整个社区传递了一个明确的信号:依赖大模型裁决软性评分的时代应当被重新审视,特别是在那些关乎真实业务落地的严肃场景中,唯有完全客观、零裁判的确定性规则以及经过实证可达的黄金上限。
来自上海交通大学的研究团队提出了名为 ABC(Answer-Backtracked Credit Assignment,答案倒推信用分配) 的全新框架,并基于 Qwen3.5-4B 训练出了长程搜索智能体 ABSeeker 。
CliniCARE-Bench 正是基于这一严苛的部署导向而构建。研究团队依托 MIMIC-IV 真实患者数据集,设计了 25 个经由临床专家严格验证的审计场景,共实例化为 750 个具体的纵向病历案例,横跨 14 个专科门类与 10 项核心推理能力。
LongCat:其中,DeepSeek 提出的 DeepSeek Sparse Attention(DSA)凭借独立的轻量化检索器 Lightning Indexer,实现了精细的 Token 级动态检索,不仅在 DeepSeek-V3.2 与 GLM-5 等前沿开源模型中落地。
针对这一困境,研究者提出了面向 Lean 4 与 Mathlib 原生的智能体框架 MechGeo 。该框架将自动形式化与形式化证明置于统一的验证闭环中:前半段通过解耦的中间表示语言 GeoIR 实现确定性编译与语义修复;后半段则提出“几何证明规划”与“选择性代数化”相结合的双层求解机制。
为此,清华大学智能产业研究院(AIR)、上海交通大学、香港科技大学等多家机构联合提出了 MobileWAM ,首次将视频生成世界动作模型系统性适配到全身移动操作中。
在这一步,SynthEx 彻底抛弃了易造成格式错误或化学语义模糊的传统反应 SMILES 文本,创新性地提出了 ReactionJSON 结构化表达机制。在 ReactionJSON 中,化学反应不再被视作死板的字符串匹配,而是被形式化定义为一组原子级别的图编辑操作(Graph Edits)。
为此,他们提出了名为 Gambit 的推理算法框架,将长思考链推理形式化为一个在严苛硬件约束下的动态资源分配问题。通过引入思维级束搜索(Thought-Level Beam Search),Gambit 在周期性剔除低质量轨迹的同时,立刻从优质前缀派生新分支,实现硬件占用的“零和替换”。
Iris 对此提出了由粗到细的二级清洗策略。粗粒度过滤针对整条轨迹进行硬性指标截断: 首先是端到端正确性门控,轨迹必须正常终止,且提取的最终答案必须通过大模型裁判的语义对齐检验; 其次是基于 zlib 压缩率的退化检测(Degeneracy Check)。
来自卡内基梅隆大学(CMU)、加利福尼亚大学洛杉矶分校(UCLA)、上海交通大学等机构的研究团队提出了 MERA (Model Evolution and Routing with Skill Adaptation)。
研究团队提出了名为 SocialRL 的完整训练架构,仅用一个 4B 参数规模的小语言模型,在六大典型博弈环境中展开训练。实验结果表明,经过领域内博弈训练的 4B 模型不仅在多项谈判指标上超越了未微调的基线,甚至在平均效用上追平了 GPT-4.1 以及 GPT-5 系列模型。
为打破这一僵局,来自北京航空航天大学、京东科技与北京大学的研究团队提出了可扩展的数据合成管线 MAGE ,并基于其构建了首个大规模家电操作规划数据集 UseAppliance 。
当多个大语言模型组成多智能体系统(MAS)协同解决复杂任务时,系统崩溃或给出荒谬答案几乎是家常便饭。一个Agent误读了工具输出,或者两个Agent之间产生了理解偏差,错误就会沿着交互链路层层放大,最终导致整个任务彻底失败。
Deep Agentic Search研究在仓库级代码问答任务中对比向量语义检索和子智能体深层检索。本文解释两种架构的上下文组织、任务交接和成本差异,结合失败案例讨论多层检索的局限;结论不直接推广到所有代码修复任务。
在大模型迈向“深度研究”(DeepResearch)与复杂自主搜索的浪潮中,长程搜索智能体(Long-HorizonSearchAgent)成了前沿应用的核心。
在多轮交互任务中训练大语言模型(LLM)智能体,强化学习(RL)正在成为不可替代的核心范式。从DeepSeek-R1走红以来,组相对策略优化(GroupRelativePolicyOptimization,简称GRPO)凭借其“不需要训练昂贵Critic价值网络、直接在同题采样的候选组内对比结...
在复杂的大模型智能体(Agent)任务中,开启推理模式(如思维链或强化学习诱导的“思考”机制)往往能带来显著的成功率提升。然而,这一表现的背后往往伴随着沉重的推理溢价(ReasoningPremium):模型的输出Token数量通常会膨胀3到6倍,并且每次交互、每个任务实例都要重新进行一遍完整...
大语言模型(LLM)驱动的搜索智能体(SearchAgent)正从简单的单轮关键词检索,演进为需要多轮规划、长程探索与交叉验证的深度推理系统。然而,训练一个真正可用的长程搜索智能体始终面临结构性困难:现实中极度缺乏高质量、长周期的搜索与研究任务数据,人工标注完整轨迹成本高昂,且模型在多步工具调...
长期以来,在利用大语言模型(LLM)优化系统提示词(Prompt)、演进复杂算法代码或微调机器学习(ML)训练流程时,学术界和工业界普遍采用同一种范式:外挂一套显式的数学优化或搜索算法。
大型语言模型在处理现实世界任务时,正越来越依赖于多步推理与外部工具调用的结合。尤其是面对模糊、信息不全的用户查询,深度搜索智能体(DeepSearchAgents)需要在广阔的开放网络中主动探索,其交互轨迹往往会跨越数十个步骤。
在视觉-语言-动作(Vision-Language-Action,VLA)模型的演进路径上,行业正面临一个关键的架构分岔口。当前主流的范式倾向于将预训练的视觉语言模型(VLM)与一个独立训练的动作专家(如基于流匹配或扩散模型的策略头)拼接。
长期以来,人工智能在科学领域的应用(AIforScience)大多局限于“静态问答”模式。模型或许能准确回答某个具体的生物学机制或物理公式,但在真实的科研场景中,科学发现往往需要跨越极长的时间维度,涉及多种模态的证据收集、复杂工具的迭代调用,以及对外部环境的持续规划与交互。
近年来,大语言模型的能力随着参数规模和网络深度的增加而显著跃升。直觉上,层数越深,模型能够处理的逻辑越复杂。然而,近期学术界却出现了一种截然相反的声音:有研究通过对残差流的分析指出,Transformer模型后半部分的层对最终输出的贡献微乎其微,甚至砍掉后面的层也不会对结果产生致命影响。
最近,强化学习(RL)在提升大型语言模型(LLM)复杂推理能力上的表现令人瞩目。特别是DeepSeekMath引入的组相对策略优化(GRPO)算法以及后续引发热潮的各类推理模型,证明了后训练(Post-training)阶段不仅能让模型学会说话,还能让模型学会思考。