推理 第4页

TREK:告别LLM裁判,最强Agent复杂规划完美率仅46.2%

TREK 的诞生不仅为旅行规划这一细分场景提供了高难度的压力测试场,更对大模型智能体评估的方法论提出了新的范式转移。它向整个社区传递了一个明确的信号:依赖大模型裁决软性评分的时代应当被重新审视,特别是在那些关乎真实业务落地的严肃场景中,唯有完全客观、零裁判的确定性规则以及经过实证可达的黄金上限。

MechGeo:从几何规划到选择性代数化,Lean 4攻克44道IMO几何题

针对这一困境,研究者提出了面向 Lean 4 与 Mathlib 原生的智能体框架 MechGeo 。该框架将自动形式化与形式化证明置于统一的验证闭环中:前半段通过解耦的中间表示语言 GeoIR 实现确定性编译与语义修复;后半段则提出“几何证明规划”与“选择性代数化”相结合的双层求解机制。

Gambit:思维级束搜索重配算力,Token缩减68.5%且准确率提升6.7%

为此,他们提出了名为 Gambit 的推理算法框架,将长思考链推理形式化为一个在严苛硬件约束下的动态资源分配问题。通过引入思维级束搜索(Thought-Level Beam Search),Gambit 在周期性剔除低质量轨迹的同时,立刻从优质前缀派生新分支,实现硬件占用的“零和替换”。

Iris:网页拓扑反向构题加SFT-RL爬升,单Agent拿下92.9分

Iris 对此提出了由粗到细的二级清洗策略。粗粒度过滤针对整条轨迹进行硬性指标截断: 首先是端到端正确性门控,轨迹必须正常终止,且提取的最终答案必须通过大模型裁判的语义对齐检验; 其次是基于 zlib 压缩率的退化检测(Degeneracy Check)。

SocialRL:微软用强化学习把4B小模型训成谈判专家,博弈表现追平GPT-5

研究团队提出了名为 SocialRL 的完整训练架构,仅用一个 4B 参数规模的小语言模型,在六大典型博弈环境中展开训练。实验结果表明,经过领域内博弈训练的 4B 模型不仅在多项谈判指标上超越了未微调的基线,甚至在平均效用上追平了 GPT-4.1 以及 GPT-5 系列模型。

微软新研究:告别昂贵的逐次思考,离线技能蒸馏让非推理模型省下最高6倍Token

在复杂的大模型智能体(Agent)任务中,开启推理模式(如思维链或强化学习诱导的“思考”机制)往往能带来显著的成功率提升。然而,这一表现的背后往往伴随着沉重的推理溢价(ReasoningPremium):模型的输出Token数量通常会膨胀3到6倍,并且每次交互、每个任务实例都要重新进行一遍完整...

SearchArt:华为提出长程搜索智能体训练框架,27B模型多项基准比肩顶尖闭源Agent

大语言模型(LLM)驱动的搜索智能体(SearchAgent)正从简单的单轮关键词检索,演进为需要多轮规划、长程探索与交叉验证的深度推理系统。然而,训练一个真正可用的长程搜索智能体始终面临结构性困难:现实中极度缺乏高质量、长周期的搜索与研究任务数据,人工标注完整轨迹成本高昂,且模型在多步工具调...

SSPO:步级自蒸馏机制,仅5%开销超越双倍训练步数GRPO

大型语言模型在处理现实世界任务时,正越来越依赖于多步推理与外部工具调用的结合。尤其是面对模糊、信息不全的用户查询,深度搜索智能体(DeepSearchAgents)需要在广阔的开放网络中主动探索,其交互轨迹往往会跨越数十个步骤。

Intern-S2-Preview:397B科学智能体,时序推理提速5倍!

长期以来,人工智能在科学领域的应用(AIforScience)大多局限于“静态问答”模式。模型或许能准确回答某个具体的生物学机制或物理公式,但在真实的科研场景中,科学发现往往需要跨越极长的时间维度,涉及多种模态的证据收集、复杂工具的迭代调用,以及对外部环境的持续规划与交互。

微软最新证据:Transformer并非层数闲置,而是按难度自适应!

近年来,大语言模型的能力随着参数规模和网络深度的增加而显著跃升。直觉上,层数越深,模型能够处理的逻辑越复杂。然而,近期学术界却出现了一种截然相反的声音:有研究通过对残差流的分析指出,Transformer模型后半部分的层对最终输出的贡献微乎其微,甚至砍掉后面的层也不会对结果产生致命影响。

自动搜索奖励函数!单卡40小时跑通GRPO闭环,模型F1提升0.19

最近,强化学习(RL)在提升大型语言模型(LLM)复杂推理能力上的表现令人瞩目。特别是DeepSeekMath引入的组相对策略优化(GRPO)算法以及后续引发热潮的各类推理模型,证明了后训练(Post-training)阶段不仅能让模型学会说话,还能让模型学会思考。