推理

大模型也会“聊崩”?多智能体谈判实验揭秘4大协作陷阱

当多个顶级大语言模型组成团队时,它们真的能像人类精英一样高效协同吗?现实情况往往令人啼笑皆非:它们不仅经常无法达成共赢,甚至会因为资源分配问题“大打出手”,或者干脆达成一种极其糟糕的妥协。为什么大模型能够轻松通过极其困难的单体推理测试,却在简单的多轮团队沟通中频频翻车?

告别“一次性”Agent!SkillOS重塑技能管理,性能跃升近10%

当前的大模型智能体(Agent)普遍存在一个极大的局限性:它们往往是“一次性”的解题机器。在处理完一个复杂的流式任务后,它们通常无法从历史交互中吸取教训并积累经验。面对源源不断的新任务,如果Agent每次都要从零开始摸索,注定无法胜任复杂的现实世界需求。

ReSum揭秘:大模型学会自我总结,推理提升4%且输出缩减18%

最近,强化学习在大语言模型复杂任务中大放异彩。但随之而来的是一个恼人的副作用:模型极易陷入过度思考。它们生成的推理链条越来越长。这不仅消耗了大量上下文算力,还会导致模型“遗忘”之前的关键步骤。甚至让模型陷入重复验证同一子问题的死循环。针对这一痛点,来自阿里巴巴与中科大的研究团队提出了全新框架。

PEEK:为大模型Agent装上“上下文地图”,长文本成本直降5.8倍

当前,大语言模型(LargeLanguageModel,LLM)Agent正频繁游走于海量且固定的外部数据中。无论是数万条用户反馈语料库,还是庞大复杂的企业级代码仓库。面对同一数据源的反复查询,现有系统的表现却像在不断经历“系统重启”。它们要么在冗长的对话记录中迷失,要么仅仅依靠被动的切片检索...

揭秘大模型SFT数据陷阱:破解步长混杂,ASLEC提点超9%

随着DeepSeek-R1等大模型的爆火,超长思维链(Chain-of-Thought)已成为攻克复杂推理任务的核心武器。为了激发基础模型的这种能力,业界普遍采用一种标准范式:在高质量、大规模的推理数据集上进行监督微调(SFT)。然而,如何从海量的AI生成内容中,精准筛选出真正高质量的SFT数据?

MEMENTO:大模型学会自主管理上下文,KV缓存直降2.5倍!

当大语言模型在解决复杂数学或编程问题时,往往会生成数以千计的推理Token。这种长长的思维链虽然带来了惊艳的准确率,但也引发了严重的计算灾难。在传统的自回归生成中,每一个历史Token都会被保存在KV缓存中,消耗极其庞大的显存。更致命的是,模型面对如此巨大的上下文,没有任何机制能够筛选或遗忘无...

Kimi-VL技术解密:28亿激活参数跑通128K长窗口与多模态慢思考

大模型领域的竞争正从单纯的文本向多模态深度推理演进。近期,以推理见长的开源模型层出不穷,但多模态大模型()在参数规模与推理能力之间往往难以两全。现有的开源视觉语言模型大多依赖密集的庞大架构,且缺乏类似深度思考()的能力。为打破这一僵局,月之暗面发布了最新的多模态技术报告。该研究推出了Kimi-...

告别手搓Agent!HarnessX实现大模型与运行时外挂协同进化,性能最高飙升44%

目前开发AIAgent,最痛苦的环节莫过于“手搓”外挂代码。换个新模型,提示词模板可能得全部重写。加个新工具,原本顺畅的控制流直接崩溃。大量在运行中产生的报错记录和轨迹,最后只能被当成垃圾数据扔掉。究竟有没有一种方法,能让Agent的运行框架自己学习、自己修改代码?

告别被动检索!NapMem多粒度记忆金字塔让大模型学会主动导航

当你和一个AI助手交流了数月甚至数年,你期望它能建立起对你的深度理解。然而,当前大多数基于大型语言模型(LargeLanguageModel,LLM)的长期记忆系统,依然依赖于被动的检索接口——即系统在后台悄悄检索几段文本,然后塞进模型的上下文中。

打破大模型推理天花板:DSRL双空间强化学习,反思能力暴涨14倍

以DeepSeek-R1为代表的卓越模型,将基于可验证奖励的强化学习(RLVR)推向了整个行业的聚光灯下。然而,这种后训练范式隐藏着一个不容忽视的致命瓶颈。它通过优化条件分布来提升推理能力,这意味着其潜力被基座模型现有的输出分布严格锁死。

Wait, Wait, Wait... Why Do Reasoning Models Loop?

DeepSeek-R1变“复读机”?MIT揭秘:蒸馏导致死循环暴增,调高温度治标不治本。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

The Illusion of Insight in Reasoning Models

普林斯顿揭秘:模型“顿悟”竟是幻觉?百万推理轨迹拆解“自我修正”真相。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Prompt Repetition Improves Non-Reasoning LLMs

谷歌新发现:简单重复Prompt,大模型准确率暴涨且零额外延迟。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Evaluating Parameter Efficient Methods for RLVR

LoRA并非最优解?DeepSeek-R1实测揭秘:DoRA在RLVR推理任务中全面反超。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Scaling Latent Reasoning via Looped Language Models

好的,我将以世界顶级AI研究科学家的身份,遵循您的指示,撰写这份论文笔记。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

The Universal Landscape of Human Reasoning

本文提出了一种名为“信息流追踪”(Information Flow Tracking, IFT)的框架,该框架利用大语言模型(LLM)作为概率编码器,通过量化推理每一步的信息熵和信息增益,首次在统一的度量空间中对人类通用推理的动态过程进行建模。

Deep Self-Evolving Reasoning

本文提出了一种名为深度自进化推理(Deep Self-Evolving Reasoning, DSER)的概率框架,它将迭代推理建模为马尔可夫链,使即使是能力较弱的模型也能通过长时间的并行自进化过程,解决原本无法解决的复杂问题。

Dual-Weighted Reinforcement Learning for Generative Preference Modeling

本文提出了一种名为双重加权强化学习(Dual-Weighted Reinforcement Learning, DWRL)的新框架,该框架通过一个保留了偏好建模归纳偏置的双重加权强化学习目标,将思维链(CoT)推理与Bradley-Terry(BT)模型相结合,从而在不依赖可验证奖励的通用任务...

What is the objective of reasoning with reinforcement learning?

本文通过一个统一的数学框架证明,多种用于大型语言模型的流行强化学习算法(如REINFORCE、拒绝采样和GRPO),在处理二元奖励时,都可以被看作是在给定提示下获得正确答案概率的某个单调变换函数上的随机梯度上升,从而揭示了这些算法内在的深刻关联。

Unifying Tree Search Algorithm and Reward Design for LLM Reasoning: A Survey

随着大型语言模型 (LLM) 的扩展定律进入回报递减的阶段,研究前沿正从数据和参数的暴力增长转向算法效率和新的推理形式。在此背景下,两个相互关联的范式成为核心:深思熟虑的推理时搜索 (deliberative Test-Time Search, TTS),即在推理时分配自适应的辅助计算来解决难...

A Survey on Parallel Reasoning

现代大型语言模型 (Large Language Models, LLMs) 通过扩展参数和训练数据,获得了强大的基础能力。随后的研究探索了推理时扩展,如扩展思维链 (Chain-of-Thought, CoT),显著提升了推理性能。在此基础上,本文探讨了一种正交的方法:并行推理 (Paral...

LiveThinking: Enabling Real-Time Efficient Reasoning for AI-Powered Livestreaming via Reinforcement Learning

本文提出了一种名为 LiveThinking 的两阶段优化框架,旨在解决AI直播等实时场景中推理质量与延迟之间的权衡问题。该框架首先通过知识蒸馏将大型推理模型的能力压缩到轻量级模型中,然后利用强化学习进一步优化推理路径的效率,最终实现了在大幅降低延迟和计算成本的同时,提升响应的正确性与帮助性。

Aligning Perception, Reasoning, Modeling and Interaction: A Survey on Physical AI

教给AI理解物理世界是现代AI研究中最根本的挑战之一。尽管人类自幼就能直观地预测物体动态并理解复杂的物理交互,但目前的AI模型在掌握幼儿轻松掌握的基础物理推理方面仍然存在困难。随着AI系统被部署到自动驾驶、机器人操控等真实世界场景中,这种能力差距变得越来越关键。

Executable Counterfactuals: Improving LLMs' Causal Reasoning Through Code

本文提出了一个名为“可执行反事实 (Executable Counterfactuals)”的框架,通过生成需要溯因、干预和预测三个步骤的编程和数学问题,系统地评估和提升大语言模型的反事实推理能力,并实验证明强化学习(RL)比监督微调(SFT)更能实现这种能力的泛化。

Asymmetric Proximal Policy Optimization: mini-critics boost LLM reasoning

本文提出了一种非对称近端策略优化(Asymmetric Proximal Policy Optimization, AsyPPO),该框架通过使用一组在非重叠数据上训练的轻量级“迷你评论家”(mini-critics),在保持计算高效的同时恢复了评论家(critic)在大型语言模型(LLM)推...

Improving Context Fidelity via Native Retrieval-Augmented Reasoning

本文提出了一种名为CARE的新型原生检索增强推理框架,通过教导大型语言模型(LLM)在推理链中动态地从输入上下文中检索并整合证据,以解决上下文失真问题,从而在无需昂贵外部工具的情况下显著提升答案的准确性和忠实度。

FlowRL: Matching Reward Distributions for LLM Reasoning

本文提出了一种名为 FlowRL 的强化学习算法,它通过匹配完整的奖励分布而非简单地最大化奖励,来提升大型语言模型(LLM)的推理能力,从而解决了现有方法容易陷入模式崩溃、探索多样性不足的问题。

A Survey of Reasoning and Agentic Systems in Time Series with Large Language Models

时间序列数据在金融、医疗、能源等领域无处不在,推动了监控、预测和决策等关键应用的发展。然而,许多新兴应用如个性化医疗、自适应风险管理等,要求模型不仅能预测,还能解释其输出、进行因果推理和决策。这突显了时间序列分析对结构化和可靠推理能力的迫切需求。

Outcome-based Exploration for LLM Reasoning

本文提出了一种“基于结果的探索”(Outcome-based Exploration)方法,通过在强化学习训练中根据最终答案(而非整个推理过程)给予探索奖励,有效提升了大型语言模型在推理任务上的准确率,同时缓解了传统RL训练导致的生成多样性下降问题。

CogGuide: Human-Like Guidance for Zero-Shot Omni-Modal Reasoning

本文提出了一种名为 CogGuide 的零样本全模态推理组件,它通过模拟人类“理解-规划-选择”的认知过程,生成并筛选“意图简图”(intent sketch)策略来指导多模态大模型,从而在无需微调的情况下提升复杂推理任务的性能并抑制“捷径”推理。

HEAL: A Hypothesis-Based Preference-Aware Analysis Framework

本文提出了一个名为HEAL的新型评估框架,它将大语言模型的偏好对齐问题重新定义为在“假设空间”内的重排序过程,并通过排序准确性和偏好强度相关性两个新指标,更全面地分析现有偏好学习方法。

LIMO: Less is More for Reasoning

本文提出并验证了LIMO假说:对于在预训练中已编码了丰富领域知识的基础模型,仅需极少量(本文为817个)精心策划的认知过程范例(高质量的推理链),便能有效激发其复杂的数学推理能力,从而以不到1%的训练数据量,在多个高难度基准上超越了依赖大规模数据微调的SOTA模型。

Kimi k1.5: Scaling Reinforcement Learning with LLMs

本文提出了一种通过强化学习(RL)扩展大型语言模型(LLM)能力的方法,其核心是利用长上下文(long context)和改进的策略优化算法,构建了一个无需蒙特卡洛树搜索等复杂技术的简化框架,从而在多项推理基准上取得了顶尖性能。

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

本文通过大规模强化学习(无论是纯粹应用于基础模型还是结合少量冷启动数据),成功地激发并显著增强了大型语言模型的推理能力,推出了DeepSeek-R1系列模型,并验证了可以将这种高级推理能力通过蒸馏有效地迁移到更小的模型中。

DAPO: An Open-Source LLM Reinforcement Learning System at Scale

本文提出了一种名为DAPO的强化学习算法,通过解耦裁剪范围、动态采样、Token级损失计算和超长奖励塑造这四项关键技术,成功解决了大语言模型在长思路链(long-CoT)推理任务中遇到的熵崩溃、训练不稳定和效率低下等问题,并开源了整个大规模强化学习系统。