推理 第8页

Improving Context Fidelity via Native Retrieval-Augmented Reasoning

本文提出了一种名为CARE的新型原生检索增强推理框架,通过教导大型语言模型(LLM)在推理链中动态地从输入上下文中检索并整合证据,以解决上下文失真问题,从而在无需昂贵外部工具的情况下显著提升答案的准确性和忠实度。

CogGuide: Human-Like Guidance for Zero-Shot Omni-Modal Reasoning

本文提出了一种名为 CogGuide 的零样本全模态推理组件,它通过模拟人类“理解-规划-选择”的认知过程,生成并筛选“意图简图”(intent sketch)策略来指导多模态大模型,从而在无需微调的情况下提升复杂推理任务的性能并抑制“捷径”推理。

Outcome-based Exploration for LLM Reasoning

本文提出了一种“基于结果的探索”(Outcome-based Exploration)方法,通过在强化学习训练中根据最终答案(而非整个推理过程)给予探索奖励,有效提升了大型语言模型在推理任务上的准确率,同时缓解了传统RL训练导致的生成多样性下降问题。

HEAL: A Hypothesis-Based Preference-Aware Analysis Framework

本文提出了一个名为HEAL的新型评估框架,它将大语言模型的偏好对齐问题重新定义为在“假设空间”内的重排序过程,并通过排序准确性和偏好强度相关性两个新指标,更全面地分析现有偏好学习方法。

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

本文通过大规模强化学习(无论是纯粹应用于基础模型还是结合少量冷启动数据),成功地激发并显著增强了大型语言模型的推理能力,推出了DeepSeek-R1系列模型,并验证了可以将这种高级推理能力通过蒸馏有效地迁移到更小的模型中。

Kimi k1.5: Scaling Reinforcement Learning with LLMs

本文提出了一种通过强化学习(RL)扩展大型语言模型(LLM)能力的方法,其核心是利用长上下文(long context)和改进的策略优化算法,构建了一个无需蒙特卡洛树搜索等复杂技术的简化框架,从而在多项推理基准上取得了顶尖性能。

LIMO: Less is More for Reasoning

本文提出并验证了LIMO假说:对于在预训练中已编码了丰富领域知识的基础模型,仅需极少量(本文为817个)精心策划的认知过程范例(高质量的推理链),便能有效激发其复杂的数学推理能力,从而以不到1%的训练数据量,在多个高难度基准上超越了依赖大规模数据微调的SOTA模型。

DAPO: An Open-Source LLM Reinforcement Learning System at Scale

本文提出了一种名为DAPO的强化学习算法,通过解耦裁剪范围、动态采样、Token级损失计算和超长奖励塑造这四项关键技术,成功解决了大语言模型在长思路链(long-CoT)推理任务中遇到的熵崩溃、训练不稳定和效率低下等问题,并开源了整个大规模强化学习系统。