Improving Context Fidelity via Native Retrieval-Augmented Reasoning
本文提出了一种名为CARE的新型原生检索增强推理框架,通过教导大型语言模型(LLM)在推理链中动态地从输入上下文中检索并整合证据,以解决上下文失真问题,从而在无需昂贵外部工具的情况下显著提升答案的准确性和忠实度。
本文提出了一种名为CARE的新型原生检索增强推理框架,通过教导大型语言模型(LLM)在推理链中动态地从输入上下文中检索并整合证据,以解决上下文失真问题,从而在无需昂贵外部工具的情况下显著提升答案的准确性和忠实度。
对用于大型推理模型的强化学习的综述。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文的核心是提出了一种新的训练框架,其关键概念根植于双层优化理论。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文提出了一种名为 CogGuide 的零样本全模态推理组件,它通过模拟人类“理解-规划-选择”的认知过程,生成并筛选“意图简图”(intent sketch)策略来指导多模态大模型,从而在无需微调的情况下提升复杂推理任务的性能并抑制“捷径”推理。
本文提出了一种困难度感知的思维链蒸馏框架,通过在与问题难度成比例的思维链(CoT)数据上进行后训练,教会大语言模型根据问题复杂性动态调整推理深度,从而在保持或提升准确率的同时,显著提升推理效率。
本文提出了一种“基于结果的探索”(Outcome-based Exploration)方法,通过在强化学习训练中根据最终答案(而非整个推理过程)给予探索奖励,有效提升了大型语言模型在推理任务上的准确率,同时缓解了传统RL训练导致的生成多样性下降问题。
本文提出了一个名为HEAL的新型评估框架,它将大语言模型的偏好对齐问题重新定义为在“假设空间”内的重排序过程,并通过排序准确性和偏好强度相关性两个新指标,更全面地分析现有偏好学习方法。
本文提出了一个全面的评估框架,对ChatGPT在多任务、多语言、多模态、推理、幻觉和交互性方面进行了系统的量化评估,揭示了其在多数零样本任务上的卓越表现,同时也指出了其在低资源语言、复杂推理和事实性方面的显著局限。
本文介绍并验证了一个名为 Chatbot Arena 的开放平台,该平台通过众包用户的成对比较和偏好投票,来评估和排名大型语言模型(LLM),并为此设计了一套高效、可靠的统计方法论。
本文通过大规模强化学习(无论是纯粹应用于基础模型还是结合少量冷启动数据),成功地激发并显著增强了大型语言模型的推理能力,推出了DeepSeek-R1系列模型,并验证了可以将这种高级推理能力通过蒸馏有效地迁移到更小的模型中。
本文介绍了DeepSeekMath,一个通过在精心构建的120B数学语料上进行持续预训练,并采用一种名为GRPO的新型高效强化学习算法,从而将开源模型的数学推理能力推向接近GPT-4水平的7B语言模型。
通过系统性地使用大 值的 指标进行评估,本文发现当前的带可验证奖励的强化学习(RLVR)方法并未赋予大语言模型超越其基础模型的新推理能力,而仅仅是提升了对基础模型已有能力的采样效率,甚至可能缩小了模型的推理范围。
本文提出了一种通过强化学习(RL)扩展大型语言模型(LLM)能力的方法,其核心是利用长上下文(long context)和改进的策略优化算法,构建了一个无需蒙特卡洛树搜索等复杂技术的简化框架,从而在多项推理基准上取得了顶尖性能。
本文提出并验证了LIMO假说:对于在预训练中已编码了丰富领域知识的基础模型,仅需极少量(本文为817个)精心策划的认知过程范例(高质量的推理链),便能有效激发其复杂的数学推理能力,从而以不到1%的训练数据量,在多个高难度基准上超越了依赖大规模数据微调的SOTA模型。
本文提出了 MathVista,一个全面的基准测试,旨在系统性地评估基础模型在视觉情境下的数学推理能力,并揭示了即便是最先进的 GPT-4V 模型,其性能也与人类水平存在显著差距。
本文提出了一种名为DAPO的强化学习算法,通过解耦裁剪范围、动态采样、Token级损失计算和超长奖励塑造这四项关键技术,成功解决了大语言模型在长思路链(long-CoT)推理任务中遇到的熵崩溃、训练不稳定和效率低下等问题,并开源了整个大规模强化学习系统。