-
Relative-Based Scaling Law for Neural Language Models
本文提出了一种基于相对排序的新指标——相对概率(RBP),并据此建立了相对标度律(Relative-Based Scaling Law),该定律揭示了模型将正确答案排在靠前位置的能力如何随模型规模的增大而遵循幂律提升,为理解大语言模型提供了补充交叉熵的全新视角。
-
Reinforcement learning
强化学习 (Reinforcement Learning, RL),在深度神经网络的推动下,已在多个学科取得重大突破,例如在计算机游戏、棋类对弈、机器人技术以及矩阵乘法和排序等高效算法开发中都展现了卓越能力。
-
Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle
Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle。
-
Reinforcement Learning Improves Traversal of Hierarchical Knowledge in LLMs
告别“对齐税”!Meta新研究:RL将LLM变身知识导航员,分层知识检索飙升24%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Reinforcement Learning for Machine Learning Engineering Agents
本文证明,通过强化学习(RL)对一个较小的语言模型(如 Qwen2.5-3B)进行梯度更新,可以在机器学习工程(MLE)任务中超越比它大得多的静态模型(如 Claude-3.5-Sonnet),其核心贡献是提出了两种关键技术来克服RL在智能体(Agent)设置中的挑战:时长感知梯度更新(duration-a。
-
Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs
本文通过边缘归因修补(EAP)方法分析发现,在线强化学习(RL)微调能系统性地增强大语言模型(LLM)内部回路的激活强度和模式多样性,从而提升模型能力,而直接偏好优化(DPO)则不具备此效应。
-
Reflexion: Language Agents with Verbal Reinforcement Learning
本文提出 Reflexion 框架,通过让语言智能体对过去的试错经验进行口头反思(verbal reflection)并形成文本记忆,从而在无需更新模型权重的情况下实现强化学习,显著提升了其在决策、推理和编程等任务上的表现。
-
Reflect before Act: Proactive Error Correction in Language Models
本文提出了一种名为 REBACT 的新方法,在大型语言模型 (LLM) 执行下一步行动前增加了一个“反思”步骤,通过主动纠正先前动作中的错误,从而显著提升了其在交互式决策任务中的性能和计算效率。
-
Recursive Language Models
打破上下文诅咒:递归语言模型(RLM)让GPT-5处理无限长文本。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Reconstructing KV Caches with Cross-layer Fusion For Enhanced Transformers
KV缓存减半,性能反超!阿里FusedKV揭示K/V不对称共享新范式。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Read As Human: Compressing Context via Parallelizable Close Reading and Skimming
像人一样“精读+略读”:RAM长文本压缩框架实现12倍加速。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Re4: Scientific Computing Agent with Rewriting, Resolution, Review and Revision
本文提出了一个名为 Re⁴ 的科学计算智能体 (Agent) 框架,它通过“重写-解决-审查-修订” (Rewriting-Resolution-Review-Revision) 的逻辑链,利用多个大型语言模型 (LLM) 协同工作,显著提升了根据自然语言描述自主生成代码的可靠性和准确性。
-
RAGs to Riches: RAG-like Few-shot Learning for Large Language Model Role-playing
本文提出了一种名为 RAGs-to-Riches 的新颖提示框架,它将大语言模型(LLM)的角色扮演问题重构为一个类似检索增强生成(RAG)的文本检索任务,通过使用精心策划的、源于训练数据之外的参考范例,显著增强了模型在面对敌对用户时保持角色一致性的能力。
-
QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management
QwenLong-L1.5:挑战GPT-5,揭秘400万字长文本推理的“后训练”秘籍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement
本文提出了一系列数学专用大语言模型 Qwen2.5-Math,其核心创新在于将“自我改进”(self-improvement)的理念贯穿于从预训练、后训练到推理的整个模型开发流程,从而在多个数学基准上实现了超越现有开源及闭源模型(如GPT-4o)的顶尖性能。
-
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
本文提出了Qwen2-VL系列多模态模型,通过创新的原生动态分辨率机制和多模态旋转位置编码(M-RoPE),使模型能像人一样处理任意分辨率的图像和视频,并在广泛的多模态基准测试中展现出与GPT-4o等顶尖模型相媲美的性能。
-
Qwen2 Technical Report
本文介绍了Qwen2系列大型语言模型,通过改进模型架构、扩大并优化多语言和代码数学预训练数据、采用可扩展的对齐技术,在0.5B到72B的多个尺寸上全面超越了现有开源模型,并在各项基准测试中展现出与顶尖闭源模型相当的竞争力。
-
Quantitative Bounds for Length Generalization in Transformers
本文首次为Transformer的长度泛化(length generalization)能力提供了定量的边界,通过引入一种“模拟论证”方法,证明了当训练序列足够长,能够“模拟”更长序列上的内部行为时,模型便能实现长度泛化,并给出了所需训练长度与模型参数、任务复杂度之间关系的具体数学刻画。
-
Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
本文挑战了“高SFT分数能带来更好RL效果”的普遍假设,通过实验证明SFT分数具有误导性,并提出使用“泛化损失”和“Pass@large k”作为更可靠的RL后性能预测指标。
-
QLoRA: Efficient Finetuning of Quantized LLMs
本文提出了一种名为QLoRA的高效微调方法,通过将梯度反向传播到冻结的4-bit量化模型中的低秩适配器(LoRA),首次实现了在单个48GB GPU上微调65B参数的大型语言模型,同时保持了与16-bit全量微调相当的性能。
-
QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs
本文提出了QeRL,一个量化增强的强化学习框架,它通过利用量化噪声来提升策略探索,在显著加速大模型强化学习(RL)训练、降低显存占用的同时,实现了超越16位基线方法的性能。
-
QAgent: A modular Search Agent with Interactive Query Understanding
本文提出了 QAgent,一个统一的智能体 RAG 框架,它通过一个采用两阶段强化学习策略训练的模块化搜索智能体,进行交互式查询理解和自适应检索,从而提高了对复杂问题的检索质量和作为可插拔模块的泛化能力。
-
Prompts Generalize with Low Data: Non-vacuous Generalization Bounds for Optimizing Prompts with More Informative Priors
本文提出了一种新颖的泛化界理论,通过引入基于困惑度(perplexity)的、信息更丰富的先验(prior),为数据稀疏场景下的提示(prompt)优化提供了非空泛的(non-vacuous)理论保证,并证明了这种方法在实践中能提升提示的泛化能力。
-
Prompt Repetition Improves Non-Reasoning LLMs
谷歌新发现:简单重复Prompt,大模型准确率暴涨且零额外延迟。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Prompt-R1: Collaborative Automatic Prompting Framework via End-to-end Reinforcement Learning
本文提出了一种名为 Prompt-R1 的端到端强化学习框架,该框架通过训练一个小型语言模型(作为智能体)以多轮交互的方式生成并优化提示,从而与一个大型语言模型(作为环境)协作,以更低的成本和更高的效率解决复杂问题。
-
Process-Supervised Reinforcement Learning for Interactive Multimodal Tool-Use Agents
本文提出了一种名为“回合级评审强化学习” (Turn-level Adjudicated Reinforcement Learning, TARL) 的流程监督方法,该方法利用大型语言模型 (LLM) 作为裁判提供细粒度的回合级奖励,并结合混合任务训练策略,以解决长程交互中的信用分配和探索不足问题,从而显著。
-
Prefill vs. Decode Bottlenecks: SRAM-Frequency Tradeoffs and the Memory-Bandwidth Ceiling
打破LLM能效瓶颈:32KB缓存+1.4GHz高频竟是最佳硬件甜点?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Predicting Task Performance with Context-aware Scaling Laws
本文提出了一个简洁、可解释的上下文感知缩放定律 (context-aware scaling law) 框架,该框架通过一个函数联合建模了训练计算量和上下文长度,从而能够准确预测和推断大型语言模型在下游任务中的性能。
-
Pre-training under infinite compute
本文提出,在数据受限而计算资源无限的未来场景下,通过深度优化正则化、模型集成和知识蒸馏等经典算法,可以显著提升语言模型预训练的数据效率,其效果远超单纯增加训练轮次或模型参数的传统方法。
-
Power-of-Two Quantization-Aware-Training (PoT-QAT) in Large Language Models (LLMs)
移位代替乘法!LLM推理提速10倍、内存节省87.5%的PoT-QAT技术。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
PLUM: Adapting Pre-trained Language Models for Industrial-scale Generative Recommendations
本文提出了一个名为 PLUM 的框架,旨在将预训练语言模型(LLM)应用于工业级生成式推荐任务,该框架通过语义ID(Semantic IDs)、领域持续预训练(CPT)和生成式微调三个阶段,实现了超越传统大规模嵌入模型的推荐效果和样本效率。
-
Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers
Meta新作Canon Layers:仅增0.5%参数,推理深度暴涨4倍的“魔法”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone
本文介绍了phi-3系列模型,特别是38亿参数的phi-3-mini,它通过在一个精心筛选和合成的高质量数据集上进行训练,实现了与Mixtral 8x7B和GPT-3.5等大模型相媲美的性能,同时其模型尺寸小到可以在手机上本地部署。
-
Part II: ROLL Flash -- Accelerating RLVR and Agentic Training with Asynchrony
本文提出了 ROLL Flash,一个通过引入异步机制来解耦 rollout 和训练阶段的系统,从而显著提升了强化学习后训练(RL Post-Training)的吞吐量和资源可扩展性,同时通过精细化的陈旧度控制确保了模型的最终性能。
-
Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
本文提出了一种名为 Parrot 的新颖训练流水线,旨在通过三个专门设计的子任务和混合训练策略,相互增强程序思维链(P-CoT)和自然语言思维链(N-CoT)的性能,从而同时提升两种范式下的数学推理能力。
-
Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey
大型模型 (Large Models, LMs) 在自然语言处理 (NLP) 和计算机视觉 (CV) 等多个领域取得了显著进展,但其巨大的规模带来了高昂的计算成本。参数高效微调 (Parameter-Efficient Fine-Tuning, PEFT) 通过在冻结大部分预训练模型参数的同时,仅调整一小部。
-
ParallelMuse: Agentic Parallel Thinking for Deep Information Seeking
本文提出了一种名为 ParallelMuse 的两阶段智能体并行思维框架,通过“功能指定的局部展开”策略和“压缩推理聚合”方法,在提升深度信息寻求 (deep information-seeking) 任务效果的同时,显著降低了探索所需的Token成本。
-
Paper2Agent: Reimagining Research Papers As Interactive and Reliable AI Agents
本文提出了 Paper2Agent,一个自动化框架,它能将研究论文及其代码库转化为交互式、可靠的AI智能体,让用户能通过自然语言使用论文中的方法,从而加速科学知识的传播和应用。
-
PaLM-E: An Embodied Multimodal Language Model
本文提出了一种具身多模态语言模型 PaLM-E,通过将图像等连续的真实世界传感器数据直接注入到预训练语言模型的词嵌入空间,从而在一个统一的模型中实现了机器人规划、视觉问答和语言理解等多种任务,并证明了跨领域联合训练带来的正向知识迁移效应。
-
PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning
8B模型超越GPT-5!PaCoRe:解锁200万Token推理算力的新范式。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Outcome-based Exploration for LLM Reasoning
本文提出了一种“基于结果的探索”(Outcome-based Exploration)方法,通过在强化学习训练中根据最终答案(而非整个推理过程)给予探索奖励,有效提升了大型语言模型在推理任务上的准确率,同时缓解了传统RL训练导致的生成多样性下降问题。
-
ORION: Teaching Language Models to Reason Efficiently in the Language of Thought
大模型推理太“话痨”?ORION压缩16倍思考路径,成本直降9倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Optimizing Mixture of Block Attention
MIT联手英伟达发布FlashMoBA:稀疏注意力提速14.7倍,长文本处理迎来新篇章。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
OpenVLA: An Open-Source Vision-Language-Action Model
本文介绍并开源了一款名为OpenVLA的7B参数视觉-语言-动作(Vision-Language-Action, VLA)模型,该模型通过在包含970k真实世界机器人演示的大规模多样化数据集上进行训练,其通用操作能力不仅超越了参数量大7倍的闭源模型RT-2-X,并且首次系统地展示了如何利用参数高效微调(Lo。
-
OpenAssistant Conversations -- Democratizing Large Language Model Alignment
本文发布了一个通过全球众包构建的大规模、多语言、人工标注的对话数据集——OpenAssistant Conversations,旨在通过开放高质量的人类反馈数据,推进大型语言模型对齐技术的研究民主化。
-
Open Data Synthesis For Deep Research
本文提出了一个名为 InfoSeek 的可扩展数据合成框架,它将复杂的“深度研究”任务形式化为分层约束满足问题(HCSP),并自动生成高质量的训练数据,使一个3B参数量的小模型在复杂的深度研究任务上,性能超越了32B的大模型及部分商业API。
-
Opal: An Operator Algebra View of RLHF
本文提出了Opal,一个用于强化学习从人类反馈(RLHF)的算子代数视图,以及GKPO,一个标准化的交换模式,通过一个当且仅当满足三个核心假设时成立的约简定律,来统一、比较和验证不同的RLHF目标函数,从而整理了该领域繁杂的方法。
-
Online Process Reward Leanring for Agentic Reinforcement Learning
本文提出了一种名为在线过程奖励学习 (Online Process Reward Learning, OPRL) 的智能体强化学习信誉分配策略,该策略通过在线交替优化一个过程奖励模型和智能体策略,将轨迹级别的偏好无缝转化为密集的步骤级奖励,从而在不依赖额外数据或步骤标签的情况下,高效稳定地训练长时程大型语言。
-
OnePiece: Bringing Context Engineering and Reasoning to Industrial Cascade Ranking System
本文提出了 OnePiece,一个统一的框架,它将大型语言模型(LLM)风格的上下文工程和多步推理机制成功地集成到工业级级联排序系统的召回和排序阶段,并取得了显著的离线和在线效果提升。
-
On the Theoretical Limitations of Embedding-Based Retrieval
本文通过连接学习理论与嵌入式检索,从理论和实证上证明了单向量嵌入模型因其维度限制,无法表示所有可能的相关文档组合,并构建了一个名为LIMIT的简单数据集,揭示了即使是当前最先进的模型也存在这一根本局限性。