-
Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error
本文提出了一种名为 LTE(Learning to reason from Trial and Error) 的方法,通过利用大语言模型(LLM)自身在推理失败时产生的错误答案作为提示信息,来克服强化学习中的探索停滞问题,从而无需任何外部专家指导即可提升模型的推理能力。
-
Do Depth-Grown Models Overcome the Curse of Depth? An In-Depth Analysis
告别“深度诅咒”:谷歌新方法LIDAS让LLM动态生长,训练提速29%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
DLER: Doing Length pEnalty Right - Incentivizing More Intelligence per Token via Reinforcement Learning
本文提出了一种名为 DLER 的强化学习训练配方,通过改进优化技术(而非设计复杂的长度惩罚函数)来解决模型输出过长的问题,在将响应长度缩短超过70%的同时,还能超越基线模型的准确率,实现了顶尖的准确率-效率权衡。
-
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
本文提出了一种名为直接偏好优化(DPO)的新算法,它通过一个解析性的映射关系,将传统强化学习中带约束的奖励最大化问题,巧妙地转化为一个简单的分类损失函数,从而无需显式训练奖励模型或进行复杂的强化学习,就能高效地使语言模型与人类偏好对齐。
-
Digital Twin AI: Opportunities and Challenges from Large Language Models to World Models
数字孪生迎“智变”:大模型与世界模型驱动的4阶段进化全景。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Diffusion Language Models are Super Data Learners
本文通过大量实验证明,在训练数据稀缺但计算资源充足的条件下,扩散语言模型(Diffusion Language Models, DLMs)相比同等规模的自回归模型(Autoregressive Models, AR)能从有限数据中学习到更多信息,最终在性能上实现超越,这一现象被称为“智能交叉”(Intell。
-
Detecting Data Contamination in LLMs via In-Context Learning
本文提出了一种名为 CoDeC 的新方法,通过衡量上下文学习(In-Context Learning)对模型置信度的影响,来有效检测和量化大语言模型中的训练数据污染问题。
-
Demystifying Synthetic Data in LLM Pre-training: A Systematic Study of Scaling Laws, Benefits, and Pitfalls
本文通过大规模实证研究系统地揭示了,在大型语言模型预训练中战略性地混合约30%的重述(rephrased)合成数据与自然网络文本,可以在大数据量下将达到相同损失所需的训练速度提升5-10倍,但合成数据的最终效果高度依赖其类型、混合比例和生成器模型的能力。
-
DELTA: Decoupling Long-Tailed Online Continual Learning
本文提出了一种名为 DELTA 的解耦学习框架,通过两阶段训练策略(监督对比学习 + 均衡损失)有效解决了长尾在线持续学习(Long-Tailed Online Continual Learning, LTOCL)中的灾难性遗忘和类别不平衡问题。
-
Defeating the Training-Inference Mismatch via FP16
本文发现,在强化学习微调大型语言模型时,仅需将训练精度从广泛使用的 BF16 切换回 FP16,即可从根源上解决训练与推理策略之间的数值不匹配问题,从而获得更稳定的优化、更快的收敛和更强的模型性能。
-
DeepWideSearch: Benchmarking Depth and Width in Agentic Information Seeking
现有用于评估智能体的基准测试主要沿着两个维度发展:搜索宽度与搜索深度。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning
普特南118分超人类!DeepSeekMath-V2:AI如何学会“自我审日志”?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
本文介绍了DeepSeekMath,一个通过在精心构建的120B数学语料上进行持续预训练,并采用一种名为GRPO的新型高效强化学习算法,从而将开源模型的数学推理能力推向接近GPT-4水平的7B语言模型。
-
DeepSeek-V3 Technical Report
本文提出了一种名为 DeepSeek-V3 的671B参数的强混合专家(MoE)模型,它通过创新的无辅助损失负载均衡策略、多Token预测训练目标以及高效的MLA和DeepSeekMoE架构,以极高的训练效率和经济成本,实现了与顶级闭源模型相媲美的性能。
-
DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
本文提出了一种名为DeepSeek-V2的强混合专家(MoE)语言模型,该模型通过创新的多头潜在注意力(MLA)和DeepSeekMoE架构,在实现顶尖性能的同时,显著降低了训练成本并提升了推理效率。
-
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
本文通过大规模强化学习(无论是纯粹应用于基础模型还是结合少量冷启动数据),成功地激发并显著增强了大型语言模型的推理能力,推出了DeepSeek-R1系列模型,并验证了可以将这种高级推理能力通过蒸馏有效地迁移到更小的模型中。
-
DeepDive: Advancing Deep Search Agents with Knowledge Graphs and Multi-Turn RL
本文提出了 DeepDive 方法,通过从知识图谱自动合成高难度问题,并采用端到端多轮强化学习进行训练,旨在提升大型语言模型(LLM)作为深度搜索智能体所需的长时序推理和信息检索能力。
-
DeepAgent: A General Reasoning Agent with Scalable Toolsets
本文提出DeepAgent,一个通用的端到端深度推理智能体(Agent),它将思考、动态工具发现和动作执行统一在单个连贯的推理流中,并通过自主记忆折叠机制和专门的强化学习方法ToolPO,使其能够高效利用规模可变的工具集解决复杂真实世界任务。
-
Deep sequence models tend to memorize geometrically; it is unclear why
本文通过一个精心设计的实验揭示,深度序列模型在记忆事实时并非简单地存储局部关联,而是会自发形成一种“几何式记忆”结构,这种结构编码了实体间(包括训练中未共现的实体)的全局关系,从而将复杂的多步推理任务简化为易于学习的单步几何问题。
-
Deep Self-Evolving Reasoning
本文提出了一种名为深度自进化推理(Deep Self-Evolving Reasoning, DSER)的概率框架,它将迭代推理建模为马尔可夫链,使即使是能力较弱的模型也能通过长时间的并行自进化过程,解决原本无法解决的复杂问题。
-
Deep Delta Learning
超越ResNet!普林斯顿Deep Delta Learning:让神经网络学会“遗忘”与“反思”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Decide Then Retrieve: A Training-Free Framework with Uncertainty-Guided Triggering and Dual-Path Retrieval
告别“无脑”检索:无需训练,DTR框架利用不确定性让RAG性能全面提升。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Dataset Growth
本文提出了一种名为 InfoGrowth 的高效在线算法,通过实时评估数据流中每个数据点的噪声和冗余度,动态地清洗和选择信息量高的数据,以实现高质量数据集的持续、高效增长。
-
DataSage: Multi-agent Collaboration for Insight Discovery with External Knowledge Retrieval, Multi-role Debating, and Multi-path Reasoning
AI分析师天团来了!字节DataSage引入辩论机制,洞察力飙升13.9%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI
1万条顶100万条!北大DataFlow:像写PyTorch一样搞定大模型数据。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Data-Efficient RLVR via Off-Policy Influence Guidance
本文提出了一种名为CROPI的数据高效强化学习框架,通过一种新颖的离策略影响函数估计方法,以极低的计算成本识别并挑选对模型训练最有价值的数据,从而在大型语言模型的推理能力训练中实现显著的加速。
-
DAPO: An Open-Source LLM Reinforcement Learning System at Scale
本文提出了一种名为DAPO的强化学习算法,通过解耦裁剪范围、动态采样、Token级损失计算和超长奖励塑造这四项关键技术,成功解决了大语言模型在长思路链(long-CoT)推理任务中遇到的熵崩溃、训练不稳定和效率低下等问题,并开源了整个大规模强化学习系统。
-
DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle
数据智能体“高考”来了!字节跳动DAComp揭示:顶级模型成功率不足20%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning
AI当上CUDA工程师:性能超NVIDIA官方库26%,CUDA-L2来了!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
CRoPE: Efficient Parametrization of Rotary Positional Embedding
RoPE“瘦身”术:砍掉Attention层50%参数,性能却几乎无损。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
CreativityPrism: A Holistic Benchmark for Large Language Model Creativity
本文提出了一个名为 的整体性评估框架,通过跨越三个领域(发散性思维、创意写作、逻辑推理)的九个任务和二十个指标,从质量、新颖性和多样性三个维度系统地评估大型语言模型的创造力。
-
Cost-Aware Retrieval-Augmentation Reasoning Models with Adaptive Retrieval Depth
本文提出了一种成本感知的动态检索增强推理模型 Dynamic Search-R1,它通过强化学习动态调整检索文档的数量,在显著降低约16-20%延迟的同时,将精确匹配(Exact Match)准确率平均提升了约5%。
-
ConvergeWriter: Data-Driven Bottom-Up Article Construction
本文提出了一种名为 ConvergeWriter 的“自下而上”长文生成框架,它通过“先检索知识,后聚类定结构”的策略,确保文章的规划和生成完全由可用的知识数据驱动,从而根本上解决了传统“自上而下”方法中规划与知识脱节导致的幻觉问题。
-
Controlling changes to attention logits
Mistral AI新作QuacK:不靠归一化,动态学习率让Transformer训练提速10%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Continual Learning via Sparse Memory Finetuning
本文提出了一种名为稀疏内存微调(sparse memory finetuning)的方法,通过仅更新与新知识高度相关的、利用TF-IDF筛选出的极少数内存槽位,使大型语言模型在学习新知识的同时,显著减少了灾难性遗忘。
-
Context-Free Recognition with Transformers
Transformer 突破理论极限: 循环层解锁 CFL 语法识别。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Connecting Jensen-Shannon and Kullback-Leibler Divergences: A New Bound for Representation Learning
本文推导出了一个连接Kullback-Leibler散度(KLD)和Jensen-Shannon散度(JSD)的新的、紧致的下界,从而在理论上证明了最大化基于JSD的判别器目标函数等同于最大化互信息(MI)的一个可靠下界,为表示学习中广泛使用的判别式方法提供了坚实的理论基础。
-
Compress to Impress: Efficient LLM Adaptation Using a Single Gradient Step on 100 Samples
本文提出了一种名为"Compress to Impress"的高效LLM自适应方法,仅需在100个样本上进行单次梯度计算,并结合多子空间矩阵分解,即可在无需任何微调的情况下,快速提升模型在下游任务上的性能。
-
CoMeT: Collaborative Memory Transformer for Efficient Long Context Modeling
阿里CoMeT:32k训练解锁100万长文,显存恒定,告别KV Cache爆炸。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Collaboration and Conflict between Humans and Language Models through the Lens of Game Theory
本文通过博弈论中的迭代囚徒困境 (Iterated Prisoner’s Dilemma) 框架,系统地研究了语言模型智能体在长期交互中的合作与对抗行为,发现其表现不亚于甚至超越了顶尖的经典策略,并能快速适应对手策略的变化,但与人类相比,其策略更倾向于短期收益最大化而非建立长期互利合作。
-
Cognitive Foundations for Reasoning and Their Manifestation in LLMs
哈佛解剖LLM大脑:揭示其“浅层思维”缺陷,认知引导让性能飙升60%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
CogMem: A Cognitive Memory Architecture for Sustained Multi-Turn Reasoning in Large Language Models
给大模型装上“类脑记忆”:CogMem三层架构破解长对话遗忘难题,多轮推理更像人。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
CogGuide: Human-Like Guidance for Zero-Shot Omni-Modal Reasoning
本文提出了一种名为 CogGuide 的零样本全模态推理组件,它通过模拟人类“理解-规划-选择”的认知过程,生成并筛选“意图简图”(intent sketch)策略来指导多模态大模型,从而在无需微调的情况下提升复杂推理任务的性能并抑制“捷径”推理。
-
CogFlow: Bridging Perception and Reasoning through Knowledge Internalization for Visual Mathematical Problem Solving
拒绝“看对算错”!CogFlow首创知识内化机制,7B模型视觉数学推理SOTA。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
CODA: Coordinating the Cerebrum and Cerebellum for a Dual-Brain Computer Use Agent with Decoupled Reinforcement Learning
本文提出了一种名为 CODA 的可训练组合式智能体框架,它模仿人脑的大脑与小脑功能分离机制,通过解耦的强化学习和两阶段训练流程,协同一个通用规划器(大脑)和一个专用执行器(小脑),以有效解决科学计算等专业领域中长时序规划与精确GUI操作的挑战。
-
Citation-Grounded Code Comprehension: Preventing LLM Hallucination Through Hybrid Retrieval and Graph-Augmented Context
告别代码幻觉:混合检索+图增强,实现92%引用准确率与零错误。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
本文介绍并验证了一个名为 Chatbot Arena 的开放平台,该平台通过众包用户的成对比较和偏好投票,来评估和排名大型语言模型(LLM),并为此设计了一套高效、可靠的统计方法论。
-
CaveAgent: Transforming LLMs into Stateful Runtime Operators
告别上下文遗忘!CaveAgent引入“双流架构”,数据密集任务Token暴降59%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Causal Reasoning Favors Encoders: On The Limits of Decoder-Only Models
BERT“逆袭”GPT?微软新论文揭示Decoder-only在因果推理中的致命短板。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Capabilities of GPT-4 on Medical Challenge Problems
本文通过对美国行医执照考试(USMLE)等权威医学基准的全面评测,表明通用的GPT-4模型在未经任何领域专业化微调的情况下,其医学知识水平和推理能力已远超之前的通用模型(GPT-3.5)和医学专用模型(Med-PaLM),并以高分通过考试,同时展现出更优的概率校准能力和强大的交互式解释潜力。