-
When Less is More: 8-bit Quantization Improves Continual Learning in Large Language Models
少即是多?8-bit量化竟让大模型持续学习能力暴涨15%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
What's the next frontier for Data-centric AI? Data Savvy Agents
近期,能够自主交流、与人类协作并使用多种工具的AI智能体 (agents) 的兴起,为各种真实世界场景解锁了巨大的机遇。然而,尽管这些基于大型语言模型 (LLM) 的智能体在自然语言理解和问题解决方面取得了显著进展,它们大多仍局限于具有预定义数据和结构化任务的受控环境中。
-
What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study
推理模型“瘦身”奇迹:2-bit量化下数学能力暴涨44%的技术解密。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
What Limits Agentic Systems Efficiency?
本文对基于网络交互的智能体系统效率瓶颈进行了实证研究,并提出一个名为 SpecCache 的缓存框架,该框架利用推测性执行(speculative execution)来重叠模型推理与网络环境交互,从而在不降低任务性能的前提下,显著减少系统延迟。
-
What is the objective of reasoning with reinforcement learning?
本文通过一个统一的数学框架证明,多种用于大型语言模型的流行强化学习算法(如REINFORCE、拒绝采样和GRPO),在处理二元奖励时,都可以被看作是在给定提示下获得正确答案概率的某个单调变换函数上的随机梯度上升,从而揭示了这些算法内在的深刻关联。
-
What Does Loss Optimization Actually Teach, If Anything? Knowledge Dynamics in Continual Pre-training of LLMs
Loss一直降,模型却没学会?揭秘LLM持续预训练的“学习假象”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
What Affects the Effective Depth of Large Language Models?
MIT新发现:大模型半数层在“划水”,R1推理变强竟不靠深度?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research
本文提出了 WebWeaver,一个模仿人类研究过程的双智能体框架,其中规划器(Planner)通过迭代优化大纲并搜集证据,构建动态且有来源依据的报告结构,而写作者(Writer)则分章节、有针对性地从记忆库中检索信息进行写作,有效解决了传统方法的静态规划缺陷和长上下文处理失败问题,在开放式深度研究任务中实。
-
Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels
本文提出了一种名为 Webscale-RL 的自动化数据流水线,旨在通过从网络文档中自动挖掘和生成数据,将强化学习(RL)数据的规模扩展到与预训练数据相当的水平,从而显著提升大型语言模型的性能。
-
Web World Models
Web World Model:用普通代码构建“物理法则”,让LLM只负责“想象”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Wait, Wait, Wait... Why Do Reasoning Models Loop?
DeepSeek-R1变“复读机”?MIT揭秘:蒸馏导致死循环暴增,调高温度治标不治本。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Voyager: An Open-Ended Embodied Agent with Large Language Models
本文提出了一种名为 Voyager 的具身智能体,它首次利用大型语言模型(LLM)实现了在《我的世界》(Minecraft) 开放世界中的无干预终身学习,通过自动课程、可不断增长的技能库和迭代提示机制,持续探索、获取技能并做出新发现。
-
Visual Language Hypothesis
字节跳动硬核推导:视觉理解的本质是“纤维丛”?揭秘Expand-and-Snap背后的拓扑真相。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Vision Transformers are Circulant Attention Learners
ViT暗藏“循环”玄机?清华新作:用FFT将注意力复杂度降至。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model
本文提出了一种名为 Vision Mamba (Vim) 的通用视觉骨干网络,它通过将双向状态空间模型 (SSM) 和位置嵌入相结合,在不使用自注意力机制的情况下,实现了与 Vision Transformer 相媲美甚至更优的性能,并显著提升了处理高分辨率图像时的计算与内存效率。
-
Virtual Width Networks
字节跳动VWN:不加算力“拓宽”Transformer,训练提速高达3倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Virtual Agent Economies
随着自主人工智能(AI)智能体的迅速普及,一个全新的经济层面正在崛起。在这个层面中,智能体以超越人类直接监督的规模和速度进行交易与协作。本文提出了“沙盒经济”(sandbox economy)这一框架来分析这个新兴系统,并从两个关键维度对其进行刻画:其起源(自发涌现 vs. 有意设计)以及其与现有的人类经济。
-
VideoAgentTrek: Computer Use Pretraining from Unlabeled Videos
本文提出了一种名为 VideoAgentTrek 的可扩展方法,通过一个逆动力学模块(VADM)从未经标注的公开屏幕录制视频中自动挖掘出结构化的训练数据,从而解决了训练计算机使用智能体(Agent)时对大规模手动标注数据的依赖问题。
-
VibeVoice Technical Report
本文提出了一种名为 VibeVoice 的新模型,它通过一个创新的、具有超高压缩率的连续语音tokenizer和一个基于大型语言模型的下一token扩散框架,实现了长达90分钟、多达4人的高质量长篇对话语音合成。
-
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
本文提出了 VerlTool,一个统一、模块化且高效的框架,旨在解决智能体强化学习与工具使用 (Agentic Reinforcement Learning with Tool use, ARLT) 领域的系统碎片化、执行效率低下和扩展性差等核心问题。
-
Valid Survey Simulations with Limited Human Data: The Roles of Prompting, Fine-Tuning, and Rectification
本文提出了一种将大型语言模型(LLM)用于调查问卷模拟的有效框架,其核心思想是:不应将所有宝贵的人类数据用于微调模型,而应将大部分数据用于对LLM生成的大量合成数据进行统计校正(Rectification),从而在有限的人类数据下获得低偏倚、高效率的群体估计。
-
Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
本文识别并解决了多智能体 LLM 推理框架中的“懒惰智能体”问题,通过理论分析揭示其源于现有强化学习目标的内在偏差,并提出了一种名为 Dr. MAMR 的新框架,该框架利用夏普利启发的因果影响测量和一种可验证的深思熟虑(deliberation)奖励机制,以促进智能体之间更均衡、更有效的协作。
-
Unifying Tree Search Algorithm and Reward Design for LLM Reasoning: A Survey
随着大型语言模型 (LLM) 的扩展定律进入回报递减的阶段,研究前沿正从数据和参数的暴力增长转向算法效率和新的推理形式。在此背景下,两个相互关联的范式成为核心:深思熟虑的推理时搜索 (deliberative Test-Time Search, TTS),即在推理时分配自适应的辅助计算来解决难题;以及自我提。
-
Unifying Large Language Models and Knowledge Graphs: A Roadmap
大语言模型(Large Language Models, LLMs),例如ChatGPT和GPT-4,因其涌现能力和泛化性,在自然语言处理和人工智能领域引发了新的浪潮。然而,LLMs是黑箱模型,常常难以捕获和访问事实性知识。相比之下,知识图谱(Knowledge Graphs, KGs)是结构化的知识模型。
-
UNIFORM: Unifying Knowledge from Large-scale and Diverse Pre-trained Models
本文提出了一个名为 UNIFORM 的统一知识迁移框架,旨在从大量异构(不同架构、不同训练数据)的预训练模型中,通过新颖的特征投票和Logit投票机制,解决知识冲突问题,从而高效地将共识知识迁移到一个学生模型中,且无需任何手动标注。
-
Understanding the Role of Training Data in Test-Time Scaling
本文通过一个可理论分析的线性回归任务,从理论上解释了训练数据的特性如何决定测试时增加计算(即更长的思想链)能否成功提升模型性能,并证明了在多样化、相关且困难的任务上进行训练对测试时扩展(test-time scaling)最为有利。
-
Understanding Robustness of Model Editing in Code LLMs: An Empirical Study
本文通过一项在受控环境中进行的系统性实证研究发现,现有的模型编辑方法在更新代码大语言模型(code LLMs)以适应API演进时,表现出有限且不稳定的适应能力,普遍导致模型性能显著下降,且多数成功案例依赖变通方案而非真正采纳新API。
-
Understanding R1-Zero-Like Training: A Critical Perspective
本文通过剖析 R1-Zero 类训练,揭示了其基座模型与强化学习算法(GRPO)中存在的偏见,并提出了一种无偏的优化方法 Dr. GRPO,从而以更高效的方式提升了模型的数学推理能力。
-
Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-Time
拒绝“过度思考”!CREST让大模型推理提速37.6%,精度暴涨17.5%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Uncovering Scaling Laws for Large Language Models via Inverse Problems
本文倡导将大型语言模型(LLM)的开发挑战构建为逆问题(inverse problems),从而以一种系统性的、高成本效益的方式,发现指导LLM构建与优化的底层缩放定律(scaling laws)。
-
UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning
UI-TARS-2:多轮强化学习炼成!达60%人类水平,AI智能体自主操作电脑。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
TreeWriter: AI-Assisted Hierarchical Planning and Writing for Long-Form Documents
TreeWriter来了:打破线性束缚,用“树状结构”让AI长文写作更可控。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
TreeGRPO: Tree-Advantage GRPO for Online RL Post-Training of Diffusion Models
训练加速2.4倍!TreeGRPO用“决策树”革新AI绘画模型对齐。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Tree Search for LLM Agent Reinforcement Learning
本文提出了一种名为 Tree-GRPO (Tree-based Group Relative Policy Optimization) 的方法,通过将传统强化学习中独立的链式轨迹采样替换为树搜索采样,从而在有限的 rollout 预算下为多轮智能体任务生成更多、更高质量的轨迹,并利用树结构从稀疏的结果奖励中。
-
Tree of Thoughts: Deliberate Problem Solving with Large Language Models
本文提出了一种名为“思想树”(Tree of Thoughts, ToT)的新型语言模型推理框架,它通过将问题解决过程建模为对“思想”(连貫的文本单元)树的探索,使大型语言模型能够进行深思熟虑的决策、前瞻和回溯,从而显著提升其在需要规划和搜索的复杂任务上的解决能力。
-
Transition Models: Rethinking the Generative Learning Objective
本文提出了一种名为过渡模型 (Transition Models, TiM) 的新型生成范式,它通过学习一个能够在任意时间间隔 上进行状态转换的精确动力学方程,成功统一了高效的少步生成与高质量的多步精炼,解决了现有生成模型中普遍存在的“速度-质量”权衡困境。
-
Transformers learn factored representations
Transformer的世界观:自动将指数级复杂世界拆解为线性正交因子。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality
本文通过揭示结构化状态空间模型 (SSM) 与注意力机制在结构化半可分矩阵 (semiseparable matrices) 理论下的对偶关系,提出了一个名为“状态空间对偶 (State Space Duality, SSD)”的统一框架,并基于此设计了一种新的、更高效的语言模型架构 Mamba-2。
-
Transformer Enhanced Relation Classification: A Comparative Analysis of Contextuality, Data Efficiency and Sequence Complexity
本文通过系统性的对比实验,证实了基于Transformer的模型在关系分类任务上,无论是在标准性能、长文本处理能力还是数据效率方面,均显著优于传统的非Transformer深度学习模型。
-
Training Task Reasoning LLM Agents for Multi-turn Task Planning via Single-turn Reinforcement Learning
本文提出了一种新颖的方法,通过将复杂的多轮任务规划问题转化为一系列单轮任务推理问题,并利用基于专家轨迹的单轮强化学习(GRPO)进行优化,成功训练出在长时程规划任务中性能超越大型基线模型的小参数量智能体。
-
Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers
LLSA:让Diffusion Transformer提速28倍的“对数级”稀疏注意力机制。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Train on Validation (ToV): Fast data selection with applications to fine-tuning
本文提出了一种名为“在验证集上训练 (Train on Validation, ToV)”的快速数据选择方法,通过反转训练集和验证集的传统角色,依据训练样本在模型于少量目标验证集上微调后的预测损失变化来为其评分,从而高效地筛选出对提升目标任务性能最有益的数据。
-
Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations
本文提出了一种名为“二元检索增强奖励 (Binary Retrieval-Augmented Reward, Binary RAR)”的在线强化学习方法,通过一个简单的二元(事实完全正确为1,否则为0)奖励信号,在不损害模型通用能力的前提下,显著减少了语言模型的幻觉。
-
Towards Unbiased Calibration using Meta-Regularization
本文提出了一种名为元正则化 (Meta-Regularization) 的新方法,通过一个元学习框架来学习无偏的、校准良好的深度学习模型。该方法包含两个核心组件:一个能为Focal Loss学习样本级连续 值的 -Net ,以及一个作为无偏、可微校准目标的平滑期望校准误差 (SECE)。
-
Towards Flash Thinking via Decoupled Advantage Policy Optimization
本文提出了一种名为DEPO的新型强化学习框架,它通过解耦高效与低效推理片段的优势计算、引入难度感知的长度惩罚和优势裁剪机制,在保持甚至提升模型准确率的同时,显著减少了大型推理模型的无效推理(“过度思考”)和响应长度。
-
Towards Execution-Grounded Automated AI Research
斯坦福自动化AI科研:10轮进化准确率飙升21%,RL反而“变笨”?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Towards Automated Kernel Generation in the Era of LLMs
告别手写CUDA噩梦:LLM+Agent自动生成高性能Kernel技术全景。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Towards a Unified View of Large Language Model Post-Training
本文提出了一个统一的策略梯度估计器(UPGE),将监督微调(SFT)和强化学习(RL)两种后训练范式归纳到单一的优化目标下,并基于此设计了一种名为混合后训练(HPT)的新算法,该算法能根据模型的实时表现动态地在SFT和RL之间切换,从而有效提升模型的推理能力。
-
Towards a Science of Scaling Agent Systems
AI Agent协作双刃剑:性能提升81%,错误放大17倍!DeepMind发布首个量化法则。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
TOUCAN: Synthesizing 1.5M Tool-Agentic Data from Real-World MCP Environments
本文介绍了一个名为 TOUCAN 的大规模工具智能体数据集,包含 150 万条从近 500 个真实世界 MCP 环境中合成的轨迹,旨在通过提供多样、真实且复杂的训练数据,显著提升开源大型语言模型(LLM)的工具调用和智能体能力。