-
$π_0$: A Vision-Language-Action Flow Model for General Robot Control
A Vision-Language-Action Flow Model for General Robot Control。
-
$ΔL$ Normalization: Rethink Loss Aggregation in RLVR
本文提出了一种名为 的新型损失聚合方法,通过构建一个无偏且方差最小的策略梯度估计器,有效解决了在带可验证奖励的强化学习(RLVR)中因响应长度变化巨大导致的高梯度方差和训练不稳定问题。
-
Weight-sparse transformers have interpretable circuits
OpenAI重磅发现:让Transformer“瘦身”99.9%,电路可解释性暴增16倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Tree Training: Accelerating Agentic LLMs Training via Shared Prefix Reuse
本文提出了一种名为 Tree Training 的新训练范式,通过将智能体交互产生的树状轨迹数据进行高效打包和计算复用,在训练的前向和后向传播中对共享的前缀(prefix)只计算一次,从而显著提升了智能体大语言模型(Agentic LLM)的训练效率。
-
Supervised learning pays attention
性能媲美XGBoost,解释性堪比Lasso:斯坦福新作“注意力Lasso”详解。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Step-GUI Technical Report
成本暴降100倍!Step-GUI刷新SOTA,打造手机端最强“操作员”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning
本文提出了一种名为 SSL4RL 的新框架,通过将自监督学习(SSL)任务重新定义为可验证的内在奖励,对视觉语言模型(VLM)进行强化学习(RL)微调,从而在无需人工标注或AI评判器的情况下有效提升模型的视觉推理与对齐能力。
-
Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling
本文提出了一种名为 Seesaw 的训练加速方法,它通过将标准学习率调度中的衰减部分转化为批次大小(batch size)的增加,从而在保持模型性能(以 FLOPs 衡量)的同时,显著减少了约 36% 的训练墙钟时间。
-
Reasoning over mathematical objects: on-policy reward modeling and test time aggregation
AI数学推理不再“偏科”:Principia让大模型精通复杂公式,性能提升18%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Qwen3-VL Technical Report
Qwen3-VL重磅发布:256K上下文,三大架构升级打造全能多模态。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Putting on the Thinking Hats: A Survey on Chain of Thought Fine-tuning from the Perspective of Human Reasoning Mechanism
本文提出一个新颖的视角,即从人类的“六顶思考帽”思维模型出发,对思维链(Chain of Thought, CoT)微调技术进行系统性的梳理、分类和展望,为理解和发展更类人的大语言模型推理能力提供了全新的框架。
-
Prune4Web: DOM Tree Pruning Programming for Web Agent
LLM不读万行代码:Prune4Web让网页元素定位精度飙升至88%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
PPTArena: A Benchmark for Agentic PowerPoint Editing
PPT炼狱场来了!新Agent PPTPilot精准编辑,性能超越专有模型10%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Monadic Context Engineering
告别“面条代码”:普林斯顿用Monad重塑AI Agent架构,健壮性狂飙。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Mitigating Hallucination in Large Language Models (LLMs): An Application-Oriented Survey on RAG, Reasoning, and Agentic Systems
本文是一篇以应用为导向的综述,系统性地分析了检索增强生成(RAG)、推理增强以及智能体(Agentic Systems)系统如何通过提升模型能力来缓解大型语言模型(LLM)中的知识型和逻辑型幻觉。
-
Memory in the Age of AI Agents
Agent记忆≠RAG!复旦/NUS重磅综述:3大维度全景拆解智能体“大脑”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
MemEvolve: Meta-Evolution of Agent Memory Systems
让Agent自己“进化”大脑?MemEvolve实现17%性能跃升与跨模型泛化。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
LLMs Encode How Difficult Problems Are
本文通过一系列实验发现,大型语言模型(LLMs)的内部激活向量中,确实以线性的方式编码了问题的难度,但这种编码与人类判断的对齐程度远高于与其它LLM性能评估的对齐程度;并且,在强化学习训练过程中,与人类判断一致的难度表征会得到加强,而与LLM性能相关的难度表征则会退化。
-
LLM-ERM: Sample-Efficient Program Learning via LLM-Guided Search
本文提出了一种名为 LLM-ERM 的新型程序学习算法,该算法通过大型语言模型(LLM)引导的搜索来高效地最小化经验风险,从而仅需极少量(例如1-2个)的输入输出样例就能成功合成正确的程序。
-
LIMI: Less is More for Agency
本文提出 LIMI 方法,证明通过极少量(仅78个)精心策划的高质量训练样本,即可训练出在智能体任务上超越使用海量数据训练的模型的强大AI智能体,从而确立了智能体开发的“少即是多”原则。
-
LIME: Making LLM Data More Efficient with Linguistic Metadata Embeddings
LIME:给LLM喂点“语法糖”,训练效率飙升56%,推理能力提升38%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem
阿里开源ROME:SWE-bench胜率57%,揭秘打造顶尖Agent的“罗马”基建。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Large Language Models Meet Virtual Cell: A Survey
本文全面综述了大型语言模型(LLM)在构建“虚拟细胞”(virtual cell)——一个能够表示、预测和推理细胞状态与行为的计算系统——中的应用,并提出了一个将现有方法分为“作为预言机的LLM”(LLMs as Oracles)和“作为智能体的LLM”(LLMs as Agents)两大范式的统一分类体系。
-
Knowledge-tuning Large Language Models with Structured Medical Knowledge Bases for Reliable Response Generation in Chinese
准确率飙升至86.7%!哈工大发布“知识调优”,专治医疗大模型“一本正经胡说八道”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Kimi Linear: An Expressive, Efficient Attention Architecture
KimiLinear揭秘:首次全面超越全注意力,1M上下文解码提速6倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Hybrid Architectures for Language Models: Systematic Analysis and Design Insights
本文系统性地分析和评估了语言模型的混合架构(层间与层内),发现层内混合策略在模型质量与计算效率之间取得了最佳的帕累托前沿 (Pareto-frontier)。
-
Group Representational Position Encoding
群表示位置编码(GRAPE):统一RoPE与ALiBi的理论框架。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Fourier Neural Operators Explained: A Practical Perspective
NVIDIA万字长文:别再误用FNO了!傅里叶神经算子终极实践指南。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
ForTIFAI: Fending Off Recursive Training Induced Failure for AI Models
本文提出了一种名为截断交叉熵(TCE)的置信度感知损失函数,通过在训练中忽略对高置信度预测的损失贡献,有效缓解了因循环使用合成数据进行训练而导致的模型崩溃现象。
-
ELPO: Ensemble Learning Based Prompt Optimization for Large Language Models
告别玄学Prompt!字节跳动ELPO框架,F1分数最高提升7.6分。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
DR. WELL: Dynamic Reasoning and Learning with Symbolic World Model for Embodied LLM-Based Multi-Agent Collaboration
本文提出了DR. WELL,一个去中心化的神经符号框架,该框架通过结构化的协商协议和动态演化的符号世界模型,使基于大语言模型(LLM)的具身智能体能够高效地进行协作规划、学习与自我优化。
-
DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
AI自己当“考官”:DR Tulu-8B用进化标尺实现顶级研究,成本降低近1000倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models
斩获IMO/IOI金牌!DeepSeek-V3.2发布,推理比肩Gemini 3.0 Pro。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift
批量归一化(Batch Normalization):深度学习的“稳定器”与“加速器”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
AI4X Roadmap: Artificial Intelligence for the advancement of scientific pursuit and its future directions
诺奖得主领衔!AI4X路线图发布:AI如何重塑8大前沿科学的未来?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Unified Definition of Hallucination, Or: It's the World Model, Stupid
幻觉研究迎来“大一统”:CMU等机构揭示本质,错在世界模型!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Comprehensive Survey on Benchmarks and Solutions in Software Engineering of LLM-Empowered Agentic System
好的,我将遵循您的指示,撰写一份关于该论文的报告。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
A Comedy of Estimators: On KL Regularization in RL Training of LLMs
RL微调避坑指南:揭秘KL正则化的“梯度陷阱”与性能真相。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Thinking Augmented Pre-training
本文提出了一种名为“思维增强预训练”(Thinking Augmented Pre-training, TPT)的简单且可扩展的方法,通过使用现有LLM为预训练数据自动生成“思维轨迹”(thinking trajectories),从而显著提升了语言模型训练的数据效率和推理能力。
-
Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
通过系统性地使用大 值的 指标进行评估,本文发现当前的带可验证奖励的强化学习(RLVR)方法并未赋予大语言模型超越其基础模型的新推理能力,而仅仅是提升了对基础模型已有能力的采样效率,甚至可能缩小了模型的推理范围。
-
An Augmentation Overlap Theory of Contrastive Learning
本文提出了一个“增强重叠”(Augmentation Overlap)理论,通过揭示同一类别的不同样本在数据增强下会产生重叠的视图,解释了实例级别的对比学习为何能学习到具有类别区分性的表示,并基于此推导出了更紧密的下游任务性能界。
-
A Multi-Agent Framework for Stateful Inference-Time Search
本文提出了一个无需训练的有状态多智能体进化搜索框架,通过结合持久化推理时状态、对抗性变异和进化式搜索,提升单元测试中边缘案例的生成能力和代码覆盖率。
-
Zero-Shot Performance Prediction for Probabilistic Scaling Laws
本文提出一种新框架,通过将学习曲线(learning curves, LCs)预测问题建模为具有双层层级结构的多任务学习问题,并利用潜变量多输出高斯过程来捕捉任务间的相关性,从而实现对模型性能学习曲线的零样本(zero-shot)预测,进而以更低的计算成本生成概率性的缩放定律(scaling laws)。
-
Youtu-LLM: Unlocking the Native Agentic Potential for Lightweight Large Language Models
腾讯Youtu-LLM重磅发布:1.96B小模型解锁原生Agent能力,128k长文本与11T数据揭秘。
-
You Need Better Attention Priors
斯坦福GOAT:重构注意力底层数学,显存降36%,长文本性能全面超越RoPE。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
xLLM Technical Report
本文提出了一种名为 xLLM 的智能高效的大语言模型推理框架,其采用创新的服务-引擎解耦架构,通过智能调度与系统级协同优化,专为高性能、大规模的企业级服务而设计,解决了混合负载、资源利用率低和硬件适配性差等核心挑战。
-
WizardCoder: Empowering Code Large Language Models with Evol-Instruct
本文提出了一种名为 的方法,通过自动进化和增强编程指令的复杂性,来精调(fine-tune)代码大语言模型,从而创造出在多个基准测试中性能卓越的 模型系列。
-
Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention
本文首次系统性地揭示了在使用Flash Attention进行低精度(BF16)Transformer模型训练时,导致训练崩溃的内在机制,指出其根源在于注意力机制中出现的相似低秩表示与BF16算术固有有偏舍入误差的累积效应,两者共同形成恶性循环,最终导致损失爆炸。
-
Why Less is More (Sometimes): A Theory of Data Curation
本文建立了一个理论框架,通过推导精确的缩放定律,揭示了在何时以及为何精心筛选(curate)一小部分数据进行训练,会比使用全部数据获得更好的性能,从而解决了“少即是多”与“多即是多”的矛盾。
-
Who Said Neural Networks Aren't Linear?
本文提出了一种名为 Linearizer 的新架构,通过将一个线性算子置于两个可逆神经网络之间,使得传统的非线性映射在特定构造的向量空间中表现为严格的线性变换,从而能够将线性代数的强大工具(如SVD、伪逆)应用于深度学习模型。