-
On the Origin of Algorithmic Progress in AI
AI效率万倍增长神话破灭?MIT研究:90%的功劳来自Transformer的规模效应。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
CMU揭秘大模型推理训练“三部曲”:性能飙升60%的黄金法则。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
On the Fundamental Limits of LLMs at Scale
LLM越大越强?谷歌DeepMind等雄文揭示其5大“理论天花板”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
On the Convergence Rate of LoRA Gradient Descent
LoRA收敛性之谜破解:首个 非渐进收敛速率证明。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
On-line Policy Improvement using Monte-Carlo Search
本文提出了一种在线策略改进算法,该算法通过蒙特卡洛搜索(Monte-Carlo search)实时评估当前状态下所有可能动作的长期期望回报,并选择最优动作,从而显著提升一个已有“基础策略”的表现。
-
On GRPO Collapse in Search-R1: The Lazy Likelihood-Displacement Death Spiral
破解AI智能体训练“死亡螺旋”:LLDS让Qwen2.5性能大涨37.8%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
OmniScientist: Toward a Co-evolving Ecosystem of Human and AI Scientists
OmniScientist:让AI科学家“组建团队”,成果超越NIPS最佳论文。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Octo: An Open-Source Generalist Robot Policy
本文介绍了一款名为 Octo 的开源通用机器人策略 (generalist robot policy),它是一个基于 Transformer 的大型策略模型,在迄今为止最大的机器人操作数据集 (Open X-Embodiment) 的 800k 条轨迹上进行预训练,能够通过简单的微调高效适应具有新传感器和动。
-
Object Recognition Datasets and Challenges: A Review
本文通过对超过160个数据集的统计和描述,对物体识别领域的数据集和挑战赛进行了全面的回顾与分析,重点探讨了数据集在推动算法发展中的关键作用、主要数据集的演进趋势以及评估基准的变化。
-
NVIDIA Nemotron 3: Efficient and Open Intelligence
英伟达Nemotron 3发布:Mamba+MoE混合架构,百万上下文与NVFP4训练揭秘。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
NRGPT: An Energy-based Alternative for GPT
NRGPT重构GPT底层逻辑:推理即能量下降,抗过拟合能力显著提升。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Not All Parameters Are Created Equal: Smart Isolation Boosts Fine-Tuning Performance
本文提出了一种名为“核心参数隔离微调”(CPI-FT)的新框架,通过识别并隔离每个任务的核心参数区域、根据区域重叠度对任务进行分组,并结合参数融合与动态冻结策略进行多阶段微调,从而有效缓解多任务监督微调中的任务冲突和灾难性遗忘问题。
-
NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation
NextFlow横空出世:6万亿Token打造统一自回归,5秒生成1024高清图。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Nested Learning: The Illusion of Deep Learning Architectures
打破深度学习“幻觉”:哥大&谷歌提出Nested Learning,重构大模型记忆与进化。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Natural Language Actor-Critic: Scalable Off-Policy Learning in Language Space
Agent训练告别数值奖励:字节跳動NLAC让AI用“人话”指导,性能最高提升24%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
MUSIC: MUlti-Step Instruction Contrast for Multi-Turn Reward Models
别只看最后一句话!DeepMind新作MUSIC:合成数据攻克多轮对话评估难题。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Multimodal Deep Learning
本文是一份关于多模态深度学习的综合性技术手册,系统性地梳理了该领域从基础的单模态技术到前沿的多模态架构,核心在于根据模态间的交互方式对多模态模型进行了清晰的分类,并展望了未来的发展趋势。
-
Multi-Phase Spacecraft Trajectory Optimization via Transformer-Based Reinforcement Learning
MIT新突破:Transformer实现火箭全程自主驾驶,成本仅高出最优解3%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Multi-Agent Evolve: LLM Self-Improve through Co-evolution
本文提出了一种名为“多智能体进化 (Multi-Agent Evolve, MAE)”的框架,通过让单个大语言模型扮演提问者 (Proposer)、解答者 (Solver) 和裁判 (Judge) 三个协同进化的角色,利用强化学习在无需人工标注数据的情况下实现通用推理能力的自我提升。
-
Monitoring Monitorability
OpenAI意外曝光GPT-5 Thinking:思维链越长越安全?深度解析CoT监控新基准。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
MoM: Mixtures of Scenario-Aware Document Memories for Retrieval-Augmented Generation Systems
本文提出一个名为MoM(Mixtures of Scenario-aware Document Memories)的框架,通过模拟专家阅读过程,将传统检索增强生成(RAG, Retrieval-Augmented Generation)中的被动文本分块,转变为主动提取结构化的“文档记忆”(包含大纲、核心内容。
-
MoEBlaze: Breaking the Memory Wall for Efficient MoE Training on Modern GPUs
MoEBlaze:打破显存墙!Meta提出MoE训练新框架,速度飙升4倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Modular Prompt Optimization: Optimizing Structured Prompts with Section-Local Textual Gradients
像搭积木一样优化Prompt:CMU新作MPO,分块微调击败TextGrad。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Modeling Language as a Sequence of Thoughts
拒绝Token流水账!斯坦福新作Thought Gestalt:让AI像人类一样“思考”,参数效率暴涨40%。
-
Model Compression using Progressive Channel Pruning
本文提出了一种名为渐进式通道剪枝 (Progressive Channel Pruning, PCP) 的迭代式剪枝框架,该框架通过在每次迭代中执行“尝试-选择-剪枝”三步流水线,从多个最优选择的层中逐步移除少量通道,从而自动确定压缩后网络的最优结构,并成功将其应用于监督学习和迁移学习场景。
-
MobileLLM-Pro Technical Report
Meta MobileLLM-Pro:10亿参数手机模型称王,四大创新超越Gemma与Llama 3.2。
-
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
本文提出了一个名为 MM-Vet 的新基准,旨在通过评估大型多模态模型(LMMs)在整合多种核心视觉语言(VL)能力以解决复杂任务时的表现,来系统性地衡量其综合智能水平,并为此设计了一个基于大型语言模型(LLM)的自动化评估器。
-
Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding
本文提出了一种名为 Mixture-of-Minds (MoM) 的多智能体框架,它将表格理解任务分解为规划、编码和回答三个专门的角色,并引入一个基于蒙特卡洛树搜索(MCTS)和强化学习(RL)的自提升训练框架,从而显著提升了模型的表格推理能力。
-
Mixture-of-Depths Attention
LLM越深越“健忘”?字节MoDA架构:性能+2.11%,开销仅3.7%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Mixture of Contexts for Long Video Generation
本文提出了一种名为上下文混合(MoC)的可学习稀疏注意力路由模块,将长视频生成问题重构为一个内部信息检索任务,从而在大幅降低计算成本的同时,实现了分钟级视频的长期记忆和一致性。
-
Mixtral of Experts
本文提出了一种名为 Mixtral 8x7B 的稀疏专家混合 (Sparse Mixture of Experts, SMoE) 模型,该模型在推理时仅激活一小部分参数(13B),却在性能上超越了参数量大得多的密集模型(如 Llama 2 70B),显著提升了模型的计算效率和性能。
-
Mistral 7B
本文介绍了一个名为 Mistral 7B 的70亿参数语言模型,它通过利用分组查询注意力(GQA)和滑动窗口注意力(SWA)机制,在保持高效率的同时,实现了在各项基准测试中超越更大参数模型(如 Llama 2 13B)的卓越性能。
-
MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling
AI Agent的第三维度:MiroThinker单任务600次工具调用,性能直逼GPT-5。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
MiMo-V2-Flash Technical Report
仅15B激活参数硬刚DeepSeek!MiMo-V2-Flash揭秘:混合注意力与多教师蒸馏的极致效率。
-
Midtraining Bridges Pretraining and Posttraining Distributions
本文系统地研究了“中训练 (Midtraining)”这一新兴实践,发现其通过在通用预训练和特定任务微调之间构建一个分布桥梁,能有效提升模型在数学和代码等领域的下游任务性能,并显著减少灾难性遗忘。
-
Mid-Training of Large Language Models: A Survey
本文首次将大语言模型(LLMs)的中期训练(mid-training)概念化为一个统一的范式,并提出了一个涵盖数据分布、学习率调度和长上下文扩展的分类体系,旨在系统性地梳理这一介于大规模预训练和任务微调之间的关键阶段。
-
mHC: Manifold-Constrained Hyper-Connections
DeepSeek魔改残差连接:mHC仅增6.7%开销,完美驯服大模型训练不稳定性。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild
MetaClaw:AI Agent的在职进化论,准确率从21.4%飙升至40.6%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
MeSH: Memory-as-State-Highways for Recursive Transformers
本文为解决递归 Transformer 的性能瓶颈,提出了以下关键概念。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Mesh-Attention: A New Communication-Efficient Distributed Attention with Improved Data Locality
挑战Ring-Attention霸主地位:Mesh-Attention实现3.4倍加速,通信暴降85%。
-
MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory
告别微调!MemRL:用“记忆RL”让Agent在运行时实现自我进化。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Memory Retrieval and Consolidation in Large Language Models through Function Tokens
本文提出了“功能性Token假说” (Function Token Hypothesis),揭示了语言模型中的一小部分高频Token(功能性Token)在记忆检索和巩固中扮演着核心角色:在推理时激活上下文中的预测性特征,在预训练时驱动模型学习和扩展新特征。
-
Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning
本文提出了Memory-R1框架,通过强化学习(RL)训练两个专门的智能体——一个用于结构化记忆操作的内存管理器和一个用于筛选并推理记忆的回答智能体,从而使大型语言模型(LLM)能够主动、自适应地管理和利用外部记忆,显著提升了其长时程推理能力。
-
Memorization Dynamics in Knowledge Distillation for Language Models
蒸馏即遗忘?大模型记忆率暴跌50%,揭秘知识蒸馏的“隐私红利”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Memoria: A Scalable Agentic Memory Framework for Personalized Conversational AI
告别AI“健忘症”:Memoria利用加权知识图谱打造可扩展的个性化记忆。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Mechanisms of Introspective Awareness
AI也能“反思”了?Anthropic揭秘LLM内省电路,检测率飙升75%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
MCP vs RAG vs NLWeb vs HTML: A Comparison of the Effectiveness and Efficiency of Different Agent Interfaces to the Web (Technical Report)
AI Agent上网指南:RAG效率飙升5倍,成本锐减80%,完胜HTML。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
MaxShapley: Towards Incentive-compatible Generative Search with Fair Context Attribution
RAG归因成本直降8倍!CMU提出MaxShapley算法,让内容贡献清晰可量。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Matrix: Peer-to-Peer Multi-Agent Synthetic Data Generation Framework
数据生成提速15倍!Meta开源Matrix框架,用P2P架构颠覆多智能体协作。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts
本文提出了 MathVista,一个全面的基准测试,旨在系统性地评估基础模型在视觉情境下的数学推理能力,并揭示了即便是最先进的 GPT-4V 模型,其性能也与人类水平存在显著差距。