-
Mathematical Framing for Different Agent Strategies
告别炼丹玄学:谷歌用概率统一AI Agent,提出“自由度”新思路。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
MARS: Optimizing Dual-System Deep Research via Multi-Agent Reinforcement Learning
本文提出了一种名为 MARS 的双系统多智能体强化学习框架,该框架通过模拟人类认知的双系统(系统1的快速直觉与系统2的审慎推理),让两个智能体协同解决需要外部知识的复杂推理任务,显著提升了模型在动态信息环境下的深度研究和推理能力。
-
MAPEX: A Multi-Agent Pipeline for Keyphrase Extraction
本文提出了MAPEX,一个用于关键词提取的多智能体协作框架,它通过为不同长度的文档设计动态的双路径策略(知识驱动与主题引导),显著提升了大型语言模型(LLM)在零样本场景下的关键词提取性能。
-
Mamba: Linear-Time Sequence Modeling with Selective State Spaces
本文提出了一种名为Mamba的新型序列建模架构,它通过引入选择性状态空间模型(Selective SSM),在保持线性时间复杂度的同时,实现了与Transformer相媲美的性能,尤其在处理长序列任务上表现出色。
-
MAI-UI Technical Report: Real-World Centric Foundation GUI Agents
超越Gemini!阿里MAI-UI发布:全尺寸GUI Agent与端云协同新范式。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
LORE: A Large Generative Model for Search Relevance
阿里LORE:电商搜索相关性暴涨27%!大模型训练心法全公开。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
LoRA on the Go: Instance-level Dynamic LoRA Selection and Merging
即插即用LoRA!LoGo实现零成本动态适配,推理性能最高提升3.6%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Loong: Synthesize Long Chain-of-Thoughts at Scale through Verifiers
本文提出了Loong项目,一个旨在通过人工审查的种子数据集(LoongBench)和模块化的合成环境(LoongEnv),大规模生成跨多个推理领域、可自动验证的长链思维(Chain-of-Thoughts)数据,以解决高质量训练数据稀缺的问题,并为基于可验证奖励的强化学习(RLVR)提供支持。
-
LLM$ imes$MapReduce-V3: Enabling Interactive In-Depth Survey Generation through a MCP-Driven Hierarchically Modular Agent System
本文提出了一种名为 LLM×MapReduce-V3 的分层模块化智能体系统,该系统通过模型-上下文-协议 (MCP) 驱动的动态规划,实现了交互式、可定制的深度综述论文生成。
-
LLM Router: Prefill is All You Need
英伟达亮剑LLM路由:成本锐减74%,性能直追理论最优!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
LLM-in-Sandbox Elicits General Agentic Intelligence
给大模型配台“电脑”:通用智能涌现,长文本Token消耗暴降8倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
LLM-guided Hierarchical Retrieval
本文提出了一种名为 LATTICE 的LLM引导分层检索框架,通过将海量文档组织成语义树,并让大型语言模型(LLM)基于创新的校准路径相关性得分进行推理和导航,从而以对数级的搜索复杂度高效解决复杂的推理密集型查询。
-
LLM-empowered knowledge graph construction: A survey
本文系统性地综述了大型语言模型(LLM)如何重塑知识图谱(KG)构建的全流程,通过分析本体工程、知识抽取和知识融合三个核心阶段的新兴范式,揭示了从传统方法向语言驱动、生成式框架的转变。
-
LLM-as-a-Judge: Toward World Models for Slate Recommendation Systems
本文解读《LLM-as-a-Judge: Toward World Models for Slate Recommendation Systems》,梳理核心方法、关键实验结果与工程实践启示。
-
Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations
本文提出 Llama Guard,一个基于 Llama2-7b 的开源模型,通过将其构建为一种遵循指令的分类器,为人类与AI的对话提供可定制的、高效的输入-输出内容安全防护。
-
LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention
本文提出了一种名为 LLaMA-Adapter 的高效微调方法,它通过引入一个仅有1.2M可学习参数、带有零初始化注意力的轻量级适配器,在冻结 LLaMA 模型主体的情况下,实现了快速(1小时内)、高效的指令微调,并能轻松扩展到多模态任务。
-
Llama 2: Open Foundation and Fine-Tuned Chat Models
本文发布了 Llama 2,一个包含从7B到70B参数的开源预训练和微调大型语言模型系列,其为对话优化的版本 Llama 2-Chat 在多个基准测试中表现优于现有开源模型,并通过详细阐述其微调和安全对齐方法,旨在推动社区对负责任的大型语言模型进行建设和发展。
-
LiveThinking: Enabling Real-Time Efficient Reasoning for AI-Powered Livestreaming via Reinforcement Learning
本文提出了一种名为 LiveThinking 的两阶段优化框架,旨在解决AI直播等实时场景中推理质量与延迟之间的权衡问题。该框架首先通过知识蒸馏将大型推理模型的能力压缩到轻量级模型中,然后利用强化学习进一步优化推理路径的效率,最终实现了在大幅降低延迟和计算成本的同时,提升响应的正确性与帮助性。
-
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
本文提出了 LiveCodeBench,一个通过持续从编程竞赛平台收集新问题来避免数据污染,并从代码生成、自我修复、代码执行、测试输出预测等多个维度来全面评估大型语言模型(LLM)代码能力的动态基准。
-
LinMU: Multimodal Understanding Made Linear
告别 !LinMU让多模态大模型实现线性复杂度,推理提速9倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
LIMO: Less is More for Reasoning
本文提出并验证了LIMO假说:对于在预训练中已编码了丰富领域知识的基础模型,仅需极少量(本文为817个)精心策划的认知过程范例(高质量的推理链),便能有效激发其复杂的数学推理能力,从而以不到1%的训练数据量,在多个高难度基准上超越了依赖大规模数据微调的SOTA模型。
-
Limits of trust in medical AI
本文论证了医疗人工智能(AI)系统仅能被依赖(be relied upon),而不能被信任(be trusted),因为真正的信任需要善意、动机和道德责任等人类特有的能动性(agency)要素,而AI的广泛应用可能通过取代人类医生的认知权威,导致医疗实践中人际信任关系的缺失。
-
Let's Verify Step by Step
本文通过在极具挑战性的MATH数学数据集上进行实验,证明了过程监督 (Process Supervision) 在训练奖励模型方面显著优于结果监督 (Outcome Supervision),其训练出的模型能更可靠地解决复杂的多步推理问题。
-
Let's (not) just put things in Context: Test-Time Training for Long-Context LLMs
别再堆Thinking Tokens了!qTTT让长文本性能暴涨14%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Less LLM, More Documents: Searching for Improved RAG
本文通过系统性实验证明,在检索增强生成(Retrieval-Augmented Generation, RAG)系统中,扩大检索语料库的规模可以作为一种有效的替代方案来弥补使用较小语言模型(LLM)所带来的性能差距,为构建更高效、更易于部署的RAG系统提供了新的权衡思路。
-
Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation
本文提出了一种困难度感知的思维链蒸馏框架,通过在与问题难度成比例的思维链(CoT)数据上进行后训练,教会大语言模型根据问题复杂性动态调整推理深度,从而在保持或提升准确率的同时,显著提升推理效率。
-
Learning When to Plan: Efficiently Allocating Test-Time Compute for LLM Agents
本文提出了一种两阶段训练方法(监督微调+强化学习),使大型语言模型(LLM)智能体能够学习在序贯决策任务中动态地决定何时进行规划,从而以更高效的计算成本实现更优的性能和更强的可控性。
-
Learning to Reason: Training LLMs with GPT-OSS or DeepSeek R1 Reasoning Traces
推理成本直降75%!英伟达新研究:LLM学会“长话短说”,数学能力还不减。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Learning to Focus: Focal Attention for Selective and Scalable Transformers
让大模型学会“专注”:AWS发布Focal Attention,参数减42%,长文本性能飙升82%!
-
Learning to Discover at Test Time
TTT-Discover:开源模型+测试时训练,仅需数百美元刷新多领域SOTA。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Learning on the Job: An Experience-Driven Self-Evolving Agent for Long-Horizon Tasks
本文提出了MUSE,一个经验驱动的自进化智能体 (Agent) 框架,通过一个分层的记忆模块和“计划-执行-反思-记忆”的闭环系统,使智能体能够在执行长时程任务中持续学习、积累经验并实现自我进化。
-
Learning from Synthetic Data: Limitations of ERM
谷歌揭秘合成数据陷阱:ERM不再万能,新算法破解“模型崩溃”危机。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware
本文提出了一套名为 ALOHA 的低成本开源双臂遥操作硬件系统,并结合一种名为 ACT 的新型模仿学习算法,通过预测动作序列(Action Chunking)而非单步动作,成功地让低成本机器人学会了多种以往需要昂贵设备才能完成的精细操作任务。
-
Latent Traits and Cross-Task Transfer: Deconstructing Dataset Interactions in LLM Fine-tuning
本文提出了一个基于性能矩阵和主成分分析(PCA)的分析框架,旨在系统性地解构大语言模型(LLM)微调过程中的跨任务迁移学习效应,并发现任务性能更多地受源数据集中隐藏的统计特征(如输出长度、类别分布)和特定语言特征的影响,而非表面上的领域相似性。
-
Latent learning: episodic memory complements parametric learning by enabling flexible reuse of experiences
本文的核心论点建立在对认知科学概念的借鉴和对机器学习泛化能力的重新审视之上。以下是理解本文至关重要的核心概念。
-
Larger Datasets Can Be Repeated More: A Theoretical Analysis of Multi-Epoch Scaling in Linear Regression
数据告急?北大清华发现:数据集越大,重复训练收益越高,价值可达logN倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Large Language Monkeys: Scaling Inference Compute with Repeated Sampling
本文系统地研究了通过重复采样来扩展推理计算(Inference Compute)的方法,发现其能显著提升模型在代码和数学等任务上的覆盖率(即解决问题的能力),其扩展性甚至遵循类似缩放定律的规律,并使得小模型在成本效益更高的情况下超越大模型的单次推理表现。
-
Large language models are not about language
剑桥等名校联合檄文:LLM根本不懂语言!70MW能耗下的概率游戏。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Large language models and the entropy of English
挑战香农极限:LLM揭示10^4字符长程依赖与“涌现确定性”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Large Language Model Sourcing: A Survey
大语言模型溯源:一篇综述。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Language Self-Play For Data-Free Training
本文提出了一种名为语言自博弈(Language Self-Play, LSP)的无数据训练方法,通过构建一个强化学习框架,让大型语言模型在“挑战者”(生成难题)和“解答者”(解答问题)两种角色间自我对抗,从而在无需外部训练数据的情况下实现持续自我提升。
-
Language models as tools for investigating the distinction between possible and impossible natural languages
斯坦福新观点:让AI挑战“不可能的语言”,4步揭秘人类认知偏好。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
KTO: Model Alignment as Prospect Theoretic Optimization
本文提出了一种名为KTO (Kahneman-Tversky Optimization) 的新型大模型对齐方法,它基于前景理论,仅需“可取”或“不可取”的二元反馈信号,便能在10亿到300亿参数规模的模型上达到甚至超越基于偏好数据的DPO方法的性能。
-
Kling-Omni Technical Report
10步推理生成电影级视频:快手Kling-Omni全能架构揭秘。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Kimi K2.5: Visual Agentic Intelligence
Kimi K2.5重磅开源:多模态联合增强,Agent推理提速4.5倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Kimi k1.5: Scaling Reinforcement Learning with LLMs
本文提出了一种通过强化学习(RL)扩展大型语言模型(LLM)能力的方法,其核心是利用长上下文(long context)和改进的策略优化算法,构建了一个无需蒙特卡洛树搜索等复杂技术的简化框架,从而在多项推理基准上取得了顶尖性能。
-
KCM: KAN-Based Collaboration Models Enhance Pretrained Large Models
本文提出了一种名为 KCM (KAN-Based Collaboration Models) 的大-小模型协同框架,它利用一个基于 Kolmogorov-Arnold Network (KAN) 的小型判断模型,智能地将输入样本分配给高效的小模型或强大的预训练大模型处理,并通过提示修改和知识蒸馏机制实现两个。
-
Kascade: A Practical Sparse Attention Method for Long-Context LLM Inference
微软Kascade:无需训练,H100上长文本推理提速4.1倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
KAN: Kolmogorov-Arnold Networks
本文提出了一种名为科尔莫戈罗夫-阿诺德网络(Kolmogorov-Arnold Networks, KANs)的新型神经网络架构,其将可学习的激活函数置于网络边缘(“权重”)而非节点上,从而在函数拟合等任务中,相比于传统的多层感知机(MLPs),展现出更高的精度和可解释性。
-
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
本文提出使用强大的大语言模型(如GPT-4)作为裁判(LLM-as-a-Judge)来评估聊天机器人,并通过新提出的基准 MT-Bench 和 Chatbot Arena 的实验证明,该方法的评判结果与人类偏好具有超过80%的一致性,达到了人类之间的一致性水平,为自动化评估提供了一种可扩展且可解释的方案。