-
Top 10 Open Challenges Steering the Future of Diffusion Language Model and Its Variants
扩散模型能否颠覆GPT?华为诺亚详解阻碍DLM爆发的十大核心挑战。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs
本文提出了一个名为ToolLLM的通用工具使用框架,通过构建一个包含超过16000个真实世界API的大规模指令微调数据集ToolBench,并采用一种新颖的深度优先搜索决策树(DFSDT)方法,成功地将开源大语言模型(LLaMA)的工具使用能力提升至与ChatGPT相当的水平。
-
Tongyi DeepResearch Technical Report
本文介绍了通义深搜(Tongyi DeepResearch),一个开源的AI研究智能体,它通过创新的“智能体中训练”与“智能体后训练”两阶段训练框架,结合可扩展的合成数据引擎,实现了领先的深度研究能力。
-
Thought Communication in Multiagent Collaboration
本文提出了一种名为 THOUGHTCOMM 的多智能体协作新范式,它使智能体能通过理论上可识别的、直接的潜在“思想”进行交流,而非传统的自然语言,从而突破语言瓶颈,提升集体智能的协作效率和上限。
-
Thinker: Training LLMs in Hierarchical Thinking for Deep Search via Multi-Turn Interaction
只需数百样本,性能反超SOTA!蚂蚁Thinker教LLM如何“分层思考”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression
本文提出了一种名为 TRAC 的在线强化学习后训练方法,利用模型自身的自注意力机制来识别并压缩冗余的推理步骤,并根据动态评估的任务难度自适应地调整压缩程度,从而有效缓解大模型在简单任务上“过度思考”和在困难任务上“思考不足”的问题。
-
Think Outside the Policy: In-Context Steered Policy Optimization
本文提出了一种名为“上下文引导策略优化” (In-Context Steered Policy Optimization, ICPO) 的新型强化学习框架,该框架利用大推理模型 (Large Reasoning Models, LRM) 固有的上下文学习 (In-Context Learning, ICL)。
-
TheMCPCompany: Creating General-purpose Agents with Task-specific Tools
本文提出了一个名为 TheMCPCompany 的大规模工具调用基准(包含超18000个工具),并通过实验证明,利用专门的工具集比通用浏览器能带来更好的性能和更低的成本,但从海量工具中检索并组合正确工具以解决复杂问题仍是当前智能体面临的核心挑战。
-
The Universal Landscape of Human Reasoning
本文提出了一种名为“信息流追踪”(Information Flow Tracking, IFT)的框架,该框架利用大语言模型(LLM)作为概率编码器,通过量化推理每一步的信息熵和信息增益,首次在统一的度量空间中对人类通用推理的动态过程进行建模。
-
The Two-Stage Decision-Sampling Hypothesis: Understanding the Emergence of Self-Reflection in RL-Trained LLMs
RL为何能让大模型“学会自省”?双阶段决策采样假说揭秘SFT的死穴。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
The Rise and Potential of Large Language Model Based Agents: A Survey
The Rise and Potential of Large Language Model Based Agents: A Survey。
-
The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only
本文提出了一种仅使用网页数据,通过大规模精细过滤和严格去重,就能训练出顶尖大语言模型(LLM)的方法,并发布了由此产生的5万亿token数据集RefinedWeb,挑战了LLM预训练必须混合“高质量”精选语料库的传统认知。
-
The Reasoning-Creativity Trade-off: Toward Creativity-Driven Problem Solving
剑桥重磅:直击LLM“创造力坍缩”,DCR框架如何打破推理单一化僵局?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
The Prompt Engineering Report Distilled: Quick Start Guide for Life Sciences
本文为生命科学领域的研究人员提炼了一份提示工程(Prompt Engineering)快速入门指南,重点介绍了六种核心技术(零样本、少样本、思维生成、集成、自我批评和分解),并提供了具体的用例、最佳实践和常见陷阱,旨在帮助研究人员从机会主义的提问方式转变为系统、高效的实践。
-
The Path Not Taken: RLVR Provably Learns Off the Principals
强化学习“另辟蹊径”:避开90%关键参数,模型推理能力竟能大幅提升。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
The Missing Layer of AGI: From Pattern Alchemy to Coordination Physics
反驳“LLM死路论”!斯坦福提出AGI“缺失层”,用一个公式定义通往AGI之路。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
The Llama 3 Herd of Models
本文介绍了 Llama 3 模型家族,其中旗舰模型是一个拥有 405B 参数的密集型 Transformer,通过在 15T 多语言 token 上进行大规模预训练,并采用稳定可扩展的架构和训练方法,使其在多项基准测试中达到了与 GPT-4 等顶级模型相当的性能水平。
-
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
本文提出并形式化了“智能体强化学习(Agentic Reinforcement Learning, Agentic RL)”这一新兴范式,将其定义为将大语言模型(LLM)从被动的序列生成器转变为在复杂动态环境中进行自主决策的智能体,并通过一个围绕智能体核心能力(规划、工具使用、记忆、推理等)的分类体系,系统。
-
The Illusion of Insight in Reasoning Models
普林斯顿揭秘:模型“顿悟”竟是幻觉?百万推理轨迹拆解“自我修正”真相。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
The human biological advantage over AI
本文提出,人类相较于人工智能(AI)的核心优势在于我们基于生物学的中央神经系统(Central Nervous System, CNS),它使我们能够沉浸式地与物理现实融为一体,体验真实的情感,从而发展出植根于经验、有意义且可持续的伦理体系,这是任何非生物的AI都无法复制的。
-
The FM Agent
本文提出一个名为FM Agent的通用多智能体框架,该框架创新性地结合了大型语言模型(LLM)的推理能力和大规模进化搜索,以自动化方式在运筹优化、机器学习、GPU内核优化和数学问题等多个领域解决复杂的现实世界挑战,并取得了最先进(SOTA)的成果。
-
The Evolution of Reranking Models in Information Retrieval: From Heuristic Methods to Large Language Models
RAG效果提升神器:重排序模型从BERT到LLM的硬核进化史。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
The Era of Agentic Organization: Learning to Organize with Language Models
本文提出了一种名为 AsyncThink 的新推理范式,它允许大型语言模型通过一种“组织者-工作者”协议,将复杂的思考过程分解为可并发执行的子任务,并通过强化学习自主学会如何优化这种异步协同结构,从而在降低推理延迟的同时提升了解决问题的准确性。
-
The Curse and Blessing of Mean Bias in FP4-Quantized LLM Training
FP4训练的诅咒与祝福:简单“减均值”,性能直追BF16。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
The Art of Scaling Reinforcement Learning Compute for LLMs
本文通过大规模系统性研究,首次为大语言模型(LLMs)的强化学习(RL)训练提出了一个可预测的规模化框架,并基于此提出了一套名为 的最佳实践方法,旨在将RL训练的规模化从“艺术”转变为可预测的“科学”。
-
The Alignment Waltz: Jointly Training Agents to Collaborate for Safety
本文提出了一种名为 的多智能体强化学习框架,该框架通过训练一个对话智能体和一个反馈智能体进行协作,将安全对齐问题转化为一个正和博弈,从而同时减少大型语言模型(LLM)的不安全响应和过度拒绝现象,提升了模型在有益性(helpfulness)和无害性(harmlessness)之间的帕累托前沿。
-
The 2025 Foundation Model Transparency Index
2025 AI透明度大倒退:均分跌至40,IBM夺冠,xAI与Midjourney垫底。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Tackling the Inherent Difficulty of Noise Filtering in RAG
RAG去噪为何这么难?人大清华揭秘“三元困境”,非线性微调让LLM自带“过滤器”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
T5Gemma 2: Seeing, Reading, and Understanding Longer
Google DeepMind重磅发布T5Gemma 2:让Encoder-Decoder架构在长文本与多模态中强势回归。
-
SynthDrive: Scalable Real2Sim2Real Sensor Simulation Pipeline for High-Fidelity Asset Generation and Driving Data Synthesis
本文提出了 SynthDrive,一个可扩展的“真实-仿真-真实 (real2sim2real)”数据流,它通过从单张图片自动挖掘并生成高保真度的3D资产,用于合成自动驾驶中的罕见场景(corner-case)数据,以提升感知模型的性能。
-
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
本文提出了一个名为 SWE-bench 的大规模、真实世界的软件工程基准,通过要求语言模型(Language Models, LMs)解决来自12个流行Python仓库的真实GitHub问题,发现即使是最先进的模型也难以完成这些复杂的代码编辑任务,揭示了当前模型能力的巨大局限性。
-
Supporting Our AI Overlords: Redesigning Data Systems to be Agent-First
本文指出,未来的数据系统将主要服务于由大型语言模型(LLM)驱动的智能体,并提出了一种“智能体优先”(agent-first)的数据系统新架构,以高效处理智能体工作负载中普遍存在的高吞吐量、异构、冗余和可引导的“智能体推测”(agentic speculation)过程。
-
Students' Voices on Generative AI: Perceptions, Benefits, and Challenges in Higher Education
本文通过对香港399名大学生的问卷调查,揭示了学生对生成式AI(如ChatGPT)普遍持积极态度,认可其在个性化学习、写作和研究方面的潜力,但同时也对技术的准确性、隐私伦理、对个人能力发展和未来职业的冲击表示了显著担忧。
-
Structured Hints for Sample-Efficient Lean Theorem Proving
DeepSeek-Prover潜力释放:仅需简单“骨架”提示,性能飙升43%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Stronger Normalization-Free Transformers
告别LayerNorm?CMU提出Derf:仅用简单函数,多模态性能全面超越。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Stream: Scaling up Mechanistic Interpretability to Long Context in LLMs via Sparse Attention
本文提出了一种名为 Stream 的可解释性框架,通过其具体实现算法 Stream-Attn,利用动态稀疏注意力机制,以近线性的时间( )和线性空间( )复杂度,高效分析大型语言模型在百万级Token长上下文中的注意力模式,从而在消费级GPU上实现了以往难以企及的机理可解释性分析。
-
Step-DeepResearch Technical Report
32B模型媲美OpenAI?Step-DeepResearch揭秘:低成本实现专家级深度研究。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Statistical Reinforcement Learning in the Real World: A Survey of Challenges and Future Directions
RL不该只会打游戏:哈佛联合帝国理工发布“现实世界落地”三步走指南。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
StarCoder: may the source be with you!
本文发布了StarCoder,一个拥有155亿参数、支持8K上下文长度和代码填充能力的开源代码大语言模型;该模型在经过精心筛选和隐私信息处理的 permissively licensed 代码数据集上进行训练,其性能超越了所有现存的多语言开源代码模型,并达到了与闭源模型相当的水平。
-
Staircase Streaming for Low-Latency Multi-Agent Inference
本文提出了一种名为“阶梯式流式传输 (Staircase Streaming)”的方法,通过让多智能体系统中的后续智能体(如聚合器)在接收到前序智能体(如提议者)的部分输出块(chunks)后便开始生成,而非等待其完整输出,从而将序贯依赖转变为流水线并行处理,显著降低了多智能体推理的首Token时间 (TT。
-
Stackelberg Learning from Human Feedback: Preference Optimization as a Sequential Game
ETH新作SLHF:用“领导者-跟随者”博弈重塑对齐,推理性能零样本提升。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Stabilizing Reinforcement Learning with LLMs: Formulation and Practices
Token级优化为何能对齐序列级奖励?阿里耗费数十万GPU时,揭秘LLM强化学习稳定之道。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Spotlight Attention: Towards Efficient LLM Generation via Non-linear Hashing-based KV Cache Retrieval
本文提出Spotlight Attention,一种通过可学习的非线性哈希函数来高效检索KV缓存(Key-Value Cache)的方法,从而在几乎不损失性能的前提下,显著提升大语言模型(LLM)的推理速度。
-
SpecAttn: Speculating Sparse Attention
本文提出了一种名为 SpecAttn 的免训练方法,该方法将推测解码(speculative decoding)与稀疏注意力相结合,通过利用草稿模型(draft model)已计算出的注意力权重来为目标模型(target model)动态预测并选择重要的 Token,从而在不显著牺牲模型性能的前提下,高效实。
-
SparseGPT: Massive Language Models Can Be Accurately Pruned in One-Shot
本文提出了一种名为 SparseGPT 的新颖剪枝方法,能够对超大规模语言模型(如 OPT-175B)进行一次性(One-Shot)剪枝,在不进行任何重新训练的情况下,达到50%-60%的稀疏度,同时保持极低的准确率损失。
-
Sparse Attention Post-Training for Mechanistic Interpretability
大模型“瘦身”革命:砍掉99.7%注意力连接,内部电路清晰100倍且性能不降!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Spanish Pre-trained BERT Model and Evaluation Data
本文提出并开源了第一个完全基于西班牙语料库预训练的BERT模型(BETO),并构建了一个名为GLUES的西班牙语NLP任务评估基准,实验证明该单语模型在多数西班牙语下游任务上的表现优于同等规模的多语言BERT模型。
-
SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling
SortedRL:简单排个序,LLM强化学习训练吞吐量提升近40%,性能最高涨18%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations
SonicMoE:64张H100顶96张用,MoE训练显存暴降45%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Soft Adaptive Policy Optimization
告别硬裁剪!阿里SAPO算法,用“柔性门控”提升LLM训练稳定性与性能。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。