-
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
GRPO多奖励训练“失效”?GDPO解耦归一化:AIME准确率提升6.3%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
GatePro: Parameter-Free Expert Selection Optimization for Mixture-of-Experts Models
本文提出了一种名为 GatePro 的新型、无参数的专家选择优化方法,它将 MoE 模型中的专家选择问题构建为一个最优传输问题,无需可学习的门控参数或人工调整的负载均衡损失函数,即可实现高效且稳定的专家分配。
-
GaLLoP: Gradient-based Sparse Learning on Low-Magnitude Parameters
本文提出了一种名为 GaLLoP 的稀疏微调新方法,它通过优先选择在下游任务上梯度最大、且在预训练模型中权重绝对值最小的参数进行微调,从而在提升任务性能的同时有效保留预训练知识,实现了卓越的分布内(ID)和分布外(OOD)泛化能力。
-
From Static Templates to Dynamic Runtime Graphs: A Survey of Workflow Optimization for LLM Agents
告别“写死”的工作流:IBM万字综述,定义Agent动态进化新范式。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
From Experience to Strategy: Empowering LLM Agents with Trainable Graph Memory
让Agent经验“活”起来:可训练图记忆,助小模型性能飙升25.8%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Forgetful but Faithful: A Cognitive Memory Architecture and Benchmark for Privacy-Aware Generative Agents
给 AI 装上“橡皮擦”:MaRS 架构如何用“遗忘”换取 0.911 的高分表现?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
FlowRL: Matching Reward Distributions for LLM Reasoning
本文提出了一种名为 FlowRL 的强化学习算法,它通过匹配完整的奖励分布而非简单地最大化奖励,来提升大型语言模型(LLM)的推理能力,从而解决了现有方法容易陷入模式崩溃、探索多样性不足的问题。
-
FLEx: Language Modeling with Few-shot Language Explanations
仅需4-11个纠错案例!FLEx:消除大模型83%顽固错误,无需参数微调。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
FLEX: Continuous Agent Evolution via Forward Learning from Experience
让AI像人一样“吃一堑长一智”:FLEX框架使Agent性能飙升23%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
First Try Matters: Revisiting the Role of Reflection in Reasoning Models
本文通过大规模量化分析揭示,当前推理模型中的“反思”步骤主要起确认作用而非纠错,其性能提升源于首次尝试正确率的提高,并基于此发现提出了一种可大幅提升推理效率的提前终止策略。
-
Fine-tuning Small Language Models as Efficient Enterprise Search Relevance Labelers
速度飙升17倍,成本仅1/19:微软亚马逊用小模型“蒸馏”搞定企业搜索标注。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Fast-weight Product Key Memory
Sakana AI新作:赋予模型“即时记忆”,4K训练竟能泛化至128K长文。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Fast attention mechanisms: a tale of parallelism
本文提出了一种名为“近似最近邻注意力”(ANNA)的高效注意力机制,其时间复杂度为亚二次方,并从理论上证明了它在保持与大规模并行计算(MPC)模型等价的强大表达能力的同时,能够高效解决关键推理任务,且其能力可涵盖低秩注意力机制。
-
FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning
本文提出了一种名为缺陷感知策略优化 (FAPO) 的方法,通过训练一个生成式奖励模型(GenRM)来识别并惩罚那些最终答案正确但推理过程有误的“缺陷正样本”,从而在不增加Token预算的情况下,提升大型语言模型在强化学习训练中的推理可靠性、效率和稳定性。
-
Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions
本文提出一种名为结构化反思 (structured reflection) 的新机制,将工具调用失败后的错误诊断与修复过程,转化为一种可控、可训练的智能体行为,从而显著增强大型语言模型在多轮工具交互中的可靠性和错误恢复能力。
-
FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation
本文提出了一种名为 FActScore 的新评估指标,通过将长文本分解为一系列原子事实并计算由可靠知识源支持的事实比例,来精细化地衡量语言模型生成内容的事实准确性,同时还开发了一个自动化模型来低成本、大规模地估算此分数。
-
F -- A Model of Events based on the Foundational Ontology DOLCE+DnS Ultralite
本文提出了一种名为 Event-Model-F (F) 的事件形式化模型,该模型基于 foundational ontology (基础本体) DOLCE+DnS Ultralite (DUL),通过一种模式驱动的方法,全面地表示事件中的时间、空间、参与对象、结构关系(部分-整体、因果、相关)以及对同一事件。
-
Extracting alignment data in open models
本文提出了一种新方法,通过利用聊天模板(chat template)作为前缀诱导模型生成内容,并结合神经嵌入(neural embeddings)来度量语义相似度,从而可以从开放权重的语言模型中高效提取出大量有价值的对齐训练数据。
-
Exploration v.s. Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
随机奖励竟能提升数学推理?阿里新作揭秘RLVR背后的“熵减”魔法。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Explaining the Success of Nearest Neighbor Methods in Prediction
解释预测中最近邻方法的成功。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Expand Neurons, Not Parameters
本文提出了一种名为“固定参数扩展”(Fixed Parameter Expansion, FPE)的方法,通过在不增加非零参数总数的情况下增加网络中的神经元数量,来减少由特征叠加(superposition)引起的干扰,从而提升模型性能。
-
Executable Counterfactuals: Improving LLMs' Causal Reasoning Through Code
本文提出了一个名为“可执行反事实 (Executable Counterfactuals)”的框架,通过生成需要溯因、干预和预测三个步骤的编程和数学问题,系统地评估和提升大语言模型的反事实推理能力,并实验证明强化学习(RL)比监督微调(SFT)更能实现这种能力的泛化。
-
Excess Description Length of Learning Generalizable Predictors
微调是“唤醒”还是“注入”?Anthropic提出EDL:量化模型泛化能力的标尺。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
EvoRoute: Experience-Driven Self-Routing LLM Agent Systems
破解Agent“不可能三角”:EvoRoute实现成本降80%、速度提升3倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
EvoClaw: Evaluating AI Agents on Continuous Software Evolution
AI Agent的“金鱼记忆”:EvoClaw揭示其长期编码性能从80%暴跌至38%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models
1600万Token上下文!蚂蚁HSA模型实现90%准确率,揭秘超长记忆关键。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Every Question Has Its Own Value: Reinforcement Learning with Explicit Human Values
本文提出 RLEV 方法,通过将可验证的正确性奖励与人类定义的显式价值(如题目分数)相结合,直接优化语言模型,使其不仅追求正确性,更优先处理高价值任务,并学会根据任务重要性调整回答的详略程度。
-
Every Attention Matters: An Efficient Hybrid Architecture for Long-Context Reasoning
本文提出了一种名为 Ring-linear 的高效混合注意力架构,通过将线性注意力(Linear Attention)与标准的 Softmax 注意力相结合,在显著降低长上下文推理的 I/O 和计算成本的同时,保持了强大的模型性能。
-
Evaluating Parameter Efficient Methods for RLVR
LoRA并非最优解?DeepSeek-R1实测揭秘:DoRA在RLVR推理任务中全面反超。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Epistemological Fault Lines Between Human and Artificial Intelligence
大模型只是“概率填空”:揭秘AI与人类认知的7道“认识论断层”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Enhancing LLM Planning Capabilities through Intrinsic Self-Critique
DeepMind力证LLM能自我纠错:无需外部验证,规划准确率飙升至89%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
本文系统性地介绍了奖励模型(Reward Models, RMs)的基础概念、分类体系和主流应用,并深入分析了它们在提升大型语言模型(LLM)推理能力中的关键作用,最后探讨了该领域面临的核心挑战与未来方向。
-
End-to-End Test-Time Training for Long Context
128k长文本推理提速2.7倍:TTT-E2E让模型学会“边读边学”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Encoder-Decoder or Decoder-Only? Revisiting Encoder-Decoder Large Language Model
本文通过为编码器-解码器架构(RedLLM)集成现代LLM技术(如旋转位置编码),并在约1.5亿至80亿参数规模上与主流的解码器-仅架构(DecLLM)进行系统性对比,发现RedLLM在指令微调后,能以显著更高的推理效率达到甚至超越DecLLM的性能,证明了该被忽视架构的巨大潜力。
-
Empowering Real-World: A Survey on the Technology, Practice, and Evaluation of LLM-driven Industry Agents
好的,我已判断这是一篇 [综述] 论文。我将严格遵循综述报告的模板,以原文结构为基础,重点剖析其提出的分类体系,并提炼核心内容。
-
EmoRAG: Evaluating RAG Robustness to Symbolic Perturbations
EmoRAG:一个表情符号,如何100%“污染”RAG,让大模型更易“中招”?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Emergent Introspective Awareness in Large Language Models
Anthropic重磅:给大模型“植入思想”,Claude Opus 4.1展现惊人内省能力。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
ELLA: Efficient Lifelong Learning for Adapters in Large Language Models
内存仅需1/35!亚马逊ELLA:无需回放的大模型终身学习新SOTA。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Efficient Streaming Language Models with Attention Sinks
本文提出了一种名为 StreamingLLM 的高效框架,通过保留少量初始 Token 作为“注意力池 (Attention Sinks)”来稳定注意力分布,从而使预训练好的大语言模型无需微调即可处理无限长的流式输入。
-
Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
本文提出了一种名为PREPO的高效强化学习方法,通过结合基于提示困惑度(Perplexity)的课程学习调度和基于相对熵(Relative Entropy)的探索性序列加权,在不牺牲模型性能的前提下,将大语言模型在强化学习训练中的数据效率提升了高达3倍。
-
Efficient Memory Management for Large Language Model Serving with PagedAttention
本文提出 PagedAttention,一种受操作系统虚拟内存和分页机制启发的注意力算法,通过将键值缓存(KV Cache)划分为非连续的内存块进行管理,解决了大型语言模型(LLM)服务中因内存碎片化和无法共享而导致的效率低下问题,从而在 vLLM 系统中实现了 2-4 倍的吞吐量提升。
-
Effective context engineering for AI agents
本文提出了“上下文工程” (Context Engineering) 的概念,主张将 AI 智能体开发的重点从编写静态提示词(prompt)转向动态地策划和管理输入给模型的全部信息(即上下文),从而在模型有限的注意力预算下,实现更可靠、更高效的智能体行为。
-
Educational data mining and learning analytics: An updated survey
本文是一篇关于教育数据挖掘(EDM)和学习分析(LA)领域的更新版综述,系统性地回顾了该领域的关键术语、发展历程、知识发现流程、主要应用环境、方法论、工具集以及未来发展趋势,旨在为研究人员和实践者提供一份全面的最新知识图谱。
-
Dynamic Speculative Agent Planning
本文提出动态推测规划 (Dynamic Speculative Planning, DSP),一个通过在线强化学习自适应调整推测步骤(speculation step)的智能体规划框架,旨在实现无损加速的同时显著降低成本,并允许用户控制延迟与成本之间的权衡。
-
Dynamic Affective Memory Management for Personalized LLM Agents
本文提出了一种名为DAM-LLM的动态情感记忆管理系统,通过引入基于贝叶斯的更新机制和记忆熵概念,使智能体能够自主维护一个动态更新的记忆数据库,以解决传统静态记忆的冗余、过时和一致性差的问题,从而提供更具个性化的情感交互。
-
Dual-Weighted Reinforcement Learning for Generative Preference Modeling
本文提出了一种名为双重加权强化学习(Dual-Weighted Reinforcement Learning, DWRL)的新框架,该框架通过一个保留了偏好建模归纳偏置的双重加权强化学习目标,将思维链(CoT)推理与Bradley-Terry(BT)模型相结合,从而在不依赖可验证奖励的通用任务上有效提升了生。
-
Dual LoRA: Enhancing LoRA with Magnitude and Direction Updates
AMD力作Dual LoRA:性能最高提升1.8%!将参数更新分解为“幅值”与“方向”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
DRO-InstructZero: Distributionally Robust Prompt Optimization for Large Language Models
本文提出了一种名为 DRO-InstructZero 的方法,它将分布式鲁棒优化(Distributionally Robust Optimization, DRO)与贝叶斯优化(Bayesian Optimization, BO)相结合,用于搜索在数据分布发生变化时仍能保持高性能的、具有鲁棒性的语言模型指。
-
DoPE: Denoising Rotary Position Embedding
LLM长文本“失效”有救了!DoPE:免训练为RoPE降噪,解锁64K超长上下文。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
DocReward: A Document Reward Model for Structuring and Stylizing
本文提出了一种名为 DocReward 的文档奖励模型,它通过在一个包含117K对文档的大规模数据集上学习,专门用于评估文档的结构和风格专业性,并在该任务上显著优于 GPT-5 等强大的基线模型。