-
SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding
本文提出了一种名为 SlideAgent 的分层智能体框架,通过设置全局、页面、元素三个级别的专业智能体,将复杂的多页视觉文档理解任务分解,先构建独立于查询的结构化知识库,再进行针对性推理,从而显著提升了大型语言模型在处理幻灯片等文档时的细粒度理解和推理能力。
-
SkyRL-Agent: Efficient RL Training for Multi-turn LLM Agent
AI Agent训练成本减半!SkyRL-Agent框架揭秘1.55倍加速秘诀。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
SkillRouter: Retrieve-and-Rerank Skill Selection for LLM Agents at Scale
颠覆常识!阿里SkillRouter:Agent选对工具,代码比描述重要44%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
SimPO: Simple Preference Optimization with a Reference-Free Reward
本文提出了一种名为 SimPO 的简单偏好优化算法,它通过使用一个无需参考模型、与生成过程对齐的长度归一化奖励,在提升模型性能的同时,显著提高了训练的计算和内存效率。
-
SimpleMem: Efficient Lifelong Memory for LLM Agents
SimpleMem:让Agent记忆成本暴降30倍!F1提升26.4%的“语义无损压缩”新架构。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Sigmoid Loss for Language Image Pre-Training
本文提出了一种用于语言-图像预训练的简单成对 Sigmoid 损失函数 (Sigmoid loss),它将对比学习任务转化为对图文对的独立二元分类,从而解耦了损失计算与批次大小 (batch size) 的依赖,实现了更高的内存效率和在小批量数据下更优的性能。
-
Sigmoid Head for Quality Estimation under Language Ambiguity
告别Softmax“分票”困境:Sigmoid Head无需人工标注,精准量化大模型置信度。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Shrinking the Variance: Shrinkage Baselines for Reinforcement Learning with Verifiable Rewards
本文提出了一种基于收缩估计 (shrinkage estimators) 的新型基线 (baseline) 方法,通过在统计上更优地结合单个提示 (per-prompt) 和跨提示批次 (across-prompt) 的奖励均值,来显著降低策略梯度估计的方差,从而为大型推理模型的强化学习训练带来更强的稳定性。
-
Short-Context Dominance: How Much Local Context Natural Language Actually Needs?
80%的预测只需96个Token!DeepMind揭示大模型“短视”的秘密。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
SFT Doesn't Always Hurt General Capabilities: Revisiting Domain-Specific Fine-Tuning in LLMs
本文挑战了领域特定监督微调(SFT)必然损害大语言模型(LLM)通用能力的普遍观念,指出使用小学习率可以显著缓解性能下降,并提出了一种名为“令牌自适应损失重加权”(TALR)的新方法,以更有效地平衡领域知识注入与通用能力保持。
-
SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents
本文提出了一种名为 SFR-DeepResearch 的方法,其核心是使用一套完全由合成数据驱动的强化学习(RL)方法,在保留并增强其原有推理能力的基础上,将专为推理优化的语言模型(如 QwQ, Qwen3)转化为用于深度研究(Deep Research)任务的自主单智能体。
-
Sentence-Anchored Gist Compression for Long-Context LLMs
LLM长文本“瘦身”8倍:新方法让模型按“句”读取,性能几乎无损。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model
DPO假设失效?康奈尔联合Netflix提出SPO:大模型对齐的“单指标”革命。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection
本文提出了一种名为自反思检索增强生成 (Self-Reflective Retrieval-Augmented Generation, Self-RAG) 的新框架,通过训练一个语言模型,使其能按需自适应地进行检索,并利用特殊的“反思”Token (reflection tokens) 对检索到的信息和自身。
-
Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model
字节Seedance 1.5 pro发布:原生音视频联合生成,推理加速超10倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Seed-Prover 1.5: Mastering Undergraduate-Level Theorem Proving via Learning from Experience
9小时攻克11道Putnam难题!Seed-Prover 1.5重塑AI形式化证明。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Search over Self-Edit Strategies for LLM Adaptation
CMU新作:让AI自主设计“自我修正”策略,带存档机制逼近人类专家水平。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
SCRIBES: Web-Scale Script-Based Semi-Structured Data Extraction with Reinforcement Learning
本文提出了一种名为 SCRIBES 的新型强化学习框架,它通过利用同一网站内网页间的布局相似性作为奖励信号,训练大型语言模型生成可重用的提取脚本,从而实现对网页半结构化数据(如表格和列表)的网络规模、高效率提取。
-
Scaling up Multi-Turn Off-Policy RL and Multi-Agent Tree Search for LLM Step-Provers
本文介绍了BFS-Prover-V2,一个通过创新的训练与推理扩展技术来提升大型语言模型(LLM)定理证明能力的系统,它结合了克服性能瓶颈的多阶段强化学习框架和用于分层推理的规划器增强型多智能体搜索架构,从而在多个数学基准测试中取得了当前最优性能。
-
Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models
本文证明,通过将大规模测试时搜索算法(test-time search)应用于开源代码大语言模型(如 Code Llama-70B),可以在国际信息学奥林匹克(IOI)竞赛级别的算法问题上达到金牌水平,这一成就先前被认为只有顶级的专有模型才能实现。
-
Scaling Reinforcement Learning for Content Moderation with Large Language Models
数据效率暴涨100倍!Meta AI揭秘强化学习在内容审核中的Scaling Law。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
本文提出了一种“计算最优”扩展策略,即根据问题的难度自适应地分配测试时(test-time)的计算资源,并证明在特定场景下,这种策略比单纯扩展模型参数能更有效地提升大型语言模型(LLM)的性能。
-
Scaling Latent Reasoning via Looped Language Models
好的,我将以世界顶级AI研究科学家的身份,遵循您的指示,撰写这份论文笔记。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Scaling Environments for LLM Agents in the Era of Learning from Interaction: A Survey
Agent智能进化论:阿里港科大万字综述,揭秘GEF三步循环。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding
(a) 在长文档理解任务中,使用与不使用多模态RAG的多模态大语言模型(MLLM)的对比。(b) 2024年至2025年相关出版物的增长情况。
-
Scaling and context steer LLMs along the same computational path as the human brain
LLM与人脑“神同步”:Meta AI证实模型越大,计算路径越像人。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Sampling and Loss Weights in Multi-Domain Training
Sampling and Loss Weights in Multi-Domain Training。
-
SAM 2: Segment Anything in Images and Videos
本文提出了SAM 2,一个统一处理图像和视频中可提示分割任务的基础模型,它通过引入流式记忆架构和构建大规模视频分割数据集SA-V,在显著提升分割精度和交互效率的同时,性能超越了现有方法。
-
s1: Simple test-time scaling
本文提出了一种极其简单且高效的方法,通过在精心筛选的1000个样本(s1K)上进行监督微调,并结合一种名为“预算强制”(budget forcing)的测试时干预技术,成功构建了一个具备强大推理能力和可控测试时扩展(test-time scaling)行为的语言模型(s1-32B)。
-
RollPacker: Mitigating Long-Tail Rollouts for Fast, Synchronous RL Post-Training
本文提出了一种名为 RollPacker 的同步强化学习(RL)训练系统,其核心是一种创新的 rollout 调度策略——尾部批处理(tail batching),该策略通过将导致长响应的 prompt 整合到少数专用的 rollout 步骤中,显著减少了因响应长度不均衡导致的 GPU 空闲时间,从而在不牺。
-
Robust Layerwise Scaling Rules by Proper Weight Decay Tuning
本文提出了一种针对矩阵类参数的权重衰减缩放规则 ( ),通过在AdamW训练的稳态下保持子层增益在不同模型宽度下的不变性,从而扩展了最大更新参数化( P)框架,实现了学习率和权重衰减超参数的零样本迁移。
-
RMAAT: Astrocyte-Inspired Memory Compression and Replay for Efficient Long-Context Transformers
模拟大脑“胶质细胞”!RMAAT解锁线性注意力,长序列训练显存效率暴涨。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
RLHF: A comprehensive Survey for Cultural, Multimodal and Low Latency Alignment Methods
RLHF: A comprehensive Survey for Cultural, Multimodal and Low Latency Alignment Methods。
-
RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training
本文提出一种名为 RiskPO 的大语言模型训练后优化方法,通过引入一个基于风险度量的目标函数(MVaR),替代传统的均值优化目标,从而将模型优化的重点放在处理困难样本上,有效缓解了熵坍塌问题,并显著提升了模型的推理能力。
-
ReX-MLE: The Autonomous Agent Benchmark for Medical Imaging Challenges
GPT-5也排0%分位?ReX-MLE揭秘:顶尖AI智能体为何搞不定医学影像。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
RewardDance: Reward Scaling in Visual Generation
本文提出了RewardDance,一个基于生成式范式的可扩展视觉奖励模型框架,它通过将奖励预测重构为“是/否”Token预测任务,实现了对模型尺寸和上下文信息的有效扩展,从而显著提升了视觉生成模型的质量和对齐效果。
-
RevFFN: Memory-Efficient Full-Parameter Fine-Tuning of Mixture-of-Experts LLMs with Reversible Blocks
单卡全量微调MoE大模型?RevFFN让显存占用减半,性能超越LoRA。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Reusing Pre-Training Data at Test Time is a Compute Multiplier
本文提出,在测试时通过检索增强的方式重用模型的预训练数据,可以显著提升大语言模型的性能,这种方法相当于一种高效的“计算倍增器”,证明了当前预训练方法并未充分利用数据中的信息。
-
Retrieval--Reasoning Processes for Multi-hop Question Answering: A Four-Axis Design Framework and Empirical Trends
RAG系统的“黑盒”困境:谷歌提出多跳QA的四轴设计框架。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Retrieval Augmented Generation (RAG) for Fintech: Agentic Design and Evaluation
本文提出了一种专为金融科技(Fintech)领域设计的智能体化检索增强生成(Agentic Retrieval-Augmented Generation, A-RAG)架构,通过一个由专业智能体组成的模块化、迭代式流水线,有效解决了领域内术语密集、缩写混杂和知识碎片化等挑战,显著提升了检索精度和答案相关性。
-
Retrieval-Augmented Generation for Large Language Models: A Survey
本文系统性地综述了大型语言模型(LLM)的检索增强生成(Retrieval-Augmented Generation,RAG)技术,将其发展划分为朴素(Naive)、高级(Advanced)和模块化(Modular)三个范式,并深入剖析了检索、生成与增强这三大核心组件的前沿技术、评估体系及未来挑战。
-
Rethinking Supervised Fine-Tuning: Emphasizing Key Answer Tokens for Improved LLM Accuracy
SFTKey:别让CoT喧宾夺主!两阶段微调让大模型准确率提升超5%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Rethinking Retrieval-Augmented Generation for Medicine: A Large-Scale, Systematic Expert Evaluation and Practical Insights
Rethinking Retrieval-Augmented Generation for Medicine: A Large-Scale, Systematic Expert Evaluation and Practical Insights。
-
Rethinking Cross-lingual Gaps from a Statistical Viewpoint
本文从统计学视角重新审视了大型语言模型的跨语言知识差距问题,提出这一差距主要源于目标语言(target language)响应的方差增大,而非知识传递失败所导致的偏差(bias),并通过创新的偏差-方差分解框架和一系列实验验证了该假设。
-
Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
本文通过系统性比较发现,强化学习(RL)在后训练中比监督微调(SFT)更能有效缓解灾难性遗忘,其根本原因在于RL利用在线策略(on-policy)数据所产生的“模式寻求”(mode-seeking)特性,能够在学习新任务的同时更好地保留模型的已有知识模式。
-
ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding
本文提出了一种名为 ReST-RL 的统一强化学习范式,通过将优化的自训练算法 (ReST-GRPO) 与基于价值模型 (Value Model) 的蒙特卡洛树搜索解码方法 (VM-MCTS) 相结合,显著提升了大型语言模型 (LLM) 在代码推理任务上的准确性。
-
Repurposing Synthetic Data for Fine-grained Search Agent Supervision
本文提出了一种名为 E-GRPO 的新方法,通过重利用合成数据生成过程中被忽略的实体信息,构建了一个细粒度的实体感知奖励函数,以解决传统强化学习方法中的奖励稀疏和“功亏一篑”(near-miss)问题,从而更有效地训练搜索智能体。
-
Remote Labor Index: Measuring AI Automation of Remote Work
本文提出了一种名为远程劳动指数(Remote Labor Index, RLI)的新基准,通过评估AI智能体在真实自由职业平台上的端到端项目完成能力,来衡量AI在具有经济价值的实际任务上的自动化水平,从而为追踪AI的经济影响提供了实证基础。
-
Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution
记忆即算力?阿里ReMe让8B模型超越14B,揭秘动态记忆进化论。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
-
Relative Scaling Laws for LLMs
本文提出了一种名为“相对缩放定律 (Relative Scaling Laws)”的新框架,用于量化随着计算规模的增加,不同数据分布上的性能差距如何演变,揭示了规模增长并非普适的均衡器,其影响因领域而异。