Zero-Shot Performance Prediction for Probabilistic Scaling Laws
本文提出一种新框架,通过将学习曲线(learning curves, LCs)预测问题建模为具有双层层级结构的多任务学习问题,并利用潜变量多输出高斯过程来捕捉任务间的相关性,从而实现对模型性能学习曲线的零样本(zero...
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
PAPER INSIGHTS
本文提出一种新框架,通过将学习曲线(learning curves, LCs)预测问题建模为具有双层层级结构的多任务学习问题,并利用潜变量多输出高斯过程来捕捉任务间的相关性,从而实现对模型性能学习曲线的零样本(zero...
本文对基于网络交互的智能体系统效率瓶颈进行了实证研究,并提出一个名为 SpecCache 的缓存框架,该框架利用推测性执行(speculative execution)来重叠模型推理与网络环境交互,从而在不降低任务性能...
本文提出了一种名为DEPO的新型强化学习框架,它通过解耦高效与低效推理片段的优势计算、引入难度感知的长度惩罚和优势裁剪机制,在保持甚至提升模型准确率的同时,显著减少了大型推理模型的无效推理(“过度思考”)和响应长度。
本文提出了一种名为 SSL4RL 的新框架,通过将自监督学习(SSL)任务重新定义为可验证的内在奖励,对视觉语言模型(VLM)进行强化学习(RL)微调,从而在无需人工标注或AI评判器的情况下有效提升模型的视觉推理与对齐能力。
本文提出了一种名为 Seesaw 的训练加速方法,它通过将标准学习率调度中的衰减部分转化为批次大小(batch size)的增加,从而在保持模型性能(以 FLOPs 衡量)的同时,显著减少了约 36% 的训练墙钟时间。
(a) 在长文档理解任务中,使用与不使用多模态RAG的多模态大语言模型(MLLM)的对比。(b) 2024年至2025年相关出版物的增长情况。
本文提出了一种针对矩阵类参数的权重衰减缩放规则 ( ),通过在AdamW训练的稳态下保持子层增益在不同模型宽度下的不变性,从而扩展了最大更新参数化( P)框架,实现了学习率和权重衰减超参数的零样本迁移。
本文从统计学视角重新审视了大型语言模型的跨语言知识差距问题,提出这一差距主要源于目标语言(target language)响应的方差增大,而非知识传递失败所导致的偏差(bias),并通过创新的偏差-方差分解框架和一系列...
本文提出一个新颖的视角,即从人类的“六顶思考帽”思维模型出发,对思维链(Chain of Thought, CoT)微调技术进行系统性的梳理、分类和展望,为理解和发展更类人的大语言模型推理能力提供了全新的框架。
本文提出了一种名为 SPA (Self Play Agent) 的智能体强化学习框架,它通过自我博弈(Self-Play)有监督微调(SFT),让大语言模型智能体在策略优化前先内化一个世界模型(World Model)...
本文提出了一种名为双重加权强化学习(Dual-Weighted Reinforcement Learning, DWRL)的新框架,该框架通过一个保留了偏好建模归纳偏置的双重加权强化学习目标,将思维链(CoT)推理与B...
本文提出了一种名为 DRO-InstructZero 的方法,它将分布式鲁棒优化(Distributionally Robust Optimization, DRO)与贝叶斯优化(Bayesian Optimizati...
本文提出了一种名为 DLER 的强化学习训练配方,通过改进优化技术(而非设计复杂的长度惩罚函数)来解决模型输出过长的问题,在将响应长度缩短超过70%的同时,还能超越基线模型的准确率,实现了顶尖的准确率-效率权衡。
本文提出了一种成本感知的动态检索增强推理模型 Dynamic Search-R1,它通过强化学习动态调整检索文档的数量,在显著降低约16-20%延迟的同时,将精确匹配(Exact Match)准确率平均提升了约5%。
近年来,AI领域的发展由生成式AI主导,但其本质上仍是被动响应。为了超越被动生成,实现自主行动,研究焦点正转向智能体AI (Agentic AI),它强调自指导行为、复杂推理和环境交互。智能体AI被广泛视为AI系统演化...
本文通过分析大型语言模型(LLM)在推理任务中的注意力模式,揭示了一种“预规划-锚定”(Preplan-and-Anchor)的内在节奏,并基于此发现提出了一种细粒度策略优化方法,有效解决了传统强化学习方法中奖励稀疏和...
本文提出了一种名为胶囊提示调优(Capsule Prompt Tuning, CaPT)的新型参数高效微调方法,通过将实例感知(instance-aware)信息和任务感知(task-aware)信息创新性地融合到一个...
本文提出并探讨了“智能体不平等”(agentic inequality)这一新概念,即因AI智能体的接入和能力差异而导致的权力、机会与结果上的不平等,并构建了一个包含可用性、质量和数量三个维度的分析框架,以系统性地分析...
面向具身智能的世界模型综合综述。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文提出了一种名为 xLLM 的智能高效的大语言模型推理框架,其采用创新的服务-引擎解耦架构,通过智能调度与系统级协同优化,专为高性能、大规模的企业级服务而设计,解决了混合负载、资源利用率低和硬件适配性差等核心挑战。
本文通过一个统一的数学框架证明,多种用于大型语言模型的流行强化学习算法(如REINFORCE、拒绝采样和GRPO),在处理二元奖励时,都可以被看作是在给定提示下获得正确答案概率的某个单调变换函数上的随机梯度上升,从而揭...
本文通过大规模系统性研究,首次为大语言模型(LLMs)的强化学习(RL)训练提出了一个可预测的规模化框架,并基于此提出了一套名为 的最佳实践方法,旨在将RL训练的规模化从“艺术”转变为可预测的“科学”。
本文证明,通过将大规模测试时搜索算法(test-time search)应用于开源代码大语言模型(如 Code Llama-70B),可以在国际信息学奥林匹克(IOI)竞赛级别的算法问题上达到金牌水平,这一成就先前被认...
本文提出了一个简洁、可解释的上下文感知缩放定律 (context-aware scaling law) 框架,该框架通过一个函数联合建模了训练计算量和上下文长度,从而能够准确预测和推断大型语言模型在下游任务中的性能。