最新发布
TCER:相对信息增益破解平庸偏置,阿里无监督强化学习新突破
在当今大语言模型(LLM)的训练范式中,对齐技术已经成为决定模型最终表现的胜负手。在有监督微调(SFT)阶段之后,强化学习微调(RFT)被广泛用于进一步优化模型行为。然而,当我们把目光从数学推理或代码生成转向开放式文本生成(如长文写作、创意生成)时,强化学习面临着一个极为棘手的瓶颈:缺乏可验证的客观奖励信号。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
在当今大语言模型(LLM)的训练范式中,对齐技术已经成为决定模型最终表现的胜负手。在有监督微调(SFT)阶段之后,强化学习微调(RFT)被广泛用于进一步优化模型行为。然而,当我们把目光从数学推理或代码生成转向开放式文本生成(如长文写作、创意生成)时,强化学习面临着一个极为棘手的瓶颈:缺乏可验证的客观奖励信号。
PAPER INSIGHTS
大型推理模型(LargeReasoningModels)如DeepSeek-R1和GPT-5正在以前所未有的速度重塑复杂任务的解决边界。然而,当这些庞大的模型在生成长篇幅回答时,幻觉问题依然是悬在真实落地应用头顶的达摩...
随着当代视觉与大语言模型(LLMs)参数规模的指数级增长,其在推理阶段所消耗的计算资源与显存带宽已成为实际部署中的严峻挑战。在众多模型压缩策略中,网络剪枝(NetworkPruning)因其能够直接移除冗余权重而备受关...
第二部分大型语言模型在执行复杂任务时,经常表现出令人惊叹的连贯性。无论是写出一篇逻辑严密的小说,还是生成一段完全可运行的代码,它们似乎在落笔之前就已经在心中打好了草稿。
在海量文本数据中提取核心信息时,主题模型(TopicModeling)一直扮演着关键角色。从经典的隐狄利克雷分布(LDA)到近年来基于深度神经网络甚至大语言模型(LLM)的进阶方案,现有的主题建模方法在不断提升统计学意...
大型语言模型的落地部署正经历一场从追求极度规模到追求极致效率的范式转移。在这个过程中,低秩自适应(Low-RankAdaptation,即LoRA)凭借其极小的训练开销,几乎成为了参数高效微调(Parameter-Ef...
最近,强化学习(RL)在提升大型语言模型(LLM)复杂推理能力上的表现令人瞩目。特别是DeepSeekMath引入的组相对策略优化(GRPO)算法以及后续引发热潮的各类推理模型,证明了后训练(Post-training...
随着大语言模型(LLM)Agent在生产环境中的快速部署,一个反复出现的规律逐渐浮出水面:任务执行的可靠性,其实已经不再主要取决于底层的LLM模型能力,而是越来越依赖于包裹在模型外围的基础设施层——也就是所谓的“Age...
大型语言模型(LLMs)在处理复杂推理任务时,往往依赖于思维链(Chain-of-Thought,CoT)技术。通过让模型一步一步地用自然语言写出推理过程,其准确率确实得到了显著提升。然而,这里隐藏着一个根本性的效率错...
近年来,大型语言模型在软件工程(SoftwareEngineering,SWE)领域的表现,已成为衡量其真实世界推理与执行能力的核心试金石。然而,要训练出顶尖的编程智能体(Agent),往往受限于高质量代码工程任务数据...
随着大语言模型驱动的智能体(Agent)从执行简单的单次工具调用,逐步演进为能够自主执行复杂长周期任务的系统,Agent需要掌握的技能数量和种类正在急剧膨胀。为了在真实环境中有效运作,Agent必须从多种来源获取大量可...
当前,大语言模型(LLM)Agent的开发正从“手写Prompt”走向“组装技能库”的新阶段。开发者们为了让Agent能够执行特定的专业任务,往往不再从零开始编写代码,而是直接复用社区中已有的Agent技能(Skills)。
当前的大模型智能体(Agent)已经展现出令人惊叹的单点任务解决能力。面对复杂的指令,它们能够自主调用工具、反思错误,并通过与环境的不断交互找到破局之道。然而,这种成功往往是高度脆弱且孤立的。
随着大语言模型基础能力的飞跃,当前的AI智能体已经能够处理极长的上下文,熟练调用外部工具,并执行跨度极长的复杂任务。然而,当这些智能体被部署在真实的长期交互场景中时,它们不可避免地会遇到一个核心瓶颈:如何有效地记住并利...
在当今的大型语言模型和智能体系统研究中,如何让模型在复杂推理任务上表现得更好,已成为核心议题。无论是通过后训练(Post-training)让模型自我改进,还是在推理阶段(Inference)通过增加计算量来拉升性能上...
在大型推理模型的部署中,知识蒸馏(KnowledgeDistillation)是将数百亿参数模型的强大能力压缩至轻量级模型的核心手段。长期以来,离线策略(Off-policy)蒸馏占据主导地位,即让学生模型在教师模型预...
在大型语言模型的后训练(Post-training)阶段,如何将强大的闭源或超大参数模型(Teacher)的推理能力,高效地迁移到参数量较小的模型(Student)身上,一直是工业界和学术界死磕的核心命题。
大型语言模型正在从单一智能体的问答模式,向多智能体协同工作流快速演进。在这些系统中,多个智能体会进行交流、检索信息、对中间输出进行批判,并共同生成最终答复。虽然这种架构通过任务分解显著提升了系统处理复杂问题的鲁棒性,但...
当前,大语言模型的应用范式正在从单次对话向终身学习智能体(LifelongAgents)快速演进。为了应对复杂任务,这类智能体需要记住用户的偏好、迭代行动计划、积累工具使用经验,并在长周期的交互中保持敏捷的响应。然而,...
在深度学习尤其是大语言模型的训练中,优化器的设计直接决定了模型学习的效率与最终的性能上限。长期以来,AdamW等基于标量动量和方差调整的优化器占据了主导地位。然而,随着模型规模的爆炸式增长,研究人员开始将目光投向利用权...
在大语言模型(LLM)的后训练(Post-Training)阶段,强化学习(RL)已经成为提升模型特定领域能力的标准范式。无论是利用可验证奖励进行数学推理训练,还是在沙盒环境中进行代码能力的代理式强化学习,或者是基于规...
在多智能体大型语言模型(LLM)系统的部署中,开发者往往会面临一个棘手的现象:当多个专注于特定子任务的智能体协同工作时,系统输出经常会出现严重的幻觉。这种幻觉与单个模型能力不足所导致的胡言乱语不同,在很多情况下,每一个...