最新发布
Direct-OPD:不模仿小模型策略,而是转移隐式奖励,4小时提升Qwen3表现
带有可验证奖励的强化学习(RLVR)是当前激活大型语言模型深层推理能力的核心密码。从各大顶尖机构的动作来看,让模型在数学、代码等逻辑严密领域通过自我纠错和多步推理来获取高分,已经成为一种标配。然而,这种后训练(post-training)范式极其昂贵。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
带有可验证奖励的强化学习(RLVR)是当前激活大型语言模型深层推理能力的核心密码。从各大顶尖机构的动作来看,让模型在数学、代码等逻辑严密领域通过自我纠错和多步推理来获取高分,已经成为一种标配。然而,这种后训练(post-training)范式极其昂贵。
PAPER INSIGHTS
在大语言模型的后训练(Post-training)阶段,如何有效地将强大的闭源或超大参数模型的能力“灌输”给较小的学生模型,一直是极具挑战的核心命题。在过去的探索中,同策略蒸馏(On-PolicyDistillatio...
大模型智能体(Agent)正越来越多地依靠外部技能库来完成复杂任务。相比于完全依赖模型的隐式推理能力,调用封装好的功能代码或API能够显著提升执行的稳定性和成功率。然而,随着技能库规模的不断膨胀,如何精准地为当前任务挑...
在大型语言模型的自我进化路线中,带有特权上下文的同策略自蒸馏(On-PolicySelf-Distillation,OPSD)一直被视为一种极具潜力的范式。这种方法让模型互为师生,同时给予“教师”模型额外的特权信息(例...
在企业级IT运维(AIOps)中,引入大语言模型(LLM)驱动的Agent已经成为解决复杂故障的主流方向。Agent通过调用工具观察系统状态、进行逻辑推理并执行修复动作,这种高度的灵活性使其能够有效应对前所未见的新型故障。
语言模型能够在单次提示的对话中生成连贯的回复,但当面对需要长期存在的长效智能体(Long-LivedAIAgents)时,单纯依赖上下文窗口的扩展往往会遭遇系统性的瓶颈。长效智能体需要在跨度极长、次数繁多的交互中维持对...
大模型智能体(LLMAgents)在处理长周期、开放性任务时的能力正在快速进化。为了让智能体不只是“见招拆招”,研究人员往往会为其配备“技能(Skill)”——一种可复用、可编辑的程序化知识库。然而,手工编写的静态技能...
当前,大语言模型(LLM)本身是无状态的。如果希望一个AI智能体(Agent)能在数月甚至数年间持续陪伴用户、积累知识,它就必须拥有一套强大的长期记忆“外挂”系统。
当前的大语言模型智能体(LanguageAgents)普遍遵循着“观察-推理-行动”的经典循环,但它们所依赖的外部记忆,往往被隔离在这个核心循环之外。在现有的主流架构中,外部记忆通常被当作一个独立的数据库,智能体在每个...
在当前的大语言模型(LLM)Agent研究中,工具调用能力已成为其与真实世界交互、解决复杂任务的核心基石。然而,当开发者们不断赋予Agent各种能力时,一个明显的效率瓶颈逐渐显现:现有框架绝大多数依赖由“原子操作”(A...
在长时间跨度的大型语言模型(LLM)系统研究中,一个不争的共识正在成型:一个实用的智能体(Agent)不应该每次都从零开始解决任务。当Agent在复杂环境中经历过成功与失败后,它应当能够像人类一样,将过往的经验沉淀为可...
大语言模型正在加速演进为能够自主执行复杂任务的智能体(Agent)。在这一演进路线中,模型面对的最核心挑战之一不仅是“如何准确地生成工具调用参数”,更在于一系列离散的战略决策:“何时该调用工具”、“何时该消化工具的返回...
随着大型语言模型的普及,自动化正迎来从“辅助生成”向“自主执行”的转折点。现代AIAgent不仅能够编写代码、浏览网页,更能自主调用API、操作终端甚至查询生产数据库。然而,当前的AI自动化往往止步于“只读”阶段,例如...
大语言模型(LLM)的应用正在发生一场不可逆转的结构性转变:从简单的单轮提示词(Prompting),全面转向由工具调用、检索、分支、检查点和人工审批构成的显式工作流(ExplicitWorkflows)。
在基于大语言模型(LLM)的复杂应用前沿,多智能体系统正在成为解决跨领域复杂任务的核心范式。通过将不同的职责分配给具备专门设定的智能体,系统能够实现更丰富的推理、更灵活的规划以及跨越多个工具的协调工作流。
基于大语言模型(LLM)的智能体正在彻底改变网络信息检索的形态。我们早已不再满足于用它来回答简单的单一事实问题(例如“某电影的主演是谁”),而是开始向它下达更为复杂的“研究型”指令——比如“对比过去三年里所有开源多模态...
在当今的大模型应用中,基于代码生成的智能体(Agent)正逐渐成为处理复杂软件和操作系统的主流交互方式。面对各种长尾的故障排查、工作流调度和数据查询,Agent可以通过阅读自然语言指令、实时编写代码并执行来达成目标。
单细胞RNA测序与空间转录组学技术的普及,为人类解析细胞动态发育过程提供了前所未有的显微镜。在这其中,轨迹推断(TrajectoryInference,TI)作为将静态细胞“快照”重构为连续发育路径的核心方法,一直扮演...
当前,具备自主规划和工具调用能力的AgenticLLM(智能体大模型)系统正在重塑数据分析与代码生成的范式。然而,所有主流的智能体框架都面临一个根本性的上下文难题:会话是无状态的。每次用户启动一个新任务,系统就像完全失...
大模型推理能力的发展,正逐渐从依赖单体模型参数的线性增长,转向多智能体(Multi-agent)协作机制。然而,简单地堆叠多个智能体往往会带来推理延迟与显存占用的成倍增加,更关键的是,过去的研究并未彻底解决三个核心问题...
在大型语言模型驱动的智能体(LLMAgent)研究中,业界长期受困于一个看似无解的顽疾:当任务轨迹变得越来越长,智能体会不可避免地变得“健忘”且固执。这种健忘往往不是因为上下文窗口不够大,而是智能体在漫长的局部试错和多...
在当今的大语言模型(LLM)应用中,开发者正试图将越来越多的信息塞进单次API调用里。尤其是多智能体(Multi-agent)系统和增强记忆的架构,其Prompt中往往充斥着大量的协调内容——包括智能体间的历史对话、共...