EASy:告别无脑堆算力,莫纳什用强化学习让智能体按预算精明办大事
针对这一长期被忽视的痛点,莫纳什大学(Monash University)的研究团队提出了名为 EASy (Efficient Agentic System)的可训练智能体框架。
针对这一长期被忽视的痛点,莫纳什大学(Monash University)的研究团队提出了名为 EASy (Efficient Agentic System)的可训练智能体框架。
在面向大语言模型(LLM)的智能体强化学习(AgenticRL)研究中,环境交互一直是一道难以逾越的高墙。要让模型学会在复杂的现实任务中连续调用工具、处理报错并达成目标,通常需要让它在成千上万次交互中碰壁摸索。
在图形用户界面(GUI)中执行长流程任务的计算机操作智能体(Computer-UseAgents,CUA),正在成为大模型走向通用落地的关键路径。然而,在这个充满未知动作与动态界面的领域中,强化学习(RL)长期受困于一个底层瓶颈:系统如何客观判定智能体的一长串操作到底有没有真正完成人类的意图?
在推理期通过多轮迭代、引入环境反馈来自我进化,是近期大语言模型(LLM)实现能力跃升的重要路径。从FunSearch到AlphaEvolve,基于进化算法的代码探索已经能够解决许多复杂的数学与系统优化问题。
在视觉-语言-动作(VLA)模型的后训练阶段,强化学习(RL)正在成为突破模仿学习天花板的关键路径。然而,当前主流的Actor-Critic范式在机器人操控任务中遭遇了一个隐蔽却致命的瓶颈:大多数Critic模型要么只基于单帧视觉观测,要么直接依赖预训练VLM的单帧隐层特征来估计状态价值。
在大语言模型被赋予工具调用、代码执行和环境反馈能力之后,基于可验证奖励的强化学习(RLVR,ReinforcementLearningwithVerifiableReward)已经成为训练代码Agent(CodingAgent)的核心范式。
大语言模型(LLM)正迅速从“单轮对话的文本生成器”迈向“多轮自主行动的智能体(Agent)”。在浏览网页(WebArena)、操控操作系统(OSWorld)或执行复杂代码任务时,模型需要不断输出动作指令、调用工具或系统API,并在等待外部环境反馈后将新的观察结果追加进历史上下文,开启下一轮推理。
随着大模型在复杂软件工程任务中的应用日益深入,针对代码智能体(CodingAgents)的强化学习正在成为前沿焦点。这类智能体在执行任务时,高度依赖长时间运行的智能体脚手架(AgentHarnesses)来管理工具集成、代码仓库上下文以及执行反馈。
在现实世界的医学教育中,医学生将书本上的学术知识转化为真正的临床专业能力,必须经历漫长而高压的住院医师规范化培训阶段(Residency)。在这个过程中,他们需要在数千次真实的医患互动中积累经验,接收来自上级医生和患者的多样化反馈,并逐渐承担更大的独立决策权。
在当今的人工智能前沿,顶尖的AIAgent(智能体)极少只是一个“裸”的大语言模型或视觉语言模型。为了在复杂的真实环境中执行诸如软件开发、网页浏览和日常工具调度等任务,这些模型通常会被包裹在一个极其复杂的推理框架(InferenceHarness)中。
在当今大语言模型(LLM)的训练范式中,对齐技术已经成为决定模型最终表现的胜负手。在有监督微调(SFT)阶段之后,强化学习微调(RFT)被广泛用于进一步优化模型行为。然而,当我们把目光从数学推理或代码生成转向开放式文本生成(如长文写作、创意生成)时,强化学习面临着一个极为棘手的瓶颈:缺乏可验证...
最近,强化学习(RL)在提升大型语言模型(LLM)复杂推理能力上的表现令人瞩目。特别是DeepSeekMath引入的组相对策略优化(GRPO)算法以及后续引发热潮的各类推理模型,证明了后训练(Post-training)阶段不仅能让模型学会说话,还能让模型学会思考。
随着大语言模型逐渐从单轮问答转向需要长期规划、多轮交互以及工具调用的智能体(Agent)任务,强化学习(RL)正成为大模型后训练阶段的核心范式。然而,在面对复杂的长周期任务时,传统的基于结果的强化学习面临着极其严重的监督信号稀疏问题。
以DeepSeek-R1为代表的卓越模型,将基于可验证奖励的强化学习(RLVR)推向了整个行业的聚光灯下。然而,这种后训练范式隐藏着一个不容忽视的致命瓶颈。它通过优化条件分布来提升推理能力,这意味着其潜力被基座模型现有的输出分布严格锁死。
现阶段在开发大语言模型智能体时,开发者们往往将绝大部分精力投入于调优提示词、微调模型,或是费力编写错综复杂的固定代码逻辑。这些包围在模型外围的代码框架,被称为外围控制层(Harness),它决定了Agent何时观察环境、何时调用工具、何时进行反思以及何时输出最终答案。
当前,无论是OpenAI的GPT-4、Anthropic的Claude,还是Meta的Llama2,这些能够与人类流畅对话、展现出惊人理解力的大语言模型背后,都站着同一位幕后英雄:基于人类反馈的强化学习(ReinforcementLearningfromHumanFeedback,RLHF)。
大语言模型赛道早已不再是简单的参数堆砌游戏。如何在复杂的逻辑推理、代码生成与工具调用上硬刚闭源巨头?阿里云正式披露了其大规模语言模型系列的核心技术细节。该研究推出的Qwen模型不仅在基础通用能力上表现惊艳,其实验室数据的详细披露更是干货满满。本文将深入解析其背后的预训练机制、上下文扩展技巧及强...
当你满怀期待地用强化学习训练多轮大语言模型Agent时,监控大屏上的指标可能正在欺骗你。通常业界习惯用“熵”来衡量模型推理的多样性与稳定性。当熵稳如泰山时,你以为模型正在积极探索不同的解题路径。然而在实际测试中,Agent却常常表现得像一个背诵万能公式的机器人。
最近,强化学习在大语言模型复杂任务中大放异彩。但随之而来的是一个恼人的副作用:模型极易陷入过度思考。它们生成的推理链条越来越长。这不仅消耗了大量上下文算力,还会导致模型“遗忘”之前的关键步骤。甚至让模型陷入重复验证同一子问题的死循环。针对这一痛点,来自阿里巴巴与中科大的研究团队提出了全新框架。
当前具身智能与机器人学习正经历一场深度的范式革命。以往大放异彩的视觉-语言-动作模型(Vision-Language-Action,VLA)正逐渐暴露出其在物理世界中的局限性。以直接将多模态观察映射为底层动作为核心,这些模型本质上仍是“纯反应式”的系统。
DPO收益甚微,LoRA竟被反超?斯坦福揭秘小模型微调的“最优解”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
LoRA并非最优解?DeepSeek-R1实测揭秘:DoRA在RLVR推理任务中全面反超。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
随机奖励竟能提升数学推理?阿里新作揭秘RLVR背后的“熵减”魔法。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
数据效率暴涨100倍!Meta AI揭秘强化学习在内容审核中的Scaling Law。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。