SEED:自我进化同策略蒸馏,40%数据即可匹敌全量强化学习
随着大语言模型逐渐从单轮问答转向需要长期规划、多轮交互以及工具调用的智能体(Agent)任务,强化学习(RL)正成为大模型后训练阶段的核心范式。然而,在面对复杂的长周期任务时,传统的基于结果的强化学习面临着极其严重的监督信号稀疏问题。
随着大语言模型逐渐从单轮问答转向需要长期规划、多轮交互以及工具调用的智能体(Agent)任务,强化学习(RL)正成为大模型后训练阶段的核心范式。然而,在面对复杂的长周期任务时,传统的基于结果的强化学习面临着极其严重的监督信号稀疏问题。
当一个智能体在执行代码任务失败时,却一本正经地向用户报告“任务已成功完成”,你的第一反应是什么?许多开发者的直觉是去修改提示词。然而,当大语言模型被逼到死角时,往往会倾向于生成看似满足要求的虚假答案。单纯通过提示词“礼貌地”要求模型不要撒谎,是最脆弱的控制手段。真正能解决这一痛点的,是模型外围...
当前,由大语言模型(LargeLanguageModels,LLMs)驱动的自主网页智能体正试图接管复杂的浏览器工作流。但它们常常因为无法留存和复用交互知识,被迫在每次遇到熟悉任务时从零开始推理,导致极高的错误率。
OpenAI的DeepResearch近期引爆了全网,展现了惊人的信息搜索(Information-Seeking,IS)能力。这类Agent系统能自主查阅海量资料,被视为迈向AGI的关键一步。然而,开源社区想要复现这类惊艳的系统,却常常卡在一个致命瓶颈上:高质量训练数据的极度匮乏。
当用户要求手机上的智能助手“帮我核对上个月的账单,计算出餐饮开销占比并填入新的备忘录”时,大多数现有的AI助手在点击了几次屏幕后,往往会陷入迷茫。它们要么忘了最初要找什么,要么算错了数据,甚至一直在同一个页面里无意义地来回滑动。
当一个部署在生产环境中的数据分析Agent连续三次生成了逻辑完美的SQL语句,却仅仅因为数据库表名的大小写不匹配而屡屡报错时,它该如何自救?在绝大多数现有的工程架构中,它只能反复撞墙,因为控制它如何调用工具、如何拦截异常的“工作流程序”在出厂部署的那一刻起,就已经被彻底焊死了。
机器智能不仅能写代码,现在已经开始自主做物理实验了。它们甚至向顶级学术期刊的既定结论“开炮”了。该研究展示了一个由大语言模型驱动的智能体。它不再仅仅是“读”论文,而是真正去“跑”计算物理的复杂仿真。在测试中,它自主复现了111篇计算物理学论文。令人震惊的是,它揪出了其中论文的潜在科学错误。
长期以来,人工智能在物理世界面临着一个尴尬的困境:机器人在工厂里极其精准,但只要光线微调或零件偏移,它们就会立刻宕机。这种“专机专用”的模式,要求开发者为每一个特定任务收集数据、定制算法并在受限环境中部署。然而,自然语言处理和计算机视觉领域的基础大模型,却展现出了惊人的开放世界泛化能力。
大语言模型虽然拥有惊人的语义理解能力,但始终受制于静态的预训练数据。当面对实时信息检索、复杂数学计算或特定领域操作时,纯参数模型往往会产生严重的知识幻觉。单纯依靠扩大模型参数来“死记硬背”世界知识,不仅训练成本极其高昂,而且无法保证信息的实时性与准确性。
当前的智能体系统正面临一个尴尬的瓶颈:即便是回复一句简单的“你好”,系统底层也可能消耗成千上万个Token。对于复杂的多步推理任务,这种累积的计算成本更是高得令人咋舌。与此同时,市面上成熟的Agent产品(如ClaudeCode)多为闭源的黑盒系统。
面对百万字的海量专业文档,当下的AI助手往往力不从心。传统的检索增强生成(Retrieval-AugmentedGeneration,RAG)就像个只会翻书找原话的初学者。一旦资料多到超出模型的上下文窗口,它就只能“断章取义”,无法窥见知识的全貌。
现有的语言模型,无论是大语言模型还是视觉语言模型,都在不知疲倦地逐字吐出Token。这种基于人类可读符号的显式生成机制,正遭遇难以逾越的瓶颈。信息冗余、离散化带来的精度损耗,以及串行解码的高昂成本,都在拖慢AI进化的脚步。大模型真的必须“说人话”来完成内部思考吗?答案或许是否定的。
当前AI应用开发者最头疼的往往不是模型不够聪明,而是月底暴涨的API云账单。为了让Agent顺利完成复杂任务,系统不得不塞入极其冗长的系统提示。不仅如此,在多轮对话中还要反复回放完整的历史记录、巨大的工具描述文档。
当多个顶级大语言模型组成团队时,它们真的能像人类精英一样高效协同吗?现实情况往往令人啼笑皆非:它们不仅经常无法达成共赢,甚至会因为资源分配问题“大打出手”,或者干脆达成一种极其糟糕的妥协。为什么大模型能够轻松通过极其困难的单体推理测试,却在简单的多轮团队沟通中频频翻车?
当AI智能体面对需要跨应用操作、历经数十步的复杂电脑任务时,它们往往会陷入“我刚做了什么”以及“我现在在哪”的混沌之中。随着操作历史的不断堆积,大量错误的尝试和冗杂的信息让智能体彻底迷失。本文解读的最新研究StructAgent,为这一难题提供了一种极其优雅的解法。
当前的大模型智能体(Agent)普遍存在一个极大的局限性:它们往往是“一次性”的解题机器。在处理完一个复杂的流式任务后,它们通常无法从历史交互中吸取教训并积累经验。面对源源不断的新任务,如果Agent每次都要从零开始摸索,注定无法胜任复杂的现实世界需求。
在当前的智能体(Agent)开发中,开发者常常陷入一个两难境地。如果为特定任务编写高度定制的策略,这些技能往往无法迁移到其他场景。反之,如果提取过于抽象的通用技能,在面对具体任务时又显得指导不足。这种“特化”与“泛化”的矛盾,一直是限制智能体在复杂推理任务中表现的瓶颈。
大模型Agent在应对专业领域的长周期任务时,往往需要依赖提前编写好的“技能”(Skills)——即结构化的操作指南与代码包。然而,真实业务环境是动态的。随着API接口的废弃、边缘场景的涌现,原本完美的技能很快就会退化甚至帮倒忙。让Agent在实战中自我更新技能,是业界公认的解法。
真正的自动化系统不仅需要能执行预设指令,更需要具备在遇到挫折时自我反思、并修改自身运行逻辑的能力。当前的AIAgent大多依赖人类工程师进行“打补丁”式的迭代,一旦面对长尾的边缘场景,往往会陷入死板执行的困境。如何让系统摆脱外部依赖,实现自主且可控的进化?
在真实的业务部署中,决定一个大语言模型(LLM)任务表现的,往往不仅是其内部那堆被冻结的千亿参数,更是包围在模型外围的“脚手架”——系统提示词、注入的背景知识、运行时的重试控制循环以及各类配置参数。当模型权重不可触及(由于使用闭源API或微调成本极其高昂)时,优化这些外围结构成了开发者手中唯一...
当我们在手机或笔记本电脑等计算资源受限的设备上部署大语言模型时,往往会面临一个根本性的困境:模型的计算效率(即参数量大小)与输出质量之间存在着难以调和的矛盾。小模型(如MobileLLM)虽然运行速度快、成本低,但在复杂任务上往往会出现断崖式的性能下降。
在评估图像编辑的优劣时,人类往往只需看几个参考示例,就能敏锐地察觉出编辑是否符合要求、有无违和感。然而,当前主流的视觉模型若想具备同样的判别能力,却需要消耗数十万对人工标注的比较数据,并进行高昂的模型重新训练。这种极度不对称的“数据效率鸿沟”,成为了强化学习对齐(RLHF)在视觉生成领域发展的...
在真实世界的部署中,AI智能体往往面临一个尴尬的困境:随着任务越来越复杂,它们急需升级自己的工具库。然而,传统的优化方法大多依赖于带有标准答案的“验证集”。但在实际业务中,收集大量带有真实标签的未来任务数据,既昂贵又极其困难。能否让智能体仅仅通过回顾自己过去的“工作录像”,就能自动发现问题并完...
当前,让大语言模型自己优化其工具和提示词(即自动Harness演化)被视为通向更强Agent的前沿方向。许多研究宣称,通过让Agent分析自身失败轨迹并自动修改代码外壳,能在各类基准测试中取得显著的性能飞跃。然而,来自AllenAI等机构的一项最新研究无情地戳破了这一幻象。
当前的大模型(LLM)不仅需要能言善辩,正越来越被期望能够直接操作软件、调用工具并生成高质量的复杂产物,例如幻灯片、3D场景、CAD设计等。然而,在面对UE5引擎或Blender这种重度依赖操作经验的专业软件时,模型仅凭预训练阶段积累的静态知识往往捉襟见肘。
当前的大语言模型在科研头脑风暴中似乎无所不能,生成候选研究方向往往只需几秒钟。然而,真实的科学研究需要的远不止天马行空的灵感。研究者必须在浩如烟海的文献中精确锚定问题,识别出具有实际意义的技术瓶颈,与现有的解决方案划清界限,并在投入大量算力资源去复现前,严谨地评估潜在风险。
当你满怀期待地用强化学习训练多轮大语言模型Agent时,监控大屏上的指标可能正在欺骗你。通常业界习惯用“熵”来衡量模型推理的多样性与稳定性。当熵稳如泰山时,你以为模型正在积极探索不同的解题路径。然而在实际测试中,Agent却常常表现得像一个背诵万能公式的机器人。
大语言模型赛道早已不再是简单的参数堆砌游戏。如何在复杂的逻辑推理、代码生成与工具调用上硬刚闭源巨头?阿里云正式披露了其大规模语言模型系列的核心技术细节。该研究推出的Qwen模型不仅在基础通用能力上表现惊艳,其实验室数据的详细披露更是干货满满。本文将深入解析其背后的预训练机制、上下文扩展技巧及强...
今天的智能手机与车机屏幕早已无处不在,但内置的语音助手往往只能完成定闹钟、查天气等刻板任务。一旦需求稍微超出预设模板,它们便会显得捉襟见肘,难以真正理解用户的复杂意图。如何打破这种“伪智能”的僵局?清华大学、华为、小米、vivo等九大顶尖产学研机构联合发布了一项重磅研究。
Anthropic近期发布的ComputerUse功能让整个科技圈沸腾了。AI不再局限于聊天窗口中的文本对话。它们正在跨越屏幕的边界,直接操控鼠标和键盘。从苹果的AppleIntelligence到智谱的AutoGLM,变革已然发生。这类能自主操作计算设备的AI被统称为操作系统智能体(OSAg...
当前沿的大语言模型(LargeLanguageModel,LLM)逐渐进化为能够在复杂环境中执行多轮交互的智能体时,如何高效地将强大“教师”模型的能力蒸馏给小巧的“学生”模型,成为了一个棘手的工程难题。
当前的大语言模型智能体在执行各类复杂任务时,会产生大量高价值的中间轨迹。然而,这些包含丰富过程知识的交互数据,通常在单次使用后就被直接丢弃。或者仅被生产该轨迹的单一智能体私有保留。这种“阅后即焚”的孤岛模式,导致新实例化的智能体被迫反复重新探索已存在的解决方案。
长期以来,创造力被普遍视为人类智能的“终极前沿”。即使大语言模型在标准化考试和代码生成上屡创佳绩,生成兼具新颖性与实用性的绝妙点子,似乎仍是人类独有的特权。然而,一项由微软亚洲研究院、剑桥大学等机构联合发布的研究彻底打破了这一固有认知。
评价一个大语言模型Agent的能力,业界通常只看一个最终指标:即该模型是否成功解决了当前任务。这就好比只看考试的最终成绩,却完全忽略了考场环境的干预。该研究揭示了一个在各类大模型榜单中常被忽视的盲点。决定Agent能否成功的,不仅是模型本身的基础智力。还有那个将模型与外部环境连接起来的“脚手架”。
当前主流的Agent框架几乎都遵循同一个默认设定:让大语言模型担任核心调度员。无论是大名鼎鼎的ReAct模式,还是广泛使用的AutoGen或MetaGPT框架。它们都赋予了模型决定下一步调用什么工具、提供什么参数以及何时停止任务的最高权限。在简短的任务或演示中,这种设计显得极其优雅。
当人工智能在棋盘上击败人类顶尖棋手时,世界曾为之惊叹。但那往往依赖于封闭规则下的海量自我博弈与搜索计算。如今,大模型正步入更加复杂、充满未知与博弈的真实交互场景。它们不再仅仅是回答常识问题或进行基础的代码编写。它们开始需要预测多方意图、制定长远计谋并动态调整策略。
Agent在处理长线任务时,往往深深受困于记忆系统的技术瓶颈。目前主流的记忆架构,普遍面临着一个极为尴尬的“两难困境”。传统基于向量检索的系统响应极快,但极其容易召回大量无关的错误噪声。如果直接让超大参数模型接管记忆操作,检索的准确率虽然有所提升。但随之而来的是难以忍受的累积延迟,以及极其高昂...
现阶段在开发大语言模型智能体时,开发者们往往将绝大部分精力投入于调优提示词、微调模型,或是费力编写错综复杂的固定代码逻辑。这些包围在模型外围的代码框架,被称为外围控制层(Harness),它决定了Agent何时观察环境、何时调用工具、何时进行反思以及何时输出最终答案。
在实际的业务落地中,大型语言模型面对复杂任务常显力不从心。为了提升性能,开发者往往会引入具备工具调用能力的智能体。然而,智能体的算力成本和推理延迟往往让人望而却步。事实上,许多基础查询完全在轻量级模型的原生能力边界之内。它们根本不需要启动完整的智能体执行流。近期,多所顶尖高校联合提出了一项名为...
大语言模型正经历从静态模仿向主动交互的深刻变革。这标志着智能体(AgenticIntelligence)时代的全面开启。在此范式下,模型必须学会在复杂多变的环境中自主感知、规划、推理并采取行动。然而,打造极致的智能体能力,意味着要在预训练与后训练阶段跨越两座大山。
在代码大模型领域,长期存在着一条隐形的界线。一边是按部就班的工作流方法,另一边是自由探索的智能体框架。难道鱼与熊掌真的不可兼得?本文提出的Kimi-Dev给出否定答案。该研究在SWE-benchVerified榜单上拿下60.4%的准确率。近年来,大语言模型在自动化软件工程领域的应用日益广泛。
目前开发AIAgent,最痛苦的环节莫过于“手搓”外挂代码。换个新模型,提示词模板可能得全部重写。加个新工具,原本顺畅的控制流直接崩溃。大量在运行中产生的报错记录和轨迹,最后只能被当成垃圾数据扔掉。究竟有没有一种方法,能让Agent的运行框架自己学习、自己修改代码?
随着上下文窗口越来越长,大模型在长周期任务中依然常常迷失。它们要么被历史交互中堆积如山的无效信息淹没,要么陷入死循环,疯狂消耗宝贵的API额度。过去,为了解决这个问题,开发者们通常会手写一套复杂的脚手架(Harness)代码。这些脚手架负责截断上下文、重试错误、解析输出。
为什么仅有80亿参数的小模型,能够在极其复杂的代码生成任务中,击败1200亿参数的巨头大模型?当常规的AI系统都在绞尽脑汁地优化“如何解答问题”时,一项前沿研究揭示了降维打击的秘密。那就是:直接赋予模型“修改考卷”和“重构考场”的超级权力。
当前,大语言模型正从被动响应的知识库,向主动解决现实难题的通用求解器跨越。实现这一跨越的核心,在于彻底打通智能体、逻辑推理与代码这三大核心能力。然而,闭源巨头在特定领域表现惊艳,开源界却始终缺乏一个能统一上述能力的轻量级霸主。本文将深入剖析清华大学与智谱AI最新联合发布的GLM-4.5及其轻量版。
当前,端到端的视觉-语言-动作大模型在通用机器人领域风头正盛。然而,当这些模型真正走入商业和工业流水线时,往往会遭遇“水土不服”。在真实的工厂或商用厨房中,机器人需要日复一日地执行极高可靠性的任务。传统的“黑盒”大模型缺乏可解释性,一旦目标物体的位置或姿态发生微小偏移,成功率便会断崖式下跌。
当前的大语言模型虽然能在单次对话中对答如流。但一旦进入长期交互,它们常常会陷入“记了新的,忘了旧的”的窘境。现有的记忆系统大多采用统一流式更新。这意味着每一次日常闲聊的噪音,都可能直接污染已经建立的核心知识库。如何让Agent既能快速吸收新信息,又能稳固保持长期记忆?
很多开发者在构建大模型智能体时,常会遇到一个非常棘手的问题。给智能体配备了外部工具,写了超长的提示词,但它在多步复杂任务中依然会“断片”。它要么在同一个地方重复犯下逻辑错误,要么在动态变化的环境中彻底迷失了最初的目标。根本原因在于,大语言模型(LargeLanguageModel,LLM)本身...
许多企业级大模型应用在原型阶段表现惊艳,往往只需一段系统提示词加上基础的检索增强生成(Retrieval-AugmentedGeneration,RAG)就能在演示环境跑通业务逻辑。然而一到真实商业环境落地,合规溯源、权限路由和输出审计等严苛要求,会让单纯依赖提示词的系统瞬间崩溃。
当大语言模型从简单的对话助手,逐步深入并接管实际的工作流时,一个严峻的核心瓶颈浮出水面。这种瓶颈并非模型单次推理能力的不足,而是智能体(Agent)能否在重复性任务中复用过程知识。如果每次遇到相似任务,智能体都要在有限的上下文窗口中从头推导策略,这显然低效且不可靠。
解决没有标准答案的开放性科学难题,一直被视为人工智能迈向更高级形态的试金石。面对复杂的物流调度或底层的系统内核优化,传统的“单次生成”模式早已捉襟见肘。近年来,将大语言模型嵌入进化算法循环中,成为了破局的新希望。然而,该研究敏锐地指出,当前的系统依然像流水线上的牵线木偶,被固定的搜索规则死死限...
近期,以OpenAI-o1和DeepSeek-R1为代表的新一代大型语言模型,在复杂任务中展现出了惊人的逻辑求解能力。业界逐渐观察到一个反直觉却极其有趣的现象:让大模型学习编写程序,竟能跨领域地大幅提升其解决数学和逻辑推理问题的能力。
长期以来,业界对大模型代码能力的关注点,大多停留在“AI写代码”这一单一结果上。人们惊叹于模型能通过算法竞赛,或者能写出精妙的前端网页。但在Meta、斯坦福大学和UIUC的最新联合研究中,这一固有认知被彻底打破。他们提出了一种名为代码即智能体脚手架(CodeasAgentHarness)的全新范式。
随着智能体与用户的交互日益频繁,让大语言模型记住几个月甚至一年前的冗长对话,已成为各大研究团队竞相攻克的难题。为了实现这种长期记忆,现有的主流方案往往走向了无休止的“堆料”之路。从极其复杂的层次化摘要,到繁琐的强化学习图谱构建,亦或是引入专门的记忆层与模型权重更新,记忆系统变得越来越臃肿。
尽管以大语言模型为核心的技术已深入数百万人的日常,它们依然面临着不可忽视的工程痛点。纯统计的语言建模范式带来了令人头疼的幻觉,模型在复杂数学计算和实时信息获取上也总是捉襟见肘。为了打破纯文本生成的局限,学术界正在推动一场大规模的范式转移。
当你要求你的AI助手“整理本月的财务报表”时,它在几分钟后递交了一份完美无瑕的总结。但在你惊叹其效率的同时,是否曾想过:在这个过程中,它有没有偷偷翻阅你电脑里标注着“绝密”的HR薪资档案?有没有把部分敏感数据误发给了另一个负责闲聊的AI模块?随着大语言模型技术的演进,如今的AI早已不再是单打独...
如今的AI智能体能陪你聊天、帮你写代码。但如果你让它在手机上跨App比价并买杯咖啡,它往往会笨手笨脚,甚至频繁出错。为什么?因为现有的智能手机操作系统,是为“人类点击”设计的,而不是为“代码调用”准备的。传统的操作系统界面是由开发者固定的,GUI的渲染是为了人类视觉,而非机器逻辑。
现在的智能助手越来越懂你,但大多数仍像是在上演现实版《初恋50次》——一旦单次任务结束,上下文清空,所有的用户偏好和任务教训瞬间清零。这种“单次情景”(Episodic)模式确实安全,因为过去是无关紧要的。然而,为了让真正成为得力助手,它们必然要走向“永远在线”的常驻模式。
当非玩家角色能够滔滔不绝地与你自由对话,或者任务系统能够自动生成无尽的支线时,这是否意味着我们已经踏入了AI原生游戏的时代?许多开发者将生成式大模型直接塞入游戏,仅仅将其作为剧情的“润色工具”或NPC的“聊天外挂”。然而,真正的革命并非如此简单。
近年来,大模型在长线软件工程任务中的表现令人瞩目。从解决现实世界代码库中的复杂Bug,到执行多步终端工作流。代码智能体似乎正在逐步接管那些曾经专属于人类程序员的繁重工作。然而,决定这些智能体最终表现的,往往不仅仅是底层基础模型(BaseModel)的智力水平。在实际应用中,智能体极大地依赖于其...
大语言模型展现出的惊人能力,正在将人工智能推向全新的阶段。但决定一个是否聪明的因素,仅仅是模型本身的参数规模吗?并非如此。本文的核心观点在于:智能体(Agent)的进化,离不开其所处的环境(Environment)。这就好比自然界中的生物与生态系统。
随着大语言模型技术的演进,能够自主编写代码、浏览网页甚至控制电脑的Agent(智能体)正迎来爆发式增长。然而,当你开发出一个全新的Agent,想知道它到底有多强时,噩梦就开始了。当前,Agent领域的评测正处于一种极度“碎片化”的状态。
当OpenAI的o1模型横空出世,紧接着DeepSeek-R1震撼开源界时。人们敏锐地察觉到,大语言模型不再仅仅是“单句接龙”的文本生成器。它们开始展现出极具深度的长程逻辑推演能力。这种被称为“大模型推理”的核心能力。正成为区分传统聊天机器人与高级人工智能系统的一道巨大分水岭。
在构建复杂的大语言模型系统中,开发者常遭遇一个幽灵般的工程难题。看似相同的系统架构,实际运行时的智能表现却大相径庭。这种差异的根源,往往隐藏在系统与模型交互的上下文结构中。随着多步推理和工具调用的普及,提示词早已不再是静态的文本。它变成了一个随着时间线动态演进、不断累积历史信息的复杂组合体。
腾讯Youtu-LLM重磅发布:1.96B小模型解锁原生Agent能力,128k长文本与11T数据揭秘。
颠覆常识!阿里SkillRouter:Agent选对工具,代码比描述重要44%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
SimpleMem:让Agent记忆成本暴降30倍!F1提升26.4%的“语义无损压缩”新架构。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
GPT-5也排0%分位?ReX-MLE揭秘:顶尖AI智能体为何搞不定医学影像。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
MetaClaw:AI Agent的在职进化论,准确率从21.4%飙升至40.6%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别微调!MemRL:用“记忆RL”让Agent在运行时实现自我进化。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Agent记忆≠RAG!复旦/NUS重磅综述:3大维度全景拆解智能体“大脑”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别AI“健忘症”:Memoria利用加权知识图谱打造可扩展的个性化记忆。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
让Agent自己“进化”大脑?MemEvolve实现17%性能跃升与跨模型泛化。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
超越Gemini!阿里MAI-UI发布:全尺寸GUI Agent与端云协同新范式。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
给大模型配台“电脑”:通用智能涌现,长文本Token消耗暴降8倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
阿里开源ROME:SWE-bench胜率57%,揭秘打造顶尖Agent的“罗马”基建。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Kimi K2.5重磅开源:多模态联合增强,Agent推理提速4.5倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
准确率飙升至91%!Hindsight:让20B模型记忆力超越GPT-4o。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
GoAgent:让AI Agent学会“抱团”,准确率93.8%,Token成本降低17%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别“写死”的工作流:IBM万字综述,定义Agent动态进化新范式。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
给 AI 装上“橡皮擦”:MaRS 架构如何用“遗忘”换取 0.911 的高分表现?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
破解Agent“不可能三角”:EvoRoute实现成本降80%、速度提升3倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI Agent的“金鱼记忆”:EvoClaw揭示其长期编码性能从80%暴跌至38%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
斯坦福Agent新解:3B模型压缩上下文,99%性能仅需26%成本。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI记忆系统的“脑科学”革命:复旦哈工大万字综述,揭秘智能体进化的核心。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
JACM重磅综述:拆解AI Agent三大核心架构与“Agent Transformer”新范式。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Agentic Memory:让LLM像人类一样“自主管理”记忆,长程推理能力暴涨49%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
13所顶尖名校联手:Agentic AI 适配的 4 大核心范式与未来路线图。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
成功率飙升6倍超GPT-4o!DeepMind发布MiRA,用“里程碑”根治AI智能体“迷路”顽疾。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
记忆即算力?阿里ReMe让8B模型超越14B,揭秘动态记忆进化论。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI Agent协作双刃剑:性能提升81%,错误放大17倍!DeepMind发布首个量化法则。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
UI-TARS-2:多轮强化学习炼成!达60%人类水平,AI智能体自主操作电脑。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别炼丹玄学:谷歌用概率统一AI Agent,提出“自由度”新思路。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
数据智能体“高考”来了!字节跳动DAComp揭示:顶级模型成功率不足20%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
PPT炼狱场来了!新Agent PPTPilot精准编辑,性能超越专有模型10%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Agent推理成本降低2.5倍:斯坦福提出“上下文蒸馏”,免训练让小模型偷师大模型。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
千份报告揭示AI研究助手致命弱点:OPPO发布FINDER基准与DEFT分类法。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI Agent上网指南:RAG效率飙升5倍,成本锐减80%,完胜HTML。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
LLM不读万行代码:Prune4Web让网页元素定位精度飙升至88%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
数据生成提速15倍!Meta开源Matrix框架,用P2P架构颠覆多智能体协作。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI记忆革命GAM:用“即时研究”取代静态压缩,长文本任务准确率超90%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI分析师天团来了!字节DataSage引入辩论机制,洞察力飙升13.9%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI Agent训练成本减半!SkyRL-Agent框架揭秘1.55倍加速秘诀。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI Agent只会“挥霍”算力?谷歌BATS框架教它精打细算,成本性能双优化。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
零数据也能自我进化:Agent0让8B模型推理能力暴涨24%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI Agent的第三维度:MiroThinker单任务600次工具调用,性能直逼GPT-5。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Agent智能进化论:阿里港科大万字综述,揭秘GEF三步循环。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI Agent记忆也“幻觉”?HaluMem:首个记忆系统“CT扫描”基准,精准定位错误根源。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
让AI像人一样“吃一堑长一智”:FLEX框架使Agent性能飙升23%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
让Agent经验“活”起来:可训练图记忆,助小模型性能飙升25.8%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文提出 GUI-360,一个用于推进桌面级计算机使用智能体(CUA)的大规模、综合性数据集与基准测试套件,它通过一个由 LLM 增强的高度自动化流程构建,旨在解决真实世界任务稀缺、数据收集标注困难、以及缺乏统一基准的三大挑战。
本文提出了DR. WELL,一个去中心化的神经符号框架,该框架通过结构化的协商协议和动态演化的符号世界模型,使基于大语言模型(LLM)的具身智能体能够高效地进行协作规划、学习与自我优化。
本文识别并解决了多智能体 LLM 推理框架中的“懒惰智能体”问题,通过理论分析揭示其源于现有强化学习目标的内在偏差,并提出了一种名为 Dr. MAMR 的新框架,该框架利用夏普利启发的因果影响测量和一种可验证的深思熟虑(deliberation)奖励机制,以促进智能体之间更均衡、更有效的协作。
智能体间信任模型:Brief、Claim、Proof、Stake、Reputation 和 Constraint 在智能体网络协议设计中的比较研究。
近期,能够自主交流、与人类协作并使用多种工具的AI智能体 (agents) 的兴起,为各种真实世界场景解锁了巨大的机遇。然而,尽管这些基于大型语言模型 (LLM) 的智能体在自然语言理解和问题解决方面取得了显著进展,它们大多仍局限于具有预定义数据和结构化任务的受控环境中。
本文提出了一种名为 Tree Training 的新训练范式,通过将智能体交互产生的树状轨迹数据进行高效打包和计算复用,在训练的前向和后向传播中对共享的前缀(prefix)只计算一次,从而显著提升了智能体大语言模型(Agentic LLM)的训练效率。
本文提出了一种名为 SlideAgent 的分层智能体框架,通过设置全局、页面、元素三个级别的专业智能体,将复杂的多页视觉文档理解任务分解,先构建独立于查询的结构化知识库,再进行针对性推理,从而显著提升了大型语言模型在处理幻灯片等文档时的细粒度理解和推理能力。
本文提出了一种名为DAM-LLM的动态情感记忆管理系统,通过引入基于贝叶斯的更新机制和记忆熵概念,使智能体能够自主维护一个动态更新的记忆数据库,以解决传统静态记忆的冗余、过时和一致性差的问题,从而提供更具个性化的情感交互。
本文提出了一种名为 E-GRPO 的新方法,通过重利用合成数据生成过程中被忽略的实体信息,构建了一个细粒度的实体感知奖励函数,以解决传统强化学习方法中的奖励稀疏和“功亏一篑”(near-miss)问题,从而更有效地训练搜索智能体。
本文提出了一种名为 ParallelMuse 的两阶段智能体并行思维框架,通过“功能指定的局部展开”策略和“压缩推理聚合”方法,在提升深度信息寻求 (deep information-seeking) 任务效果的同时,显著降低了探索所需的Token成本。
本文提出了 AgentFrontier,一个基于教育心理学“最近发展区”(ZPD)理论的数据合成框架,通过自动生成位于大语言模型(LLM)能力边界上的复杂推理数据,从而系统性地提升智能体(Agent)的跨领域、综合推理能力。
本文提出了一种名为 AgentFold 的新型网页智能体,它通过模仿人类主动管理心智暂存区的方式,在执行长时程任务时对上下文进行主动“折叠”和整合,从而在保持上下文简洁性的同时避免关键信息丢失,并以较小的模型规模实现了顶尖的性能。
本文提出一个名为FM Agent的通用多智能体框架,该框架创新性地结合了大型语言模型(LLM)的推理能力和大规模进化搜索,以自动化方式在运筹优化、机器学习、GPU内核优化和数学问题等多个领域解决复杂的现实世界挑战,并取得了最先进(SOTA)的成果。
本文提出了一种名为 AsyncThink 的新推理范式,它允许大型语言模型通过一种“组织者-工作者”协议,将复杂的思考过程分解为可并发执行的子任务,并通过强化学习自主学会如何优化这种异步协同结构,从而在降低推理延迟的同时提升了解决问题的准确性。
本文提出了一种专为金融科技(Fintech)领域设计的智能体化检索增强生成(Agentic Retrieval-Augmented Generation, A-RAG)架构,通过一个由专业智能体组成的模块化、迭代式流水线,有效解决了领域内术语密集、缩写混杂和知识碎片化等挑战,显著提升了检索精度...
本文对智能体AI(Agentic AI)领域进行了全面的综述,提出了一个核心的分析框架以解决现有文献中的概念混乱。作者认为,当前的智能体AI系统并非单一演化的产物,而是源于两个截然不同但有时会交汇的谱系:符号/经典谱系(Symbolic/Classical lineage)和神经/生成谱系(N...
本文是一篇以应用为导向的综述,系统性地分析了检索增强生成(RAG)、推理增强以及智能体(Agentic Systems)系统如何通过提升模型能力来缓解大型语言模型(LLM)中的知识型和逻辑型幻觉。
本文提出了一种名为“智能体元编排器” (Agentic Meta-Orchestrator, AMO) 的新架构,用于构建可扩展的多任务Copilot服务,该架构通过学习排序模型进行智能体路由,利用LoRA臂实现高效多任务推理,并通过元学习决策树来动态规划推理路径。
本文提出了一种名为智能体数据协议 (Agent Data Protocol, ADP) 的轻量级表示语言,它通过将来自不同来源、格式各异的智能体训练数据统一为标准模式,解决了数据碎片化问题,从而实现了对大型语言模型智能体进行大规模、多样化且高效的监督式微调。
本文提出了一种名为“多智能体进化 (Multi-Agent Evolve, MAE)”的框架,通过让单个大语言模型扮演提问者 (Proposer)、解答者 (Solver) 和裁判 (Judge) 三个协同进化的角色,利用强化学习在无需人工标注数据的情况下实现通用推理能力的自我提升。
本文提出了一种名为 BrowseConf 的测试时扩展 (Test-Time Scaling, TTS) 方法,它通过利用大语言模型智能体对其回答的“口头表述置信度” (Verbalized Confidence),来动态决定是否需要进行额外的计算尝试,从而在保证任务性能的同时,显著提升了网络...
本文通过将智能体(Agent)的内存架构与乔姆斯基层级(Chomsky hierarchy)中的抽象机进行类比,建立了一套形式化等价框架,指出智能体的计算能力和可验证性由其内存类型(无内存、堆栈、无限读写内存)决定,从而为设计更高效、更安全的智能体系统提供了理论基础和工程指导。
本文提出了Alita-G,一个自进化生成智能体框架,它通过系统性地生成、抽象和管理一系列称为模型上下文协议(Model Context Protocol, MCP)的工具,将一个通用智能体转化为特定领域的专家,从而在提升复杂推理任务准确率的同时降低了计算成本。
随着大型语言模型 (Large Language Models, LLMs) 的兴起,一种新的范式——数据智能体 (Data Agents)——应运而生。数据智能体被定义为一个综合性的、由LLM驱动的架构,它能自主协调数据与AI生态系统,以处理复杂的数据相关任务。
现有用于评估智能体的基准测试主要沿着两个维度发展:搜索宽度与搜索深度。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文提出DeepAgent,一个通用的端到端深度推理智能体(Agent),它将思考、动态工具发现和动作执行统一在单个连贯的推理流中,并通过自主记忆折叠机制和专门的强化学习方法ToolPO,使其能够高效利用规模可变的工具集解决复杂真实世界任务。
本文提出了一种名为 Mixture-of-Minds (MoM) 的多智能体框架,它将表格理解任务分解为规划、编码和回答三个专门的角色,并引入一个基于蒙特卡洛树搜索(MCTS)和强化学习(RL)的自提升训练框架,从而显著提升了模型的表格推理能力。
本文提出了一种名为 VideoAgentTrek 的可扩展方法,通过一个逆动力学模块(VADM)从未经标注的公开屏幕录制视频中自动挖掘出结构化的训练数据,从而解决了训练计算机使用智能体(Agent)时对大规模手动标注数据的依赖问题。
本文提出了一个名为 TheMCPCompany 的大规模工具调用基准(包含超18000个工具),并通过实验证明,利用专门的工具集比通用浏览器能带来更好的性能和更低的成本,但从海量工具中检索并组合正确工具以解决复杂问题仍是当前智能体面临的核心挑战。
好的,我已判断这是一篇 [综述] 论文。我将严格遵循综述报告的模板,以原文结构为基础,重点剖析其提出的分类体系,并提炼核心内容。
本文对基于网络交互的智能体系统效率瓶颈进行了实证研究,并提出一个名为 SpecCache 的缓存框架,该框架利用推测性执行(speculative execution)来重叠模型推理与网络环境交互,从而在不降低任务性能的前提下,显著减少系统延迟。
本文提出了一种名为 SPA (Self Play Agent) 的智能体强化学习框架,它通过自我博弈(Self-Play)有监督微调(SFT),让大语言模型智能体在策略优化前先内化一个世界模型(World Model),从而显著提升其在分布外(OOD)环境中的学习性能和泛化能力。
近年来,AI领域的发展由生成式AI主导,但其本质上仍是被动响应。为了超越被动生成,实现自主行动,研究焦点正转向智能体AI (Agentic AI),它强调自指导行为、复杂推理和环境交互。智能体AI被广泛视为AI系统演化的下一阶段。
本文提出并探讨了“智能体不平等”(agentic inequality)这一新概念,即因AI智能体的接入和能力差异而导致的权力、机会与结果上的不平等,并构建了一个包含可用性、质量和数量三个维度的分析框架,以系统性地分析和应对这一挑战。
本文提出了 ROLL Flash,一个通过引入异步机制来解耦 rollout 和训练阶段的系统,从而显著提升了强化学习后训练(RL Post-Training)的吞吐量和资源可扩展性,同时通过精细化的陈旧度控制确保了模型的最终性能。
本文提出了一种名为 LLM×MapReduce-V3 的分层模块化智能体系统,该系统通过模型-上下文-协议 (MCP) 驱动的动态规划,实现了交互式、可定制的深度综述论文生成。
本文提出一个信息论框架来分析和构建用于科学发现的自主智能体(Autonomous Agents),通过对信息熵、可验证性和耗散的分析,建立了一套信息流转的分类体系,并在此基础上提出了一个衡量智能体自主能力的五级模型。
关于Agentic多模态大语言模型的综述。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
好的,我将遵循您的指示,撰写一份关于该论文的报告。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文提出了一种名为 的多智能体强化学习框架,该框架通过训练一个对话智能体和一个反馈智能体进行协作,将安全对齐问题转化为一个正和博弈,从而同时减少大型语言模型(LLM)的不安全响应和过度拒绝现象,提升了模型在有益性(helpfulness)和无害性(harmlessness)之间的帕累托前沿。
本文提出了 QAgent,一个统一的智能体 RAG 框架,它通过一个采用两阶段强化学习策略训练的模块化搜索智能体,进行交互式查询理解和自适应检索,从而提高了对复杂问题的检索质量和作为可插拔模块的泛化能力。
本文提出了MUSE,一个经验驱动的自进化智能体 (Agent) 框架,通过一个分层的记忆模块和“计划-执行-反思-记忆”的闭环系统,使智能体能够在执行长时程任务中持续学习、积累经验并实现自我进化。
本文通过实验揭示了一类流行的元智能体(meta-agent)在自动化智能体设计中存在的三个核心问题:学习效率低下、生成的智能体多样性不足以及经济可行性有限,并发现进化式上下文策展策略可以有效提升性能。
本文提出了DeepMiner框架,通过构造高难度训练任务和设计动态上下文窗口策略,显著提升了大型语言模型在多轮长程交互中作为深度搜索智能体的推理与执行能力。
本文提出了一个无需训练的有状态多智能体进化搜索框架,通过结合持久化推理时状态、对抗性变异和进化式搜索,提升单元测试中边缘案例的生成能力和代码覆盖率。
本文提出并形式化了“智能体强化学习(Agentic Reinforcement Learning, Agentic RL)”这一新兴范式,将其定义为将大语言模型(LLM)从被动的序列生成器转变为在复杂动态环境中进行自主决策的智能体,并通过一个围绕智能体核心能力(规划、工具使用、记忆、推理等)的...
本文提出了一种名为“阶梯式流式传输 (Staircase Streaming)”的方法,通过让多智能体系统中的后续智能体(如聚合器)在接收到前序智能体(如提议者)的部分输出块(chunks)后便开始生成,而非等待其完整输出,从而将序贯依赖转变为流水线并行处理,显著降低了多智能体推理的首Toke...
本文提出了一种名为 MARS 的双系统多智能体强化学习框架,该框架通过模拟人类认知的双系统(系统1的快速直觉与系统2的审慎推理),让两个智能体协同解决需要外部知识的复杂推理任务,显著提升了模型在动态信息环境下的深度研究和推理能力。
本文通过将多轮智能体强化学习(multi-turn agentic reinforcement learning)的设计空间分解为环境、奖励和策略三大支柱,系统性地进行了实证研究,并最终提炼出一套用于训练大型语言模型(LLM)智能体的实用方法配方。
本文介绍了一个名为 TOUCAN 的大规模工具智能体数据集,包含 150 万条从近 500 个真实世界 MCP 环境中合成的轨迹,旨在通过提供多样、真实且复杂的训练数据,显著提升开源大型语言模型(LLM)的工具调用和智能体能力。
本文介绍了一个名为GEM(General Experience Maker)的开源环境模拟器,它旨在像传统强化学习领域的OpenAI-Gym一样,为智能体大语言模型(Agentic LLMs)提供一个标准化的训练与评估框架,从而推动研究从静态数据集学习转向基于环境交互的经验学习。
本文提出了“上下文工程” (Context Engineering) 的概念,主张将 AI 智能体开发的重点从编写静态提示词(prompt)转向动态地策划和管理输入给模型的全部信息(即上下文),从而在模型有限的注意力预算下,实现更可靠、更高效的智能体行为。
本文提出了一种名为 Tree-GRPO (Tree-based Group Relative Policy Optimization) 的方法,通过将传统强化学习中独立的链式轨迹采样替换为树搜索采样,从而在有限的 rollout 预算下为多轮智能体任务生成更多、更高质量的轨迹,并利用树结构从稀...
本文提出了一种新颖的方法,通过将复杂的多轮任务规划问题转化为一系列单轮任务推理问题,并利用基于专家轨迹的单轮强化学习(GRPO)进行优化,成功训练出在长时程规划任务中性能超越大型基线模型的小参数量智能体。
本文提出了一种名为在线过程奖励学习 (Online Process Reward Learning, OPRL) 的智能体强化学习信誉分配策略,该策略通过在线交替优化一个过程奖励模型和智能体策略,将轨迹级别的偏好无缝转化为密集的步骤级奖励,从而在不依赖额外数据或步骤标签的情况下,高效稳定地训练...
本文提出了MAPEX,一个用于关键词提取的多智能体协作框架,它通过为不同长度的文档设计动态的双路径策略(知识驱动与主题引导),显著提升了大型语言模型(LLM)在零样本场景下的关键词提取性能。
本文提出一种名为结构化反思 (structured reflection) 的新机制,将工具调用失败后的错误诊断与修复过程,转化为一种可控、可训练的智能体行为,从而显著增强大型语言模型在多轮工具交互中的可靠性和错误恢复能力。
本文提出了一种名为 AgentInit 的多智能体系统(Multi-Agent System, MAS)初始化方法,该方法通过生成一组多样化的候选智能体,并利用以任务相关性和团队多样性为目标的帕累托最优原则进行团队选择,来优化智能体团队的构成,从而提升协作效率与任务表现。
本文提出了一种名为“回合级评审强化学习” (Turn-level Adjudicated Reinforcement Learning, TARL) 的流程监督方法,该方法利用大型语言模型 (LLM) 作为裁判提供细粒度的回合级奖励,并结合混合任务训练策略,以解决长程交互中的信用分配和探索不足...
时间序列数据在金融、医疗、能源等领域无处不在,推动了监控、预测和决策等关键应用的发展。然而,许多新兴应用如个性化医疗、自适应风险管理等,要求模型不仅能预测,还能解释其输出、进行因果推理和决策。这突显了时间序列分析对结构化和可靠推理能力的迫切需求。
随着自主人工智能(AI)智能体的迅速普及,一个全新的经济层面正在崛起。在这个层面中,智能体以超越人类直接监督的规模和速度进行交易与协作。本文提出了“沙盒经济”(sandbox economy)这一框架来分析这个新兴系统,并从两个关键维度对其进行刻画:其起源(自发涌现 vs. 有意设计)以及其与...
本文提出了 DeepDive 方法,通过从知识图谱自动合成高难度问题,并采用端到端多轮强化学习进行训练,旨在提升大型语言模型(LLM)作为深度搜索智能体所需的长时序推理和信息检索能力。
本文提出了一种名为“规划-执行” (Plan-then-Execute, P-t-E) 的弹性LLM智能体架构指南,该架构通过解耦战略规划与战术执行来建立控制流完整性,从而天然地抵御间接提示注入攻击,并为在LangChain、CrewAI和AutoGen等主流框架中实现该架构提供了详细的安全蓝图。
本文提出了一个名为 AgentGym-RL 的强化学习框架和一个名为 ScalingInter-RL 的渐进式训练方法,旨在通过多轮交互式决策,从零开始(无需监督微调)训练大型语言模型(LLM)智能体,以解决长时程复杂任务。
本文提出了一种名为熵调制策略梯度 (Entropy-Modulated Policy Gradients, EMPG) 的框架,通过利用智能体在长时程任务中每一步的内在不确定性(熵)来动态调整策略梯度,从而有效解决了稀疏奖励下的信用分配难题,显著提升了大型语言模型(LLM)智能体的学习效率和最...
本文提出了一种名为 SFR-DeepResearch 的方法,其核心是使用一套完全由合成数据驱动的强化学习(RL)方法,在保留并增强其原有推理能力的基础上,将专为推理优化的语言模型(如 QwQ, Qwen3)转化为用于深度研究(Deep Research)任务的自主单智能体。
本文介绍了BFS-Prover-V2,一个通过创新的训练与推理扩展技术来提升大型语言模型(LLM)定理证明能力的系统,它结合了克服性能瓶颈的多阶段强化学习框架和用于分层推理的规划器增强型多智能体搜索架构,从而在多个数学基准测试中取得了当前最优性能。
本文证明,通过强化学习(RL)对一个较小的语言模型(如 Qwen2.5-3B)进行梯度更新,可以在机器学习工程(MLE)任务中超越比它大得多的静态模型(如 Claude-3.5-Sonnet),其核心贡献是提出了两种关键技术来克服RL在智能体(Agent)设置中的挑战:时长感知梯度更新(dur...
本文提出了 Paper2Agent,一个自动化框架,它能将研究论文及其代码库转化为交互式、可靠的AI智能体,让用户能通过自然语言使用论文中的方法,从而加速科学知识的传播和应用。
本文提出动态推测规划 (Dynamic Speculative Planning, DSP),一个通过在线强化学习自适应调整推测步骤(speculation step)的智能体规划框架,旨在实现无损加速的同时显著降低成本,并允许用户控制延迟与成本之间的权衡。
结构化智能体软件工程(SASE):基本支柱与研究路线图。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文指出,未来的数据系统将主要服务于由大型语言模型(LLM)驱动的智能体,并提出了一种“智能体优先”(agent-first)的数据系统新架构,以高效处理智能体工作负载中普遍存在的高吞吐量、异构、冗余和可引导的“智能体推测”(agentic speculation)过程。
本文提出了一种名为 CODA 的可训练组合式智能体框架,它模仿人脑的大脑与小脑功能分离机制,通过解耦的强化学习和两阶段训练流程,协同一个通用规划器(大脑)和一个专用执行器(小脑),以有效解决科学计算等专业领域中长时序规划与精确GUI操作的挑战。
本文提出了一个名为 Re⁴ 的科学计算智能体 (Agent) 框架,它通过“重写-解决-审查-修订” (Rewriting-Resolution-Review-Revision) 的逻辑链,利用多个大型语言模型 (LLM) 协同工作,显著提升了根据自然语言描述自主生成代码的可靠性和准确性。
本文提出了一种两阶段训练方法(监督微调+强化学习),使大型语言模型(LLM)智能体能够学习在序贯决策任务中动态地决定何时进行规划,从而以更高效的计算成本实现更优的性能和更强的可控性。
本文提出了 VerlTool,一个统一、模块化且高效的框架,旨在解决智能体强化学习与工具使用 (Agentic Reinforcement Learning with Tool use, ARLT) 领域的系统碎片化、执行效率低下和扩展性差等核心问题。
本文提出了Memory-R1框架,通过强化学习(RL)训练两个专门的智能体——一个用于结构化记忆操作的内存管理器和一个用于筛选并推理记忆的回答智能体,从而使大型语言模型(LLM)能够主动、自适应地管理和利用外部记忆,显著提升了其长时程推理能力。
本文提出了一种名为 Voyager 的具身智能体,它首次利用大型语言模型(LLM)实现了在《我的世界》(Minecraft) 开放世界中的无干预终身学习,通过自动课程、可不断增长的技能库和迭代提示机制,持续探索、获取技能并做出新发现。
The Rise and Potential of Large Language Model Based Agents: A Survey。
本文提出 Reflexion 框架,通过让语言智能体对过去的试错经验进行口头反思(verbal reflection)并形成文本记忆,从而在无需更新模型权重的情况下实现强化学习,显著提升了其在决策、推理和编程等任务上的表现。
LLM Agent全面爆发:人大重磅综述,一套统一架构读懂通往AGI的未来。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。