最新发布
VaG:化解自进化Agent技能污染,腾讯以5倍更小技能池达72%成功率
给大模型赋予“自我进化”(Self-Evolution)的能力,是构建真正长生命周期自主Agent的核心愿景之一。目前主流的设计模式非常直观:让智能体在执行任务后复盘自身轨迹,将解决问题的有效经验提炼成一条条自然语言技能(Skills),写入持久化的技能库中;当下一次遇到新任务时,这些技能会被动态检索或全部注。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
给大模型赋予“自我进化”(Self-Evolution)的能力,是构建真正长生命周期自主Agent的核心愿景之一。目前主流的设计模式非常直观:让智能体在执行任务后复盘自身轨迹,将解决问题的有效经验提炼成一条条自然语言技能(Skills),写入持久化的技能库中;当下一次遇到新任务时,这些技能会被动态检索或全部注。
PAPER INSIGHTS
前沿大语言模型已经能够在单次前向传播中解决极其复杂的推理问题,其表现足以媲美数年前的独立学术成果。然而,一旦将同一个模型置入智能体(Agent)循环中,要求它独立处理耗时数小时的软件工程或数据分析任务,系统往往会暴露出...
评估代码智能体(CodingAgent)的能力正在陷入一种尴尬的困境:榜单上的分数越来越高,但在真实工程环境里写起代码来依然漏洞百出。这种落差背后的核心症结在于两点。
在推理期通过多轮迭代、引入环境反馈来自我进化,是近期大语言模型(LLM)实现能力跃升的重要路径。从FunSearch到AlphaEvolve,基于进化算法的代码探索已经能够解决许多复杂的数学与系统优化问题。
在以大语言模型为核心的智能体(LLMAgent)体系中,模型正迅速从纯粹的文本生成器演进为能够自主推理、规划并反复调用外部环境工具的计算中枢。为了保障执行安全与环境隔离,以Anthropic提出的ModelContex...
在图形用户界面(GUI)中执行长流程任务的计算机操作智能体(Computer-UseAgents,CUA),正在成为大模型走向通用落地的关键路径。然而,在这个充满未知动作与动态界面的领域中,强化学习(RL)长期受困于一...
现代神经科学正在被海量、异构且跨尺度的实验数据所重塑。研究人员不仅能记录自由活动动物的精细动作姿态,还能同步追踪全脑数十万神经元的动态钙信号、解析突触级连接组,甚至测定单细胞空间转录组。然而,数据爆炸并没有等比例带来科...
在大模型迈向“深度研究”(DeepResearch)与复杂自主搜索的浪潮中,长程搜索智能体(Long-HorizonSearchAgent)成了前沿应用的核心。
当视频生成的分辨率迈向720p、1080p,生成时长从数秒拉长到数十秒甚至一分钟时,扩散模型底层的计算范式正撞上一堵难以逾越的显存与算力墙。目前开源和闭源的主流视频扩散Transformer(VideoDiT),大多重...
在以大语言模型为核心的智能体(LLMAgent)开发中,持久化层(PersistenceLayer)往往被视作系统工程的基石。无论是人类在回路(Human-in-the-loop)中的审批等待,还是服务器遭遇故障预检、...
在自动驾驶的研究版图中,强化学习(RL)特别是基于多智能体自博弈(Self-play)的方法,一直被视为打破传统离线人类驾驶模仿学习天花板的一把利剑。离线模仿学习极度依赖昂贵的实车采集数据,并且天然受困于协变量偏移(C...
医疗大模型正在经历一场从“做题家”到“执行者”的剧烈转折。在过去两三年里,评估一个医学大模型的水平,主流方法几乎都是给它一张考卷:从美国医师执照考试(USMLE)到各科临床单项选择题,只要模型在问答基准上刷出高分,往往...
赋予大语言模型(LLM)长久记忆,曾被视为智能体(Agent)迈向自主工作的关键一步。从项目代码、用户日常偏好到复杂的跨系统业务流程,记忆模块让智能体告别了“单次对话清零”的局限。
在多轮交互与工具调用的复杂任务中,大语言模型(LLM)Agent经常陷入一种令人沮丧的怪圈:在当前轮次或单次重试中,Agent明明通过反思纠正了错误;但只要开启新任务,面对极其相似的场景,它依然会重蹈覆辙。
在大模型落地实际任务的过程中,如何赋予模型稳定的“专业技能”,始终面临着一个两难困境。最符合人类直觉的方式是将操作流程写成提示词(TextSkill),这种做法灵活、易读且即插即用,但模型在实际推理时往往难以稳定遵循复...
大模型智能体(Agent)一旦部署到复杂的现实或模拟环境中,往往会暴露出各种意料之外的系统性缺陷:工具调用参数写错、环境状态追踪丢失、陷入无效死循环,或者在遭遇异常后彻底无法恢复。
长期以来,人工智能领域对“递归自提升”(RecursiveSelf-Improvement,RSI)的讨论往往停留在理论推演或科幻设想中。如果一个智能系统能够自主改进制造下一代AI的过程,智能的爆发式增长就会成为可能。
绝大多数大语言模型Agent的评估基准,在设计逻辑上都有一个隐形假设:每个任务都是孤立发生的。Agent面对一个任务,调动工具、推理规划、输出结果,随后环境刷新,上下文清空,一切归零。但现实世界中的专业工作流绝非如此。
自AlexNet掀起现代深度学习的浪潮以来,AI领域建立了一条近乎公理的演进路径:端到端(end-to-end)训练总能击败手工切分的分阶段流水线。从早期的图像分类、物体检测,到语义分割与端到端语音识别,凡是允许模型直...
在面向大语言模型(LLM)的智能体强化学习(AgenticRL)研究中,环境交互一直是一道难以逾越的高墙。要让模型学会在复杂的现实任务中连续调用工具、处理报错并达成目标,通常需要让它在成千上万次交互中碰壁摸索。
在AI驱动的软件工程领域,代码智能体(CodeAgent)的上下文工程(ContextEngineering)正经历一场剧烈的范式转移。为了解决海量仓库代码撑爆模型上下文、引发所谓“上下文腐化”(ContextRot或...
在大语言模型被推向各类专业运维场景的浪潮中,数据库管理员(DBA)往往被视作最适合被AI替代或赋能的岗位之一。近年来,学术界和工业界接连涌现出如D-Bot、DBAIOps、DBAgent等一系列基于大模型的数据库运维智...