腾讯提出Oracle-OPD:斩断多轮历史诱偏,小模型工具准确率达87%
为了攻克这一隐蔽而普遍的系统性缺陷,该团队推出了成对诊断基准 ContextPollute-Bench ,并提出了基于可靠状态特权知识迁移的在线策略蒸馏方法 Oracle-OPD (Oracle-guided On-Policy Distillation)。
为了攻克这一隐蔽而普遍的系统性缺陷,该团队推出了成对诊断基准 ContextPollute-Bench ,并提出了基于可靠状态特权知识迁移的在线策略蒸馏方法 Oracle-OPD (Oracle-guided On-Policy Distillation)。
针对这一本质瓶颈,研究团队提出了名为 VaG (Verifier-as-Gatekeeper)的预提交门控机制。该框架通过三层异构判别器与边际增益贪心选择,把技能入库变成一道极其严苛的晋升流程。
在强化学习与智能体(Agent)研究领域,构建高质量、多样化且可交互的真实环境一直是最沉重的工程包袱。无论是经典的机器人仿真,还是如今风头正劲的代码编写与企业运维智能体,训练环境往往都是工程师手动用代码“硬抠”出来的,或者围绕某些固定基准测试集特异性拼装而成。
在大模型技术从单纯的“聊天对话”向具备自主行动能力的“智能体(Agent)”演进的过程中,系统所面临的安全边界正在发生根本性的位移。当Agent获得了读取本地文件系统、执行Shell脚本、调用外部API以及加载第三方技能(Skills/Tools)的权限时,传统的提示词安全和输出内容审核立刻显...
在处理长程、多轮的复杂智能体(Agent)任务时,大语言模型常常陷入一种两难困境:如果将每一次工具交互、网页浏览和中间思考都完整保留在提示词中,上下文长度会以惊人的速度膨胀。
在大语言模型被赋予工具调用、代码执行和环境反馈能力之后,基于可验证奖励的强化学习(RLVR,ReinforcementLearningwithVerifiableReward)已经成为训练代码Agent(CodingAgent)的核心范式。
大模型编程智能体(CodingAgent)正在经历从“单次工具调用”向“自演化系统”的重要跃迁。像Voyager、MetaGPT等经典框架,以及兼容ModelContextProtocol(MCP)等工具生态的现代Agent,不再仅依赖预设的静态工具箱;它们能够在解决软件工程任务的过程中,将自...
在复杂的信息检索与深度推理任务中,基于大语言模型(LLM)构建的深度搜索智能体(DeepResearchAgents)正在展现出惊人的自主规划能力。然而,许多工程师和研究人员在实测中都会遭遇一个令人沮丧的现象:当智能体一旦拟定了一个稍微偏离正轨的搜索关键词,或者在早期生成了某个并不严谨的子计划...
当开发者把一个具有广泛权限的系统凭据(Credential)交给自主运行的大语言模型Agent时,一个根本性的安全隐患就此埋下:Agent继承了人类在系统里的访问触达范围,却没有继承人类在具体场景中运用权限的审慎判断。
在肺癌精准医疗的实际诊疗中,病理评估早已超越单纯的“看切片定良恶性”。临床医生制定靶向治疗、免疫治疗或抗体偶联药物(ADC)方案,必须依赖组织形态学(H&E)、免疫组织化学(IHC)多标志物以及分子变异数据的深度整合。
要让大语言模型(LLM)从只会单轮对话的聊天机器人,蜕变为能长期伴随用户的智能体,外部记忆系统不可或缺。然而,当前主流智能体记忆系统的运行逻辑存在一个隐形却极其昂贵的代价:每产生一轮对话,系统就急于调用一次LLM去抽取实体、总结事实并更新记忆库。
在多轮交互任务中训练大语言模型(LLM)智能体,强化学习(RL)正在成为不可替代的核心范式。从DeepSeek-R1走红以来,组相对策略优化(GroupRelativePolicyOptimization,简称GRPO)凭借其“不需要训练昂贵Critic价值网络、直接在同题采样的候选组内对比结...
长期以来,让人工智能代理(LLMAgent)像人类研究员一样自主开展科学探索与机器学习研究,一直是自主系统领域极具野心的目标。然而,当科研任务的跨度从几十分钟的单次代码生成,拉长到数小时乃至数天的连续实验时,现有的自动科研代理(AutoresearchAgents)往往会迅速陷入瓶颈。
大语言模型(LLM)驱动的搜索智能体(SearchAgent)正从简单的单轮关键词检索,演进为需要多轮规划、长程探索与交叉验证的深度推理系统。然而,训练一个真正可用的长程搜索智能体始终面临结构性困难:现实中极度缺乏高质量、长周期的搜索与研究任务数据,人工标注完整轨迹成本高昂,且模型在多步工具调...
在构建自主智能体(AutonomousAgent)时,业界几乎默认遵循一种“对话式上下文累积”的运行范式:智能体每执行一步,就把环境观察、思考链(CoT)、工具调用参数和执行返回值,线性追加到上下文末尾。只要执行步骤变长,Prompt就会像滚雪球一样迅速膨胀。
在具身智能、机器人规划和多模态助手的技术演进中,空间智能(SpatialIntelligence)正被视为大模型迈向物理世界的核心基石。然而,即便是当前顶尖的视觉语言模型(VLM),在面对三维空间关系推理、遮挡判断、坐标定位和深度估计时,依然暴露出明显的脆弱性。
长期以来,在利用大语言模型(LLM)优化系统提示词(Prompt)、演进复杂算法代码或微调机器学习(ML)训练流程时,学术界和工业界普遍采用同一种范式:外挂一套显式的数学优化或搜索算法。
在大模型推理成本高居不下的背景下,模型路由(LLMRouting)被普遍视为最直接的降本增效利器。它的逻辑非常直观:遇到简单问题交给廉价的小模型,遇到复杂推理才激活昂贵的大模型。
大语言模型(LLM)正迅速从“单轮对话的文本生成器”迈向“多轮自主行动的智能体(Agent)”。在浏览网页(WebArena)、操控操作系统(OSWorld)或执行复杂代码任务时,模型需要不断输出动作指令、调用工具或系统API,并在等待外部环境反馈后将新的观察结果追加进历史上下文,开启下一轮推理。
在大模型驱动的智能体(LLMAgent)落地过程中,工程团队经常面临一种让人哭笑不得的窘境:同一个任务,测试时明明能跑通一次,甚至能给出近乎完美的工具调用序列;但换一个轮次、换一个测试用例,或者稍微多跑几次,智能体就会莫名其妙地“翻车”。
CLAUDE.md:研究团队据此提出了 提示词注释 (Prompt Comments)机制:在维护系统规则时,以特定符号(如 Python 风格的 # 或 Markdown 隐藏语法)为指令附带结构化的潜在推理元数据。
大语言模型在软件工程领域的应用,正在经历一场从“单轮代码片段生成”向“长程(Long-Horizon)自主智能体”的范式转移。面对真实代码仓库中盘根错节的依赖、长达数十甚至上百步的探索轨迹,智能体脚手架(AgentHarness)的角色已经从最初薄薄的一层API封装,蜕变成为决定整个系统上限的...
大语言模型在智能体(Agent)方向的进化一日千里,但一个令许多开发者感到挫败的现象依然存在:在某个框架或基准测试中表现卓越的“高分智能体”,一旦被放入全新的工具生态、面对跨系统的长周期任务,或是遇到难以预测的用户追问时,往往会迅速崩溃。
移动端GUI(图形用户界面)智能体正处于一个关键的演进节点。多模态基础模型的出现,使得智能体可以直接通过屏幕像素感知和触摸动作来操作智能手机。这种通用的交互范式使其能够跨越繁杂的应用边界,直接执行复杂长程任务。