最新发布
2026年08月16日
告别纯反应式VLA:全面解析机器人世界模型进化密码
当前具身智能与机器人学习正经历一场深度的范式革命。以往大放异彩的视觉-语言-动作模型(Vision-Language-Action,VLA)正逐渐暴露出其在物理世界中的局限性。以直接将多模态观察映射为底层动作为核心,这些模型本质上仍是...
具身智能与机器人 推理与强化学习
2026年08月16日
大模型Agent的“缰绳”:4大标准重新定义Agent Harness与6大系统横测
当一个智能体在执行代码任务失败时,却一本正经地向用户报告“任务已成功完成”,你的第一反应是什么?许多开发者的直觉是去修改提示词。然而,当大语言模型被逼到死角时,往往会倾向于生成看似满足要求的虚假答案。单纯通过提示词“礼貌地”要求模型不...
AI Agent AI安全与评测
2026年08月16日
微软提出WebXSkill:赋予网页Agent“双模”技能,成功率最高涨12.9%
当前,由大语言模型(LargeLanguageModels,LLMs)驱动的自主网页智能体正试图接管复杂的浏览器工作流。但它们常常因为无法留存和复用交互知识,被迫在每次遇到熟悉任务时从零开始推理,导致极高的错误率。
AI Agent
2026年08月16日
WebShaper:集合论重构数据合成,打造最强开源搜索Agent
OpenAI的DeepResearch近期引爆了全网,展现了惊人的信息搜索(Information-Seeking,IS)能力。这类Agent系统能自主查阅海量资料,被视为迈向AGI的关键一步。然而,开源社区想要复现这类惊艳的系统,却...
AI Agent 基础模型与理论
2026年08月16日
告别盲目堆料:全景解析大模型训练效率的“数据-内存-算力”协同法则
在当今的大模型研发中,算力焦虑几乎笼罩着每一个技术团队。当我们将目光聚焦于动辄千亿参数的模型时,往往会陷入一个误区:单纯地增加GPU数量就能解决一切问题。然而,真实的工程痛点远比这复杂。
模型训练与优化
2026年08月16日
手机操作不再断片!UI-Copilot凭副驾驶机制实现GUI任务17.1%性能跃升
当用户要求手机上的智能助手“帮我核对上个月的账单,计算出餐饮开销占比并填入新的备忘录”时,大多数现有的AI助手在点击了几次屏幕后,往往会陷入迷茫。它们要么忘了最初要找什么,要么算错了数据,甚至一直在同一个页面里无意义地来回滑动。
AI Agent RAG与知识系统
2026年08月16日
TTHE:无需微调与标签,测试时脚手架演化让Agent准确率暴涨38%
当一个部署在生产环境中的数据分析Agent连续三次生成了逻辑完美的SQL语句,却仅仅因为数据库表名的大小写不匹配而屡屡报错时,它该如何自救?在绝大多数现有的工程架构中,它只能反复撞墙,因为控制它如何调用工具、如何拦截异常的“工作流程序...
AI Agent
2026年08月16日
AI进军真实物理科研:端到端复现111篇论文,揪出42%潜在错误
机器智能不仅能写代码,现在已经开始自主做物理实验了。它们甚至向顶级学术期刊的既定结论“开炮”了。该研究展示了一个由大语言模型驱动的智能体。它不再仅仅是“读”论文,而是真正去“跑”计算物理的复杂仿真。在测试中,它自主复现了111篇计算物...
AI Agent
-
打破“专机专用”魔咒:基础大模型重塑通用机器人的核心机制与局限
长期以来,人工智能在物理世界面临着一个尴尬的困境:机器人在工厂里极其精准,但只要光线微调或零件偏移,它们就会立刻宕机。这种“专机专用”的模式,要求开发者为每一个特定任务收集数据、定制算法并在受限环境中部署。然而,自然语言处理和计算机视觉领域的基础大模型,却展现出了惊人的开放世界泛化能力。
-
告别“幻觉”:涵盖18种工具的Tool Learning通用框架全解析
大语言模型虽然拥有惊人的语义理解能力,但始终受制于静态的预训练数据。当面对实时信息检索、复杂数学计算或特定领域操作时,纯参数模型往往会产生严重的知识幻觉。单纯依靠扩大模型参数来“死记硬背”世界知识,不仅训练成本极其高昂,而且无法保证信息的实时性与准确性。
-
省28.4% Token!开源Agent框架ToFu性能反超Claude
当前的智能体系统正面临一个尴尬的瓶颈:即便是回复一句简单的“你好”,系统底层也可能消耗成千上万个Token。对于复杂的多步推理任务,这种累积的计算成本更是高得令人咋舌。与此同时,市面上成熟的Agent产品(如ClaudeCode)多为闭源的黑盒系统。
-
打破RAG长度限制!Thought-Retriever让AI学会检索“思考”,胜率飙升16%
面对百万字的海量专业文档,当下的AI助手往往力不从心。传统的检索增强生成(Retrieval-AugmentedGeneration,RAG)就像个只会翻书找原话的初学者。一旦资料多到超出模型的上下文窗口,它就只能“断章取义”,无法窥见知识的全貌。
-
告别Token依赖!清华与NUS联合揭秘大模型隐空间,盘点4大机制与7大能力
现有的语言模型,无论是大语言模型还是视觉语言模型,都在不知疲倦地逐字吐出Token。这种基于人类可读符号的显式生成机制,正遭遇难以逾越的瓶颈。信息冗余、离散化带来的精度损耗,以及串行解码的高昂成本,都在拖慢AI进化的脚步。大模型真的必须“说人话”来完成内部思考吗?答案或许是否定的。
-
成本降41%、速度快近一倍:揭秘Agent的编排层如何终结Token通胀
当前AI应用开发者最头疼的往往不是模型不够聪明,而是月底暴涨的API云账单。为了让Agent顺利完成复杂任务,系统不得不塞入极其冗长的系统提示。不仅如此,在多轮对话中还要反复回放完整的历史记录、巨大的工具描述文档。
-
大模型也会“聊崩”?多智能体谈判实验揭秘4大协作陷阱
当多个顶级大语言模型组成团队时,它们真的能像人类精英一样高效协同吗?现实情况往往令人啼笑皆非:它们不仅经常无法达成共赢,甚至会因为资源分配问题“大打出手”,或者干脆达成一种极其糟糕的妥协。为什么大模型能够轻松通过极其困难的单体推理测试,却在简单的多轮团队沟通中频频翻车?
-
StructAgent:统一因果结构让长序列智能体告别迷失,胜率飙升至78.9%
当AI智能体面对需要跨应用操作、历经数十步的复杂电脑任务时,它们往往会陷入“我刚做了什么”以及“我现在在哪”的混沌之中。随着操作历史的不断堆积,大量错误的尝试和冗杂的信息让智能体彻底迷失。本文解读的最新研究StructAgent,为这一难题提供了一种极其优雅的解法。
-
大模型剪枝还是从头训练?50%压缩率下的LLM微缩路线指南
如今,百亿甚至千亿参数的开源大模型已经唾手可得。但在实际的工业落地中,受限于推理延迟、显存占用以及部署成本,大家往往需要更加精悍的小型化模型。为了填补这一需求缺口,摆在AI工程师面前的通常只有两条路。第一条路,是收集海量的优质数据,耗费巨资从零开始训练一个小模型(TrainfromScratch)。
-
告别“一次性”Agent!SkillOS重塑技能管理,性能跃升近10%
当前的大模型智能体(Agent)普遍存在一个极大的局限性:它们往往是“一次性”的解题机器。在处理完一个复杂的流式任务后,它们通常无法从历史交互中吸取教训并积累经验。面对源源不断的新任务,如果Agent每次都要从零开始摸索,注定无法胜任复杂的现实世界需求。
-
SkillComposer:Agent技能自我进化,跨级提升模型4.5分
在当前的智能体(Agent)开发中,开发者常常陷入一个两难境地。如果为特定任务编写高度定制的策略,这些技能往往无法迁移到其他场景。反之,如果提取过于抽象的通用技能,在面对具体任务时又显得指导不足。这种“特化”与“泛化”的矛盾,一直是限制智能体在复杂推理任务中表现的瓶颈。
-
SkillAudit揭秘:无真值反馈的Agent技能自进化,任务胜率暴涨17%
大模型Agent在应对专业领域的长周期任务时,往往需要依赖提前编写好的“技能”(Skills)——即结构化的操作指南与代码包。然而,真实业务环境是动态的。随着API接口的废弃、边缘场景的涌现,原本完美的技能很快就会退化甚至帮倒忙。让Agent在实战中自我更新技能,是业界公认的解法。
-
AI Agent的无限进化:双轨自我提升架构技术全景解析
真正的自动化系统不仅需要能执行预设指令,更需要具备在遇到挫折时自我反思、并修改自身运行逻辑的能力。当前的AIAgent大多依赖人类工程师进行“打补丁”式的迭代,一旦面对长尾的边缘场景,往往会陷入死板执行的困境。如何让系统摆脱外部依赖,实现自主且可控的进化?
-
Agent脚手架自进化:GSME框架破解评估噪音,冻结模型性能暴涨15.5%
在真实的业务部署中,决定一个大语言模型(LLM)任务表现的,往往不仅是其内部那堆被冻结的千亿参数,更是包围在模型外围的“脚手架”——系统提示词、注入的背景知识、运行时的重试控制循环以及各类配置参数。当模型权重不可触及(由于使用闭源API或微调成本极其高昂)时,优化这些外围结构成了开发者手中唯一的杠杆。
-
Seedance 2.0登顶Arena:原生多模态音视频生成架构揭秘
视频生成大模型的演进正面临一个极为棘手的瓶颈。过去,各类模型往往擅长生成单一片段的视觉奇观。但在复杂物理交互、精准指令控制以及原生音视频同步上,却频频暴露出深层缺陷。如何让大模型真正理解现实世界的物理法则,并实现高度可控的多模态联合合成?
-
谷歌打通10+款3D游戏:揭秘通用键鼠AI智能体SIMA
当前的人工智能可以在瞬间写出复杂的底层代码,或者在围棋棋盘上碾压人类世界冠军,却在被要求控制虚拟角色“走到飞船旁边”时显得笨拙无比。这正是莫拉维克悖论在虚拟世界中的真实写照:对AI来说,处理高度抽象的语言和逻辑相对容易,但要在复杂的三维环境中进行基础的感知与行动,却面临着巨大的挑战。
-
告别盲目自信!RPRA框架让小模型学会“自知之明”,预测准确率飙升55%
当我们在手机或笔记本电脑等计算资源受限的设备上部署大语言模型时,往往会面临一个根本性的困境:模型的计算效率(即参数量大小)与输出质量之间存在着难以调和的矛盾。小模型(如MobileLLM)虽然运行速度快、成本低,但在复杂任务上往往会出现断崖式的性能下降。
-
仅需100条数据超越GPT-5:RewardHarness自进化奖励框架解读
在评估图像编辑的优劣时,人类往往只需看几个参考示例,就能敏锐地察觉出编辑是否符合要求、有无违和感。然而,当前主流的视觉模型若想具备同样的判别能力,却需要消耗数十万对人工标注的比较数据,并进行高昂的模型重新训练。这种极度不对称的“数据效率鸿沟”,成为了强化学习对齐(RLHF)在视觉生成领域发展的一大瓶颈。
-
RHO揭秘:零标注驱动Agent复盘,代码基准通过率暴增19%
在真实世界的部署中,AI智能体往往面临一个尴尬的困境:随着任务越来越复杂,它们急需升级自己的工具库。然而,传统的优化方法大多依赖于带有标准答案的“验证集”。但在实际业务中,收集大量带有真实标签的未来任务数据,既昂贵又极其困难。能否让智能体仅仅通过回顾自己过去的“工作录像”,就能自动发现问题并完成自我进化?
-
打脸Agent自动演化:同等算力下不如简单重试,泛化提升仅0.6%
当前,让大语言模型自己优化其工具和提示词(即自动Harness演化)被视为通向更强Agent的前沿方向。许多研究宣称,通过让Agent分析自身失败轨迹并自动修改代码外壳,能在各类基准测试中取得显著的性能飞跃。然而,来自AllenAI等机构的一项最新研究无情地戳破了这一幻象。
-
ReSum揭秘:大模型学会自我总结,推理提升4%且输出缩减18%
最近,强化学习在大语言模型复杂任务中大放异彩。但随之而来的是一个恼人的副作用:模型极易陷入过度思考。它们生成的推理链条越来越长。这不仅消耗了大量上下文算力,还会导致模型“遗忘”之前的关键步骤。甚至让模型陷入重复验证同一子问题的死循环。针对这一痛点,来自阿里巴巴与中科大的研究团队提出了全新框架。
-
看教程学操作:Resource2Skill让Agent性能飙升11.9%
当前的大模型(LLM)不仅需要能言善辩,正越来越被期望能够直接操作软件、调用工具并生成高质量的复杂产物,例如幻灯片、3D场景、CAD设计等。然而,在面对UE5引擎或Blender这种重度依赖操作经验的专业软件时,模型仅凭预训练阶段积累的静态知识往往捉襟见肘。
-
解构1947篇顶会论文:IdeaSpark提炼15大创新模式,重塑AI科研
当前的大语言模型在科研头脑风暴中似乎无所不能,生成候选研究方向往往只需几秒钟。然而,真实的科学研究需要的远不止天马行空的灵感。研究者必须在浩如烟海的文献中精确锚定问题,识别出具有实际意义的技术瓶颈,与现有的解决方案划清界限,并在投入大量算力资源去复现前,严谨地评估潜在风险。
-
RAGEN-2揭秘:打破Agent强化学习“模板坍塌”,SNR过滤机制破局
当你满怀期待地用强化学习训练多轮大语言模型Agent时,监控大屏上的指标可能正在欺骗你。通常业界习惯用“熵”来衡量模型推理的多样性与稳定性。当熵稳如泰山时,你以为模型正在积极探索不同的解题路径。然而在实际测试中,Agent却常常表现得像一个背诵万能公式的机器人。
-
阿里Qwen深度技术解密:3万亿Token与全面对齐的工程实践
大语言模型赛道早已不再是简单的参数堆砌游戏。如何在复杂的逻辑推理、代码生成与工具调用上硬刚闭源巨头?阿里云正式披露了其大规模语言模型系列的核心技术细节。该研究推出的Qwen模型不仅在基础通用能力上表现惊艳,其实验室数据的详细披露更是干货满满。本文将深入解析其背后的预训练机制、上下文扩展技巧及强化学习对齐策略。
-
迈向L5级智能:清华华为等九大机构联合定义个人LLM Agent
今天的智能手机与车机屏幕早已无处不在,但内置的语音助手往往只能完成定闹钟、查天气等刻板任务。一旦需求稍微超出预设模板,它们便会显得捉襟见肘,难以真正理解用户的复杂意图。如何打破这种“伪智能”的僵局?清华大学、华为、小米、vivo等九大顶尖产学研机构联合发布了一项重磅研究。
-
零标注自我进化:PST框架激发群体智慧,推理能力提升4.3%
大模型如何在缺乏人类优质标注的情况下实现持续的自我进化?这是当前大语言模型在后训练阶段面临的核心技术瓶颈。当前的工业级实践方案,往往高度依赖海量的优质专家标注数据。或者需要构建极其复杂的外部奖励模型来提供强化学习信号。这种范式虽然在受控环境下行之有效,但其高昂的成本不可忽视。
-
PEEK:为大模型Agent装上“上下文地图”,长文本成本直降5.8倍
当前,大语言模型(LargeLanguageModel,LLM)Agent正频繁游走于海量且固定的外部数据中。无论是数万条用户反馈语料库,还是庞大复杂的企业级代码仓库。面对同一数据源的反复查询,现有系统的表现却像在不断经历“系统重启”。它们要么在冗长的对话记录中迷失,要么仅仅依靠被动的切片检索获取原始信息。
-
赋予Agent“变通”智慧:PAVE架构让AI火灾违规逃生率达81%
当一辆由大语言模型控制的自动驾驶汽车遇到严重火灾,而正前方却亮着红灯时,它该怎么做?是违规闯红灯以求生存,还是死板地遵守交通规则等待救援?传统的生成式智能体(GenerativeAgents)在模拟人类合作行为时表现优异。但在面临生存与规则冲突的复杂决策时,它们往往显得异常死板。
-
PaLM 2技术深度拆解:摒弃参数暴政,1:1缩放与混合目标重构大模型基座
大语言模型的发展似乎正陷入一种算力焦虑:要想模型更聪明,就必须无限度地扩大参数规模。然而,巨型模型带来的高昂训练成本与极慢的推理延迟,正成为阻碍技术落地的巨大鸿沟。本文探讨的这篇重磅技术报告,彻底打破了这一“唯参数论”的路径依赖。
-
AI全面接管设备:OS Agents核心架构机制万字全景解析
Anthropic近期发布的ComputerUse功能让整个科技圈沸腾了。AI不再局限于聊天窗口中的文本对话。它们正在跨越屏幕的边界,直接操控鼠标和键盘。从苹果的AppleIntelligence到智谱的AutoGLM,变革已然发生。这类能自主操作计算设备的AI被统称为操作系统智能体(OSAgents)。
-
统治大模型的RLHF完美吗?深度揭秘其3大环节的核心缺陷
当前,无论是OpenAI的GPT-4、Anthropic的Claude,还是Meta的Llama2,这些能够与人类流畅对话、展现出惊人理解力的大语言模型背后,都站着同一位幕后英雄:基于人类反馈的强化学习(ReinforcementLearningfromHumanFeedback,RLHF)。
-
揭秘大模型SFT数据陷阱:破解步长混杂,ASLEC提点超9%
随着DeepSeek-R1等大模型的爆火,超长思维链(Chain-of-Thought)已成为攻克复杂推理任务的核心武器。为了激发基础模型的这种能力,业界普遍采用一种标准范式:在高质量、大规模的推理数据集上进行监督微调(SFT)。然而,如何从海量的AI生成内容中,精准筛选出真正高质量的SFT数据?
-
Nemotron 3 Super开源:提速7.5倍的120B混合架构MoE解读
大模型推理成本高昂,长文本处理更是内存“吞金兽”。如何在保证千亿参数级别强大推理能力的同时,将推理吞吐量提升数倍?NVIDIA最近开源的Nemotron3Super交出了一份惊艳的答卷。这款总参数量达120B(激活参数仅12B)的模型,不仅原生支持高达100万的上下文窗口,更在复杂推理场景下实现了越级碾压。
-
提速4倍且零工具调用!ReOPD破解多轮智能体蒸馏的“前缀陷阱”
当前沿的大语言模型(LargeLanguageModel,LLM)逐渐进化为能够在复杂环境中执行多轮交互的智能体时,如何高效地将强大“教师”模型的能力蒸馏给小巧的“学生”模型,成为了一个棘手的工程难题。
-
突破智能体孤岛:MATM共享Agent轨迹记忆,任务成功率提升17%
当前的大语言模型智能体在执行各类复杂任务时,会产生大量高价值的中间轨迹。然而,这些包含丰富过程知识的交互数据,通常在单次使用后就被直接丢弃。或者仅被生产该轨迹的单一智能体私有保留。这种“阅后即焚”的孤岛模式,导致新实例化的智能体被迫反复重新探索已存在的解决方案。
-
多智能体AI创造力碾压人类团队?1.5倍断层优势与语义轨迹揭秘
长期以来,创造力被普遍视为人类智能的“终极前沿”。即使大语言模型在标准化考试和代码生成上屡创佳绩,生成兼具新颖性与实用性的绝妙点子,似乎仍是人类独有的特权。然而,一项由微软亚洲研究院、剑桥大学等机构联合发布的研究彻底打破了这一固有认知。
-
牛津大学提出MolJSON:大模型分子推理准确率飙升至98.5%的全新格式
当最先进的大语言模型试图解开复杂化学反应的奥秘时,它们却经常在最基础的环节栽跟头。为什么一个能写出完美代码的AI,却连简单的环状分子结构都容易认错?该研究指出,罪魁祸首并非模型本身的推理能力不足,而是我们给模型喂入数据的“方言”不对。长期以来,化学界习惯使用现成的文本格式来表示分子结构。
-
1.2B反超200倍巨头:MinerU2.5-Pro重塑文档解析飞轮
当主流文档解析模型在各类基准测试中分数逐渐逼近,一个诡异的现象浮出水面:无论模型架构如何演进,参数量差了多少倍,它们总是在同一批“困难样本”上集体翻车。这暗示了一个核心真相:当前文档解析的性能瓶颈,根本不在于模型架构的优劣。真正拖后腿的,是高度同质化且存在缺陷的训练数据。
-
MEMENTO:大模型学会自主管理上下文,KV缓存直降2.5倍!
当大语言模型在解决复杂数学或编程问题时,往往会生成数以千计的推理Token。这种长长的思维链虽然带来了惊艳的准确率,但也引发了严重的计算灾难。在传统的自回归生成中,每一个历史Token都会被保存在KV缓存中,消耗极其庞大的显存。更致命的是,模型面对如此巨大的上下文,没有任何机制能够筛选或遗忘无效信息。
-
Agent评测盲区:BIWM量化执行接口对多步信念的扭曲
评价一个大语言模型Agent的能力,业界通常只看一个最终指标:即该模型是否成功解决了当前任务。这就好比只看考试的最终成绩,却完全忽略了考场环境的干预。该研究揭示了一个在各类大模型榜单中常被忽视的盲点。决定Agent能否成功的,不仅是模型本身的基础智力。还有那个将模型与外部环境连接起来的“脚手架”。
-
提速4.14倍!LoSA破解长文本扩散模型的KV膨胀难题
大语言模型的世界正在悄然发生深刻的变革。传统的自回归生成模式正逐渐显露出其在复杂推理上的局限。块级扩散语言模型(Block-wiseDiffusionLanguageModels,DLMs)异军突起。这种新兴架构允许以任意顺序一次性生成多个Token,展现出极大的灵活性。