最新发布
VC-Tooler:让视觉Agent学会组合与自适应工具,V*达95.8%
VC-Tooler:该项研究明确提出:视觉工具调用不应被视为对死记硬背参数的拟合,而是一种包含视觉接地(Grounding)、多步组合(Composition)与自适应反思(Adaptation)的通用能力。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
VC-Tooler:该项研究明确提出:视觉工具调用不应被视为对死记硬背参数的拟合,而是一种包含视觉接地(Grounding)、多步组合(Composition)与自适应反思(Adaptation)的通用能力。
PAPER INSIGHTS
令人震撼的实验结果表明:仅依靠一个经过训练的 7B 参数轻量模型(Qwen2.5-7B-Instruct),Trident 就让当前最顶尖的 DRL 蓝队防御性能平均断崖式暴跌 522%,并自主涌现出诸如规避蜜罐诱饵、...
来自清华大学和腾讯的研究团队近期提出了全新的框架 TrajDebug 。该工作指出,现阶段长程智能体调试之所以失效,根源在于长轨迹中充斥着复杂的“错误动力学”——智能体在执行过程中会产生大量局部小失误,其中超过六成会被...
他们提出了名为 SAVOR (Strategy Abstraction Via Outcome-Conditioned Reflection)的元认知攻击框架,核心是将自适应的试错成本从“测试期在线交互”转移到“离线策...
由香港科技大学、新加坡国立大学、中国人民大学及都柏林大学学院等机构组成的研究团队,提出了名为 ToolArtist 的全新框架。与以往“外挂式拼接”的生成智能体完全不同,ToolArtist 基于原生统一多模态模型(U...
这项研究之所以冠以“苦涩的教训”(The Bitter Lesson),正是因为它指出了工具调用工程中的一个执念:业界花费了大量精力去设计专门的 Function Calling API、结构化约束解码和 JSON 解...
来自厦门大学等机构的研究团队提出了 TARL(Transaction-Aware Reliable Ledgers) ,从状态机与数据库事务的视角重新审视智能体记忆管理。
这项来自神经形态硬件与边缘 AI 领域的研究,提出了名为 PRECOG (Pre-Computed Context Injection,预计算上下文注入)的检索机制,以及面向长期设备记忆的 SMC (Structure...
针对这一痛点,来自计算机科学与人工智能领域的研究团队提出了 SkillSentry ,一个面向 Agent 技能执行的运行时保障(Runtime Assurance)框架。该方案的核心转变在于: 它不再将技能执行寄托于...
针对这一本质矛盾,基础设施团队 VideoDB 提出了一个明确判断:在物理与数字构成的视觉世界中进行搜索,本质上是一个系统架构问题,而非单纯依靠更大参数量训练出的端到端视频检索模型。
为了打破这种粗暴的信息摄入模式,研究团队提出了名为 SIEVE 的全新交互范式。该框架放弃了传统的 Search–Visit 模式,转向“搜索-检视-获取”(Search–Inspect–Fetch)三段式架构,并深度...
ParaRecover:为了对模型在执行过程中的表现进行多维切片,研究团队提出了 SDE 评估细则(SDE Rubric) ,将评测视角由单一维度的二元对错,拆解为三个互为补充的核心支柱: - 结构完整性(Struct...
针对这一两难困境,百度团队在一项最新研究中提出了名为 VideoXAgent 的纯在线长视频智能体框架(Purely Online Video Agent Harness)。
针对这一瓶颈,来自慕尼黑大学(LMU Munich)、慕尼黑机器学习中心(MCML)与电子科技大学的研究团队提出了 Mendel Gödel Machine(MGM) 。
近年来不少智能体本文提出,让智能体像人类工程师一样具备“沉淀经验”的能力:将常见子任务写成工具脚本存进持久化目录,后续任务直接复用,从而形成技能库闭环。然而,严谨的双盲统计表明, 在 Bash 基础上增加持久化工具合成...
近期来自清华、北大、复旦、浙大等机构的研究团队提出了一种解耦机制 FACTOR (Factorizing Action Credit and Token Responsibility),直击当前多轮 Agent 强化的...
香港科技大学(HKUST)的研究团队在最新论文中打破了这种静态脚手架的思维定式,提出了名为 HSI (Hierarchical Self-Improvement,分层自进化)的全新框架。
他们提出了 HarnessCompass 框架,通过引入全局泛化约束、Agent 第一人称主动反馈,以及分组件解耦优化三大机制,重新规范了脚手架演化流程。在 SWE-bench Verified 基准测试中,以 GPT...
近期,来自复旦大学、京东以及阿卜杜拉国王科技大学的研究团队提出了名为 EMAS(Evolving Multi-Agent System)的演化多智能体系统。该框架明确提出:不需要更新大模型的底层权重,而是把多智能体系统...
为了打破这种“纸上谈兵”的困境,来自哈尔滨工业大学、上海人工智能实验室、上海交通大学、中山大学、天津大学与清华大学的研究团队联合推出了针对全链条对地观测的完整解决方案——不仅构建了首个覆盖全流程的评测基准 Earth-...
针对不同深度的代码区域,CyberForge 设计了两套互补的注入流水线。这一流水线专攻现有模糊测试 Harness 能够直接触达的代码区域。借助 Harness 现成的输入解析通道,系统可以显著降低 PoV 构建的试...
针对这一根本性矛盾,来自微软亚洲研究院与北京大学的研究团队提出了一种名为 BCP(Bernoulli-Continuation Policy) 的轻量级即插即用框架。