ToolArtist:统一多模态模型自主搜图与绘制,拿下开放基准非商业第一
由香港科技大学、新加坡国立大学、中国人民大学及都柏林大学学院等机构组成的研究团队,提出了名为 ToolArtist 的全新框架。与以往“外挂式拼接”的生成智能体完全不同,ToolArtist 基于原生统一多模态模型(U...
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
PAPER INSIGHTS
由香港科技大学、新加坡国立大学、中国人民大学及都柏林大学学院等机构组成的研究团队,提出了名为 ToolArtist 的全新框架。与以往“外挂式拼接”的生成智能体完全不同,ToolArtist 基于原生统一多模态模型(U...
这项研究之所以冠以“苦涩的教训”(The Bitter Lesson),正是因为它指出了工具调用工程中的一个执念:业界花费了大量精力去设计专门的 Function Calling API、结构化约束解码和 JSON 解...
来自厦门大学等机构的研究团队提出了 TARL(Transaction-Aware Reliable Ledgers) ,从状态机与数据库事务的视角重新审视智能体记忆管理。
这项来自神经形态硬件与边缘 AI 领域的研究,提出了名为 PRECOG (Pre-Computed Context Injection,预计算上下文注入)的检索机制,以及面向长期设备记忆的 SMC (Structure...
针对这一痛点,来自计算机科学与人工智能领域的研究团队提出了 SkillSentry ,一个面向 Agent 技能执行的运行时保障(Runtime Assurance)框架。该方案的核心转变在于: 它不再将技能执行寄托于...
针对这一本质矛盾,基础设施团队 VideoDB 提出了一个明确判断:在物理与数字构成的视觉世界中进行搜索,本质上是一个系统架构问题,而非单纯依靠更大参数量训练出的端到端视频检索模型。
为了打破这种粗暴的信息摄入模式,研究团队提出了名为 SIEVE 的全新交互范式。该框架放弃了传统的 Search–Visit 模式,转向“搜索-检视-获取”(Search–Inspect–Fetch)三段式架构,并深度...
ParaRecover:为了对模型在执行过程中的表现进行多维切片,研究团队提出了 SDE 评估细则(SDE Rubric) ,将评测视角由单一维度的二元对错,拆解为三个互为补充的核心支柱: - 结构完整性(Struct...
针对这一两难困境,百度团队在一项最新研究中提出了名为 VideoXAgent 的纯在线长视频智能体框架(Purely Online Video Agent Harness)。
针对这一瓶颈,来自慕尼黑大学(LMU Munich)、慕尼黑机器学习中心(MCML)与电子科技大学的研究团队提出了 Mendel Gödel Machine(MGM) 。
近年来不少智能体本文提出,让智能体像人类工程师一样具备“沉淀经验”的能力:将常见子任务写成工具脚本存进持久化目录,后续任务直接复用,从而形成技能库闭环。然而,严谨的双盲统计表明, 在 Bash 基础上增加持久化工具合成...
近期来自清华、北大、复旦、浙大等机构的研究团队提出了一种解耦机制 FACTOR (Factorizing Action Credit and Token Responsibility),直击当前多轮 Agent 强化的...
香港科技大学(HKUST)的研究团队在最新论文中打破了这种静态脚手架的思维定式,提出了名为 HSI (Hierarchical Self-Improvement,分层自进化)的全新框架。
他们提出了 HarnessCompass 框架,通过引入全局泛化约束、Agent 第一人称主动反馈,以及分组件解耦优化三大机制,重新规范了脚手架演化流程。在 SWE-bench Verified 基准测试中,以 GPT...
近期,来自复旦大学、京东以及阿卜杜拉国王科技大学的研究团队提出了名为 EMAS(Evolving Multi-Agent System)的演化多智能体系统。该框架明确提出:不需要更新大模型的底层权重,而是把多智能体系统...
为了打破这种“纸上谈兵”的困境,来自哈尔滨工业大学、上海人工智能实验室、上海交通大学、中山大学、天津大学与清华大学的研究团队联合推出了针对全链条对地观测的完整解决方案——不仅构建了首个覆盖全流程的评测基准 Earth-...
针对不同深度的代码区域,CyberForge 设计了两套互补的注入流水线。这一流水线专攻现有模糊测试 Harness 能够直接触达的代码区域。借助 Harness 现成的输入解析通道,系统可以显著降低 PoV 构建的试...
针对这一根本性矛盾,来自微软亚洲研究院与北京大学的研究团队提出了一种名为 BCP(Bernoulli-Continuation Policy) 的轻量级即插即用框架。
研究提出的“权威链劫持”(Authority-Chain Hijack, ACH)策略,通过在智能体推进检索时动态投喂看似来自不同独立信源、实则彼此印证的协同证据,直接破解了智能体的多源交叉验证防线,在 SafeSea...
BlueLM-GUI 提出了 MobileGUI-VBench 以及一套“配额驱动”(Quota-driven)的动态评测方法学。该方法彻底抛弃了“专家挑选一些主观难题组成固定测试集”的旧模式,将基准拆解为业务场景、任...
为了打破这一“能力天花板”,来自北京理工大学和深圳北理莫斯科大学的研究团队提出了一种全新的 零阶自进化框架 。该方法彻底跳出了“必须先采出正确轨迹才能训练”的传统思维,而是对大模型的 LoRA 参数施加微小扰动,仅依据...
研究团队提出的黑盒攻击框架 SkillClone 证明:哪怕底层文件被严密保护、不发生任何文本泄露,仅凭普通的任务交互与闭环差分修复,攻击者依然能以极低的成本重构出可独立执行的等价程序克隆。
由微软、上海交通大学、清华大学、北京大学等机构联合提出的 Argus ,正是为了打破这一长期困境而设计的通用 Agent 运行时。Argus 的核心思想非常直接却极具颠覆性:长程推理的关键不在于更长地维持一个固定计划。
面对这种隐蔽而危险的群体性误导,传统的过滤门禁与只看讨论记录的法官模型几乎全线失效,而研究团队提出的“独立裁判(Referee)”机制,通过在会后向模型发起一次私下重质询(Private Re-query),以非介入式...