最新发布
WorldSimProbe:不是能动就行!北大等用1.8万测试例诊断具身物理保真度
针对这一根本痛点,来自北京大学、北京理工大学、EvoPhys AI 以及香港科技大学等机构的研究团队提出了名为 WorldSimProbe 的系统性诊断基准。该研究不再把世界模型当成单纯的视频生成器,而是将其拉回物理模拟器的严苛标准进行检验,提出了具身物理模拟必须满足的“可观测模拟器契约”。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
针对这一根本痛点,来自北京大学、北京理工大学、EvoPhys AI 以及香港科技大学等机构的研究团队提出了名为 WorldSimProbe 的系统性诊断基准。该研究不再把世界模型当成单纯的视频生成器,而是将其拉回物理模拟器的严苛标准进行检验,提出了具身物理模拟必须满足的“可观测模拟器契约”。
PAPER INSIGHTS
针对这一工业落地痛点,来自亚马逊(Amazon)的研究团队提出了名为 TRACE (TRajectory Attribution for Automated Context Engineering)的自动化反馈回路框架...
为了彻底纠正这两种扭曲,研究团队提出了名为 ToolVision 的能力对齐视觉工具调用框架。ToolVision 在 SFT 阶段通过多智能体管道探索轨迹,并由包含学生尺寸模型的委员会量化评估逐步证据增益,只保留学生...
但由南方科技大学等机构联合发表的最新研究 SkillSmith 提出了截然不同的诊断结论:端侧模型的核心短板并非通用智能不足,而是缺乏特定任务环境的规则与操作常识。
为了解决这种典型的“模型不匹配”(Model-Mismatch)难题,来自哈工大、上海人工智能实验室、上海交通大学以及清华大学的研究团队提出了 SKILLER 。
为了解决这一痛点,腾讯联合武汉大学提出了面向生产级数仓任务交付的端到端自动化智能体系统 —— SiriusDeliver 。该系统不仅能写代码,更接管了从业务需求解析、环境元数据对齐、工件全生命周期质检到平台自主提交与...
来自阿里巴巴达摩院与湖畔实验室的研究团队提出了具身价值基石模型 RynnValue 。该工作放弃了主观的偏好标注与归一化的虚拟进度,直接回归最优控制理论中最本质的物理物理量: 时间距离(Temporal Distanc...
本文提出了名为 Repeat-After-Me 的黑盒自适应视觉提示词注入框架。该方法不依赖梯度,无需白盒权限,在正常的良性用户任务干扰下,成功诱导前沿商业模型泄漏隐私数据,甚至精准触发原生工具调用(Native To...
不列颠哥伦比亚大学(UBC)的研究团队提出了 MDA (Model Discovery Agent,模型发现智能体)。这项研究打破了以往“纯大模型试错”与“传统静态贝叶斯推断”各自为战的局限,首次将大语言模型的开集假设...
近期,来自同济大学、南京大学、西北工业大学、中国人民公安大学以及巴黎高等师范学院的研究团队提出了名为 MIRA (Medical Image Reflection for Agentic Diagnosis)的全新医疗...
来自卡内基梅隆大学(CMU)、加利福尼亚大学洛杉矶分校(UCLA)、上海交通大学等机构的研究团队提出了 MERA (Model Evolution and Routing with Skill Adaptation)。
Iris 对此提出了由粗到细的二级清洗策略。粗粒度过滤针对整条轨迹进行硬性指标截断: 首先是端到端正确性门控,轨迹必须正常终止,且提取的最终答案必须通过大模型裁判的语义对齐检验; 其次是基于 zlib 压缩率的退化检测...
针对这一盲区,字节跳动 Seed 联合清华大学、北京大学的研究团队提出了专门针对代码智能体的指令遵循基准 Harness-IF 。该工作将指令拆解为可被执行证据逐一判决的原子规则,涵盖真实运行环境中的多层“指令表面”(...
Harbor-Index:为了确保转译过程不破坏基准原有的评测语义,研究团队并未采取粗暴的代码重写,而是设计了由自动化检查、初审和终审构成的三阶段人工代码审查机制,累计在 GitHub 上产生了超过一万条审核讨论;同时...
针对这一根本缺陷,该团队首次形式化定义了 执行状态遗忘(Execution-State Unlearning) ,并提出了 出处导向的选择性重放(Provenance-Guided Selective Replay) ...
然而由 Salesforce Research、北卡罗来纳大学教堂山分校(UNC Chapel Hill)与威斯康星大学麦迪逊分校(UW-Madison)联合提出的最新基准 EvoHarnessBench ,却揭示了一...
由中国人民大学 AI Box 团队与 BOSS 直聘等机构联合提出的研究给出了坚实的实证回应。他们推出了首个专门用于评测大模型自主迭代 Agent 支架能力的基准测试 Evo-Bench 。
为了破解上述矛盾,ElasticBack 提出了一种以“门控词”(Gate Words)为枢纽、将触发词视作激活开关的联合优化框架。整个攻击流程的核心思想是: 先利用语义锚定技术在技能文档中精准植入一条带有严格约束边界...
为此,研究团队提出了 DARC (Diagnosis-guided Agent Recovery and Correction,诊断引导的智能体恢复与自愈)框架,主张“先诊断、后修复”,将智能体在开发集上的失败样本转化...
来自华中科技大学、南方医科大学、香港科技大学、新南威尔士大学与浙江大学的研究团队,针对这一严峻临床痛点提出了名为 ATLAS 的框架。该方法跳出了“单次生成解答”的传统交互套路,将临床指南图谱与多智能体策略深度耦合。
该研究提出的攻击框架 ColluSkill 证明,攻击者并不需要构建任何显性的恶意技能。相反,攻击者可以借鉴社会学中的“依存链”理论,将完整的恶意载荷拆解为多个彼此交织、顺序传递的子载荷,分别隐藏在看似合理的良性技能包...
来自康考迪亚大学、麦克马斯特大学、Mila 魁北克人工智能研究所和多伦多大学的研究团队提出了一种全新的破局思路: CoAdapt-GUI 。这项工作不再指望源域训练能“一劳永逸”地搞定所有新软件,而是聚焦于 测试时自适...