最新发布
WeatherNext 3:告别分析场,DeepMind用原始观测实现逐小时0.1°预报
WeatherNext 3 选择在模型内部彻底打通这一环节,提出了针对离散观测的“站点输出头”(Station Output Head)。这一机制的本质是将天气预报转化为连续时空的函数查询任务: 在给定预报时刻,模型提取出高分辨率 0.1° 隐空间特征场; 当需要查询特定经纬度的地面预报时。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
WeatherNext 3 选择在模型内部彻底打通这一环节,提出了针对离散观测的“站点输出头”(Station Output Head)。这一机制的本质是将天气预报转化为连续时空的函数查询任务: 在给定预报时刻,模型提取出高分辨率 0.1° 隐空间特征场; 当需要查询特定经纬度的地面预报时。
PAPER INSIGHTS
LinkedIn 建立了一套高度解耦的模块化评估框架,将客服交互质量拆解为互不干扰的独立维度,并分别设计评估策略: - 接地性与事实依据(Groundedness) :专门校验 Agent 生成的每一条事实性断言是否严...
为打破这一僵局,来自北京航空航天大学、京东科技与北京大学的研究团队提出了可扩展的数据合成管线 MAGE ,并基于其构建了首个大规模家电操作规划数据集 UseAppliance 。
针对此瓶颈,最新提出的 RoboBRIDGE 框架给出了一种模块化编排方案:它不对底层 VLA 进行伤筋动骨的重训,而是在控制策略外层构建了一套由监控器(Monitor)、感知器(Perceptor)、规划器(Plan...
针对这一威胁,来自 ELLIS 研究所、苏黎世联邦理工学院(ETH Zurich)、马克斯·普朗克智能系统研究所(MPI-IS)以及阿姆斯特丹大学等机构的研究团队提出了专为自动化 AI 研发设计的控制评估框架 Rese...
北京智源人工智能研究院、香港理工大学、中国人民大学与中国科学技术大学的研究团队在近期工作中指出了这一结构性缺失,并提出了名为 DisCo 的技能驱动型科研智能体框架。
由百度与华中科技大学联合团队提出的 RILA (Rendering-In-the-Loop Agent),正是为了斩断这一死结。RILA 首次将真实的浏览器端到端渲染与运行交互深度引入大模型开发回路,构建了“动作交互验...
作者团队在涵盖 LangGraph、AutoGen 以及自研框架,横跨 Qwen-2.5-7B/3B、Llama-3.1-8B 以及商用 Gemini-2.5-flash API 的 2823 个真实智能体轨迹上,构建...
由 Scale AI、加州大学圣克鲁兹分校(UC Santa Cruz)与范德堡大学医学中心(Vanderbilt University Medical Center)联合提出的 READY (Reliable Ent...
来自华为技术有限公司、北京大学与东南大学的研究团队提出了自动化多跳网络靶场编排框架 RangeFactory 。该框架将复杂的靶场构建本质抽象为“依赖解析”问题,利用多智能体流水线从孤立的真实漏洞环境中自动提取能力与运...
- 状态构建(State Construction) :在复杂环境中自主搜集、过滤、理解并保留关键信息,构建出足以支撑后续决策的高质量“工作记忆”,避免对上下文信息的遗忘或曲解。
由 IBM 与伊利诺伊大学厄巴纳-香槟分校(UIUC)联合团队提出的 LivePlan 框架,换了一种更务实的解题思路: 将运行时的“漂移裁决”与“纠偏建议”彻底解耦 。
针对这一隐蔽且危险的操作风险,研究团队提出了名为 OBLIVION 的基准与防御框架,首次系统性地将“操作型技能遗忘”(Operational Skill Unlearning)形式化为一个源到汇(Source-to-...
IssueTrojanBench:分析得出的结论对当前 Agent 框架的架构设计者提出了直接警示: 在这 1,400 次拦截中, 82.9% 的拒绝行为完全来源于底层大模型自身的显式安全推理 ,模型在思考链中识别出指...
针对这一瓶颈,来自西北大学、伊利诺伊大学芝加哥分校与南加州大学的研究团队提出了 HyperSkill 。该框架将智能体的经验记忆形式化为一个 超图(Hypergraph) ,用超边把单次轨迹中的子任务序列、可复用技能与...
HVTB:实验结果清晰地揭示了提示词防御的局限性。在最贴近现实生产环境的 L0 阶段(开发者仅给出通用禁令,无法预见特定漏洞),几乎所有前沿模型都表现出了相当比例的作弊行为。这说明当前大模型对高层抽象伦理指令的遵从能力...
由来自 Drexel、Northeastern、Purdue 和 Virginia Tech 的研究团队最新提出的 GlanceWAM ,给出了破解这一困局的优雅答案。该工作指出,现存的“速度与成功率不可兼得”并非视觉...
来自复旦大学、清华大学与合作团队提出的 GameWAM ,打破了这两者之间的界限。作为首个面向原生闭环游戏操作与图形用户界面(GUI)控制的“世界-动作模型”(World–Action Model, WAM),Game...
卡耐基梅隆大学(CMU)、超威半导体(AMD)与纽约州立大学布法罗分校的研究团队提出了一套全新系统 FlashRT。该方案打破了“为人手写调度器”或“用规则编译器解决一切”的传统思路,转而将系统级优化任务交给大模型编码...
为此,团队提出了名为 FailForge 的智能体自愈蒸馏框架,将原本注定被丢弃的失败样本重新激活为高价值训练数据。实验表明,FailForge 成功挽回了超过 26% 连试数次均彻底失败的难题。
针对这一脱节现象,NVIDIA 团队提出了名为 ACES(Agentic Continuous Evaluation of Skills)的持续评估框架,并在开源工具 NVIDIA SkillEvaluator 中实现...
为了攻克工程级长程代码迁移的难题,华为技术有限公司与香港中文大学的研究团队提出了一种基于代码对抗熵最小化的多智能体协同框架—— ECAT (Entropy-based Code Adversarial Translat...