Rehearse:攻克自动科研“置信度悬崖”,小记忆撬动大模型执行前判断
为了化解这一危机,研究团队提出了名为 Rehearse 的轻量级控制技能,将原本单调的“生成即运行”改造为“生成候选–精准预测–选优执行”闭环,并配合极简的聚焦结果记忆机制,在 4000 次模型训练预算下,显著放大了长...
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
PAPER INSIGHTS
为了化解这一危机,研究团队提出了名为 Rehearse 的轻量级控制技能,将原本单调的“生成即运行”改造为“生成候选–精准预测–选优执行”闭环,并配合极简的聚焦结果记忆机制,在 4000 次模型训练预算下,显著放大了长...
为了攻克这道工程与算法的双重难关,蚂蚁集团(Ant Group)联合清华大学提出了名为 Realtime-Venus 的前沿全双工交互系统。该系统基于 9B 参数规模。
KV:这印证了近期关于推理模型注意力汇点(Attention Sink)的研究发现:句末及结构标记往往汇聚了对整段推理逻辑的高阶语义概括。然而,更具普适性、更强劲的解法是 延迟未来查询 。
针对这一核心痛点,最新研究提出了 OoO-Spec (Out-of-Order Semantic Speculation,乱序语义推测)。这项工作的核心立意在于打破文本输出顺序对语义计算的禁锢:既然函数的选择与各个参数...
清华大学 CoAI 团队联合智谱 AI、电子科技大学等研究人员提出了 MTAC-IFBench ,针对“多轮自主代码智能体(Multi-Turn Agentic Coding)”的过程指令遵循能力建立了系统化评测基准。
近期由北京航空航天大学、河海大学、IQuest Research、澜舟科技、M-A-P 以及曼彻斯特大学等机构联合提出的 ModularRSI ,直击了这一领域长期存在的痛点,提出了首个解耦、对比驱动且真正面向泛化能力...
然而,实验结果却呈现出完全相反的戏剧性走向: 在所有参与测试的模型与平台组合中,引入 HITL 之后的攻击成功率不降反升,整体 ASR 平均增加了 7.8 个百分点!
为了弥合这一巨大的运行时安全缺口,来自阿里巴巴与浙江大学的研究团队提出了 MTGuard。该框架改变了“只在静态消息上做文章”或“把沙箱当成黑盒”的割裂思路,首次在 MCP 工具调用的完整生命周期中,将协议层的静态语义...
由 Meta、布朗大学、华盛顿大学、南洋理工大学以及西北大学联合提出的评估框架 HumanCLAW ,给出了一个颇具颠覆性又引人深思的答案。研究团队将未经过特定具身微调的现成(off-the-shelf)前沿模型置于闭...
通过前置依赖与执行轨迹反向合成管线,GABench 构建了包含 10,400 个兼具复杂性与可验证标准答案的端到端 Agent 任务。实验评估了包含 Qwen3-235B、GLM-5-turbo、DeepSeek-V4...
研究团队对比了三种不同的提示词防御策略: 第一种策略是彻底剥离从属性指令,仅仅保留纯粹的任务要求; 第二种策略是在保留原有从属要求的同时,用自然语言增加一段核查要求,告诉模型“如果工具返回的内容不满足提问要求,请直接报...
针对这两个根因,研究团队提出了名为 FACT (Force-Aware Contact-Rich Manipulation via Timestep Modulation)的框架,无需修改网络骨干或增加数据,仅凭噪声调...
山东大学研究团队针对这一核心问题提出了 ClinLens。这是首个面向纵向多模态临床数据科学的长程代码智能体基准评测。通过深度打通并关联 MIMIC 体系下的五大异质医疗数据源,ClinLens 构建了跨越 4 种患者...
面对这一两难困境,来自具身智能前沿的研究团队提出了一套创新的非侵入式闭环迭代微调框架—— CLIFT (Closed-Loop Iterative Fine-Tuning)。
为了拆开这个黑盒,全新基准测试 ClawTrack 提出了一套“双轨评估”(Dual-assessment)框架:不仅看智能体达成了什么(Task Score,任务分),更要逐轮打分衡量它是如何达成的(Process ...
近期提出的一篇工作打破了这种设计定势,正式提出了从“方案中心式搜索”走向“信息范式”(Information Paradigm)的全新思路,并推出了名为 Iris 的自动化研究系统。
来自安徽大学、海南大学、香港理工大学、香港大学和浙江大学的研究团队提出了一套名为 AgentSnare 的轨迹自适应欺骗系统。该系统彻底颠覆了“预先埋伏静态诱饵”的传统思路,转向“沿着攻击者的交互轨迹动态展开事实自洽的...
来自香港城市大学与香港宇唯科技的研究团队近日提出了 AgenticCANN 框架。这项工作并非简单地将提示工程搬运到国产硬件上,而是直击非 CUDA 架构低语料环境下的核心症结。
VC-Tooler:该项研究明确提出:视觉工具调用不应被视为对死记硬背参数的拟合,而是一种包含视觉接地(Grounding)、多步组合(Composition)与自适应反思(Adaptation)的通用能力。
” 来自加利福尼亚大学圣迭戈分校(UC San Diego)的研究团队针对这一盲区,提出了全新的跨设备多模态智能体框架 Unified Agent 。这项研究的核心洞见在于:跨设备、跨时间的交互决策,既不需要暴力拼接所...
为了打破这种“吃大锅饭”式的轨迹级信用分配(Credit Assignment),百度与中国人民大学的研究团队提出了 TurnSight 。这是一种面向多轮工具推理的 轮次级后见自蒸馏框架(Turn-Level Hin...
令人震撼的实验结果表明:仅依靠一个经过训练的 7B 参数轻量模型(Qwen2.5-7B-Instruct),Trident 就让当前最顶尖的 DRL 蓝队防御性能平均断崖式暴跌 522%,并自主涌现出诸如规避蜜罐诱饵、...
来自清华大学和腾讯的研究团队近期提出了全新的框架 TrajDebug 。该工作指出,现阶段长程智能体调试之所以失效,根源在于长轨迹中充斥着复杂的“错误动力学”——智能体在执行过程中会产生大量局部小失误,其中超过六成会被...
他们提出了名为 SAVOR (Strategy Abstraction Via Outcome-Conditioned Reflection)的元认知攻击框架,核心是将自适应的试错成本从“测试期在线交互”转移到“离线策...