最新发布
AGRI:大模型早知被入侵,探测潜层表征将注入成功率降至0%
基于此,作者团队提出了一种轻量且高效的防御范式 AGRI(Action-Guiding Reasoning Intervention),通过实时探测模型的隐层状态动态激活思维链干预,在极难的 AgentDojo 基准上,直接将多个前沿开源模型的注入攻击成功率(ASR)压缩至接近 0%。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
基于此,作者团队提出了一种轻量且高效的防御范式 AGRI(Action-Guiding Reasoning Intervention),通过实时探测模型的隐层状态动态激活思维链干预,在极难的 AgentDojo 基准上,直接将多个前沿开源模型的注入攻击成功率(ASR)压缩至接近 0%。
PAPER INSIGHTS
TREK 的诞生不仅为旅行规划这一细分场景提供了高难度的压力测试场,更对大模型智能体评估的方法论提出了新的范式转移。它向整个社区传递了一个明确的信号:依赖大模型裁决软性评分的时代应当被重新审视,特别是在那些关乎真实业务...
为了让 TransMem 学习到通用的“信息提取与利用能力”,而非特定的事实知识,作者提出了一种优雅的训练策略: 证据条件自蒸馏(Evidence-Conditioned Self-Distillation, ECSD...
基于这一底层机理,研究团队提出了一个极为简洁却极其有效的轻量防御方案 SafeKeep :在推理时将“安全审计”与“工具执行”彻底解耦。在安全评判环节,把原本结构化的 Schema 剥离成扁平的自然文本叙述,瞬间唤醒模...
从 CanItDelete 暴露出的断层,到仅需 0.7% 数据微调便能大幅缓解的实验结果,论文指向了一条清晰的演进路径:未来的代码大模型后训练,必须将“减法能力”提升到与“加法能力”对等的战略高度。
针对这一问题,本文提出了一种轻量且通用的后训练框架—— TAPO (Transition-Aware Policy Optimization)。该方案的核心突破在于: 不采集任何额外的专家数据,不增加任何多余的在线采样...
面对一台已经被攻击者通过网络渗透拿下的云主机,Agent 能否像资深安全专家一样,根据告警日志与底层只读磁盘快照,层层抽丝剥茧还原整个入侵链路,找齐所有隐蔽后门,并提出一套真正可用且完成闭环验证的处置修复方案?来自阿里...
针对这一系列痛点,来自开源社区的研究者提出了 SearchMaster ,这是一个兼具“落地约束(Grounded)”与“行为规范(Regulated)”的搜索智能体自我博弈框架。
近期发表的这项工作提出了 SciDisco 框架,试图彻底改变这一现状。其核心思路不是在推理阶段堆叠复杂的 Prompt 工作流,而是构建了一个原生支持过程验证与多轮信用分配的训练闭环。
针对这一评估盲区,来自学术界的最新研究提出了首个专门用于受控评估终身智能体路径依赖特性的评测框架 PATH-Bench 。该框架利用多模型上下文学习(ICL)预先估计任务之间的有向迁移关系,构建以固定“探针任务”(Pr...
CMU:更进一步,团队提出了一种成本感知的选择性路由架构:先用轻量级统计特征过滤出高风险异常时段,仅在可疑度达到阈值时才唤醒开销巨大的强模型进行精细语义研判。实验表明,这种按需调用的动态策略在取得 0.629 的 Bu...
RadixArk:随着 Miles 开源生态的演进,前沿尺度的 Agent 训练技术门槛将被进一步拉低,为学界与工业界构建真正具备自我演进能力的复杂智能体提供了稳固可靠的工程底座。
针对这一矛盾,最新研究提出了 Meta-Task 框架,其核心哲学非常直接而巧妙: 与其用外部流水线生硬拼接任务,不如把“合成终端任务”本身定义为一个标准的 Terminal-Bench 格式任务(即元任务,Meta-...
HoF-Bench 的实验结果重构了软件工程团队对 AI 辅助代码安全分析的固有认知。它明确证实了利用廉价模型搭建实用级 SAST 分析器的可行性。以往企业往往受困于大参数前沿模型高昂的 Token 费用和有限的速率配...
为了从根本上改变这一表征维度的瓶颈,本文提出了 G-ReAct (Graph-guided Reasoning and Acting)框架。该工作不再寄希望于依靠纯粹扩大模型规模或堆叠数万条轨迹的强化学习(RL)来硬抗...
为此,研究团队提出了 FRAMES (Feedback-driven Reasoning with Adaptive Mutation and Evolution of Skills,自适应突变与技能演化的反馈驱动推理...
为了彻底打破这种“自测自纠”中的共谋缺陷,来自佐治亚理工学院、微软研究院(MSR)和威斯康星大学麦迪逊分校的研究团队提出了 ExecCritic 。该工作将测试生成与代码修复彻底拆分为两个相互独立的智能体角色,通过硬核...
针对这一空白,来自蚂蚁集团与浙江大学的研究团队提出了专门针对深度搜索 Agent 的端到端分层评估基准 HAE-GEO 。该基准将原本不可见的交互过程拆解为从“暴露”到“恢复”的五阶行为轨迹,并在控制变量的真实网页环境...
近期,小米团队提出了名为 DriveZero 的全新端到端自动驾驶框架,试图从底层打破对人类轨迹监督的绝对依赖。这项研究的核心结论非常直截了当:即便 完全不使用任何人类驾驶轨迹作为训练目标 ,端到端系统不仅能够学会复杂...
Wix 团队在其线上生产环境提出并部署了一套 三阶段技能选择流水线 ,引入了 确定性可执行性门控(Deterministic Executability Gating) 机制。
Data:实验结果令人咋舌:原生未经微调的 Qwen3-0.6B 基座在开启思考链时的得分为 67.4%,但经过 Raw-OS 训练后,性能不仅没有提升,反而断崖式下跌至 55.1%,出现了严重的“负向迁移”。
针对这一困境,华南理工大学的研究团队提出了 CoRL(Co-Evolutionary Reinforcement Learning)框架,尝试从博弈论和动态演化的视角彻底重塑防御体系。