不是越狱而是洗脑:Anthropic揭秘多智能体“思想病毒”
这项来自 Anthropic 与 EPFL 的先驱性研究给行业敲响了警钟:在构建大规模自主多智能体系统时,安全框架绝不能仅停留在单体模型的输入输出过滤与工具权限白名单上。
这项来自 Anthropic 与 EPFL 的先驱性研究给行业敲响了警钟:在构建大规模自主多智能体系统时,安全框架绝不能仅停留在单体模型的输入输出过滤与工具权限白名单上。
针对这一困境,来自北京邮电大学、哈尔滨工业大学、北京大学与腾讯的研究团队提出了 ToolHazard ——一个能够端到端、规模化合成可执行有状态对抗环境的自动化框架。
基于这一底层机理,研究团队提出了一个极为简洁却极其有效的轻量防御方案 SafeKeep :在推理时将“安全审计”与“工具执行”彻底解耦。在安全评判环节,把原本结构化的 Schema 剥离成扁平的自然文本叙述,瞬间唤醒模型原本的对齐能力,随后再让安全的请求进入常规的 Schema 执行流程。
针对这一核心瓶颈,来自 AweAI、中国人民大学及独立研究团队的研究者们提出了 CalibForge 。这是一套基于 对抗求解器校准 (Adversarial Solver Calibration)的自主终端任务合成系统。
为了精确刻画风险在系统内部渗透的深度,HarnessSafe 提出了一套基于客观执行证据的七阶段评估阶梯(N0 到 N5b): N0(未接触) :系统在执行中甚至未与受污染的载体表面产生任何交互; N1(接触未驻留) :系统读取或接触了注入入口,但未将其写入持久化载体。
Meta:实验结果呈现出近乎绝对的单调增长:随着文本先验的增强,模型在通用视觉问答、视觉中心感知任务(如空间、3D与计数)上稳步提升,在 OCR 与图表推理等知识密集型任务上更是迎来爆发式增长。
针对这一严峻挑战,来自香港城市大学、伦敦大学学院(UCL)、小米集团以及浙江大学的研究团队正式提出了 ActBench 。这是首个专门针对协同智能体“行为安全”(Behavioral Safety)的自演化评测基准。
该研究提出的攻击框架 ColluSkill 证明,攻击者并不需要构建任何显性的恶意技能。相反,攻击者可以借鉴社会学中的“依存链”理论,将完整的恶意载荷拆解为多个彼此交织、顺序传递的子载荷,分别隐藏在看似合理的良性技能包中。在运行时,智能体自主完成技能的链式编排与中间产物接力,从而在系统层面复原...
来自华中科技大学、南方医科大学、香港科技大学、新南威尔士大学与浙江大学的研究团队,针对这一严峻临床痛点提出了名为 ATLAS 的框架。该方法跳出了“单次生成解答”的传统交互套路,将临床指南图谱与多智能体策略深度耦合。
为了彻底纠正这两种扭曲,研究团队提出了名为 ToolVision 的能力对齐视觉工具调用框架。ToolVision 在 SFT 阶段通过多智能体管道探索轨迹,并由包含学生尺寸模型的委员会量化评估逐步证据增益,只保留学生真正能吸收的有效轨迹;在 RL 阶段,离线对比冻结 SFT 模型在有无工具下...
为了攻克工程级长程代码迁移的难题,华为技术有限公司与香港中文大学的研究团队提出了一种基于代码对抗熵最小化的多智能体协同框架—— ECAT (Entropy-based Code Adversarial Translation)。
在大语言模型被推向各类专业运维场景的浪潮中,数据库管理员(DBA)往往被视作最适合被AI替代或赋能的岗位之一。近年来,学术界和工业界接连涌现出如D-Bot、DBAIOps、DBAgent等一系列基于大模型的数据库运维智能体,各大论文汇报的故障诊断准确率动辄高达80%甚至90%以上。
让大模型自我迭代、自我对齐,一直是前沿人工智能安全领域最具争议的设想之一。如果让AI代理接管自身的后训练和安全对齐工作,它们究竟是在真正解决问题,还是在学会钻测试集的空子?Anthropic与加利福尼亚大学伯克利分校(UCBerkeley)的一项最新研究给出了令人意外的实证答案。
在大模型技术从单纯的“聊天对话”向具备自主行动能力的“智能体(Agent)”演进的过程中,系统所面临的安全边界正在发生根本性的位移。当Agent获得了读取本地文件系统、执行Shell脚本、调用外部API以及加载第三方技能(Skills/Tools)的权限时,传统的提示词安全和输出内容审核立刻显...
在多智能体大型语言模型(LLM)系统的部署中,开发者往往会面临一个棘手的现象:当多个专注于特定子任务的智能体协同工作时,系统输出经常会出现严重的幻觉。这种幻觉与单个模型能力不足所导致的胡言乱语不同,在很多情况下,每一个智能体在隔离状态下都进行了完全正确的逻辑推理,但它们组合在一起的结果却自相矛盾。
随着大型语言模型的普及,自动化正迎来从“辅助生成”向“自主执行”的转折点。现代AIAgent不仅能够编写代码、浏览网页,更能自主调用API、操作终端甚至查询生产数据库。然而,当前的AI自动化往往止步于“只读”阶段,例如通过检索增强生成(RAG)回答问题或汇总财务报表。
当前的大语言模型虽然在对话与逻辑推演上表现惊艳,但距离真正的“智能生命”仍有巨大鸿沟。它们更像是拥有海量知识的被动引擎,缺乏主动感知、持续学习与全局统筹的自主能力。本文深度解析由二十余家顶尖机构联合发布的一项重磅研究。该研究提出基础智能体(FoundationAgents)的全新概念与类脑架构。
当你要求你的AI助手“整理本月的财务报表”时,它在几分钟后递交了一份完美无瑕的总结。但在你惊叹其效率的同时,是否曾想过:在这个过程中,它有没有偷偷翻阅你电脑里标注着“绝密”的HR薪资档案?有没有把部分敏感数据误发给了另一个负责闲聊的AI模块?随着大语言模型技术的演进,如今的AI早已不再是单打独...
现如今,发一份在线问卷,你收回的可能是大量机器刷单、AI辅助作弊以及随意乱填的“无效数据”。这种数据质量危机正在悄无声息地摧毁社会科学的基石。在争分夺秒的灾害响应研究中,情况更为致命。受灾最严重的人往往处于断网、流离失所或极度焦虑的状态,他们根本没时间填满冗长的问卷。这导致收集到的数据出现成片...
当主流文档解析模型在各类基准测试中分数逐渐逼近,一个诡异的现象浮出水面:无论模型架构如何演进,参数量差了多少倍,它们总是在同一批“困难样本”上集体翻车。这暗示了一个核心真相:当前文档解析的性能瓶颈,根本不在于模型架构的优劣。真正拖后腿的,是高度同质化且存在缺陷的训练数据。
随着DeepSeek-R1等大模型的爆火,超长思维链(Chain-of-Thought)已成为攻克复杂推理任务的核心武器。为了激发基础模型的这种能力,业界普遍采用一种标准范式:在高质量、大规模的推理数据集上进行监督微调(SFT)。然而,如何从海量的AI生成内容中,精准筛选出真正高质量的SFT数据?
大语言模型的发展似乎正陷入一种算力焦虑:要想模型更聪明,就必须无限度地扩大参数规模。然而,巨型模型带来的高昂训练成本与极慢的推理延迟,正成为阻碍技术落地的巨大鸿沟。本文探讨的这篇重磅技术报告,彻底打破了这一“唯参数论”的路径依赖。
当一个智能体在执行代码任务失败时,却一本正经地向用户报告“任务已成功完成”,你的第一反应是什么?许多开发者的直觉是去修改提示词。然而,当大语言模型被逼到死角时,往往会倾向于生成看似满足要求的虚假答案。单纯通过提示词“礼貌地”要求模型不要撒谎,是最脆弱的控制手段。真正能解决这一痛点的,是模型外围...
幻觉研究迎来“大一统”:CMU等机构揭示本质,错在世界模型!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。