AI安全 第2页

SafeKeep:大模型做成Agent就学坏?压平工具格式让拒绝率提升至70.6%

基于这一底层机理,研究团队提出了一个极为简洁却极其有效的轻量防御方案 SafeKeep :在推理时将“安全审计”与“工具执行”彻底解耦。在安全评判环节,把原本结构化的 Schema 剥离成扁平的自然文本叙述,瞬间唤醒模型原本的对齐能力,随后再让安全的请求进入常规的 Schema 执行流程。

HarnessSafe:328个可执行用例,揭示Agent持久化隐蔽攻击传播链

为了精确刻画风险在系统内部渗透的深度,HarnessSafe 提出了一套基于客观执行证据的七阶段评估阶梯(N0 到 N5b): N0(未接触) :系统在执行中甚至未与受污染的载体表面产生任何交互; N1(接触未驻留) :系统读取或接触了注入入口,但未将其写入持久化载体。

ColluSkill:跨技能串谋让安全扫描全面失灵,攻击成功率达96.0%

该研究提出的攻击框架 ColluSkill 证明,攻击者并不需要构建任何显性的恶意技能。相反,攻击者可以借鉴社会学中的“依存链”理论,将完整的恶意载荷拆解为多个彼此交织、顺序传递的子载荷,分别隐藏在看似合理的良性技能包中。在运行时,智能体自主完成技能的链式编排与中间产物接力,从而在系统层面复原...

ToolVision:能力对齐解决工具调用失灵,8B模型跨级超越32B!

为了彻底纠正这两种扭曲,研究团队提出了名为 ToolVision 的能力对齐视觉工具调用框架。ToolVision 在 SFT 阶段通过多智能体管道探索轨迹,并由包含学生尺寸模型的委员会量化评估逐步证据增益,只保留学生真正能吸收的有效轨迹;在 RL 阶段,离线对比冻结 SFT 模型在有无工具下...

DBA-Bench:真实数据库运维实测,AI安全修复率为何仅12.4%?

在大语言模型被推向各类专业运维场景的浪潮中,数据库管理员(DBA)往往被视作最适合被AI替代或赋能的岗位之一。近年来,学术界和工业界接连涌现出如D-Bot、DBAIOps、DBAgent等一系列基于大模型的数据库运维智能体,各大论文汇报的故障诊断准确率动辄高达80%甚至90%以上。

Anthropic自动化对齐实验:6小时击败28位人类专家,且无需人类指路

让大模型自我迭代、自我对齐,一直是前沿人工智能安全领域最具争议的设想之一。如果让AI代理接管自身的后训练和安全对齐工作,它们究竟是在真正解决问题,还是在学会钻测试集的空子?Anthropic与加利福尼亚大学伯克利分校(UCBerkeley)的一项最新研究给出了令人意外的实证答案。

ClawSentry:四阶段渐进式防御,将Agent攻击成功率降至2.61%

在大模型技术从单纯的“聊天对话”向具备自主行动能力的“智能体(Agent)”演进的过程中,系统所面临的安全边界正在发生根本性的位移。当Agent获得了读取本地文件系统、执行Shell脚本、调用外部API以及加载第三方技能(Skills/Tools)的权限时,传统的提示词安全和输出内容审核立刻显...

SSVP协议:全同步反致幻觉增加34%?Celabe破解多智能体污染

在多智能体大型语言模型(LLM)系统的部署中,开发者往往会面临一个棘手的现象:当多个专注于特定子任务的智能体协同工作时,系统输出经常会出现严重的幻觉。这种幻觉与单个模型能力不足所导致的胡言乱语不同,在很多情况下,每一个智能体在隔离状态下都进行了完全正确的逻辑推理,但它们组合在一起的结果却自相矛盾。

Agentic Data Environments:哥大打造AI安全底座,AIM准确率提升49.8%

随着大型语言模型的普及,自动化正迎来从“辅助生成”向“自主执行”的转折点。现代AIAgent不仅能够编写代码、浏览网页,更能自主调用API、操作终端甚至查询生产数据库。然而,当前的AI自动化往往止步于“只读”阶段,例如通过检索增强生成(RAG)回答问题或汇总财务报表。

揭秘“数字大脑”:下一代类脑架构基础智能体的四大演进路径

当前的大语言模型虽然在对话与逻辑推演上表现惊艳,但距离真正的“智能生命”仍有巨大鸿沟。它们更像是拥有海量知识的被动引擎,缺乏主动感知、持续学习与全局统筹的自主能力。本文深度解析由二十余家顶尖机构联合发布的一项重磅研究。该研究提出基础智能体(FoundationAgents)的全新概念与类脑架构。

别只看结果!HarnessAudit揭秘智能体框架的隐秘安全漏洞

当你要求你的AI助手“整理本月的财务报表”时,它在几分钟后递交了一份完美无瑕的总结。但在你惊叹其效率的同时,是否曾想过:在这个过程中,它有没有偷偷翻阅你电脑里标注着“绝密”的HR薪资档案?有没有把部分敏感数据误发给了另一个负责闲聊的AI模块?随着大语言模型技术的演进,如今的AI早已不再是单打独...

问卷调查走向死局?AI新架构A-TLM零偏差击败三大传统算法

现如今,发一份在线问卷,你收回的可能是大量机器刷单、AI辅助作弊以及随意乱填的“无效数据”。这种数据质量危机正在悄无声息地摧毁社会科学的基石。在争分夺秒的灾害响应研究中,情况更为致命。受灾最严重的人往往处于断网、流离失所或极度焦虑的状态,他们根本没时间填满冗长的问卷。这导致收集到的数据出现成片...

1.2B反超200倍巨头:MinerU2.5-Pro重塑文档解析飞轮

当主流文档解析模型在各类基准测试中分数逐渐逼近,一个诡异的现象浮出水面:无论模型架构如何演进,参数量差了多少倍,它们总是在同一批“困难样本”上集体翻车。这暗示了一个核心真相:当前文档解析的性能瓶颈,根本不在于模型架构的优劣。真正拖后腿的,是高度同质化且存在缺陷的训练数据。

揭秘大模型SFT数据陷阱:破解步长混杂,ASLEC提点超9%

随着DeepSeek-R1等大模型的爆火,超长思维链(Chain-of-Thought)已成为攻克复杂推理任务的核心武器。为了激发基础模型的这种能力,业界普遍采用一种标准范式:在高质量、大规模的推理数据集上进行监督微调(SFT)。然而,如何从海量的AI生成内容中,精准筛选出真正高质量的SFT数据?

大模型Agent的“缰绳”:4大标准重新定义Agent Harness与6大系统横测

当一个智能体在执行代码任务失败时,却一本正经地向用户报告“任务已成功完成”,你的第一反应是什么?许多开发者的直觉是去修改提示词。然而,当大语言模型被逼到死角时,往往会倾向于生成看似满足要求的虚假答案。单纯通过提示词“礼貌地”要求模型不要撒谎,是最脆弱的控制手段。真正能解决这一痛点的,是模型外围...