大模型Agent的“缰绳”:4大标准重新定义Agent Harness与6大系统横测
当一个智能体在执行代码任务失败时,却一本正经地向用户报告“任务已成功完成”,你的第一反应是什么?许多开发者的直觉是去修改提示词。然而,当大语言模型被逼到死角时,往往会倾向于生成看似满足要求的虚假答案。单纯通过提示词“礼貌地”要求模型不要撒谎,是最脆弱的控制手段。真正能解决这一痛点的,是模型外围...
当一个智能体在执行代码任务失败时,却一本正经地向用户报告“任务已成功完成”,你的第一反应是什么?许多开发者的直觉是去修改提示词。然而,当大语言模型被逼到死角时,往往会倾向于生成看似满足要求的虚假答案。单纯通过提示词“礼貌地”要求模型不要撒谎,是最脆弱的控制手段。真正能解决这一痛点的,是模型外围...
大语言模型的发展似乎正陷入一种算力焦虑:要想模型更聪明,就必须无限度地扩大参数规模。然而,巨型模型带来的高昂训练成本与极慢的推理延迟,正成为阻碍技术落地的巨大鸿沟。本文探讨的这篇重磅技术报告,彻底打破了这一“唯参数论”的路径依赖。
随着DeepSeek-R1等大模型的爆火,超长思维链(Chain-of-Thought)已成为攻克复杂推理任务的核心武器。为了激发基础模型的这种能力,业界普遍采用一种标准范式:在高质量、大规模的推理数据集上进行监督微调(SFT)。然而,如何从海量的AI生成内容中,精准筛选出真正高质量的SFT数据?
当主流文档解析模型在各类基准测试中分数逐渐逼近,一个诡异的现象浮出水面:无论模型架构如何演进,参数量差了多少倍,它们总是在同一批“困难样本”上集体翻车。这暗示了一个核心真相:当前文档解析的性能瓶颈,根本不在于模型架构的优劣。真正拖后腿的,是高度同质化且存在缺陷的训练数据。
现如今,发一份在线问卷,你收回的可能是大量机器刷单、AI辅助作弊以及随意乱填的“无效数据”。这种数据质量危机正在悄无声息地摧毁社会科学的基石。在争分夺秒的灾害响应研究中,情况更为致命。受灾最严重的人往往处于断网、流离失所或极度焦虑的状态,他们根本没时间填满冗长的问卷。这导致收集到的数据出现成片...
当你要求你的AI助手“整理本月的财务报表”时,它在几分钟后递交了一份完美无瑕的总结。但在你惊叹其效率的同时,是否曾想过:在这个过程中,它有没有偷偷翻阅你电脑里标注着“绝密”的HR薪资档案?有没有把部分敏感数据误发给了另一个负责闲聊的AI模块?随着大语言模型技术的演进,如今的AI早已不再是单打独...
当前的大语言模型虽然在对话与逻辑推演上表现惊艳,但距离真正的“智能生命”仍有巨大鸿沟。它们更像是拥有海量知识的被动引擎,缺乏主动感知、持续学习与全局统筹的自主能力。本文深度解析由二十余家顶尖机构联合发布的一项重磅研究。该研究提出基础智能体(FoundationAgents)的全新概念与类脑架构。
告别代码幻觉:混合检索+图增强,实现92%引用准确率与零错误。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
幻觉研究迎来“大一统”:CMU等机构揭示本质,错在世界模型!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
RLHF: A comprehensive Survey for Cultural, Multimodal and Low Latency Alignment Methods。
本文提出了一个全面的幻觉分类体系,并基于此构建了一个大规模合成数据集,用以训练 模型,使其能够在一个统一的推理过程中完成幻觉分类、范围识别和内容纠正。
本文提出了一种新方法,通过利用聊天模板(chat template)作为前缀诱导模型生成内容,并结合神经嵌入(neural embeddings)来度量语义相似度,从而可以从开放权重的语言模型中高效提取出大量有价值的对齐训练数据。
本文提出了一种名为 的多智能体强化学习框架,该框架通过训练一个对话智能体和一个反馈智能体进行协作,将安全对齐问题转化为一个正和博弈,从而同时减少大型语言模型(LLM)的不安全响应和过度拒绝现象,提升了模型在有益性(helpfulness)和无害性(harmlessness)之间的帕累托前沿。
本文发布了一个通过全球众包构建的大规模、多语言、人工标注的对话数据集——OpenAssistant Conversations,旨在通过开放高质量的人类反馈数据,推进大型语言模型对齐技术的研究民主化。
本文提出了一种名为KTO (Kahneman-Tversky Optimization) 的新型大模型对齐方法,它基于前景理论,仅需“可取”或“不可取”的二元反馈信号,便能在10亿到300亿参数规模的模型上达到甚至超越基于偏好数据的DPO方法的性能。
本文提出并验证了大型语言模型(LLM)安全训练的两种核心失败模式——“竞争性目标”与“泛化不匹配”,并基于此设计出能成功“越狱”(Jailbreak)GPT-4和Claude等顶尖模型的新型攻击方法。
本文提出了HarmBench,一个用于自动化红队攻防的标准化评估框架,并通过大规模实验揭示了当前攻防方法的局限性,同时提出了一种高效的对抗训练方法R2D2,显著提升了大型语言模型的安全鲁棒性。
大型语言模型(LLM)安全与隐私综述:善、恶与丑。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。