ContinuityBench:LLM有状态故障转移!对话连续性达99.2%
在生产级别的大语言模型(LLM)部署中,开发者往往会配置多个模型提供商(Provider)以确保系统的高可用性。当主模型服务商遭遇宕机或严格的速率限制时,网关会自动将流量切换到备用模型。从监控面板上看,HTTP状态码依然是绿色的“200OK”,系统看似运转正常。
在生产级别的大语言模型(LLM)部署中,开发者往往会配置多个模型提供商(Provider)以确保系统的高可用性。当主模型服务商遭遇宕机或严格的速率限制时,网关会自动将流量切换到备用模型。从监控面板上看,HTTP状态码依然是绿色的“200OK”,系统看似运转正常。
当前,让大语言模型自己优化其工具和提示词(即自动Harness演化)被视为通向更强Agent的前沿方向。许多研究宣称,通过让Agent分析自身失败轨迹并自动修改代码外壳,能在各类基准测试中取得显著的性能飞跃。然而,来自AllenAI等机构的一项最新研究无情地戳破了这一幻象。
Anthropic近期发布的ComputerUse功能让整个科技圈沸腾了。AI不再局限于聊天窗口中的文本对话。它们正在跨越屏幕的边界,直接操控鼠标和键盘。从苹果的AppleIntelligence到智谱的AutoGLM,变革已然发生。这类能自主操作计算设备的AI被统称为操作系统智能体(OSAg...
评价一个大语言模型Agent的能力,业界通常只看一个最终指标:即该模型是否成功解决了当前任务。这就好比只看考试的最终成绩,却完全忽略了考场环境的干预。该研究揭示了一个在各类大模型榜单中常被忽视的盲点。决定Agent能否成功的,不仅是模型本身的基础智力。还有那个将模型与外部环境连接起来的“脚手架”。
当Claude发布其具备“电脑操控”能力的最新模型时,整个科技圈为之震动。这项技术让AI不再局限于聊天窗口,而是真正接管了我们的鼠标和键盘。微软、北京大学与上海人工智能实验室近期联合发布了一项重磅长篇综述。该综述系统梳理了超过500篇核心文献,全面揭开了这项前沿技术的神秘面纱。
从被动回答问题的聊天机器人,到能够自主完成深度研究的数字员工,AI正在经历一场重大的范式转换。近期爆火的复杂商业系统无不昭示着,大语言模型智能体(LargeLanguageModelAgent,LLMAgent)时代的全面到来。
随着大语言模型技术的演进,能够自主编写代码、浏览网页甚至控制电脑的Agent(智能体)正迎来爆发式增长。然而,当你开发出一个全新的Agent,想知道它到底有多强时,噩梦就开始了。当前,Agent领域的评测正处于一种极度“碎片化”的状态。
当大语言模型从只能聊天的对话框,走向可以操作代码库、控制浏览器乃至接管操作系统的智能体时代时,我们该如何评价它究竟好不好用?现有的评估体系正陷入一种极度的“分数内卷”。在过去两年中,OSWorld、WebArena等知名基准测试上的最佳成功率飙升了5到7倍,甚至有系统声称超越了人类基准。
GPT-5也排0%分位?ReX-MLE揭秘:顶尖AI智能体为何搞不定医学影像。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
JACM重磅综述:拆解AI Agent三大核心架构与“Agent Transformer”新范式。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
PPT炼狱场来了!新Agent PPTPilot精准编辑,性能超越专有模型10%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Rethinking Retrieval-Augmented Generation for Medicine: A Large-Scale, Systematic Expert Evaluation and Practical Insights。
本文解读《LLM-as-a-Judge: Toward World Models for Slate Recommendation Systems》,梳理核心方法、关键实验结果与工程实践启示。
本文提出 GUI-360,一个用于推进桌面级计算机使用智能体(CUA)的大规模、综合性数据集与基准测试套件,它通过一个由 LLM 增强的高度自动化流程构建,旨在解决真实世界任务稀缺、数据收集标注困难、以及缺乏统一基准的三大挑战。
本文发布了HPLT 3.0,一个包含近200种语言、总量达30万亿token的开源、大规模、高质量多语言文本数据集,并提供了完整的开源数据处理流程、多语言评估框架及预训练模型,旨在推动LLM和MT研究的普及化。
本文提出了一个名为 的整体性评估框架,通过跨越三个领域(发散性思维、创意写作、逻辑推理)的九个任务和二十个指标,从质量、新颖性和多样性三个维度系统地评估大型语言模型的创造力。
好的,我已判断这是一篇 [综述] 论文。我将严格遵循综述报告的模板,以原文结构为基础,重点剖析其提出的分类体系,并提炼核心内容。
本文提出了 BabyBabelLM,一个包含45种语言、模拟人类语言习得环境的多语言基准,旨在推动语言模型在数据效率和认知合理性方面的跨语言研究。
本文提出并开源了第一个完全基于西班牙语料库预训练的BERT模型(BETO),并构建了一个名为GLUES的西班牙语NLP任务评估基准,实验证明该单语模型在多数西班牙语下游任务上的表现优于同等规模的多语言BERT模型。
本文提出了 LiveCodeBench,一个通过持续从编程竞赛平台收集新问题来避免数据污染,并从代码生成、自我修复、代码执行、测试输出预测等多个维度来全面评估大型语言模型(LLM)代码能力的动态基准。
本文提出使用强大的大语言模型(如GPT-4)作为裁判(LLM-as-a-Judge)来评估聊天机器人,并通过新提出的基准 MT-Bench 和 Chatbot Arena 的实验证明,该方法的评判结果与人类偏好具有超过80%的一致性,达到了人类之间的一致性水平,为自动化评估提供了一种可扩展且可...
本文提出了一个名为 EvalPlus 的代码合成评估框架,通过大规模自动生成测试用例(结合 LLM 和变异测试策略)来严格评估大语言模型(LLM)生成代码的真实功能正确性,揭示了现有基准(如 HumanEval)因测试不足而严重高估了模型的性能。
本文提出了HarmBench,一个用于自动化红队攻防的标准化评估框架,并通过大规模实验揭示了当前攻防方法的局限性,同时提出了一种高效的对抗训练方法R2D2,显著提升了大型语言模型的安全鲁棒性。
本文提出了 GPQA,一个包含448道由生物、物理和化学领域专家编写的研究生水平多项选择题数据集,其设计目标是“防谷歌化”(Google-Proof),即对于拥有不受限制网络访问权限的熟练非专家来说也极其困难,旨在为未来超人AI系统的可扩展监督(scalable oversight)研究提供一...
本文提出了一种名为 FActScore 的新评估指标,通过将长文本分解为一系列原子事实并计算由可靠知识源支持的事实比例,来精细化地衡量语言模型生成内容的事实准确性,同时还开发了一个自动化模型来低成本、大规模地估算此分数。
在众多领域,准确和一致的评估对决策至关重要,但由于固有的主观性、可变性和规模问题,这仍然是一项艰巨的任务。传统评估方法面临一个两难困境:以专家驱动为代表的主观方法虽然全面,但成本高、难扩展且一致性差;而以自动度量(如BLEU、ROUGE)为代表的客观方法虽然可扩展性与一致性强,但往往只关注表面...
A Survey on Evaluation of Large Language Models。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。