华为ScienceFlow:可恢复工作区加持,MLE-bench奖牌率达70.22%
长期以来,让人工智能代理(LLMAgent)像人类研究员一样自主开展科学探索与机器学习研究,一直是自主系统领域极具野心的目标。然而,当科研任务的跨度从几十分钟的单次代码生成,拉长到数小时乃至数天的连续实验时,现有的自动科研代理(AutoresearchAgents)往往会迅速陷入瓶颈。
长期以来,让人工智能代理(LLMAgent)像人类研究员一样自主开展科学探索与机器学习研究,一直是自主系统领域极具野心的目标。然而,当科研任务的跨度从几十分钟的单次代码生成,拉长到数小时乃至数天的连续实验时,现有的自动科研代理(AutoresearchAgents)往往会迅速陷入瓶颈。
在通往超级人工智能(ArtificialSuperintelligence,简称ASI)的道路上,整个学术界和工业界正面临一个隐秘的错觉:当前的大模型在各类测试榜单上屡创佳绩,在科学推理、代码生成和数据分析等任务中表现出惊人的成熟度。然而,这种繁荣很大程度上建立在对人类已有知识的学习、压缩与应...
在医疗人工智能的演进历程中,基于文本的大语言模型已经展示了令人瞩目的疾病诊断和医学推理能力。然而,真实的医患问诊从来不是一个纯粹的文本交换过程。在临床实践中,医生通过观察患者的面部表情、倾听咳嗽的音色、评估患者的体态和动作(如呼吸困难或静息震颤),不断捕获关键的非语言线索。
过去一年里,AI在科研领域的应用边界被不断拓宽,从文献检索到辅助实验,甚至是端到端的“AI科学家”框架,都展示了语言模型在科学工作流中的巨大潜力。然而,现有绝大多数自动化研究系统往往在精心挑选的示例、人类限定的主题、预定义的基准测试或是狭窄的任务空间内进行展示。
速度飙升17倍,成本仅1/19:微软亚马逊用小模型“蒸馏”搞定企业搜索标注。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
CMU新作:让AI自主设计“自我修正”策略,带存档机制逼近人类专家水平。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
RAG归因成本直降8倍!CMU提出MaxShapley算法,让内容贡献清晰可量。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
破解AI智能体训练“死亡螺旋”:LLDS让Qwen2.5性能大涨37.8%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
阿里LORE:电商搜索相关性暴涨27%!大模型训练心法全公开。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
准确率飙升至86.7%!哈工大发布“知识调优”,专治医疗大模型“一本正经胡说八道”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
诺奖得主领衔!AI4X路线图发布:AI如何重塑8大前沿科学的未来?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
只需数百样本,性能反超SOTA!蚂蚁Thinker教LLM如何“分层思考”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文解读《LLM-as-a-Judge: Toward World Models for Slate Recommendation Systems》,梳理核心方法、关键实验结果与工程实践启示。
本文提出了一种名为 LLM-ERM 的新型程序学习算法,该算法通过大型语言模型(LLM)引导的搜索来高效地最小化经验风险,从而仅需极少量(例如1-2个)的输入输出样例就能成功合成正确的程序。
本文提出一个信息论框架来分析和构建用于科学发现的自主智能体(Autonomous Agents),通过对信息熵、可验证性和耗散的分析,建立了一套信息流转的分类体系,并在此基础上提出了一个衡量智能体自主能力的五级模型。
随着大型语言模型 (LLM) 的扩展定律进入回报递减的阶段,研究前沿正从数据和参数的暴力增长转向算法效率和新的推理形式。在此背景下,两个相互关联的范式成为核心:深思熟虑的推理时搜索 (deliberative Test-Time Search, TTS),即在推理时分配自适应的辅助计算来解决难...
本文提出了 QAgent,一个统一的智能体 RAG 框架,它通过一个采用两阶段强化学习策略训练的模块化搜索智能体,进行交互式查询理解和自适应检索,从而提高了对复杂问题的检索质量和作为可插拔模块的泛化能力。
本文提出了 DeepDive 方法,通过从知识图谱自动合成高难度问题,并采用端到端多轮强化学习进行训练,旨在提升大型语言模型(LLM)作为深度搜索智能体所需的长时序推理和信息检索能力。
本文介绍了BFS-Prover-V2,一个通过创新的训练与推理扩展技术来提升大型语言模型(LLM)定理证明能力的系统,它结合了克服性能瓶颈的多阶段强化学习框架和用于分层推理的规划器增强型多智能体搜索架构,从而在多个数学基准测试中取得了当前最优性能。
本文提出了一个名为 Re⁴ 的科学计算智能体 (Agent) 框架,它通过“重写-解决-审查-修订” (Rewriting-Resolution-Review-Revision) 的逻辑链,利用多个大型语言模型 (LLM) 协同工作,显著提升了根据自然语言描述自主生成代码的可靠性和准确性。
本文提出了一种为金融领域专门打造的500亿参数大型语言模型——BloombergGPT,它通过在一个包含大量高质量金融数据和通用数据的混合数据集上进行训练,在金融领域的任务上取得了远超现有模型的性能,同时在通用LLM基准测试中保持了强大的竞争力。
本文通过对美国行医执照考试(USMLE)等权威医学基准的全面评测,表明通用的GPT-4模型在未经任何领域专业化微调的情况下,其医学知识水平和推理能力已远超之前的通用模型(GPT-3.5)和医学专用模型(Med-PaLM),并以高分通过考试,同时展现出更优的概率校准能力和强大的交互式解释潜力。
本文论证了医疗人工智能(AI)系统仅能被依赖(be relied upon),而不能被信任(be trusted),因为真正的信任需要善意、动机和道德责任等人类特有的能动性(agency)要素,而AI的广泛应用可能通过取代人类医生的认知权威,导致医疗实践中人际信任关系的缺失。
本文提出了一种在线策略改进算法,该算法通过蒙特卡洛搜索(Monte-Carlo search)实时评估当前状态下所有可能动作的长期期望回报,并选择最优动作,从而显著提升一个已有“基础策略”的表现。