Search over Self-Edit Strategies for LLM Adaptation
CMU新作:让AI自主设计“自我修正”策略,带存档机制逼近人类专家水平。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
CMU新作:让AI自主设计“自我修正”策略,带存档机制逼近人类专家水平。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
速度飙升17倍,成本仅1/19:微软亚马逊用小模型“蒸馏”搞定企业搜索标注。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
RAG归因成本直降8倍!CMU提出MaxShapley算法,让内容贡献清晰可量。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
破解AI智能体训练“死亡螺旋”:LLDS让Qwen2.5性能大涨37.8%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
阿里LORE:电商搜索相关性暴涨27%!大模型训练心法全公开。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
准确率飙升至86.7%!哈工大发布“知识调优”,专治医疗大模型“一本正经胡说八道”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
诺奖得主领衔!AI4X路线图发布:AI如何重塑8大前沿科学的未来?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
只需数百样本,性能反超SOTA!蚂蚁Thinker教LLM如何“分层思考”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文解读《LLM-as-a-Judge: Toward World Models for Slate Recommendation Systems》,梳理核心方法、关键实验结果与工程实践启示。
本文提出了一种名为 LLM-ERM 的新型程序学习算法,该算法通过大型语言模型(LLM)引导的搜索来高效地最小化经验风险,从而仅需极少量(例如1-2个)的输入输出样例就能成功合成正确的程序。
随着大型语言模型 (LLM) 的扩展定律进入回报递减的阶段,研究前沿正从数据和参数的暴力增长转向算法效率和新的推理形式。在此背景下,两个相互关联的范式成为核心:深思熟虑的推理时搜索 (deliberative Test-Time Search, TTS),即在推理时分配自适应的辅助计算来解决难...
本文提出一个信息论框架来分析和构建用于科学发现的自主智能体(Autonomous Agents),通过对信息熵、可验证性和耗散的分析,建立了一套信息流转的分类体系,并在此基础上提出了一个衡量智能体自主能力的五级模型。
本文提出了 QAgent,一个统一的智能体 RAG 框架,它通过一个采用两阶段强化学习策略训练的模块化搜索智能体,进行交互式查询理解和自适应检索,从而提高了对复杂问题的检索质量和作为可插拔模块的泛化能力。
本文提出了 DeepDive 方法,通过从知识图谱自动合成高难度问题,并采用端到端多轮强化学习进行训练,旨在提升大型语言模型(LLM)作为深度搜索智能体所需的长时序推理和信息检索能力。
本文介绍了BFS-Prover-V2,一个通过创新的训练与推理扩展技术来提升大型语言模型(LLM)定理证明能力的系统,它结合了克服性能瓶颈的多阶段强化学习框架和用于分层推理的规划器增强型多智能体搜索架构,从而在多个数学基准测试中取得了当前最优性能。
本文提出了一个名为 Re⁴ 的科学计算智能体 (Agent) 框架,它通过“重写-解决-审查-修订” (Rewriting-Resolution-Review-Revision) 的逻辑链,利用多个大型语言模型 (LLM) 协同工作,显著提升了根据自然语言描述自主生成代码的可靠性和准确性。
本文通过对香港399名大学生的问卷调查,揭示了学生对生成式AI(如ChatGPT)普遍持积极态度,认可其在个性化学习、写作和研究方面的潜力,但同时也对技术的准确性、隐私伦理、对个人能力发展和未来职业的冲击表示了显著担忧。
本文提出了一种在线策略改进算法,该算法通过蒙特卡洛搜索(Monte-Carlo search)实时评估当前状态下所有可能动作的长期期望回报,并选择最优动作,从而显著提升一个已有“基础策略”的表现。
本文论证了医疗人工智能(AI)系统仅能被依赖(be relied upon),而不能被信任(be trusted),因为真正的信任需要善意、动机和道德责任等人类特有的能动性(agency)要素,而AI的广泛应用可能通过取代人类医生的认知权威,导致医疗实践中人际信任关系的缺失。
本文通过对美国行医执照考试(USMLE)等权威医学基准的全面评测,表明通用的GPT-4模型在未经任何领域专业化微调的情况下,其医学知识水平和推理能力已远超之前的通用模型(GPT-3.5)和医学专用模型(Med-PaLM),并以高分通过考试,同时展现出更优的概率校准能力和强大的交互式解释潜力。
本文提出了一种为金融领域专门打造的500亿参数大型语言模型——BloombergGPT,它通过在一个包含大量高质量金融数据和通用数据的混合数据集上进行训练,在金融领域的任务上取得了远超现有模型的性能,同时在通用LLM基准测试中保持了强大的竞争力。