行业应用

Search over Self-Edit Strategies for LLM Adaptation

CMU新作:让AI自主设计“自我修正”策略,带存档机制逼近人类专家水平。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

LORE: A Large Generative Model for Search Relevance

阿里LORE:电商搜索相关性暴涨27%!大模型训练心法全公开。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

LLM-ERM: Sample-Efficient Program Learning via LLM-Guided Search

本文提出了一种名为 LLM-ERM 的新型程序学习算法,该算法通过大型语言模型(LLM)引导的搜索来高效地最小化经验风险,从而仅需极少量(例如1-2个)的输入输出样例就能成功合成正确的程序。

Unifying Tree Search Algorithm and Reward Design for LLM Reasoning: A Survey

随着大型语言模型 (LLM) 的扩展定律进入回报递减的阶段,研究前沿正从数据和参数的暴力增长转向算法效率和新的推理形式。在此背景下,两个相互关联的范式成为核心:深思熟虑的推理时搜索 (deliberative Test-Time Search, TTS),即在推理时分配自适应的辅助计算来解决难...

QAgent: A modular Search Agent with Interactive Query Understanding

本文提出了 QAgent,一个统一的智能体 RAG 框架,它通过一个采用两阶段强化学习策略训练的模块化搜索智能体,进行交互式查询理解和自适应检索,从而提高了对复杂问题的检索质量和作为可插拔模块的泛化能力。

Scaling up Multi-Turn Off-Policy RL and Multi-Agent Tree Search for LLM Step-Provers

本文介绍了BFS-Prover-V2,一个通过创新的训练与推理扩展技术来提升大型语言模型(LLM)定理证明能力的系统,它结合了克服性能瓶颈的多阶段强化学习框架和用于分层推理的规划器增强型多智能体搜索架构,从而在多个数学基准测试中取得了当前最优性能。

Re4: Scientific Computing Agent with Rewriting, Resolution, Review and Revision

本文提出了一个名为 Re⁴ 的科学计算智能体 (Agent) 框架,它通过“重写-解决-审查-修订” (Rewriting-Resolution-Review-Revision) 的逻辑链,利用多个大型语言模型 (LLM) 协同工作,显著提升了根据自然语言描述自主生成代码的可靠性和准确性。

On-line Policy Improvement using Monte-Carlo Search

本文提出了一种在线策略改进算法,该算法通过蒙特卡洛搜索(Monte-Carlo search)实时评估当前状态下所有可能动作的长期期望回报,并选择最优动作,从而显著提升一个已有“基础策略”的表现。

Limits of trust in medical AI

本文论证了医疗人工智能(AI)系统仅能被依赖(be relied upon),而不能被信任(be trusted),因为真正的信任需要善意、动机和道德责任等人类特有的能动性(agency)要素,而AI的广泛应用可能通过取代人类医生的认知权威,导致医疗实践中人际信任关系的缺失。

Capabilities of GPT-4 on Medical Challenge Problems

本文通过对美国行医执照考试(USMLE)等权威医学基准的全面评测,表明通用的GPT-4模型在未经任何领域专业化微调的情况下,其医学知识水平和推理能力已远超之前的通用模型(GPT-3.5)和医学专用模型(Med-PaLM),并以高分通过考试,同时展现出更优的概率校准能力和强大的交互式解释潜力。

BloombergGPT: A Large Language Model for Finance

本文提出了一种为金融领域专门打造的500亿参数大型语言模型——BloombergGPT,它通过在一个包含大量高质量金融数据和通用数据的混合数据集上进行训练,在金融领域的任务上取得了远超现有模型的性能,同时在通用LLM基准测试中保持了强大的竞争力。