行业应用 第2页

华为ScienceFlow:可恢复工作区加持,MLE-bench奖牌率达70.22%

长期以来,让人工智能代理(LLMAgent)像人类研究员一样自主开展科学探索与机器学习研究,一直是自主系统领域极具野心的目标。然而,当科研任务的跨度从几十分钟的单次代码生成,拉长到数小时乃至数天的连续实验时,现有的自动科研代理(AutoresearchAgents)往往会迅速陷入瓶颈。

ASI-Bench:撤除人类科研指导后,顶尖AI得分直降24分

在通往超级人工智能(ArtificialSuperintelligence,简称ASI)的道路上,整个学术界和工业界正面临一个隐秘的错觉:当前的大模型在各类测试榜单上屡创佳绩,在科学推理、代码生成和数据分析等任务中表现出惊人的成熟度。然而,这种繁荣很大程度上建立在对人类已有知识的学习、压缩与应...

DeepMind推出AMIE视频版:临床问诊得分83%超越人类医生

在医疗人工智能的演进历程中,基于文本的大语言模型已经展示了令人瞩目的疾病诊断和医学推理能力。然而,真实的医患问诊从来不是一个纯粹的文本交换过程。在临床实践中,医生通过观察患者的面部表情、倾听咳嗽的音色、评估患者的体态和动作(如呼吸困难或静息震颤),不断捕获关键的非语言线索。

Analemma推出FARS:全自动科研系统,量产166篇论文!

过去一年里,AI在科研领域的应用边界被不断拓宽,从文献检索到辅助实验,甚至是端到端的“AI科学家”框架,都展示了语言模型在科学工作流中的巨大潜力。然而,现有绝大多数自动化研究系统往往在精心挑选的示例、人类限定的主题、预定义的基准测试或是狭窄的任务空间内进行展示。

Search over Self-Edit Strategies for LLM Adaptation

CMU新作:让AI自主设计“自我修正”策略,带存档机制逼近人类专家水平。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

LORE: A Large Generative Model for Search Relevance

阿里LORE:电商搜索相关性暴涨27%!大模型训练心法全公开。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

LLM-ERM: Sample-Efficient Program Learning via LLM-Guided Search

本文提出了一种名为 LLM-ERM 的新型程序学习算法,该算法通过大型语言模型(LLM)引导的搜索来高效地最小化经验风险,从而仅需极少量(例如1-2个)的输入输出样例就能成功合成正确的程序。

Unifying Tree Search Algorithm and Reward Design for LLM Reasoning: A Survey

随着大型语言模型 (LLM) 的扩展定律进入回报递减的阶段,研究前沿正从数据和参数的暴力增长转向算法效率和新的推理形式。在此背景下,两个相互关联的范式成为核心:深思熟虑的推理时搜索 (deliberative Test-Time Search, TTS),即在推理时分配自适应的辅助计算来解决难...

QAgent: A modular Search Agent with Interactive Query Understanding

本文提出了 QAgent,一个统一的智能体 RAG 框架,它通过一个采用两阶段强化学习策略训练的模块化搜索智能体,进行交互式查询理解和自适应检索,从而提高了对复杂问题的检索质量和作为可插拔模块的泛化能力。

Scaling up Multi-Turn Off-Policy RL and Multi-Agent Tree Search for LLM Step-Provers

本文介绍了BFS-Prover-V2,一个通过创新的训练与推理扩展技术来提升大型语言模型(LLM)定理证明能力的系统,它结合了克服性能瓶颈的多阶段强化学习框架和用于分层推理的规划器增强型多智能体搜索架构,从而在多个数学基准测试中取得了当前最优性能。

Re4: Scientific Computing Agent with Rewriting, Resolution, Review and Revision

本文提出了一个名为 Re⁴ 的科学计算智能体 (Agent) 框架,它通过“重写-解决-审查-修订” (Rewriting-Resolution-Review-Revision) 的逻辑链,利用多个大型语言模型 (LLM) 协同工作,显著提升了根据自然语言描述自主生成代码的可靠性和准确性。

BloombergGPT: A Large Language Model for Finance

本文提出了一种为金融领域专门打造的500亿参数大型语言模型——BloombergGPT,它通过在一个包含大量高质量金融数据和通用数据的混合数据集上进行训练,在金融领域的任务上取得了远超现有模型的性能,同时在通用LLM基准测试中保持了强大的竞争力。

Capabilities of GPT-4 on Medical Challenge Problems

本文通过对美国行医执照考试(USMLE)等权威医学基准的全面评测,表明通用的GPT-4模型在未经任何领域专业化微调的情况下,其医学知识水平和推理能力已远超之前的通用模型(GPT-3.5)和医学专用模型(Med-PaLM),并以高分通过考试,同时展现出更优的概率校准能力和强大的交互式解释潜力。

Limits of trust in medical AI

本文论证了医疗人工智能(AI)系统仅能被依赖(be relied upon),而不能被信任(be trusted),因为真正的信任需要善意、动机和道德责任等人类特有的能动性(agency)要素,而AI的广泛应用可能通过取代人类医生的认知权威,导致医疗实践中人际信任关系的缺失。

On-line Policy Improvement using Monte-Carlo Search

本文提出了一种在线策略改进算法,该算法通过蒙特卡洛搜索(Monte-Carlo search)实时评估当前状态下所有可能动作的长期期望回报,并选择最优动作,从而显著提升一个已有“基础策略”的表现。