行业应用

OmniScientist:直接感知多模态原始证据,端到端科研胜率达85%

OmniScientist:真正的科学研究是一个动态闭环:对原始实验数据的直接观察决定了提出什么假说;实验执行后的原始曲线又决定了下一步如何修正方案;最终论文里的每一个主张,都必须严格回溯到观测细节。缺乏端到端感知的自动化系统,本质上只是一个高阶的代码执行器和论文生成模板,难以完成真正具有原创...

FinDeepIndicator:公式能拿70分终答仅40%,金融Agent卡在哪?

为了精确锁定 Agent 的能力边界,FinDeepIndicator 提出了一个过程级(Process-level)评估体系,将指标构建切分为四个清晰的生命周期阶段: 1. 公式规范化(Formula Specification) :评估模型是否能准确理解自然语言指令背后的金融概念,并转化为...

算力全浪费在重复Debug?哥大等重构科研Agent:金牌数翻倍至38枚

来自哥伦比亚大学、乔治城大学与 Capital One 的研究团队在深入解剖这一现象后,提出了一套全新的系统性解决方案。在底层大模型完全固定为 GPT-5-mini、不改动任何模型权重的严苛前提下,仅通过对智能体架构(Scaffold)的系统重构与算力回收。

GAUGE:大模型做金融估值为何建表93分、商业判断仅78分?

为打破这一死结,研究团队提出了针对 Agent 端到端金融估值建模的全新评测基准 GAUGE 。该基准不再依赖单一分析师的单点数值,而是构建了基于行业实践分布的“三层观察实践包线”(Observed-Practice Envelope),结合 56 个细粒度可审计切面与 8 道有效性门控。

ABE-Ralph:代码能跑不等于实验做对!破解AI科研“方法论幻觉”

为了彻底终结“以代码能否运行来衡量科研真伪”的评估偏见,研究团队提出了名为 ABE-Ralph 的全自动科学审计框架。该框架将科学复现与验证形式化为一个带有资源上限的 约束满足问题 (Constraint Satisfaction Problem, CSP),通过前置声明式 YAML 契约锁定...

K-Bench:大模型Agent做科研为何难达标?全员表达强于准确度,31%过度夸大

从技术实现与应用落地来看,K-Bench 的结论向所有试图构建垂直科研智能体的从业者发出了一条清晰信号:当前通用大模型的基础底座,在面对非结构化现实需求时,依然缺乏严谨的自省与工程化定力。要在科研领域真正替代繁杂的体力劳动,仅仅让模型学会利用工具编写文字报告是远远不够的。

SR-Agent:快手用Agent闭环自演化重排策略,订单量提升0.71%

为了解决这个顽疾,快手电商团队提出了工业界首个面向重排策略调优的闭环智能体框架: SR-Agent 。这项工作最值得关注的地方在于,它没有随波逐流地让大语言模型(LLM)去重写推荐模型的底层代码,也没有停留在简单的“LLM 当用户评分裁判”。

不是代码没变,而是算法卡死!DAPS让自主科研闭环泛化提升83.7%

针对这一顽疾,研究团队提出了 多样性感知提案采样框架(Diversity-Aware Proposal Sampling,简称 DAPS) 。在严格隔绝的“闭环-审计-双盲”三层验证协议下,DAPS 将算法语义聚类的衰减程度降低了 69.1%,并将未见过测试集上的相对保真度提升了 83.7%。

RSIBench-Data:大模型自主搞数据科研,58%能突破但78%越改越差

RSIBench-Data:弱势智能体在面对评估失败时,往往给出泛化的诊断,例如简单归咎于“模型代码生成能力不足”,随后盲目堆砌合成数据量;而表现出色的轨迹中,智能体能够精确阅读沙箱返回的具体异常栈,识别出基座模型究竟是缺失了特定库的上下文理解、欠缺特定工具参数的转义格式,还是在多步骤长链规划...

FrontierChallenge:平均分逼近90,顶尖科学Agent为何交付通过率仅20.6%?

评估一个大语言模型或智能体(Agent)的科学能力,标准正在发生根本性的变化。过去两年,各类基准测试主要集中于两类形态:要么是类似于“人类最后考试”(HLE)这种高度凝练、依赖纯专家知识的硬核选择题与问答题,要么是针对单一数据科学脚本的代码生成与补全。