Mechanist:用AI自主解构AI机制,从跨模态潜意识偏好到DNA精准干预
来自新加坡国立大学、加州大学圣地亚哥分校、浙江大学、南方科技大学等机构的研究团队提出了 Mechanist ,这是首个将 AI 本身作为“科学仪器”,用于全自主探索、解释并干预大模型内部智能机制的 Agent 科学研究系统。
来自新加坡国立大学、加州大学圣地亚哥分校、浙江大学、南方科技大学等机构的研究团队提出了 Mechanist ,这是首个将 AI 本身作为“科学仪器”,用于全自主探索、解释并干预大模型内部智能机制的 Agent 科学研究系统。
OmniScientist:真正的科学研究是一个动态闭环:对原始实验数据的直接观察决定了提出什么假说;实验执行后的原始曲线又决定了下一步如何修正方案;最终论文里的每一个主张,都必须严格回溯到观测细节。缺乏端到端感知的自动化系统,本质上只是一个高阶的代码执行器和论文生成模板,难以完成真正具有原创...
来自穆罕默德·本·扎耶德人工智能大学(MBZUAI)等机构的研究团队提出了 FigMirror。这项工作指出了一个长期被忽视的事实:科研图表与操作系统图形界面(GUI)在底层结构上高度同构,都是由代码生成的离散几何元素。
实验表明,即便换上顶尖的闭源基础模型(如 Opus-5),在 FinanceGym 上的综合得分依然低于 45%,暴露了金融研究对于复杂逻辑推理的苛刻要求;而借助 FinanceHarness 的专业分层设计,同尺寸开源基座模型的研报质量基准得分直接从 25.3% 跃升至 32.4%。
为了精确锁定 Agent 的能力边界,FinDeepIndicator 提出了一个过程级(Process-level)评估体系,将指标构建切分为四个清晰的生命周期阶段: 1. 公式规范化(Formula Specification) :评估模型是否能准确理解自然语言指令背后的金融概念,并转化为...
针对这一未被充分探索的真实现实痛点,上海人工智能实验室与同济大学等机构的研究团队提出了全新的任务范式—— 深度科学数据探索 (Deep Scientific Data Exploring),并推出了端到端轨迹合成框架 SciDataSailor 。
为了打破这种“只管生成、不保求真”的流水线局限,研究团队提出了名为 EviGraph 的全新自主科研框架。EviGraph 将科研过程从单向的流水线执行,重构成以“有类型证据图”(Typed Evidence Graph)为核心操作状态的闭环系统。
来自哥伦比亚大学、乔治城大学与 Capital One 的研究团队在深入解剖这一现象后,提出了一套全新的系统性解决方案。在底层大模型完全固定为 GPT-5-mini、不改动任何模型权重的严苛前提下,仅通过对智能体架构(Scaffold)的系统重构与算力回收。
为打破这一死结,研究团队提出了针对 Agent 端到端金融估值建模的全新评测基准 GAUGE 。该基准不再依赖单一分析师的单点数值,而是构建了基于行业实践分布的“三层观察实践包线”(Observed-Practice Envelope),结合 56 个细粒度可审计切面与 8 道有效性门控。
为了填补这一评测空白,最新研究提出了 SciExplore 。该基准将真实的科研信息搜寻抽象为一个渐进的认知阶梯,涵盖跨 10 多个学科的 103 项博士级深度任务,系统性评测大模型从最底层的实体推理到顶层的领域级结构化知识合成能力。
为了破解这一难题,研究团队提出了 RecHarness 。这项工作并未试图训练一个无所不能的端到端超大模型,而是退后一步,为大模型 Agent 建立了一套结合统计决策与程序生成的双层分流驾驭架构(Harness)。
为了彻底终结“以代码能否运行来衡量科研真伪”的评估偏见,研究团队提出了名为 ABE-Ralph 的全自动科学审计框架。该框架将科学复现与验证形式化为一个带有资源上限的 约束满足问题 (Constraint Satisfaction Problem, CSP),通过前置声明式 YAML 契约锁定...
从技术实现与应用落地来看,K-Bench 的结论向所有试图构建垂直科研智能体的从业者发出了一条清晰信号:当前通用大模型的基础底座,在面对非结构化现实需求时,依然缺乏严谨的自省与工程化定力。要在科研领域真正替代繁杂的体力劳动,仅仅让模型学会利用工具编写文字报告是远远不够的。
为了化解这一危机,研究团队提出了名为 Rehearse 的轻量级控制技能,将原本单调的“生成即运行”改造为“生成候选–精准预测–选优执行”闭环,并配合极简的聚焦结果记忆机制,在 4000 次模型训练预算下,显著放大了长程代码自优化的搜索效率。
为了攻破这一开放世界瓶颈,最新研究提出了 SciToolAgent-Evo 。这是一个具备本体感知(Ontology-Aware)与自演化能力的科学工具获取智能体框架。
为了解决这个顽疾,快手电商团队提出了工业界首个面向重排策略调优的闭环智能体框架: SR-Agent 。这项工作最值得关注的地方在于,它没有随波逐流地让大语言模型(LLM)去重写推荐模型的底层代码,也没有停留在简单的“LLM 当用户评分裁判”。
近期发表的这项工作提出了 SciDisco 框架,试图彻底改变这一现状。其核心思路不是在推理阶段堆叠复杂的 Prompt 工作流,而是构建了一个原生支持过程验证与多轮信用分配的训练闭环。
CliniCARE-Bench 正是基于这一严苛的部署导向而构建。研究团队依托 MIMIC-IV 真实患者数据集,设计了 25 个经由临床专家严格验证的审计场景,共实例化为 750 个具体的纵向病历案例,横跨 14 个专科门类与 10 项核心推理能力。
来自 KAIST、首尔大学、伦敦大学学院(UCL)、阿姆斯特丹大学、海法大学与耶鲁大学的研究团队提出了首个端到端自动化开展 AI Agent 行为科学研究的多智能体系统 AEROBAT (Automated Experimental Research on Behaviors of AI Ag...
针对这一顽疾,研究团队提出了 多样性感知提案采样框架(Diversity-Aware Proposal Sampling,简称 DAPS) 。在严格隔绝的“闭环-审计-双盲”三层验证协议下,DAPS 将算法语义聚类的衰减程度降低了 69.1%,并将未见过测试集上的相对保真度提升了 83.7%。
RSIBench-Data:弱势智能体在面对评估失败时,往往给出泛化的诊断,例如简单归咎于“模型代码生成能力不足”,随后盲目堆砌合成数据量;而表现出色的轨迹中,智能体能够精确阅读沙箱返回的具体异常栈,识别出基座模型究竟是缺失了特定库的上下文理解、欠缺特定工具参数的转义格式,还是在多步骤长链规划...
Microsoft:为此,AdsWorldEngine 提出了中枢与工具的迭代联合优化范式(Iterative Actor-Tool Optimization)。这一循环由两个交替演进的飞轮组成: 第一个飞轮是 中枢策略对工具特性的自适应 。
北京智源人工智能研究院、香港理工大学、中国人民大学与中国科学技术大学的研究团队在近期工作中指出了这一结构性缺失,并提出了名为 DisCo 的技能驱动型科研智能体框架。
评估一个大语言模型或智能体(Agent)的科学能力,标准正在发生根本性的变化。过去两年,各类基准测试主要集中于两类形态:要么是类似于“人类最后考试”(HLE)这种高度凝练、依赖纯专家知识的硬核选择题与问答题,要么是针对单一数据科学脚本的代码生成与补全。