最新发布
ZGCM-1:7B模型如何靠工具搜索叫板超大模型?全开源训推提速4.2倍
凭借这一范式与多项系统级协同设计,ZGCM-1-7B 在 16K 预训练中实现了约 4.2 倍的训练效率提升(Time-to-loss),支持原生 256K 上下文,并在数学推理与复杂 Agent 搜索基准上。
AGI FRONTIER
深度解读 AI 论文,追踪 Agent、推理、多模态与具身智能的最新进展。
最新发布
凭借这一范式与多项系统级协同设计,ZGCM-1-7B 在 16K 预训练中实现了约 4.2 倍的训练效率提升(Time-to-loss),支持原生 256K 上下文,并在数学推理与复杂 Agent 搜索基准上。
PAPER INSIGHTS
为了打破这一困局,研究团队提出了首个 AI 原生、安全且自主的攻防共进化系统 SysEvolve 。该系统通过协同设计的靶场平台 SysField 、自主攻击系统 SysSpear 和实时防御系统 SysArmor ,...
Solar Open 2 提出了一种名为“选择性权重迁移”(Selective Weight Transfer)的热启动策略,打破了传统认知中“架构大幅改变必须从头预训练”的铁律。模型上一代版本 Solar Open ...
针对这一瓶颈,腾讯与复旦大学的研究人员在论文《Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards》中提出了 Sear...
针对这一瓶颈,中国科学院与中国科学院大学的研究团队提出了 SciDSK(Scientific Data Skill,科学数据技能) 框架。这项工作的核心构想十分巧妙:不再试图去重构现有的底层数据仓储,也不把数据集当作笨...
针对这一隐蔽威胁,研究团队同时提出了一种无需调用大模型、零推理开销的输入端防御策略——显著性归一化(Salience Normalization),成功将攻击率压制至 15.3%。传统 RAG 系统在处理知识密集型问答...
研究包含两项核心成果:一是提出专门解耦环境推进与控制计算的动态评测基准 ReflexBench ,支持在同步与异步模式下精准注入真实物理延迟;二是构建了参数量不足 1B 的紧凑型模型 ReflexVLA 。
来自清华大学、中国科学院、Shopee、北京工业大学和东南大学等机构的研究团队,将这种认知直觉转化为一种原生的后训练框架,提出了 OmniReasoner 。该工作不再执着于通过无限扩展上下文窗口去强行“硬吞”全部音视...
我们往往在对方话音未落时就已经开始在大脑中构建回应,在开口陈述当前句子的同时构思下一句表达,即使中途被打断也能迅速吸收新信息并调整思路。然而,当下绝大多数基于大语言模型(LLM)构建的语音智能体(Voice Agent...
针对这一长期被忽视的痛点,来自中国科学院(CAS)、Memorax AI 等机构的研究团队提出了 MemChain 。这项工作颠覆了“检索后直接喂给模型”的粗放模式,首次在检索与回答生成之间引入了一个独立的可训练“检索...
来自埃默里大学因果动力学实验室(Causal Dynamics Lab, Emory University)的研究团队提出了名为 MegaMem 的超大上下文记忆检索系统,试图从根本架构上破除这一两难处境。其核心洞察在...
由北京交通大学、北京天坛医院、首都医科大学、西湖大学等机构联合提出的 MedClaw ,尝试通过一种完全不同的范式打破这一死锁。该系统提出了一个完全无需调整模型权重的 Agent 框架(Agent Harness),在...
研究者在此基础上提出了“对比消除”的设计。如果仅向模型灌输“打分器偏爱列表推导式而非 for 循环”,模型随后开始狂写列表推导式,实验者依然无法辨析模型是为了讨好打分器,还是产生了一种“既然打分器喜欢,那么用户大概也更...
韩国大邱庆北科学技术院(DGIST)的研究团队针对这一长期未解的痛点,提出了名为 LT-Mem 的易变性自适应时空记忆演进框架。该框架不把环境中的所有实体视为静态背景,也不对其进行无差别的纯文本历史流水账记录,而是建立...
从技术实现与应用落地来看,K-Bench 的结论向所有试图构建垂直科研智能体的从业者发出了一条清晰信号:当前通用大模型的基础底座,在面对非结构化现实需求时,依然缺乏严谨的自省与工程化定力。要在科研领域真正替代繁杂的体力...
针对这一长期困扰智能体进化的瓶颈,福州大学、香港理工大学、MemTensor、中国科学技术大学与西安交通大学等机构的研究人员提出了一种免训练的记忆与技能共进化治理框架——MSCE(Memory-Skill Co-Evo...
论文通过一个直观的例子揭示了这一机制如何瓦解系统的安全性:在一个自动化部署脚本中,包含一段用于清理构建残留的清理逻辑,其指令预设会根据环境变量 GITHUB WORKSPACE 理所当然地存在并指向代码仓库路径;然而在...
针对这一困境,研究团队提出了 EchoPath ——一种模型无关且环境无关的执行级可重放记忆框架。它不再将历史经验作为冗长的 Prompt 上下文喂回大模型,而是将经过终局验证的 GUI 执行轨迹提炼为标准化的“可调用...
然而,来自穆罕默德·本·扎耶德人工智能大学(MBZUAI)的一项最新研究提出了一个极具颠覆性的发现: 攻击者根本不需要诱导模型违背安全规则,也不需要模型在回复中吐出任何敏感词句,仅仅发送一组完全无害的普通提问,就能以极...
为此,研究团队提出了一种全新的系统级防御框架 FlowSeal。它不再指望大模型在同一个对话窗口里“既当裁判又当选手”,而是跳出模型上下文,在工具调用层构筑起基于数据溯源和信息流控制(Information Flow ...
为了全面覆盖机械工程设计流程,CADWorld 系统梳理了机械设计与制造领域的系统知识,构建了涵盖 11 个工作流类别的任务分类学(Taxonomy)。基准包含的 200 个任务覆盖了 183 个具体机械知识点。
为了搞清楚研发过程中的增益与损失发生在何处,研究团队将 Agent 的研发闭环显式拆解为三大正交的能力维度: 1. 方案构想(Solution Framing, C1) :衡量模型在最开始能否提出合理、有潜力的优化假设。