WebShaper:集合论重构数据合成,打造最强开源搜索Agent
OpenAI的DeepResearch近期引爆了全网,展现了惊人的信息搜索(Information-Seeking,IS)能力。这类Agent系统能自主查阅海量资料,被视为迈向AGI的关键一步。然而,开源社区想要复现这类惊艳的系统,却常常卡在一个致命瓶颈上:高质量训练数据的极度匮乏。
OpenAI的DeepResearch近期引爆了全网,展现了惊人的信息搜索(Information-Seeking,IS)能力。这类Agent系统能自主查阅海量资料,被视为迈向AGI的关键一步。然而,开源社区想要复现这类惊艳的系统,却常常卡在一个致命瓶颈上:高质量训练数据的极度匮乏。
现有的语言模型,无论是大语言模型还是视觉语言模型,都在不知疲倦地逐字吐出Token。这种基于人类可读符号的显式生成机制,正遭遇难以逾越的瓶颈。信息冗余、离散化带来的精度损耗,以及串行解码的高昂成本,都在拖慢AI进化的脚步。大模型真的必须“说人话”来完成内部思考吗?答案或许是否定的。
如今,百亿甚至千亿参数的开源大模型已经唾手可得。但在实际的工业落地中,受限于推理延迟、显存占用以及部署成本,大家往往需要更加精悍的小型化模型。为了填补这一需求缺口,摆在AI工程师面前的通常只有两条路。第一条路,是收集海量的优质数据,耗费巨资从零开始训练一个小模型(TrainfromScratch)。
在当前的智能体(Agent)开发中,开发者常常陷入一个两难境地。如果为特定任务编写高度定制的策略,这些技能往往无法迁移到其他场景。反之,如果提取过于抽象的通用技能,在面对具体任务时又显得指导不足。这种“特化”与“泛化”的矛盾,一直是限制智能体在复杂推理任务中表现的瓶颈。
在真实的业务部署中,决定一个大语言模型(LLM)任务表现的,往往不仅是其内部那堆被冻结的千亿参数,更是包围在模型外围的“脚手架”——系统提示词、注入的背景知识、运行时的重试控制循环以及各类配置参数。当模型权重不可触及(由于使用闭源API或微调成本极其高昂)时,优化这些外围结构成了开发者手中唯一...
今天的智能手机与车机屏幕早已无处不在,但内置的语音助手往往只能完成定闹钟、查天气等刻板任务。一旦需求稍微超出预设模板,它们便会显得捉襟见肘,难以真正理解用户的复杂意图。如何打破这种“伪智能”的僵局?清华大学、华为、小米、vivo等九大顶尖产学研机构联合发布了一项重磅研究。
当前,大语言模型(LargeLanguageModel,LLM)Agent正频繁游走于海量且固定的外部数据中。无论是数万条用户反馈语料库,还是庞大复杂的企业级代码仓库。面对同一数据源的反复查询,现有系统的表现却像在不断经历“系统重启”。它们要么在冗长的对话记录中迷失,要么仅仅依靠被动的切片检索...
当一辆由大语言模型控制的自动驾驶汽车遇到严重火灾,而正前方却亮着红灯时,它该怎么做?是违规闯红灯以求生存,还是死板地遵守交通规则等待救援?传统的生成式智能体(GenerativeAgents)在模拟人类合作行为时表现优异。但在面临生存与规则冲突的复杂决策时,它们往往显得异常死板。
大模型推理成本高昂,长文本处理更是内存“吞金兽”。如何在保证千亿参数级别强大推理能力的同时,将推理吞吐量提升数倍?NVIDIA最近开源的Nemotron3Super交出了一份惊艳的答卷。这款总参数量达120B(激活参数仅12B)的模型,不仅原生支持高达100万的上下文窗口,更在复杂推理场景下实...
长期以来,创造力被普遍视为人类智能的“终极前沿”。即使大语言模型在标准化考试和代码生成上屡创佳绩,生成兼具新颖性与实用性的绝妙点子,似乎仍是人类独有的特权。然而,一项由微软亚洲研究院、剑桥大学等机构联合发布的研究彻底打破了这一固有认知。
当最先进的大语言模型试图解开复杂化学反应的奥秘时,它们却经常在最基础的环节栽跟头。为什么一个能写出完美代码的AI,却连简单的环状分子结构都容易认错?该研究指出,罪魁祸首并非模型本身的推理能力不足,而是我们给模型喂入数据的“方言”不对。长期以来,化学界习惯使用现成的文本格式来表示分子结构。
大语言模型的世界正在悄然发生深刻的变革。传统的自回归生成模式正逐渐显露出其在复杂推理上的局限。块级扩散语言模型(Block-wiseDiffusionLanguageModels,DLMs)异军突起。这种新兴架构允许以任意顺序一次性生成多个Token,展现出极大的灵活性。
大语言模型的世界一直被逐字生成的自回归机制统治。虽然扩散模型承诺了令人兴奋的并行生成前景,但它们在文本质量上始终无法与自回归模型抗衡。为什么扩散模型在图像领域大杀四方,在文本生成领域却总是“差一口气”?
随着上下文窗口越来越长,大模型在长周期任务中依然常常迷失。它们要么被历史交互中堆积如山的无效信息淹没,要么陷入死循环,疯狂消耗宝贵的API额度。过去,为了解决这个问题,开发者们通常会手写一套复杂的脚手架(Harness)代码。这些脚手架负责截断上下文、重试错误、解析输出。
大模型领域的“军备竞赛”正从参数量向上下文窗口急剧转移。当业界还在为几十万Token的窗口欢呼时,谷歌丢出了一枚重磅炸弹。该研究正式推出了Gemini1.5系列模型,最高支持令人咋舌的1000万Token的上下文。这意味着什么?它能一口气吞下长达107小时的音频数据。
当前的大语言模型虽然能在单次对话中对答如流。但一旦进入长期交互,它们常常会陷入“记了新的,忘了旧的”的窘境。现有的记忆系统大多采用统一流式更新。这意味着每一次日常闲聊的噪音,都可能直接污染已经建立的核心知识库。如何让Agent既能快速吸收新信息,又能稳固保持长期记忆?
当前,各大AI厂商都在疯狂内卷大语言模型的上下文窗口长度,百万级Token的输入似乎已经成为前沿模型的标配。然而,仅仅给模型塞入海量的上下文,它就真的能完美处理长周期的复杂任务吗?
当我们在跟大语言模型对话,或者让视觉模型识别图像时,它们的注意力真的都放在你精心准备的提示词或核心物体上吗?事实并非如此。研究人员发现了一个极其反直觉的现象:无论模型多么先进,它们总是会将海量的“注意力”倾注在毫无语义信息的“废话”上。
当前大语言模型的惊人突破,无一例外地建立在海量无监督文本的“投喂”之上。仅以知名的CommonCrawl为例,其包含了自2008年以来抓取的超2500亿个网页。这些未经雕琢的原始数据总量高达惊人的11PB,并且每月还在以数十亿的速度膨胀。然而,将所有可获取的数据毫无保留地塞进神经网络,真的是一...
在构建复杂的大语言模型系统中,开发者常遭遇一个幽灵般的工程难题。看似相同的系统架构,实际运行时的智能表现却大相径庭。这种差异的根源,往往隐藏在系统与模型交互的上下文结构中。随着多步推理和工具调用的普及,提示词早已不再是静态的文本。它变成了一个随着时间线动态演进、不断累积历史信息的复杂组合体。
深度学习的演进史上,很少有技术能像如今的大模型这样,在短短几年内彻底重塑整个行业的底层逻辑。过去,研究人员习惯于针对单一任务从零开始训练模型;而现在,整个AI界都在拥抱一种全新的范式:“预训练+微调”。
MIT新发现:大模型半数层在“划水”,R1推理变强竟不靠深度?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Web World Model:用普通代码构建“物理法则”,让LLM只负责“想象”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Transformer的世界观:自动将指数级复杂世界拆解为线性正交因子。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
斯坦福自动化AI科研:10轮进化准确率飙升21%,RL反而“变笨”?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
RL为何能让大模型“学会自省”?双阶段决策采样假说揭秘SFT的死穴。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Google DeepMind重磅发布T5Gemma 2:让Encoder-Decoder架构在长文本与多模态中强势回归。
成本暴降100倍!Step-GUI刷新SOTA,打造手机端最强“操作员”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
32B模型媲美OpenAI?Step-DeepResearch揭秘:低成本实现专家级深度研究。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别Softmax“分票”困境:Sigmoid Head无需人工标注,精准量化大模型置信度。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
SFTKey:别让CoT喧宾夺主!两阶段微调让大模型准确率提升超5%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
打破上下文诅咒:递归语言模型(RLM)让GPT-5处理无限长文本。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
像人一样“精读+略读”:RAM长文本压缩框架实现12倍加速。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Meta新作Canon Layers:仅增0.5%参数,推理深度暴涨4倍的“魔法”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
英伟达Nemotron 3发布:Mamba+MoE混合架构,百万上下文与NVFP4训练揭秘。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
NRGPT重构GPT底层逻辑:推理即能量下降,抗过拟合能力显著提升。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
打破深度学习“幻觉”:哥大&谷歌提出Nested Learning,重构大模型记忆与进化。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
别只看最后一句话!DeepMind新作MUSIC:合成数据攻克多轮对话评估难题。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
OpenAI意外曝光GPT-5 Thinking:思维链越长越安全?深度解析CoT监控新基准。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别“面条代码”:普林斯顿用Monad重塑AI Agent架构,健壮性狂飙。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
拒绝Token流水账!斯坦福新作Thought Gestalt:让AI像人类一样“思考”,参数效率暴涨40%。
仅15B激活参数硬刚DeepSeek!MiMo-V2-Flash揭秘:混合注意力与多教师蒸馏的极致效率。
DeepSeek魔改残差连接:mHC仅增6.7%开销,完美驯服大模型训练不稳定性。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI也能“反思”了?Anthropic揭秘LLM内省电路,检测率飙升75%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
TTT-Discover:开源模型+测试时训练,仅需数百美元刷新多领域SOTA。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
剑桥等名校联合檄文:LLM根本不懂语言!70MW能耗下的概率游戏。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
挑战香农极限:LLM揭示10^4字符长程依赖与“涌现确定性”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
10步推理生成电影级视频:快手Kling-Omni全能架构揭秘。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
思考预算并非万能:揭秘让大模型更聪明的“性价比”策略。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
小模型逆袭:MoL让1.2亿参数ModernALBERT超越全参数基线。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Transformer 越深越“傻”?几何视角揭秘百层大模型坍塌之谜。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
仅需4-11个纠错案例!FLEx:消除大模型83%顽固错误,无需参数微调。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
微调是“唤醒”还是“注入”?Anthropic提出EDL:量化模型泛化能力的标尺。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
大模型只是“概率填空”:揭秘AI与人类认知的7道“认识论断层”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Anthropic重磅:给大模型“植入思想”,Claude Opus 4.1展现惊人内省能力。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
内存仅需1/35!亚马逊ELLA:无需回放的大模型终身学习新SOTA。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
数字孪生迎“智变”:大模型与世界模型驱动的4阶段进化全景。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
超越ResNet!普林斯顿Deep Delta Learning:让神经网络学会“遗忘”与“反思”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别上下文遗忘!CaveAgent引入“双流架构”,数据密集任务Token暴降59%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
LLM数不清字数?阿里新法让模型“边写边看”,训练效率升4倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
单词破碎,性能崩塌?揭秘Tokenization如何悄悄“降智”大模型。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
超越Gemini-3-Pro:开源模型“组团”打怪,成本仅47%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
DeepMind重磅:自回归模型竟是EBM?揭秘Next-Token预测的“全局规划”能力。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
阿里IBKE:用“信息瓶颈”给大模型做脑部微创,知识编辑SOTA。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Qwen-14B逼近GPT-4!Orchestra多智能体架构让开源模型制霸表格问答。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
模型即数据!英伟达领衔,三大维度解读AI新前沿:权重空间学习。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
DeepMind重磅:仅需2个参数,精准预测LLM错误率!物理学“有效场论”立大功。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
LLM遇上多臂老虎机:首篇组件级综述揭秘“双向增强”决策智能。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
2025 AI透明度大倒退:均分跌至40,IBM夺冠,xAI与Midjourney垫底。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别LayerNorm?CMU提出Derf:仅用简单函数,多模态性能全面超越。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
斯坦福新观点:让AI挑战“不可能的语言”,4步揭秘人类认知偏好。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
80%的预测只需96个Token!DeepMind揭示大模型“短视”的秘密。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别“深度诅咒”:谷歌新方法LIDAS让LLM动态生长,训练提速29%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
反驳“LLM死路论”!斯坦福提出AGI“缺失层”,用一个公式定义通往AGI之路。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
KV缓存减半,性能反超!阿里FusedKV揭示K/V不对称共享新范式。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Agent训练告别数值奖励:字节跳動NLAC让AI用“人话”指导,性能最高提升24%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
斩获IMO/IOI金牌!DeepSeek-V3.2发布,推理比肩Gemini 3.0 Pro。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
终结AI幻觉:全面剖析大模型“胡说八道”的根源与应对策略。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
LLM与人脑“神同步”:Meta AI证实模型越大,计算路径越像人。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
NVIDIA万字长文:别再误用FNO了!傅里叶神经算子终极实践指南。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
大模型推理太“话痨”?ORION压缩16倍思考路径,成本直降9倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
1600万Token上下文!蚂蚁HSA模型实现90%准确率,揭秘超长记忆关键。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Meta重塑推荐系统:GESR用“混合注意力”打破双塔模型瓶颈,性能大涨延迟仅增10%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Qwen3-VL重磅发布:256K上下文,三大架构升级打造全能多模态。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI效率万倍增长神话破灭?MIT研究:90%的功劳来自Transformer的规模效应。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
83亿参数新SOTA!混元Video 1.5开源,推理加速87%,RTX 4090轻松跑。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
OmniScientist:让AI科学家“组建团队”,成果超越NIPS最佳论文。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
字节跳动VWN:不加算力“拓宽”Transformer,训练提速高达3倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI算力新范式:斯坦福提出“每瓦特智能”,本地模型能效两年提升5.3倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
LLM长文本“瘦身”8倍:新方法让模型按“句”读取,性能几乎无损。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI当上科学家:字节跳动AlphaResearch,8项难题2次击败人类专家。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Meta MobileLLM-Pro:10亿参数手机模型称王,四大创新超越Gemma与Llama 3.2。
本文通过一项在受控环境中进行的系统性实证研究发现,现有的模型编辑方法在更新代码大语言模型(code LLMs)以适应API演进时,表现出有限且不稳定的适应能力,普遍导致模型性能显著下降,且多数成功案例依赖变通方案而非真正采纳新API。
本文提出了一种名为远程劳动指数(Remote Labor Index, RLI)的新基准,通过评估AI智能体在真实自由职业平台上的端到端项目完成能力,来衡量AI在具有经济价值的实际任务上的自动化水平,从而为追踪AI的经济影响提供了实证基础。
本文提出了一种名为 LTE(Learning to reason from Trial and Error) 的方法,通过利用大语言模型(LLM)自身在推理失败时产生的错误答案作为提示信息,来克服强化学习中的探索停滞问题,从而无需任何外部专家指导即可提升模型的推理能力。
本文通过一个精心设计的实验揭示,深度序列模型在记忆事实时并非简单地存储局部关联,而是会自发形成一种“几何式记忆”结构,这种结构编码了实体间(包括训练中未共现的实体)的全局关系,从而将复杂的多步推理任务简化为易于学习的单步几何问题。
本文首次对新兴的 AI 科学家 (AI Scientist) 领域进行了系统性综述,提出了一个统一的六阶段科学工作流框架,并基于此框架梳理了从 2022 年到 2025 年的关键研究,揭示了该领域从基础模块化、闭环集成到追求可扩展性、影响力与人机协作的清晰三阶段演进脉络。
本文介绍了通义深搜(Tongyi DeepResearch),一个开源的AI研究智能体,它通过创新的“智能体中训练”与“智能体后训练”两阶段训练框架,结合可扩展的合成数据引擎,实现了领先的深度研究能力。
本文提出了一种名为“相对缩放定律 (Relative Scaling Laws)”的新框架,用于量化随着计算规模的增加,不同数据分布上的性能差距如何演变,揭示了规模增长并非普适的均衡器,其影响因领域而异。
本文提出了一种基于相对排序的新指标——相对概率(RBP),并据此建立了相对标度律(Relative-Based Scaling Law),该定律揭示了模型将正确答案排在靠前位置的能力如何随模型规模的增大而遵循幂律提升,为理解大语言模型提供了补充交叉熵的全新视角。
本文提出了一种名为 KCM (KAN-Based Collaboration Models) 的大-小模型协同框架,它利用一个基于 Kolmogorov-Arnold Network (KAN) 的小型判断模型,智能地将输入样本分配给高效的小模型或强大的预训练大模型处理,并通过提示修改和知识蒸...
本文通过借鉴认知科学的理性模型,系统性地研究了大型语言模型(LLMs)是否能像人类一样识别和评估沟通背后的动机(即“动机警惕性”),发现它们在受控实验中表现出类似人类的能力,但在复杂的现实世界场景中表现不佳,不过简单的引导提示可以改善其表现。
本文通过一系列实验发现,大型语言模型(LLMs)的内部激活向量中,确实以线性的方式编码了问题的难度,但这种编码与人类判断的对齐程度远高于与其它LLM性能评估的对齐程度;并且,在强化学习训练过程中,与人类判断一致的难度表征会得到加强,而与LLM性能相关的难度表征则会退化。
本文提出了一种名为"Compress to Impress"的高效LLM自适应方法,仅需在100个样本上进行单次梯度计算,并结合多子空间矩阵分解,即可在无需任何微调的情况下,快速提升模型在下游任务上的性能。
本文提出了一种名为 Auto-Rubric 的无训练框架,通过一个两阶段(查询特定的准则生成与查询无关的准则聚合)过程,仅用极少量偏好数据即可自动提取出可解释、可泛化且高效的奖励模型评估准则(Rubric)集。
本文提出一种新框架,通过将学习曲线(learning curves, LCs)预测问题建模为具有双层层级结构的多任务学习问题,并利用潜变量多输出高斯过程来捕捉任务间的相关性,从而实现对模型性能学习曲线的零样本(zero-shot)预测,进而以更低的计算成本生成概率性的缩放定律(scaling ...
本文提出了一种针对矩阵类参数的权重衰减缩放规则 ( ),通过在AdamW训练的稳态下保持子层增益在不同模型宽度下的不变性,从而扩展了最大更新参数化( P)框架,实现了学习率和权重衰减超参数的零样本迁移。
本文从统计学视角重新审视了大型语言模型的跨语言知识差距问题,提出这一差距主要源于目标语言(target language)响应的方差增大,而非知识传递失败所导致的偏差(bias),并通过创新的偏差-方差分解框架和一系列实验验证了该假设。
本文提出了一种名为胶囊提示调优(Capsule Prompt Tuning, CaPT)的新型参数高效微调方法,通过将实例感知(instance-aware)信息和任务感知(task-aware)信息创新性地融合到一个单一的“胶囊”提示向量中,解决了传统提示学习方法依赖繁琐的长度搜索且与输入序...
本文提出了一种名为 xLLM 的智能高效的大语言模型推理框架,其采用创新的服务-引擎解耦架构,通过智能调度与系统级协同优化,专为高性能、大规模的企业级服务而设计,解决了混合负载、资源利用率低和硬件适配性差等核心挑战。
本文提出了一个简洁、可解释的上下文感知缩放定律 (context-aware scaling law) 框架,该框架通过一个函数联合建模了训练计算量和上下文长度,从而能够准确预测和推断大型语言模型在下游任务中的性能。
本文系统地研究了“中训练 (Midtraining)”这一新兴实践,发现其通过在通用预训练和特定任务微调之间构建一个分布桥梁,能有效提升模型在数学和代码等领域的下游任务性能,并显著减少灾难性遗忘。
大语言模型溯源:一篇综述。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
关于使用大型语言模型进行 Vibe Coding 的综述。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文提出了一种名为 Linearizer 的新架构,通过将一个线性算子置于两个可逆神经网络之间,使得传统的非线性映射在特定构造的向量空间中表现为严格的线性变换,从而能够将线性代数的强大工具(如SVD、伪逆)应用于深度学习模型。
本文提出了一个名为 PLUM 的框架,旨在将预训练语言模型(LLM)应用于工业级生成式推荐任务,该框架通过语义ID(Semantic IDs)、领域持续预训练(CPT)和生成式微调三个阶段,实现了超越传统大规模嵌入模型的推荐效果和样本效率。
本文全面综述了大型语言模型(LLM)在构建“虚拟细胞”(virtual cell)——一个能够表示、预测和推理细胞状态与行为的计算系统——中的应用,并提出了一个将现有方法分为“作为预言机的LLM”(LLMs as Oracles)和“作为智能体的LLM”(LLMs as Agents)两大范式...
本文提出了一种名为人工海马网络(Artificial Hippocampus Networks, AHN)的框架,通过一个可学习的循环模块将滑窗外的Key-Value缓存压缩为固定大小的长期记忆,从而在显著降低计算和内存成本的同时,高效地处理长序列上下文。
本文系统性地分析和评估了语言模型的混合架构(层间与层内),发现层内混合策略在模型质量与计算效率之间取得了最佳的帕累托前沿 (Pareto-frontier)。
本文提出了一种名为“固定参数扩展”(Fixed Parameter Expansion, FPE)的方法,通过在不增加非零参数总数的情况下增加网络中的神经元数量,来减少由特征叠加(superposition)引起的干扰,从而提升模型性能。
本文提出了一种名为 TRAC 的在线强化学习后训练方法,利用模型自身的自注意力机制来识别并压缩冗余的推理步骤,并根据动态评估的任务难度自适应地调整压缩程度,从而有效缓解大模型在简单任务上“过度思考”和在困难任务上“思考不足”的问题。
本文挑战了领域特定监督微调(SFT)必然损害大语言模型(LLM)通用能力的普遍观念,指出使用小学习率可以显著缓解性能下降,并提出了一种名为“令牌自适应损失重加权”(TALR)的新方法,以更有效地平衡领域知识注入与通用能力保持。
本文提出了一种名为 REBACT 的新方法,在大型语言模型 (LLM) 执行下一步行动前增加了一个“反思”步骤,通过主动纠正先前动作中的错误,从而显著提升了其在交互式决策任务中的性能和计算效率。
本文提出了一种偏置高效微调方法 (Bias-Efficient Fine-Tuning, BEFT),其核心是一种通过计算微调前后偏置向量的投影比率来评估重要性的新方法,从而能够更精确地选择出对下游任务最关键的偏置项(如Q/K/V投影中的偏置)进行微调,以极低的参数量实现卓越性能。
本文提出了 WebWeaver,一个模仿人类研究过程的双智能体框架,其中规划器(Planner)通过迭代优化大纲并搜集证据,构建动态且有来源依据的报告结构,而写作者(Writer)则分章节、有针对性地从记忆库中检索信息进行写作,有效解决了传统方法的静态规划缺陷和长上下文处理失败问题,在开放式深...
本文为生命科学领域的研究人员提炼了一份提示工程(Prompt Engineering)快速入门指南,重点介绍了六种核心技术(零样本、少样本、思维生成、集成、自我批评和分解),并提供了具体的用例、最佳实践和常见陷阱,旨在帮助研究人员从机会主义的提问方式转变为系统、高效的实践。
本文提出了Opal,一个用于强化学习从人类反馈(RLHF)的算子代数视图,以及GKPO,一个标准化的交换模式,通过一个当且仅当满足三个核心假设时成立的约简定律,来统一、比较和验证不同的RLHF目标函数,从而整理了该领域繁杂的方法。
本文倡导将大型语言模型(LLM)的开发挑战构建为逆问题(inverse problems),从而以一种系统性的、高成本效益的方式,发现指导LLM构建与优化的底层缩放定律(scaling laws)。
本文提出了一种名为过渡模型 (Transition Models, TiM) 的新型生成范式,它通过学习一个能够在任意时间间隔 上进行状态转换的精确动力学方程,成功统一了高效的少步生成与高质量的多步精炼,解决了现有生成模型中普遍存在的“速度-质量”权衡困境。
本文提出,人类相较于人工智能(AI)的核心优势在于我们基于生物学的中央神经系统(Central Nervous System, CNS),它使我们能够沉浸式地与物理现实融为一体,体验真实的情感,从而发展出植根于经验、有意义且可持续的伦理体系,这是任何非生物的AI都无法复制的。
本文提出了一种名为 BEAM 的深度学习框架,它通过分析幼儿观看视频时的多视角脑电图(EEG)信号,结合特征融合与对比学习技术,实现了对儿童共情水平(表现为助人意愿)的客观、准确预测。
本文提出了Loong项目,一个旨在通过人工审查的种子数据集(LoongBench)和模块化的合成环境(LoongEnv),大规模生成跨多个推理领域、可自动验证的长链思维(Chain-of-Thoughts)数据,以解决高质量训练数据稀缺的问题,并为基于可验证奖励的强化学习(RLVR)提供支持。
本文提出了一种名为“核心参数隔离微调”(CPI-FT)的新框架,通过识别并隔离每个任务的核心参数区域、根据区域重叠度对任务进行分组,并结合参数融合与动态冻结策略进行多阶段微调,从而有效缓解多任务监督微调中的任务冲突和灾难性遗忘问题。
本文提出了一种名为 VibeVoice 的新模型,它通过一个创新的、具有超高压缩率的连续语音tokenizer和一个基于大型语言模型的下一token扩散框架,实现了长达90分钟、多达4人的高质量长篇对话语音合成。
本文提出了一个名为 UNIFORM 的统一知识迁移框架,旨在从大量异构(不同架构、不同训练数据)的预训练模型中,通过新颖的特征投票和Logit投票机制,解决知识冲突问题,从而高效地将共识知识迁移到一个学生模型中,且无需任何手动标注。
本文提出了一种名为 的方法,通过自动进化和增强编程指令的复杂性,来精调(fine-tune)代码大语言模型,从而创造出在多个基准测试中性能卓越的 模型系列。
大语言模型(Large Language Models, LLMs),例如ChatGPT和GPT-4,因其涌现能力和泛化性,在自然语言处理和人工智能领域引发了新的浪潮。然而,LLMs是黑箱模型,常常难以捕获和访问事实性知识。相比之下,知识图谱(Knowledge Graphs, KGs)是结构...
本文提出了一种名为“思想树”(Tree of Thoughts, ToT)的新型语言模型推理框架,它通过将问题解决过程建模为对“思想”(连貫的文本单元)树的探索,使大型语言模型能够进行深思熟虑的决策、前瞻和回溯,从而显著提升其在需要规划和搜索的复杂任务上的解决能力。
本文提出了一种名为元正则化 (Meta-Regularization) 的新方法,通过一个元学习框架来学习无偏的、校准良好的深度学习模型。该方法包含两个核心组件:一个能为Focal Loss学习样本级连续 值的 -Net ,以及一个作为无偏、可微校准目标的平滑期望校准误差 (SECE)。
本文提出了一个名为ToolLLM的通用工具使用框架,通过构建一个包含超过16000个真实世界API的大规模指令微调数据集ToolBench,并采用一种新颖的深度优先搜索决策树(DFSDT)方法,成功地将开源大语言模型(LLaMA)的工具使用能力提升至与ChatGPT相当的水平。
本文介绍了 Llama 3 模型家族,其中旗舰模型是一个拥有 405B 参数的密集型 Transformer,通过在 15T 多语言 token 上进行大规模预训练,并采用稳定可扩展的架构和训练方法,使其在多项基准测试中达到了与 GPT-4 等顶级模型相当的性能水平。
本文提出了一个名为 SWE-bench 的大规模、真实世界的软件工程基准,通过要求语言模型(Language Models, LMs)解决来自12个流行Python仓库的真实GitHub问题,发现即使是最先进的模型也难以完成这些复杂的代码编辑任务,揭示了当前模型能力的巨大局限性。
本文发布了StarCoder,一个拥有155亿参数、支持8K上下文长度和代码填充能力的开源代码大语言模型;该模型在经过精心筛选和隐私信息处理的 permissively licensed 代码数据集上进行训练,其性能超越了所有现存的多语言开源代码模型,并达到了与闭源模型相当的水平。
本文提出了一种名为 SparseGPT 的新颖剪枝方法,能够对超大规模语言模型(如 OPT-175B)进行一次性(One-Shot)剪枝,在不进行任何重新训练的情况下,达到50%-60%的稀疏度,同时保持极低的准确率损失。
本文提出了SAM 2,一个统一处理图像和视频中可提示分割任务的基础模型,它通过引入流式记忆架构和构建大规模视频分割数据集SA-V,在显著提升分割精度和交互效率的同时,性能超越了现有方法。
本文提出了一种极其简单且高效的方法,通过在精心筛选的1000个样本(s1K)上进行监督微调,并结合一种名为“预算强制”(budget forcing)的测试时干预技术,成功构建了一个具备强大推理能力和可控测试时扩展(test-time scaling)行为的语言模型(s1-32B)。
本文提出了一系列数学专用大语言模型 Qwen2.5-Math,其核心创新在于将“自我改进”(self-improvement)的理念贯穿于从预训练、后训练到推理的整个模型开发流程,从而在多个数学基准上实现了超越现有开源及闭源模型(如GPT-4o)的顶尖性能。
本文介绍了Qwen2系列大型语言模型,通过改进模型架构、扩大并优化多语言和代码数学预训练数据、采用可扩展的对齐技术,在0.5B到72B的多个尺寸上全面超越了现有开源模型,并在各项基准测试中展现出与顶尖闭源模型相当的竞争力。
本文提出了一种名为QLoRA的高效微调方法,通过将梯度反向传播到冻结的4-bit量化模型中的低秩适配器(LoRA),首次实现了在单个48GB GPU上微调65B参数的大型语言模型,同时保持了与16-bit全量微调相当的性能。
本文介绍了phi-3系列模型,特别是38亿参数的phi-3-mini,它通过在一个精心筛选和合成的高质量数据集上进行训练,实现了与Mixtral 8x7B和GPT-3.5等大模型相媲美的性能,同时其模型尺寸小到可以在手机上本地部署。
大型模型 (Large Models, LMs) 在自然语言处理 (NLP) 和计算机视觉 (CV) 等多个领域取得了显著进展,但其巨大的规模带来了高昂的计算成本。参数高效微调 (Parameter-Efficient Fine-Tuning, PEFT) 通过在冻结大部分预训练模型参数的同时...
本文通过对超过160个数据集的统计和描述,对物体识别领域的数据集和挑战赛进行了全面的回顾与分析,重点探讨了数据集在推动算法发展中的关键作用、主要数据集的演进趋势以及评估基准的变化。
本文提出了一种名为渐进式通道剪枝 (Progressive Channel Pruning, PCP) 的迭代式剪枝框架,该框架通过在每次迭代中执行“尝试-选择-剪枝”三步流水线,从多个最优选择的层中逐步移除少量通道,从而自动确定压缩后网络的最优结构,并成功将其应用于监督学习和迁移学习场景。
本文提出了一种名为 Mixtral 8x7B 的稀疏专家混合 (Sparse Mixture of Experts, SMoE) 模型,该模型在推理时仅激活一小部分参数(13B),却在性能上超越了参数量大得多的密集模型(如 Llama 2 70B),显著提升了模型的计算效率和性能。
本文介绍了一个名为 Mistral 7B 的70亿参数语言模型,它通过利用分组查询注意力(GQA)和滑动窗口注意力(SWA)机制,在保持高效率的同时,实现了在各项基准测试中超越更大参数模型(如 Llama 2 13B)的卓越性能。
本文提出 Llama Guard,一个基于 Llama2-7b 的开源模型,通过将其构建为一种遵循指令的分类器,为人类与AI的对话提供可定制的、高效的输入-输出内容安全防护。
本文发布了 Llama 2,一个包含从7B到70B参数的开源预训练和微调大型语言模型系列,其为对话优化的版本 Llama 2-Chat 在多个基准测试中表现优于现有开源模型,并通过详细阐述其微调和安全对齐方法,旨在推动社区对负责任的大型语言模型进行建设和发展。
本文提出了一种名为科尔莫戈罗夫-阿诺德网络(Kolmogorov-Arnold Networks, KANs)的新型神经网络架构,其将可学习的激活函数置于网络边缘(“权重”)而非节点上,从而在函数拟合等任务中,相比于传统的多层感知机(MLPs),展现出更高的精度和可解释性。
本文提出了一种名为 PAIR 的黑盒攻击算法,其利用一个攻击者大语言模型 (LLM),通过少量(通常少于20次)的查询,以自动化、迭代的方式生成并优化具有语义的提示(Prompt),从而高效地“越狱”目标 LLM。
本文提出iTransformer,通过将Transformer的输入维度进行“反转”,即视每个单独的时间序列变量为一个独立的Token,从而使自注意力机制能够有效捕捉多变量间的相关性,而前馈网络则用于学习每个序列的非线性表示,最终显著提升了时间序列预测的性能和泛化能力。
本文通过在覆盖7大类任务的20个NLP数据集上进行全面的零样本(zero-shot)评估,系统性地剖析了ChatGPT作为通用自然语言处理任务解决器的能力,发现其在推理密集型任务上表现出色,但在序列标注等特定任务上仍面临挑战,且综合性能通常不及为特定任务微调的模型。
本文是一部综合性的教科书或讲义,旨在介绍机器学习领域的数学基础和核心技术。其内容组织体现了对该领域的系统性分类。
本文是一份面向实践者和终端用户的综合性实践指南,围绕模型、数据和下游任务三个维度,深入探讨了如何有效利用大型语言模型(LLMs)解决自然语言处理(NLP)问题,并详细剖析了不同场景下选择LLMs或微调模型的利弊。
本文提出了一种名为“思想图谱 (Graph of Thoughts, GoT)”的新型提示框架,通过将大型语言模型 (LLM) 的思维过程建模为任意图结构,其中“思想”是节点,依赖关系是边,从而实现了超越链式或树状思维模式的、更复杂和强大的推理能力,尤其擅长聚合多个推理路径以生成协同的、更高质...
本文发布了GPT-4o,一个端到端训练的原生多模态(omni)模型,该模型能够统一处理和生成文本、音频、图像的任意组合,并详细介绍了其在新能力(特别是实时语音交互)下的安全评估体系、风险缓解措施及其潜在的社会影响。
本文介绍了一个大规模、多模态模型GPT-4,它能够接收图像和文本输入并生成文本输出,在多项专业和学术基准上展现出与人类相当的性能,并通过可预测的扩展方法实现了其性能的精准预测。
Generative AI。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文介绍Gemma 2系列开放语言模型(2B、9B、27B),通过在Transformer架构中交错使用局部-全局注意力、采用分组查询注意力,并对2B和9B模型应用知识蒸馏进行训练,实现了在同等参数规模下的最佳性能,甚至能与2-3倍大的模型相媲美。
本文提出了一种名为 Event-Model-F (F) 的事件形式化模型,该模型基于 foundational ontology (基础本体) DOLCE+DnS Ultralite (DUL),通过一种模式驱动的方法,全面地表示事件中的时间、空间、参与对象、结构关系(部分-整体、因果、相关)...
解释预测中最近邻方法的成功。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文提出了一种名为 DELTA 的解耦学习框架,通过两阶段训练策略(监督对比学习 + 均衡损失)有效解决了长尾在线持续学习(Long-Tailed Online Continual Learning, LTOCL)中的灾难性遗忘和类别不平衡问题。
本文提出了一种名为 DeepSeek-V3 的671B参数的强混合专家(MoE)模型,它通过创新的无辅助损失负载均衡策略、多Token预测训练目标以及高效的MLA和DeepSeekMoE架构,以极高的训练效率和经济成本,实现了与顶级闭源模型相媲美的性能。
本文提出了一种名为DeepSeek-V2的强混合专家(MoE)语言模型,该模型通过创新的多头潜在注意力(MLA)和DeepSeekMoE架构,在实现顶尖性能的同时,显著降低了训练成本并提升了推理效率。
大型语言模型 (Large Language Models, LLMs) 的崛起已从根本上改变了语言技术。然而,这些模型在取得巨大成功的同时,也可能会学习、延续并放大有害的社会偏见,这些偏见源于不平衡的社会群体表征、刻板印象、贬损性语言等,不成比例地影响着边缘化社区。
本文提出了AlpacaFarm,这是一个旨在使用大型语言模型(LLM)模拟人类反馈,从而以低成本、高效率地研究、开发和评估人类反馈学习方法的仿真框架。
本文提出了一种名为 BC+ 的新动作语言,通过将其语义建立在通用的稳定模型(Stable Model)之上,成功地统一并扩展了多种现有动作语言(如 , , , ),并自然地集成了现代答案集规划(Answer Set Programming, ASP)中的高级构造(如选择规则和聚合)。
A Survey of Large Language Models。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
软件模式与提示模式的比较。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。