基础模型

WebShaper:集合论重构数据合成,打造最强开源搜索Agent

OpenAI的DeepResearch近期引爆了全网,展现了惊人的信息搜索(Information-Seeking,IS)能力。这类Agent系统能自主查阅海量资料,被视为迈向AGI的关键一步。然而,开源社区想要复现这类惊艳的系统,却常常卡在一个致命瓶颈上:高质量训练数据的极度匮乏。

告别Token依赖!清华与NUS联合揭秘大模型隐空间,盘点4大机制与7大能力

现有的语言模型,无论是大语言模型还是视觉语言模型,都在不知疲倦地逐字吐出Token。这种基于人类可读符号的显式生成机制,正遭遇难以逾越的瓶颈。信息冗余、离散化带来的精度损耗,以及串行解码的高昂成本,都在拖慢AI进化的脚步。大模型真的必须“说人话”来完成内部思考吗?答案或许是否定的。

大模型剪枝还是从头训练?50%压缩率下的LLM微缩路线指南

如今,百亿甚至千亿参数的开源大模型已经唾手可得。但在实际的工业落地中,受限于推理延迟、显存占用以及部署成本,大家往往需要更加精悍的小型化模型。为了填补这一需求缺口,摆在AI工程师面前的通常只有两条路。第一条路,是收集海量的优质数据,耗费巨资从零开始训练一个小模型(TrainfromScratch)。

SkillComposer:Agent技能自我进化,跨级提升模型4.5分

在当前的智能体(Agent)开发中,开发者常常陷入一个两难境地。如果为特定任务编写高度定制的策略,这些技能往往无法迁移到其他场景。反之,如果提取过于抽象的通用技能,在面对具体任务时又显得指导不足。这种“特化”与“泛化”的矛盾,一直是限制智能体在复杂推理任务中表现的瓶颈。

Agent脚手架自进化:GSME框架破解评估噪音,冻结模型性能暴涨15.5%

在真实的业务部署中,决定一个大语言模型(LLM)任务表现的,往往不仅是其内部那堆被冻结的千亿参数,更是包围在模型外围的“脚手架”——系统提示词、注入的背景知识、运行时的重试控制循环以及各类配置参数。当模型权重不可触及(由于使用闭源API或微调成本极其高昂)时,优化这些外围结构成了开发者手中唯一...

迈向L5级智能:清华华为等九大机构联合定义个人LLM Agent

今天的智能手机与车机屏幕早已无处不在,但内置的语音助手往往只能完成定闹钟、查天气等刻板任务。一旦需求稍微超出预设模板,它们便会显得捉襟见肘,难以真正理解用户的复杂意图。如何打破这种“伪智能”的僵局?清华大学、华为、小米、vivo等九大顶尖产学研机构联合发布了一项重磅研究。

PEEK:为大模型Agent装上“上下文地图”,长文本成本直降5.8倍

当前,大语言模型(LargeLanguageModel,LLM)Agent正频繁游走于海量且固定的外部数据中。无论是数万条用户反馈语料库,还是庞大复杂的企业级代码仓库。面对同一数据源的反复查询,现有系统的表现却像在不断经历“系统重启”。它们要么在冗长的对话记录中迷失,要么仅仅依靠被动的切片检索...

赋予Agent“变通”智慧:PAVE架构让AI火灾违规逃生率达81%

当一辆由大语言模型控制的自动驾驶汽车遇到严重火灾,而正前方却亮着红灯时,它该怎么做?是违规闯红灯以求生存,还是死板地遵守交通规则等待救援?传统的生成式智能体(GenerativeAgents)在模拟人类合作行为时表现优异。但在面临生存与规则冲突的复杂决策时,它们往往显得异常死板。

Nemotron 3 Super开源:提速7.5倍的120B混合架构MoE解读

大模型推理成本高昂,长文本处理更是内存“吞金兽”。如何在保证千亿参数级别强大推理能力的同时,将推理吞吐量提升数倍?NVIDIA最近开源的Nemotron3Super交出了一份惊艳的答卷。这款总参数量达120B(激活参数仅12B)的模型,不仅原生支持高达100万的上下文窗口,更在复杂推理场景下实...

多智能体AI创造力碾压人类团队?1.5倍断层优势与语义轨迹揭秘

长期以来,创造力被普遍视为人类智能的“终极前沿”。即使大语言模型在标准化考试和代码生成上屡创佳绩,生成兼具新颖性与实用性的绝妙点子,似乎仍是人类独有的特权。然而,一项由微软亚洲研究院、剑桥大学等机构联合发布的研究彻底打破了这一固有认知。

牛津大学提出MolJSON:大模型分子推理准确率飙升至98.5%的全新格式

当最先进的大语言模型试图解开复杂化学反应的奥秘时,它们却经常在最基础的环节栽跟头。为什么一个能写出完美代码的AI,却连简单的环状分子结构都容易认错?该研究指出,罪魁祸首并非模型本身的推理能力不足,而是我们给模型喂入数据的“方言”不对。长期以来,化学界习惯使用现成的文本格式来表示分子结构。

提速4.14倍!LoSA破解长文本扩散模型的KV膨胀难题

大语言模型的世界正在悄然发生深刻的变革。传统的自回归生成模式正逐渐显露出其在复杂推理上的局限。块级扩散语言模型(Block-wiseDiffusionLanguageModels,DLMs)异军突起。这种新兴架构允许以任意顺序一次性生成多个Token,展现出极大的灵活性。

吞吐量飙升3倍!I-DLM破局并行解码,媲美同级自回归质量

大语言模型的世界一直被逐字生成的自回归机制统治。虽然扩散模型承诺了令人兴奋的并行生成前景,但它们在文本质量上始终无法与自回归模型抗衡。为什么扩散模型在图像领域大杀四方,在文本生成领域却总是“差一口气”?

HarnessBridge:重塑Agent交互,Token骤降90%还能涨点

随着上下文窗口越来越长,大模型在长周期任务中依然常常迷失。它们要么被历史交互中堆积如山的无效信息淹没,要么陷入死循环,疯狂消耗宝贵的API额度。过去,为了解决这个问题,开发者们通常会手写一套复杂的脚手架(Harness)代码。这些脚手架负责截断上下文、重试错误、解析输出。

谷歌Gemini 1.5硬核解析:挑战1000万Token上下文,解锁多模态推理新极限

大模型领域的“军备竞赛”正从参数量向上下文窗口急剧转移。当业界还在为几十万Token的窗口欢呼时,谷歌丢出了一枚重磅炸弹。该研究正式推出了Gemini1.5系列模型,最高支持令人咋舌的1000万Token的上下文。这意味着什么?它能一口气吞下长达107小时的音频数据。

告别记忆污染!GAM分层图记忆让Agent长程推理提升86%

当前的大语言模型虽然能在单次对话中对答如流。但一旦进入长期交互,它们常常会陷入“记了新的,忘了旧的”的窘境。现有的记忆系统大多采用统一流式更新。这意味着每一次日常闲聊的噪音,都可能直接污染已经建立的核心知识库。如何让Agent既能快速吸收新信息,又能稳固保持长期记忆?

揭秘大模型“挑食”法则:11PB海量预训练数据如何精准提纯?

当前大语言模型的惊人突破,无一例外地建立在海量无监督文本的“投喂”之上。仅以知名的CommonCrawl为例,其包含了自2008年以来抓取的超2500亿个网页。这些未经雕琢的原始数据总量高达惊人的11PB,并且每月还在以数十亿的速度膨胀。然而,将所有可获取的数据毫无保留地塞进神经网络,真的是一...

告别Prompt玄学!ACDL:首个定义Agent动态上下文的标准语言

在构建复杂的大语言模型系统中,开发者常遭遇一个幽灵般的工程难题。看似相同的系统架构,实际运行时的智能表现却大相径庭。这种差异的根源,往往隐藏在系统与模型交互的上下文结构中。随着多步推理和工具调用的普及,提示词早已不再是静态的文本。它变成了一个随着时间线动态演进、不断累积历史信息的复杂组合体。

千亿参数的基石:预训练基础模型(PFMs)跨模态演进全解析

深度学习的演进史上,很少有技术能像如今的大模型这样,在短短几年内彻底重塑整个行业的底层逻辑。过去,研究人员习惯于针对单一任务从零开始训练模型;而现在,整个AI界都在拥抱一种全新的范式:“预训练+微调”。

Web World Models

Web World Model:用普通代码构建“物理法则”,让LLM只负责“想象”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Transformers learn factored representations

Transformer的世界观:自动将指数级复杂世界拆解为线性正交因子。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Towards Execution-Grounded Automated AI Research

斯坦福自动化AI科研:10轮进化准确率飙升21%,RL反而“变笨”?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Step-GUI Technical Report

成本暴降100倍!Step-GUI刷新SOTA,打造手机端最强“操作员”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Step-DeepResearch Technical Report

32B模型媲美OpenAI?Step-DeepResearch揭秘:低成本实现专家级深度研究。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Recursive Language Models

打破上下文诅咒:递归语言模型(RLM)让GPT-5处理无限长文本。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

NVIDIA Nemotron 3: Efficient and Open Intelligence

英伟达Nemotron 3发布:Mamba+MoE混合架构,百万上下文与NVFP4训练揭秘。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

NRGPT: An Energy-based Alternative for GPT

NRGPT重构GPT底层逻辑:推理即能量下降,抗过拟合能力显著提升。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Nested Learning: The Illusion of Deep Learning Architectures

打破深度学习“幻觉”:哥大&谷歌提出Nested Learning,重构大模型记忆与进化。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Monitoring Monitorability

OpenAI意外曝光GPT-5 Thinking:思维链越长越安全?深度解析CoT监控新基准。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Monadic Context Engineering

告别“面条代码”:普林斯顿用Monad重塑AI Agent架构,健壮性狂飙。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

MiMo-V2-Flash Technical Report

仅15B激活参数硬刚DeepSeek!MiMo-V2-Flash揭秘:混合注意力与多教师蒸馏的极致效率。

mHC: Manifold-Constrained Hyper-Connections

DeepSeek魔改残差连接:mHC仅增6.7%开销,完美驯服大模型训练不稳定性。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Mechanisms of Introspective Awareness

AI也能“反思”了?Anthropic揭秘LLM内省电路,检测率飙升75%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Learning to Discover at Test Time

TTT-Discover:开源模型+测试时训练,仅需数百美元刷新多领域SOTA。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Large language models are not about language

剑桥等名校联合檄文:LLM根本不懂语言!70MW能耗下的概率游戏。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Large language models and the entropy of English

挑战香农极限:LLM揭示10^4字符长程依赖与“涌现确定性”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Kling-Omni Technical Report

10步推理生成电影级视频:快手Kling-Omni全能架构揭秘。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Increasing the Thinking Budget is Not All You Need

思考预算并非万能:揭秘让大模型更聪明的“性价比”策略。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Geometric and Dynamic Scaling in Deep Transformers

Transformer 越深越“傻”?几何视角揭秘百层大模型坍塌之谜。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Emergent Introspective Awareness in Large Language Models

Anthropic重磅:给大模型“植入思想”,Claude Opus 4.1展现惊人内省能力。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Deep Delta Learning

超越ResNet!普林斯顿Deep Delta Learning:让神经网络学会“遗忘”与“反思”。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Accurate Table Question Answering with Accessible LLMs

Qwen-14B逼近GPT-4!Orchestra多智能体架构让开源模型制霸表格问答。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

A model of errors in transformers

DeepMind重磅:仅需2个参数,精准预测LLM错误率!物理学“有效场论”立大功。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

The 2025 Foundation Model Transparency Index

2025 AI透明度大倒退:均分跌至40,IBM夺冠,xAI与Midjourney垫底。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Stronger Normalization-Free Transformers

告别LayerNorm?CMU提出Derf:仅用简单函数,多模态性能全面超越。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Generative Early Stage Ranking

Meta重塑推荐系统:GESR用“混合注意力”打破双塔模型瓶颈,性能大涨延迟仅增10%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Qwen3-VL Technical Report

Qwen3-VL重磅发布:256K上下文,三大架构升级打造全能多模态。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

On the Origin of Algorithmic Progress in AI

AI效率万倍增长神话破灭?MIT研究:90%的功劳来自Transformer的规模效应。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

HunyuanVideo 1.5 Technical Report

83亿参数新SOTA!混元Video 1.5开源,推理加速87%,RTX 4090轻松跑。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Virtual Width Networks

字节跳动VWN:不加算力“拓宽”Transformer,训练提速高达3倍!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Sentence-Anchored Gist Compression for Long-Context LLMs

LLM长文本“瘦身”8倍:新方法让模型按“句”读取,性能几乎无损。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Understanding Robustness of Model Editing in Code LLMs: An Empirical Study

本文通过一项在受控环境中进行的系统性实证研究发现,现有的模型编辑方法在更新代码大语言模型(code LLMs)以适应API演进时,表现出有限且不稳定的适应能力,普遍导致模型性能显著下降,且多数成功案例依赖变通方案而非真正采纳新API。

Remote Labor Index: Measuring AI Automation of Remote Work

本文提出了一种名为远程劳动指数(Remote Labor Index, RLI)的新基准,通过评估AI智能体在真实自由职业平台上的端到端项目完成能力,来衡量AI在具有经济价值的实际任务上的自动化水平,从而为追踪AI的经济影响提供了实证基础。

Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error

本文提出了一种名为 LTE(Learning to reason from Trial and Error) 的方法,通过利用大语言模型(LLM)自身在推理失败时产生的错误答案作为提示信息,来克服强化学习中的探索停滞问题,从而无需任何外部专家指导即可提升模型的推理能力。

Deep sequence models tend to memorize geometrically; it is unclear why

本文通过一个精心设计的实验揭示,深度序列模型在记忆事实时并非简单地存储局部关联,而是会自发形成一种“几何式记忆”结构,这种结构编码了实体间(包括训练中未共现的实体)的全局关系,从而将复杂的多步推理任务简化为易于学习的单步几何问题。

A Survey of AI Scientists: Surveying the automatic Scientists and Research

本文首次对新兴的 AI 科学家 (AI Scientist) 领域进行了系统性综述,提出了一个统一的六阶段科学工作流框架,并基于此框架梳理了从 2022 年到 2025 年的关键研究,揭示了该领域从基础模块化、闭环集成到追求可扩展性、影响力与人机协作的清晰三阶段演进脉络。

Tongyi DeepResearch Technical Report

本文介绍了通义深搜(Tongyi DeepResearch),一个开源的AI研究智能体,它通过创新的“智能体中训练”与“智能体后训练”两阶段训练框架,结合可扩展的合成数据引擎,实现了领先的深度研究能力。

Relative Scaling Laws for LLMs

本文提出了一种名为“相对缩放定律 (Relative Scaling Laws)”的新框架,用于量化随着计算规模的增加,不同数据分布上的性能差距如何演变,揭示了规模增长并非普适的均衡器,其影响因领域而异。

Relative-Based Scaling Law for Neural Language Models

本文提出了一种基于相对排序的新指标——相对概率(RBP),并据此建立了相对标度律(Relative-Based Scaling Law),该定律揭示了模型将正确答案排在靠前位置的能力如何随模型规模的增大而遵循幂律提升,为理解大语言模型提供了补充交叉熵的全新视角。

KCM: KAN-Based Collaboration Models Enhance Pretrained Large Models

本文提出了一种名为 KCM (KAN-Based Collaboration Models) 的大-小模型协同框架,它利用一个基于 Kolmogorov-Arnold Network (KAN) 的小型判断模型,智能地将输入样本分配给高效的小模型或强大的预训练大模型处理,并通过提示修改和知识蒸...

Are Large Language Models Sensitive to the Motives Behind Communication?

本文通过借鉴认知科学的理性模型,系统性地研究了大型语言模型(LLMs)是否能像人类一样识别和评估沟通背后的动机(即“动机警惕性”),发现它们在受控实验中表现出类似人类的能力,但在复杂的现实世界场景中表现不佳,不过简单的引导提示可以改善其表现。

LLMs Encode How Difficult Problems Are

本文通过一系列实验发现,大型语言模型(LLMs)的内部激活向量中,确实以线性的方式编码了问题的难度,但这种编码与人类判断的对齐程度远高于与其它LLM性能评估的对齐程度;并且,在强化学习训练过程中,与人类判断一致的难度表征会得到加强,而与LLM性能相关的难度表征则会退化。

Zero-Shot Performance Prediction for Probabilistic Scaling Laws

本文提出一种新框架,通过将学习曲线(learning curves, LCs)预测问题建模为具有双层层级结构的多任务学习问题,并利用潜变量多输出高斯过程来捕捉任务间的相关性,从而实现对模型性能学习曲线的零样本(zero-shot)预测,进而以更低的计算成本生成概率性的缩放定律(scaling ...

Robust Layerwise Scaling Rules by Proper Weight Decay Tuning

本文提出了一种针对矩阵类参数的权重衰减缩放规则 ( ),通过在AdamW训练的稳态下保持子层增益在不同模型宽度下的不变性,从而扩展了最大更新参数化( P)框架,实现了学习率和权重衰减超参数的零样本迁移。

Rethinking Cross-lingual Gaps from a Statistical Viewpoint

本文从统计学视角重新审视了大型语言模型的跨语言知识差距问题,提出这一差距主要源于目标语言(target language)响应的方差增大,而非知识传递失败所导致的偏差(bias),并通过创新的偏差-方差分解框架和一系列实验验证了该假设。

All You Need is One: Capsule Prompt Tuning with a Single Vector

本文提出了一种名为胶囊提示调优(Capsule Prompt Tuning, CaPT)的新型参数高效微调方法,通过将实例感知(instance-aware)信息和任务感知(task-aware)信息创新性地融合到一个单一的“胶囊”提示向量中,解决了传统提示学习方法依赖繁琐的长度搜索且与输入序...

xLLM Technical Report

本文提出了一种名为 xLLM 的智能高效的大语言模型推理框架,其采用创新的服务-引擎解耦架构,通过智能调度与系统级协同优化,专为高性能、大规模的企业级服务而设计,解决了混合负载、资源利用率低和硬件适配性差等核心挑战。

Predicting Task Performance with Context-aware Scaling Laws

本文提出了一个简洁、可解释的上下文感知缩放定律 (context-aware scaling law) 框架,该框架通过一个函数联合建模了训练计算量和上下文长度,从而能够准确预测和推断大型语言模型在下游任务中的性能。

Midtraining Bridges Pretraining and Posttraining Distributions

本文系统地研究了“中训练 (Midtraining)”这一新兴实践,发现其通过在通用预训练和特定任务微调之间构建一个分布桥梁,能有效提升模型在数学和代码等领域的下游任务性能,并显著减少灾难性遗忘。

Large Language Model Sourcing: A Survey

大语言模型溯源:一篇综述。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Who Said Neural Networks Aren't Linear?

本文提出了一种名为 Linearizer 的新架构,通过将一个线性算子置于两个可逆神经网络之间,使得传统的非线性映射在特定构造的向量空间中表现为严格的线性变换,从而能够将线性代数的强大工具(如SVD、伪逆)应用于深度学习模型。

Large Language Models Meet Virtual Cell: A Survey

本文全面综述了大型语言模型(LLM)在构建“虚拟细胞”(virtual cell)——一个能够表示、预测和推理细胞状态与行为的计算系统——中的应用,并提出了一个将现有方法分为“作为预言机的LLM”(LLMs as Oracles)和“作为智能体的LLM”(LLMs as Agents)两大范式...

Artificial Hippocampus Networks for Efficient Long-Context Modeling

本文提出了一种名为人工海马网络(Artificial Hippocampus Networks, AHN)的框架,通过一个可学习的循环模块将滑窗外的Key-Value缓存压缩为固定大小的长期记忆,从而在显著降低计算和内存成本的同时,高效地处理长序列上下文。

Expand Neurons, Not Parameters

本文提出了一种名为“固定参数扩展”(Fixed Parameter Expansion, FPE)的方法,通过在不增加非零参数总数的情况下增加网络中的神经元数量,来减少由特征叠加(superposition)引起的干扰,从而提升模型性能。

Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression

本文提出了一种名为 TRAC 的在线强化学习后训练方法,利用模型自身的自注意力机制来识别并压缩冗余的推理步骤,并根据动态评估的任务难度自适应地调整压缩程度,从而有效缓解大模型在简单任务上“过度思考”和在困难任务上“思考不足”的问题。

Reflect before Act: Proactive Error Correction in Language Models

本文提出了一种名为 REBACT 的新方法,在大型语言模型 (LLM) 执行下一步行动前增加了一个“反思”步骤,通过主动纠正先前动作中的错误,从而显著提升了其在交互式决策任务中的性能和计算效率。

BEFT: Bias-Efficient Fine-Tuning of Language Models

本文提出了一种偏置高效微调方法 (Bias-Efficient Fine-Tuning, BEFT),其核心是一种通过计算微调前后偏置向量的投影比率来评估重要性的新方法,从而能够更精确地选择出对下游任务最关键的偏置项(如Q/K/V投影中的偏置)进行微调,以极低的参数量实现卓越性能。

WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research

本文提出了 WebWeaver,一个模仿人类研究过程的双智能体框架,其中规划器(Planner)通过迭代优化大纲并搜集证据,构建动态且有来源依据的报告结构,而写作者(Writer)则分章节、有针对性地从记忆库中检索信息进行写作,有效解决了传统方法的静态规划缺陷和长上下文处理失败问题,在开放式深...

The Prompt Engineering Report Distilled: Quick Start Guide for Life Sciences

本文为生命科学领域的研究人员提炼了一份提示工程(Prompt Engineering)快速入门指南,重点介绍了六种核心技术(零样本、少样本、思维生成、集成、自我批评和分解),并提供了具体的用例、最佳实践和常见陷阱,旨在帮助研究人员从机会主义的提问方式转变为系统、高效的实践。

Opal: An Operator Algebra View of RLHF

本文提出了Opal,一个用于强化学习从人类反馈(RLHF)的算子代数视图,以及GKPO,一个标准化的交换模式,通过一个当且仅当满足三个核心假设时成立的约简定律,来统一、比较和验证不同的RLHF目标函数,从而整理了该领域繁杂的方法。

Transition Models: Rethinking the Generative Learning Objective

本文提出了一种名为过渡模型 (Transition Models, TiM) 的新型生成范式,它通过学习一个能够在任意时间间隔 上进行状态转换的精确动力学方程,成功统一了高效的少步生成与高质量的多步精炼,解决了现有生成模型中普遍存在的“速度-质量”权衡困境。

The human biological advantage over AI

本文提出,人类相较于人工智能(AI)的核心优势在于我们基于生物学的中央神经系统(Central Nervous System, CNS),它使我们能够沉浸式地与物理现实融为一体,体验真实的情感,从而发展出植根于经验、有意义且可持续的伦理体系,这是任何非生物的AI都无法复制的。

BEAM: Brainwave Empathy Assessment Model for Early Childhood

本文提出了一种名为 BEAM 的深度学习框架,它通过分析幼儿观看视频时的多视角脑电图(EEG)信号,结合特征融合与对比学习技术,实现了对儿童共情水平(表现为助人意愿)的客观、准确预测。

Loong: Synthesize Long Chain-of-Thoughts at Scale through Verifiers

本文提出了Loong项目,一个旨在通过人工审查的种子数据集(LoongBench)和模块化的合成环境(LoongEnv),大规模生成跨多个推理领域、可自动验证的长链思维(Chain-of-Thoughts)数据,以解决高质量训练数据稀缺的问题,并为基于可验证奖励的强化学习(RLVR)提供支持。

Not All Parameters Are Created Equal: Smart Isolation Boosts Fine-Tuning Performance

本文提出了一种名为“核心参数隔离微调”(CPI-FT)的新框架,通过识别并隔离每个任务的核心参数区域、根据区域重叠度对任务进行分组,并结合参数融合与动态冻结策略进行多阶段微调,从而有效缓解多任务监督微调中的任务冲突和灾难性遗忘问题。

VibeVoice Technical Report

本文提出了一种名为 VibeVoice 的新模型,它通过一个创新的、具有超高压缩率的连续语音tokenizer和一个基于大型语言模型的下一token扩散框架,实现了长达90分钟、多达4人的高质量长篇对话语音合成。

UNIFORM: Unifying Knowledge from Large-scale and Diverse Pre-trained Models

本文提出了一个名为 UNIFORM 的统一知识迁移框架,旨在从大量异构(不同架构、不同训练数据)的预训练模型中,通过新颖的特征投票和Logit投票机制,解决知识冲突问题,从而高效地将共识知识迁移到一个学生模型中,且无需任何手动标注。

Unifying Large Language Models and Knowledge Graphs: A Roadmap

大语言模型(Large Language Models, LLMs),例如ChatGPT和GPT-4,因其涌现能力和泛化性,在自然语言处理和人工智能领域引发了新的浪潮。然而,LLMs是黑箱模型,常常难以捕获和访问事实性知识。相比之下,知识图谱(Knowledge Graphs, KGs)是结构...

Tree of Thoughts: Deliberate Problem Solving with Large Language Models

本文提出了一种名为“思想树”(Tree of Thoughts, ToT)的新型语言模型推理框架,它通过将问题解决过程建模为对“思想”(连貫的文本单元)树的探索,使大型语言模型能够进行深思熟虑的决策、前瞻和回溯,从而显著提升其在需要规划和搜索的复杂任务上的解决能力。

Towards Unbiased Calibration using Meta-Regularization

本文提出了一种名为元正则化 (Meta-Regularization) 的新方法,通过一个元学习框架来学习无偏的、校准良好的深度学习模型。该方法包含两个核心组件:一个能为Focal Loss学习样本级连续 值的 -Net ,以及一个作为无偏、可微校准目标的平滑期望校准误差 (SECE)。

ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs

本文提出了一个名为ToolLLM的通用工具使用框架,通过构建一个包含超过16000个真实世界API的大规模指令微调数据集ToolBench,并采用一种新颖的深度优先搜索决策树(DFSDT)方法,成功地将开源大语言模型(LLaMA)的工具使用能力提升至与ChatGPT相当的水平。

The Llama 3 Herd of Models

本文介绍了 Llama 3 模型家族,其中旗舰模型是一个拥有 405B 参数的密集型 Transformer,通过在 15T 多语言 token 上进行大规模预训练,并采用稳定可扩展的架构和训练方法,使其在多项基准测试中达到了与 GPT-4 等顶级模型相当的性能水平。

SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

本文提出了一个名为 SWE-bench 的大规模、真实世界的软件工程基准,通过要求语言模型(Language Models, LMs)解决来自12个流行Python仓库的真实GitHub问题,发现即使是最先进的模型也难以完成这些复杂的代码编辑任务,揭示了当前模型能力的巨大局限性。

StarCoder: may the source be with you!

本文发布了StarCoder,一个拥有155亿参数、支持8K上下文长度和代码填充能力的开源代码大语言模型;该模型在经过精心筛选和隐私信息处理的 permissively licensed 代码数据集上进行训练,其性能超越了所有现存的多语言开源代码模型,并达到了与闭源模型相当的水平。

SparseGPT: Massive Language Models Can Be Accurately Pruned in One-Shot

本文提出了一种名为 SparseGPT 的新颖剪枝方法,能够对超大规模语言模型(如 OPT-175B)进行一次性(One-Shot)剪枝,在不进行任何重新训练的情况下,达到50%-60%的稀疏度,同时保持极低的准确率损失。

SAM 2: Segment Anything in Images and Videos

本文提出了SAM 2,一个统一处理图像和视频中可提示分割任务的基础模型,它通过引入流式记忆架构和构建大规模视频分割数据集SA-V,在显著提升分割精度和交互效率的同时,性能超越了现有方法。

s1: Simple test-time scaling

本文提出了一种极其简单且高效的方法,通过在精心筛选的1000个样本(s1K)上进行监督微调,并结合一种名为“预算强制”(budget forcing)的测试时干预技术,成功构建了一个具备强大推理能力和可控测试时扩展(test-time scaling)行为的语言模型(s1-32B)。

Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement

本文提出了一系列数学专用大语言模型 Qwen2.5-Math,其核心创新在于将“自我改进”(self-improvement)的理念贯穿于从预训练、后训练到推理的整个模型开发流程,从而在多个数学基准上实现了超越现有开源及闭源模型(如GPT-4o)的顶尖性能。

Qwen2 Technical Report

本文介绍了Qwen2系列大型语言模型,通过改进模型架构、扩大并优化多语言和代码数学预训练数据、采用可扩展的对齐技术,在0.5B到72B的多个尺寸上全面超越了现有开源模型,并在各项基准测试中展现出与顶尖闭源模型相当的竞争力。

QLoRA: Efficient Finetuning of Quantized LLMs

本文提出了一种名为QLoRA的高效微调方法,通过将梯度反向传播到冻结的4-bit量化模型中的低秩适配器(LoRA),首次实现了在单个48GB GPU上微调65B参数的大型语言模型,同时保持了与16-bit全量微调相当的性能。

Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey

大型模型 (Large Models, LMs) 在自然语言处理 (NLP) 和计算机视觉 (CV) 等多个领域取得了显著进展,但其巨大的规模带来了高昂的计算成本。参数高效微调 (Parameter-Efficient Fine-Tuning, PEFT) 通过在冻结大部分预训练模型参数的同时...

Object Recognition Datasets and Challenges: A Review

本文通过对超过160个数据集的统计和描述,对物体识别领域的数据集和挑战赛进行了全面的回顾与分析,重点探讨了数据集在推动算法发展中的关键作用、主要数据集的演进趋势以及评估基准的变化。

Model Compression using Progressive Channel Pruning

本文提出了一种名为渐进式通道剪枝 (Progressive Channel Pruning, PCP) 的迭代式剪枝框架,该框架通过在每次迭代中执行“尝试-选择-剪枝”三步流水线,从多个最优选择的层中逐步移除少量通道,从而自动确定压缩后网络的最优结构,并成功将其应用于监督学习和迁移学习场景。

Mixtral of Experts

本文提出了一种名为 Mixtral 8x7B 的稀疏专家混合 (Sparse Mixture of Experts, SMoE) 模型,该模型在推理时仅激活一小部分参数(13B),却在性能上超越了参数量大得多的密集模型(如 Llama 2 70B),显著提升了模型的计算效率和性能。

Mistral 7B

本文介绍了一个名为 Mistral 7B 的70亿参数语言模型,它通过利用分组查询注意力(GQA)和滑动窗口注意力(SWA)机制,在保持高效率的同时,实现了在各项基准测试中超越更大参数模型(如 Llama 2 13B)的卓越性能。

Llama 2: Open Foundation and Fine-Tuned Chat Models

本文发布了 Llama 2,一个包含从7B到70B参数的开源预训练和微调大型语言模型系列,其为对话优化的版本 Llama 2-Chat 在多个基准测试中表现优于现有开源模型,并通过详细阐述其微调和安全对齐方法,旨在推动社区对负责任的大型语言模型进行建设和发展。

KAN: Kolmogorov-Arnold Networks

本文提出了一种名为科尔莫戈罗夫-阿诺德网络(Kolmogorov-Arnold Networks, KANs)的新型神经网络架构,其将可学习的激活函数置于网络边缘(“权重”)而非节点上,从而在函数拟合等任务中,相比于传统的多层感知机(MLPs),展现出更高的精度和可解释性。

Jailbreaking Black Box Large Language Models in Twenty Queries

本文提出了一种名为 PAIR 的黑盒攻击算法,其利用一个攻击者大语言模型 (LLM),通过少量(通常少于20次)的查询,以自动化、迭代的方式生成并优化具有语义的提示(Prompt),从而高效地“越狱”目标 LLM。

iTransformer: Inverted Transformers Are Effective for Time Series Forecasting

本文提出iTransformer,通过将Transformer的输入维度进行“反转”,即视每个单独的时间序列变量为一个独立的Token,从而使自注意力机制能够有效捕捉多变量间的相关性,而前馈网络则用于学习每个序列的非线性表示,最终显著提升了时间序列预测的性能和泛化能力。

Is ChatGPT a General-Purpose Natural Language Processing Task Solver?

本文通过在覆盖7大类任务的20个NLP数据集上进行全面的零样本(zero-shot)评估,系统性地剖析了ChatGPT作为通用自然语言处理任务解决器的能力,发现其在推理密集型任务上表现出色,但在序列标注等特定任务上仍面临挑战,且综合性能通常不及为特定任务微调的模型。

Introduction to Machine Learning

本文是一部综合性的教科书或讲义,旨在介绍机器学习领域的数学基础和核心技术。其内容组织体现了对该领域的系统性分类。

Harnessing the Power of LLMs in Practice: A Survey on ChatGPT and Beyond

本文是一份面向实践者和终端用户的综合性实践指南,围绕模型、数据和下游任务三个维度,深入探讨了如何有效利用大型语言模型(LLMs)解决自然语言处理(NLP)问题,并详细剖析了不同场景下选择LLMs或微调模型的利弊。

Graph of Thoughts: Solving Elaborate Problems with Large Language Models

本文提出了一种名为“思想图谱 (Graph of Thoughts, GoT)”的新型提示框架,通过将大型语言模型 (LLM) 的思维过程建模为任意图结构,其中“思想”是节点,依赖关系是边,从而实现了超越链式或树状思维模式的、更复杂和强大的推理能力,尤其擅长聚合多个推理路径以生成协同的、更高质...

GPT-4o System Card

本文发布了GPT-4o,一个端到端训练的原生多模态(omni)模型,该模型能够统一处理和生成文本、音频、图像的任意组合,并详细介绍了其在新能力(特别是实时语音交互)下的安全评估体系、风险缓解措施及其潜在的社会影响。

GPT-4 Technical Report

本文介绍了一个大规模、多模态模型GPT-4,它能够接收图像和文本输入并生成文本输出,在多项专业和学术基准上展现出与人类相当的性能,并通过可预测的扩展方法实现了其性能的精准预测。

Generative AI

Generative AI。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Gemma 2: Improving Open Language Models at a Practical Size

本文介绍Gemma 2系列开放语言模型(2B、9B、27B),通过在Transformer架构中交错使用局部-全局注意力、采用分组查询注意力,并对2B和9B模型应用知识蒸馏进行训练,实现了在同等参数规模下的最佳性能,甚至能与2-3倍大的模型相媲美。

F -- A Model of Events based on the Foundational Ontology DOLCE+DnS Ultralite

本文提出了一种名为 Event-Model-F (F) 的事件形式化模型,该模型基于 foundational ontology (基础本体) DOLCE+DnS Ultralite (DUL),通过一种模式驱动的方法,全面地表示事件中的时间、空间、参与对象、结构关系(部分-整体、因果、相关)...

DELTA: Decoupling Long-Tailed Online Continual Learning

本文提出了一种名为 DELTA 的解耦学习框架,通过两阶段训练策略(监督对比学习 + 均衡损失)有效解决了长尾在线持续学习(Long-Tailed Online Continual Learning, LTOCL)中的灾难性遗忘和类别不平衡问题。

DeepSeek-V3 Technical Report

本文提出了一种名为 DeepSeek-V3 的671B参数的强混合专家(MoE)模型,它通过创新的无辅助损失负载均衡策略、多Token预测训练目标以及高效的MLA和DeepSeekMoE架构,以极高的训练效率和经济成本,实现了与顶级闭源模型相媲美的性能。

Bias and Fairness in Large Language Models: A Survey

大型语言模型 (Large Language Models, LLMs) 的崛起已从根本上改变了语言技术。然而,这些模型在取得巨大成功的同时,也可能会学习、延续并放大有害的社会偏见,这些偏见源于不平衡的社会群体表征、刻板印象、贬损性语言等,不成比例地影响着边缘化社区。

Action Language BC+

本文提出了一种名为 BC+ 的新动作语言,通过将其语义建立在通用的稳定模型(Stable Model)之上,成功地统一并扩展了多种现有动作语言(如 , , , ),并自然地集成了现代答案集规划(Answer Set Programming, ASP)中的高级构造(如选择规则和聚合)。

A Survey of Large Language Models

A Survey of Large Language Models。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。