MEMENTO:大模型学会自主管理上下文,KV缓存直降2.5倍!
当大语言模型在解决复杂数学或编程问题时,往往会生成数以千计的推理Token。这种长长的思维链虽然带来了惊艳的准确率,但也引发了严重的计算灾难。在传统的自回归生成中,每一个历史Token都会被保存在KV缓存中,消耗极其庞大的显存。更致命的是,模型面对如此巨大的上下文,没有任何机制能够筛选或遗忘无...
当大语言模型在解决复杂数学或编程问题时,往往会生成数以千计的推理Token。这种长长的思维链虽然带来了惊艳的准确率,但也引发了严重的计算灾难。在传统的自回归生成中,每一个历史Token都会被保存在KV缓存中,消耗极其庞大的显存。更致命的是,模型面对如此巨大的上下文,没有任何机制能够筛选或遗忘无...
挑战Ring-Attention霸主地位:Mesh-Attention实现3.4倍加速,通信暴降85%。
谷歌揭秘合成数据陷阱:ERM不再万能,新算法破解“模型崩溃”危机。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
1万条顶100万条!北大DataFlow:像写PyTorch一样搞定大模型数据。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Meta/牛津重磅:噪声数据引爆LLM训练崩溃!深度比宽度更致命,诊断新法公开。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
LIME:给LLM喂点“语法糖”,训练效率飙升56%,推理能力提升38%!。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
数据智能体“高考”来了!字节跳动DAComp揭示:顶级模型成功率不足20%。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
数据生成提速15倍!Meta开源Matrix框架,用P2P架构颠覆多智能体协作。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI标注成本直降90%!字节ACT框架:让大模型学会「批判性思维」。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文建立了一个理论框架,通过推导精确的缩放定律,揭示了在何时以及为何精心筛选(curate)一小部分数据进行训练,会比使用全部数据获得更好的性能,从而解决了“少即是多”与“多即是多”的矛盾。
本文提出,在测试时通过检索增强的方式重用模型的预训练数据,可以显著提升大语言模型的性能,这种方法相当于一种高效的“计算倍增器”,证明了当前预训练方法并未充分利用数据中的信息。
本文通过大量实验证明,在训练数据稀缺但计算资源充足的条件下,扩散语言模型(Diffusion Language Models, DLMs)相比同等规模的自回归模型(Autoregressive Models, AR)能从有限数据中学习到更多信息,最终在性能上实现超越,这一现象被称为“智能交叉”...
近期,能够自主交流、与人类协作并使用多种工具的AI智能体 (agents) 的兴起,为各种真实世界场景解锁了巨大的机遇。然而,尽管这些基于大型语言模型 (LLM) 的智能体在自然语言理解和问题解决方面取得了显著进展,它们大多仍局限于具有预定义数据和结构化任务的受控环境中。
本文发布了HPLT 3.0,一个包含近200种语言、总量达30万亿token的开源、大规模、高质量多语言文本数据集,并提供了完整的开源数据处理流程、多语言评估框架及预训练模型,旨在推动LLM和MT研究的普及化。
本文提出了一种名为 CoDeC 的新方法,通过衡量上下文学习(In-Context Learning)对模型置信度的影响,来有效检测和量化大语言模型中的训练数据污染问题。
大型语言模型 (Large Language Models, LLMs) 的后训练 (post-training) 已成为释放其领域适应能力和任务泛化潜力的关键阶段。这一阶段有效增强了模型在长上下文推理、人类对齐、指令微调和领域专用适应等方面的能力。
本文提出了一种名为CROPI的数据高效强化学习框架,通过一种新颖的离策略影响函数估计方法,以极低的计算成本识别并挑选对模型训练最有价值的数据,从而在大型语言模型的推理能力训练中实现显著的加速。
本文提出了一种名为 E-GRPO 的新方法,通过重利用合成数据生成过程中被忽略的实体信息,构建了一个细粒度的实体感知奖励函数,以解决传统强化学习方法中的奖励稀疏和“功亏一篑”(near-miss)问题,从而更有效地训练搜索智能体。
本文提出了 AgentFrontier,一个基于教育心理学“最近发展区”(ZPD)理论的数据合成框架,通过自动生成位于大语言模型(LLM)能力边界上的复杂推理数据,从而系统性地提升智能体(Agent)的跨领域、综合推理能力。
本文提出了一种名为智能体数据协议 (Agent Data Protocol, ADP) 的轻量级表示语言,它通过将来自不同来源、格式各异的智能体训练数据统一为标准模式,解决了数据碎片化问题,从而实现了对大型语言模型智能体进行大规模、多样化且高效的监督式微调。
随着大型语言模型 (Large Language Models, LLMs) 的兴起,一种新的范式——数据智能体 (Data Agents)——应运而生。数据智能体被定义为一个综合性的、由LLM驱动的架构,它能自主协调数据与AI生态系统,以处理复杂的数据相关任务。
本文发布了一个包含超过58000条文本的大型数据集,其中包含真实的《纽约时报》文章以及由六种先进大语言模型(LLMs)生成的对应版本,并为区分人类与AI文本以及AI文本模型溯源这两个任务提供了基准性能。
本文通过系统性比较发现,强化学习(RL)在后训练中比监督微调(SFT)更能有效缓解灾难性遗忘,其根本原因在于RL利用在线策略(on-policy)数据所产生的“模式寻求”(mode-seeking)特性,能够在学习新任务的同时更好地保留模型的已有知识模式。
本文提出了一种新方法,通过利用聊天模板(chat template)作为前缀诱导模型生成内容,并结合神经嵌入(neural embeddings)来度量语义相似度,从而可以从开放权重的语言模型中高效提取出大量有价值的对齐训练数据。
本文提出了一种将大型语言模型(LLM)用于调查问卷模拟的有效框架,其核心思想是:不应将所有宝贵的人类数据用于微调模型,而应将大部分数据用于对LLM生成的大量合成数据进行统计校正(Rectification),从而在有限的人类数据下获得低偏倚、高效率的群体估计。
本文提出了一种新颖的泛化界理论,通过引入基于困惑度(perplexity)的、信息更丰富的先验(prior),为数据稀疏场景下的提示(prompt)优化提供了非空泛的(non-vacuous)理论保证,并证明了这种方法在实践中能提升提示的泛化能力。
本文提出了一种名为 Webscale-RL 的自动化数据流水线,旨在通过从网络文档中自动挖掘和生成数据,将强化学习(RL)数据的规模扩展到与预训练数据相当的水平,从而显著提升大型语言模型的性能。
本文通过一个可理论分析的线性回归任务,从理论上解释了训练数据的特性如何决定测试时增加计算(即更长的思想链)能否成功提升模型性能,并证明了在多样化、相关且困难的任务上进行训练对测试时扩展(test-time scaling)最为有利。
本文提出了一种名为“在验证集上训练 (Train on Validation, ToV)”的快速数据选择方法,通过反转训练集和验证集的传统角色,依据训练样本在模型于少量目标验证集上微调后的预测损失变化来为其评分,从而高效地筛选出对提升目标任务性能最有益的数据。
本文介绍了一个名为 TOUCAN 的大规模工具智能体数据集,包含 150 万条从近 500 个真实世界 MCP 环境中合成的轨迹,旨在通过提供多样、真实且复杂的训练数据,显著提升开源大型语言模型(LLM)的工具调用和智能体能力。
本文提出了一种名为 SCRIBES 的新型强化学习框架,它通过利用同一网站内网页间的布局相似性作为奖励信号,训练大型语言模型生成可重用的提取脚本,从而实现对网页半结构化数据(如表格和列表)的网络规模、高效率提取。
本文通过大规模实证研究系统地揭示了,在大型语言模型预训练中战略性地混合约30%的重述(rephrased)合成数据与自然网络文本,可以在大数据量下将达到相同损失所需的训练速度提升5-10倍,但合成数据的最终效果高度依赖其类型、混合比例和生成器模型的能力。
本文提出了一种名为 ConvergeWriter 的“自下而上”长文生成框架,它通过“先检索知识,后聚类定结构”的策略,确保文章的规划和生成完全由可用的知识数据驱动,从而根本上解决了传统“自上而下”方法中规划与知识脱节导致的幻觉问题。
本文通过系统性的对比实验,证实了基于Transformer的模型在关系分类任务上,无论是在标准性能、长文本处理能力还是数据效率方面,均显著优于传统的非Transformer深度学习模型。
本文提出了一个基于性能矩阵和主成分分析(PCA)的分析框架,旨在系统性地解构大语言模型(LLM)微调过程中的跨任务迁移学习效应,并发现任务性能更多地受源数据集中隐藏的统计特征(如输出长度、类别分布)和特定语言特征的影响,而非表面上的领域相似性。
本文提出了一种名为语言自博弈(Language Self-Play, LSP)的无数据训练方法,通过构建一个强化学习框架,让大型语言模型在“挑战者”(生成难题)和“解答者”(解答问题)两种角色间自我对抗,从而在无需外部训练数据的情况下实现持续自我提升。
本文提出了一个名为“生成式数据精炼”(Generative Data Refinement, GDR)的框架,利用预训练的生成模型将包含不良内容(如个人信息、有毒内容)的原始数据集重写为更适合模型训练的、经过精炼的高质量数据集,同时保留了数据的多样性和实用性。
本文提出了 SynthDrive,一个可扩展的“真实-仿真-真实 (real2sim2real)”数据流,它通过从单张图片自动挖掘并生成高保真度的3D资产,用于合成自动驾驶中的罕见场景(corner-case)数据,以提升感知模型的性能。
本文指出,未来的数据系统将主要服务于由大型语言模型(LLM)驱动的智能体,并提出了一种“智能体优先”(agent-first)的数据系统新架构,以高效处理智能体工作负载中普遍存在的高吞吐量、异构、冗余和可引导的“智能体推测”(agentic speculation)过程。
本文提出了一个名为 InfoSeek 的可扩展数据合成框架,它将复杂的“深度研究”任务形式化为分层约束满足问题(HCSP),并自动生成高质量的训练数据,使一个3B参数量的小模型在复杂的深度研究任务上,性能超越了32B的大模型及部分商业API。
生成式模型用于合成数据:在GenAI时代变革数据挖掘。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文提出了一种仅使用网页数据,通过大规模精细过滤和严格去重,就能训练出顶尖大语言模型(LLM)的方法,并发布了由此产生的5万亿token数据集RefinedWeb,挑战了LLM预训练必须混合“高质量”精选语料库的传统认知。
本文提出并开源了第一个完全基于西班牙语料库预训练的BERT模型(BETO),并构建了一个名为GLUES的西班牙语NLP任务评估基准,实验证明该单语模型在多数西班牙语下游任务上的表现优于同等规模的多语言BERT模型。
本文是一篇关于教育数据挖掘(EDM)和学习分析(LA)领域的更新版综述,系统性地回顾了该领域的关键术语、发展历程、知识发现流程、主要应用环境、方法论、工具集以及未来发展趋势,旨在为研究人员和实践者提供一份全面的最新知识图谱。
本文提出了一种名为 InfoGrowth 的高效在线算法,通过实时评估数据流中每个数据点的噪声和冗余度,动态地清洗和选择信息量高的数据,以实现高质量数据集的持续、高效增长。
本文介绍了 BridgeData V2,一个大规模、多样化的机器人操作行为数据集,旨在推动可扩展机器人学习的研究。该数据集包含在24个环境中、使用一个公开可用的低成本机器人收集的超过6万条轨迹,并证明了其能够支持多种主流学习算法训练出可泛化到新任务、新环境甚至新机构的策略。
本文提出了一种结合最大信息系数(MIC)和快速搜索密度峰值聚类(CFSFDP)的数据驱动方法,以无监督的方式,仅需少量额外信息(区域总电表数据),即可高效、准确地检测出形态各异的电力盗窃行为。