Solar Open 2:混合注意力支撑1M上下文,1/6参数逼平1.6T模型
Solar Open 2 提出了一种名为“选择性权重迁移”(Selective Weight Transfer)的热启动策略,打破了传统认知中“架构大幅改变必须从头预训练”的铁律。模型上一代版本 Solar Open 1 采用纯 Softmax 骨架,路由专家数为 128 个。
Solar Open 2 提出了一种名为“选择性权重迁移”(Selective Weight Transfer)的热启动策略,打破了传统认知中“架构大幅改变必须从头预训练”的铁律。模型上一代版本 Solar Open 1 采用纯 Softmax 骨架,路由专家数为 128 个。
KV:这印证了近期关于推理模型注意力汇点(Attention Sink)的研究发现:句末及结构标记往往汇聚了对整段推理逻辑的高阶语义概括。然而,更具普适性、更强劲的解法是 延迟未来查询 。
为了打破这一“能力天花板”,来自北京理工大学和深圳北理莫斯科大学的研究团队提出了一种全新的 零阶自进化框架 。该方法彻底跳出了“必须先采出正确轨迹才能训练”的传统思维,而是对大模型的 LoRA 参数施加微小扰动,仅依据最终答案计算连续的困惑度损失差。
他们提出了 隐式在线自蒸馏(Latent On-Policy Self-Distillation,简称 LOPD) 。该方法将特权上下文重构成一个端到端可学习的隐空间连续向量,不仅彻底摆脱了人工规则对经验形态的束缚,更在工具调用与代码生成两大高壁垒场景下。
针对这一瓶颈,来自东方理工大学、上海交通大学与西安交通大学的研究团队提出了 ReCache 。该框架通过三大递进机制打破了工具调用的缓存困局:用“资源级注意力”切断不同工具之间的横向交互,赋予每个工具完全独立的局部坐标,使其 KV 块具备天然的组合不变性。
针对这些根本缺陷,来自 MBZUAI、麦吉尔大学等机构的研究团队提出了 SCAFFOLD 框架。通过多实例参数化抽象、递归组合、基于最小描述长度(MDL)的库压缩,以及周期性的权重蒸馏,SCAFFOLD 彻底打通了从“动作轨迹”到“深层程序抽象”再到“模型内生能力”的自进化闭环。
来自抖音集团(Douyin Group)与上海交通大学的研究团队提出了 SWE-Pruner Pro,推翻了这种“依赖外部判别器”的惯性路径。他们发现了一个极具启发性的现象: 当代码大模型在阅读环境返回的工具输出时。
加州大学伯克利分校等机构的研究者在论文《Twin Agent: Context Residual Compression for Privilege Separated Agents》中提出了一个破局视角: 智能体的安全防御,本质上是一个“跨信任边界的信息流压缩问题” 。
针对这一问题,本文提出了一种轻量且通用的后训练框架—— TAPO (Transition-Aware Policy Optimization)。该方案的核心突破在于: 不采集任何额外的专家数据,不增加任何多余的在线采样环境交互,也不在推理时引入额外的计算负担。
为了让 TransMem 学习到通用的“信息提取与利用能力”,而非特定的事实知识,作者提出了一种优雅的训练策略: 证据条件自蒸馏(Evidence-Conditioned Self-Distillation, ECSD) 。上图 (b) 揭示了该训练范式的精髓。
来自美国东北大学与明尼苏达大学的研究团队提出了全新解决方案 SparseDitto 。该系统将大语言模型(LLM)的开放代码生成能力与基于真实硬件测量的闭环反馈相结合,为任意给定的稀疏矩阵、算子和目标 GPU 动态定制最优的底层 CUDA 内核。
来自华中科技大学、南方医科大学、香港科技大学、新南威尔士大学与浙江大学的研究团队,针对这一严峻临床痛点提出了名为 ATLAS 的框架。该方法跳出了“单次生成解答”的传统交互套路,将临床指南图谱与多智能体策略深度耦合。
为了破解上述矛盾,ElasticBack 提出了一种以“门控词”(Gate Words)为枢纽、将触发词视作激活开关的联合优化框架。整个攻击流程的核心思想是: 先利用语义锚定技术在技能文档中精准植入一条带有严格约束边界的休眠规则 ,将其参数与行为锁定后,再依托黑盒代理模型。
为了打破这种“单兵死磕”的局部最优困境,来自 IMEC 与 AILabs 的研究团队提出了名为 KernelArc 的多 Agent GPU 内核协同优化架构。
北京智源人工智能研究院、香港理工大学、中国人民大学与中国科学技术大学的研究团队在近期工作中指出了这一结构性缺失,并提出了名为 DisCo 的技能驱动型科研智能体框架。
当视频生成的分辨率迈向720p、1080p,生成时长从数秒拉长到数十秒甚至一分钟时,扩散模型底层的计算范式正撞上一堵难以逾越的显存与算力墙。目前开源和闭源的主流视频扩散Transformer(VideoDiT),大多重度依赖全时空三维Softmax注意力。
在复杂的大模型智能体(Agent)任务中,开启推理模式(如思维链或强化学习诱导的“思考”机制)往往能带来显著的成功率提升。然而,这一表现的背后往往伴随着沉重的推理溢价(ReasoningPremium):模型的输出Token数量通常会膨胀3到6倍,并且每次交互、每个任务实例都要重新进行一遍完整...
在当今的高性能机器学习系统中,GPU内核的执行效率往往决定了整个大模型推理或训练的吞吐天花板。然而,在实际的工业部署环境中,开发者常常面临一个极为棘手的黑盒困境:那些真正跑在显卡上的算子,往往只是一团无法直接阅读和修改的编译后二进制文件。
随着大型语言模型(LLM)能力的飞速提升,我们见证了它们在诸多单步交互任务中展现出令人惊艳的表现。然而,当这些模型被真正放入自主代理(Agent)系统中,去执行需要长期规划、多步推理和复杂环境交互的任务时,一种被称为“参差智能”(JaggedIntelligence)的现象便会显现:它们在某些...
大模型正从单纯的聊天机器人向能够操作工具、浏览网页和处理文件的AIAgent演进。在这个过程中,提示注入(PromptInjection)成为了横亘在应用落地前的一座大山,并被普遍视为AIAgent面临的首要安全威胁。
在大语言模型(LLM)的发展进程中,扩展定律(ScalingLaws)长期主导着预训练阶段的资源投入。然而,随着推理模型和强化学习在测试时计算(Test-timecomputation)上的突破,行业逐渐演化出两条平行的扩展轴线:一是继续扩大预训练基础模型的参数规模,二是在测试阶段通过强化学习...
随着当代视觉与大语言模型(LLMs)参数规模的指数级增长,其在推理阶段所消耗的计算资源与显存带宽已成为实际部署中的严峻挑战。在众多模型压缩策略中,网络剪枝(NetworkPruning)因其能够直接移除冗余权重而备受关注。特别是在大模型时代,传统的“剪枝-微调”范式由于高昂的重训练成本变得不再现实。
在过去几年中,模仿学习(ImitationLearning,IL)已经成为理解和训练大型语言模型(LLM)的核心范式。从最基础的指令微调(SFT)到更高级的模型对齐,我们都可以将其视为让一个学习者(模型)去模仿一个专家(人类反馈或更强大的教师模型)的序列决策过程。
在大语言模型(LLM)的后训练(Post-Training)阶段,强化学习(RL)已经成为提升模型特定领域能力的标准范式。无论是利用可验证奖励进行数学推理训练,还是在沙盒环境中进行代码能力的代理式强化学习,或者是基于规则反馈优化指令遵循能力,针对单一领域的强化学习管道往往能够稳定且大幅度地提升...