Kimi-VL技术解密:28亿激活参数跑通128K长窗口与多模态慢思考
Kimi-VL Technical Report
大模型领域的竞争正从单纯的文本向多模态深度推理演进。近期,以推理见长的开源模型层出不穷,但多模态大模型($VLM$)在参数规模与推理能力之间往往难以两全。现有的开源视觉语言模型大多依赖密集的庞大架构,且缺乏类似深度思考($Long-CoT$)的能力。
ArXiv URL:http://arxiv.org/abs/2504.07491v3
为打破这一僵局,月之暗面发布了最新的多模态技术报告。该研究推出了 Kimi-VL 系列模型。作为一个开源的 混合专家网络(Mixture-of-Experts, MoE) 视觉语言模型,它在语言解码器中仅需激活28亿(2.8B)参数,却展现出了比肩旗舰模型的全能实力,并在128K超长上下文中游刃有余。
架构创新:高能效的情报处理中心
Kimi-VL 的核心架构可以类比为一个“高能效情报处理中心”。它主要由三个精密运作的部门组成,分别是原生分辨率视觉编码器 $MoonViT$、用于特征对齐的 $MLP$ 投影层,以及扮演大脑角色的 $MoE$ 语言模型。

首先是负责“看”的部门:$MoonViT$。传统视觉模型处理图片时,就像是强制要求把所有照片裁剪或拼接成固定尺寸的相框。这不仅会丢失高清细节,还费时费力。$MoonViT$ 则引入了原生的动态处理机制。它将不同分辨率的图片直接切片、展平,再首尾相连成一维序列。这就好比扫描仪能够自适应任何尺寸的纸张,直接提取关键信息。 为了让模型在处理高清图像时依然能精准定位,研究人员不仅保留了绝对位置编码,还创新性地引入了 二维旋转位置编码(2D RoPE)。这种双管齐下的编码方式,让模型能够完美驾驭单张图片高达320万像素的超高清输入,而不会造成空间信息的紊乱。
接下来的 $MLP$ 投影层扮演“翻译官”的角色。它通过像素重排($Pixel$ $Shuffle$)操作,在空间维度上进行2x2的下采样,并相应扩展通道数,将视觉特征浓缩并平滑地转换为语言模型能理解的特征维度。
最后是核心大脑:$MoE$ 语言模型。这里采用的是 $Moonlight$ 架构,总参数量虽有160亿,但处理每次任务时,如同一个精干的专家顾问团,只有最匹配的“专家”被唤醒,激活参数仅为2.8B。这种机制极大地降低了计算开销,同时保证了强大的多模态推理能力。
训练机制:四段式预训练与长思考唤醒
好的架构离不开精细的训练流程。本文详细披露了 Kimi-VL 庞大的预训练与后训练机制。整个训练过程全程采用了增强版的 $Muon$ 优化器,并在分布式实现中结合了 $ZeRO-1$ 策略,在保留算法数学特性的同时,极大优化了显存效率。
预训练被精心划分为四个递进阶段,共消耗了4.4T的 $Token$:
- 独立视觉编码器训练:模型通过对比损失($SigLIP$)和生成损失,在海量图文对上建立起基础的视觉感知与 $OCR$ 能力。
- 图文联合预训练:模型加载了已吸收5.2T纯文本数据的语言模型权重,随后混合多模态数据继续训练。初期以纯文本为主,后期逐渐增加多模态比例,确保语言能力不退化的同时融入视觉理解。
- 联合冷却阶段($Cooldown$):通过引入高质量的合成问答对($QA$)和高保真数据子集,以极低的混合比例,重点激发模型在数学、代码和知识领域的潜能,避免过拟合。
- 长上下文激活阶段:在此阶段,模型的上下文窗口被逐步从8K扩展到惊人的128K。研究通过将长数据的比例提升至25%,配合旋转位置编码逆频率的调整,让模型稳稳拿捏长文本与长视频的输入。

在后训练阶段,Kimi-VL 同样经历了精心的调校。除了在32K和128K下进行两阶段的 监督微调(Supervised Fine-Tuning, SFT),该研究还专门针对推理能力进行了大幅强化,推出了长思考变体:Kimi-VL-Thinking。
在长思考的训练环节,强化学习($RL$)大显神威。本文采用了一种在线策略镜像下降算法,通过大规模强化学习,模型学会了自主生成结构化的思维链($CoT$)推导过程。模型就像一个不断自我反思的侦探,能够在生成答案的过程中进行错误检测、路径回溯和迭代优化。最新版本 Kimi-VL-Thinking-2506 更是将这种长视野推理能力推向了新高度。
核心实验:小身材爆发出旗舰级战斗力
Kimi-VL 的实验数据极其亮眼,展现出了惊人的效率与性能比。

在大学级别的学术测试 $MMMU$ 中,仅有2.8B激活参数的 Kimi-VL 拿下了57.0%的得分,不仅超越了同架构但参数更大的 $DeepSeek-VL2$,更是与体积庞大得多的 $Qwen2.5-VL-7B$ 和 $Gemma-3-12B-IT$ 打得难解难分。
在超长内容理解方面,得益于扎实的128K长窗口训练,它在 $LongVideoBench$ 上斩获64.5分,在文档问答测试 $MMLongBench-Doc$ 中也击败了众多竞争对手,得分仅次于 $GPT-4o$。这意味着它能轻松消化长达一小时的视频或百页的长篇 $PDF$。
在智能体($Agent$)任务中,Kimi-VL 同样大放异彩。在极具挑战的系统级交互基准 $OSWorld$ 中,它取得了8.22%的成功率,直接超越了 $GPT-4o$ 的5.03%。这意味着该模型在理解操作系统界面、精准定位图标以及执行自动化任务方面,具有极高的实战价值。
对于加入了强化学习的 Kimi-VL-Thinking 变体,其在 $MathVision$ 等硬核数学推理榜单上,随着测试时计算($Test-time$ $Scaling$)的增加,性能甚至可以与30B级别的大型多模态模型一较高下。
局限性与工程启示
尽管 Kimi-VL 取得了显著的突破,但本文也客观地探讨了当前技术的一些局限性。首先,受限于2.8B的极小激活参数规模,模型在一些极度依赖庞大世界知识的冷门任务中,仍无法与百亿或千亿级的稠密模型完全抗衡。其次,长思考模型的测试时扩展在不同任务上的收益并不完全线性。例如在 $MathVista$ 上,思考长度增加到4K后,性能便趋于饱和,这意味着如何更智能地让模型自主决定“该思考多久”仍是未来需要攻克的难题。
对工程界而言,Kimi-VL 的全面开源具有重大启示。它证明了通过原生分辨率视觉编码器、多阶段精细化混合数据训练,以及强化学习思维链的深度结合,完全可以在极低的推理成本下,实现顶级的多模态感知与系统级智能体交互能力。这无疑为在端侧设备部署复杂视觉语言大模型指明了一条高度可行、极具性价比的新路径。