谷歌Gemini 1.5硬核解析:挑战1000万Token上下文,解锁多模态推理新极限
Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context
大模型领域的“军备竞赛”正从参数量向上下文窗口急剧转移。 当业界还在为几十万 Token 的窗口欢呼时,谷歌丢出了一枚重磅炸弹。 该研究正式推出了 Gemini 1.5 系列模型,最高支持令人咋舌的 1000 万 Token 的上下文。 这意味着什么?它能一口气吞下长达 107 小时的音频数据。 也能一次性消化 10.5 小时的视频,或是直接阅读几百部《战争与和平》。 更可怕的是,这种对超长文本的“吞噬”能力,并没有以牺牲核心的多模态推理能力为代价。 相反,相比于上一代模型,它在各项核心指标上都实现了全面超越。 在这个长文本能力逐渐成为基础设施的时代,Gemini 1.5 究竟是如何打破物理极限的? 本文将深入拆解这篇技术报告,带你了解千万级上下文背后的技术奥秘。
ArXiv URL:http://arxiv.org/abs/2403.05530v5
稀疏架构与极致效率
要想让大模型处理千万级 Token 还不卡顿,传统的密集型网络显然力不从心。 因为随着序列长度的增加,计算量和内存消耗会呈指数级爆炸式增长。 为了打破这一瓶颈,Gemini 1.5 家族引入了最新的稀疏混合专家(Sparse Mixture-of-Experts, MoE)架构。 这是一种基于 Transformer 的条件计算机制,通过高度优化的路由函数进行任务分配。 它会将输入定向分配给模型参数的一个子集来进行处理,而不是激活所有神经元。 这就好比一个拥有数万名员工的超级大工厂,面对不同类型的复杂任务。 每次接到特定类型的订单,只需唤醒最对口的几个专家流水线即可,而不是让所有人一起上阵。 这种设计允许模型在总参数量大幅增长的同时,保持每次前向传播激活的参数量恒定。 这也使得 Gemini 1.5 Pro 在训练计算量大幅降低的情况下,性能全面超越了上一代的 Gemini 1.0 Ultra。
此外,本文还推出了主打轻量和极速响应的 Gemini 1.5 Flash 版本。 它是一个 Transformer 解码器模型,同样具备 200 万以上的上下文能力。 Flash 版本采用了并行计算注意力和前馈组件的机制,并通过在线蒸馏技术从 Pro 版本中汲取能力。 配合高阶预处理方法的训练,它专为低延迟推理而设计,在生成速度上大幅领先竞争对手。
长上下文的预测机制与幂律分布
随着上下文长度成倍增加,大模型是真的读懂了,还是只是把字存了起来? 该研究通过长序列困惑度实验,揭示了一个关于预测能力的有趣现象。 模型在训练时的核心目标是预测下一个 Token,研究记录了不同位置 Token 的负对数似然($NLL$)。 实验发现,随着上下文向数百万 Token 扩展,模型对下一个 Token 的预测误差在持续下降。 在长达 100 万 Token 的文档和 200 万 Token 的代码数据中,这种对数损失与上下文长度之间,呈现出精确的幂律分布。 这说明更长的上下文确实为模型提供了更多有助于预测的有效信息。 而在极长代码的预测中,特别是当序列长度接近 1000 万 Token 时。 由于代码块的重复或特定模式的重现,模型甚至能获得超出幂律预期的额外收益。 这种规模化带来的红利,证明了模型在极长上下文中依然保持着敏锐的感知力。
硬核实验:跨模态的极限挑战
评估千万级 Token 模型的真实水平,传统的短序列基准测试已经完全不够用了。 本文设计了一套极其严苛的跨模态“大海捞针”与现实复杂场景测试。
大海捞针:从文本到音视频
在合成的“大海捞针”任务中,Gemini 1.5 Pro 展现了近乎完美的检索召回率。 如图 1 所示,测试广泛覆盖了文本、视频和音频三种模态,并且将难度拉满。
只要上下文长度在 100 万 Token 以内,模型在所有模态中的召回率都超过了 99.7%。 即便将文本扩展到极限的 1000 万 Token,音频扩展到 970 万 Token。 甚至将视频扩展到 990 万 Token,它依然能稳定地找出那句隐藏的“咒语”。 在视频测试中,研究人员在一个长达 10.5 小时、以 1FPS 采样的视频中隐藏了一个极其短暂的线索画面。 模型需要根据文本问题,准确跨模态检索出该画面的信息,并交出了几乎满分的答卷。 这种跨越百个小时的数据中提取瞬间信息的能力,是前所未有的。
零资源语言的终极上下文学习
该研究利用 MTOB 基准测试,验证了模型极端的上下文学习(In-Context Learning, ICL)能力。 模型被要求仅凭上下文提供的语料,学习翻译一门全球不足 200 人使用的极小众语言 Kalamang。 由于互联网上几乎没有该语言的语料,模型无法依赖预训练阶段的记忆。 研究将长达 500 页的语法参考书、包含两千词条的双语词典和几百个平行句子,共计 25 万 Token 塞入提示词。 惊人的是,Gemini 1.5 Pro 的翻译质量,达到了与使用相同材料学习的人类相当的水平。 更进一步,当研究人员加入 45 分钟的 Kalamang 语音录音文本后。 模型甚至能直接在上下文中学习这门语言的自动语音识别,展现了跨模态少样本学习的恐怖潜力。
长文档问答:直接读取碾压检索
在面对整本《悲惨世界》(约 71 万 Token)的深层问答时。 引入完整上下文的 Gemini 1.5 Pro,以压倒性优势击败了采用检索增强生成(Retrieval-Augmented Generation, RAG)策略的系统。 研究团队使用了特定的概率模型来量化这种优势:
\[P(M_{\rm A} \text{ answers better than } M_{\rm B}) = \frac{e^{\beta_{\rm A}}}{e^{\beta_{\rm A}} + e^{\beta_{\rm B}}}\]计算显示,在使用完整书籍作为上下文时,Gemini 1.5 Pro 提供更优答案的概率高达 78%。 这表明,面对需要全局理解的复杂问题,将所有信息交给模型自行处理,比依赖外部检索系统截断信息要靠谱得多。
跨越时间的视频与复杂规划
在现实场景中,单点检索是远远不够的。 为了填补长视频问答评估的空白,研究团队提出了 1H-VideoQA 基准。 在这个包含 40 到 105 分钟公共视频的测试中。 随着提供的视频帧数不断增加,从单帧到完整视频,Gemini 1.5 Pro 的准确率稳步提升。 这证明它不仅能“看”完长视频,还能跨越漫长的时间线进行因果关联和深层理解。 而在 Agent 规划任务中,大语言模型常被认为难以进行少样本规划。 但实验结果证实,借助其庞大的上下文容量,Gemini 1.5 即使在单样本设置下也能表现出色。 并通过有效利用额外的超长上下文,进一步提升复杂动作序列的生成质量,为具身智能打下了基础。
不容忽视的局限性
尽管理想情况下的单点长文本检索堪称完美,但该研究也客观地坦诚了当前模型的诸多局限。 首先,当测试演变为“多针捞针”时,随着上下文中独立隐藏信息数量的急剧增加。 要求模型一次性找出 100 个不同的隐藏“针”,其准确率会出现明显的波动。 这意味着,面对高度密集的离散关键信息,模型仍然可能发生遗漏。 此外,目前的长上下文测试依然侧重于事实提取。 如果任务要求模型对分散在百万 Token 中的多个片段进行深度逻辑推理。 甚至要求解决不同文本片段之间的矛盾信息,模型目前的表现仍有待进一步提升,这也是未来研究的重要方向。
深远的工程启示
Gemini 1.5 的突破,不仅仅是跑分榜上的胜利,更为 AI 工程化带来了全新范式。 首先,千万级上下文窗口使得“全量输入”有望部分替代繁琐的外部检索流程。 开发者在处理大型长文档、财务报表或整个代码库时,可以直接将其作为上下文喂给模型。 这极大降低了外挂数据库和向量检索系统设计的复杂度。 其次,对于无结构数据的分析,长窗口多模态模型能够直接消化数小时的监控视频或会议录音。 它不再依赖将视频切片并转成文字再分析的传统链路。 这为自动化的智能体赋予了更广阔且原始的感知视野。 在实际工作流中,Gemini 1.5 已经能在 10 个不同的工作类别中,帮助专业人士节省 26% 到 75% 的时间。 未来,随着长上下文推理能力的完善,端到端的超长周期复杂任务处理,将成为行业标配。