Seedance 2.0登顶Arena:原生多模态音视频生成架构揭秘
视频生成大模型的演进正面临一个极为棘手的瓶颈。过去,各类模型往往擅长生成单一片段的视觉奇观。但在复杂物理交互、精准指令控制以及原生音视频同步上,却频频暴露出深层缺陷。如何让大模型真正理解现实世界的物理法则,并实现高度可控的多模态联合合成?
视频生成大模型的演进正面临一个极为棘手的瓶颈。过去,各类模型往往擅长生成单一片段的视觉奇观。但在复杂物理交互、精准指令控制以及原生音视频同步上,却频频暴露出深层缺陷。如何让大模型真正理解现实世界的物理法则,并实现高度可控的多模态联合合成?
当前的人工智能可以在瞬间写出复杂的底层代码,或者在围棋棋盘上碾压人类世界冠军,却在被要求控制虚拟角色“走到飞船旁边”时显得笨拙无比。这正是莫拉维克悖论在虚拟世界中的真实写照:对AI来说,处理高度抽象的语言和逻辑相对容易,但要在复杂的三维环境中进行基础的感知与行动,却面临着巨大的挑战。
当前的大模型(LLM)不仅需要能言善辩,正越来越被期望能够直接操作软件、调用工具并生成高质量的复杂产物,例如幻灯片、3D场景、CAD设计等。然而,在面对UE5引擎或Blender这种重度依赖操作经验的专业软件时,模型仅凭预训练阶段积累的静态知识往往捉襟见肘。
当Claude发布其具备“电脑操控”能力的最新模型时,整个科技圈为之震动。这项技术让AI不再局限于聊天窗口,而是真正接管了我们的鼠标和键盘。微软、北京大学与上海人工智能实验室近期联合发布了一项重磅长篇综述。该综述系统梳理了超过500篇核心文献,全面揭开了这项前沿技术的神秘面纱。
大模型领域的竞争正从单纯的文本向多模态深度推理演进。近期,以推理见长的开源模型层出不穷,但多模态大模型()在参数规模与推理能力之间往往难以两全。现有的开源视觉语言模型大多依赖密集的庞大架构,且缺乏类似深度思考()的能力。为打破这一僵局,月之暗面发布了最新的多模态技术报告。该研究推出了Kimi-...
大模型领域的“军备竞赛”正从参数量向上下文窗口急剧转移。当业界还在为几十万Token的窗口欢呼时,谷歌丢出了一枚重磅炸弹。该研究正式推出了Gemini1.5系列模型,最高支持令人咋舌的1000万Token的上下文。这意味着什么?它能一口气吞下长达107小时的音频数据。
为什么给大模型“开小灶”,它反而越学越傻?在如今的大模型后训练阶段,用一个强大的“老师”模型来指导一个较弱的“学生”模型,已经成为提升性能的标准操作。为了让老师教得更好,研究人员往往会给老师提供一些特权信息(PrivilegedInformation),比如数学题的解题提示,或者视觉任务中的目...
当非玩家角色能够滔滔不绝地与你自由对话,或者任务系统能够自动生成无尽的支线时,这是否意味着我们已经踏入了AI原生游戏的时代?许多开发者将生成式大模型直接塞入游戏,仅仅将其作为剧情的“润色工具”或NPC的“聊天外挂”。然而,真正的革命并非如此简单。
深度学习的演进史上,很少有技术能像如今的大模型这样,在短短几年内彻底重塑整个行业的底层逻辑。过去,研究人员习惯于针对单一任务从零开始训练模型;而现在,整个AI界都在拥抱一种全新的范式:“预训练+微调”。
字节跳动硬核推导:视觉理解的本质是“纤维丛”?揭秘Expand-and-Snap背后的拓扑真相。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
ViT暗藏“循环”玄机?清华新作:用FFT将注意力复杂度降至。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
LLSA:让Diffusion Transformer提速28倍的“对数级”稀疏注意力机制。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
扩散模型能否颠覆GPT?华为诺亚详解阻碍DLM爆发的十大核心挑战。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
字节Seedance 1.5 pro发布:原生音视频联合生成,推理加速超10倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
NextFlow横空出世:6万亿Token打造统一自回归,5秒生成1024高清图。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
告别 !LinMU让多模态大模型实现线性复杂度,推理提速9倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
Kimi K2.5重磅开源:多模态联合增强,Agent推理提速4.5倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
拒绝“看对算错”!CogFlow首创知识内化机制,7B模型视觉数学推理SOTA。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
颠覆RoPE核心信仰:等变性不再神圣?Spherical RoPE性能持平甚至反超。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
训练加速2.4倍!TreeGRPO用“决策树”革新AI绘画模型对齐。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
RAG新革命:VisionRAG告别OCR,每页17个向量实现SOTA文档检索。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
AI标注成本直降90%!字节ACT框架:让大模型学会「批判性思维」。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
RLHF: A comprehensive Survey for Cultural, Multimodal and Low Latency Alignment Methods。
本文通过大量实验证明,在训练数据稀缺但计算资源充足的条件下,扩散语言模型(Diffusion Language Models, DLMs)相比同等规模的自回归模型(Autoregressive Models, AR)能从有限数据中学习到更多信息,最终在性能上实现超越,这一现象被称为“智能交叉”...
本文提出了一种名为 SlideAgent 的分层智能体框架,通过设置全局、页面、元素三个级别的专业智能体,将复杂的多页视觉文档理解任务分解,先构建独立于查询的结构化知识库,再进行针对性推理,从而显著提升了大型语言模型在处理幻灯片等文档时的细粒度理解和推理能力。
本文提出了一种名为 SSL4RL 的新框架,通过将自监督学习(SSL)任务重新定义为可验证的内在奖励,对视觉语言模型(VLM)进行强化学习(RL)微调,从而在无需人工标注或AI评判器的情况下有效提升模型的视觉推理与对齐能力。
(a) 在长文档理解任务中,使用与不使用多模态RAG的多模态大语言模型(MLLM)的对比。(b) 2024年至2025年相关出版物的增长情况。
关于Agentic多模态大语言模型的综述。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文通过一系列详尽的实验,系统性地探究了构建高性能多模态奖励模型的关键要素,总结出一套清晰的“配方”,并基于此提出了一款名为 BaseReward 的强大基线模型,在多个主流基准测试中达到了新的SOTA水平。
本文提出了RewardDance,一个基于生成式范式的可扩展视觉奖励模型框架,它通过将奖励预测重构为“是/否”Token预测任务,实现了对模型尺寸和上下文信息的有效扩展,从而显著提升了视觉生成模型的质量和对齐效果。
本文提出了一种名为“回合级评审强化学习” (Turn-level Adjudicated Reinforcement Learning, TARL) 的流程监督方法,该方法利用大型语言模型 (LLM) 作为裁判提供细粒度的回合级奖励,并结合混合任务训练策略,以解决长程交互中的信用分配和探索不足...
本文提出了一种名为 IGPO (Inpainting-Guided Policy Optimization) 的强化学习框架,它利用扩散大语言模型 (dLLM) 独特的“填补” (inpainting) 能力,通过在探索过程中策略性地注入部分真实推理线索,从而有效解决强化学习中的探索效率低下和...
本文提出了一种名为上下文混合(MoC)的可学习稀疏注意力路由模块,将长视频生成问题重构为一个内部信息检索任务,从而在大幅降低计算成本的同时,实现了分钟级视频的长期记忆和一致性。
A Vision-Language-Action Flow Model for General Robot Control。
本文提出了一种名为 Vision Mamba (Vim) 的通用视觉骨干网络,它通过将双向状态空间模型 (SSM) 和位置嵌入相结合,在不使用自注意力机制的情况下,实现了与 Vision Transformer 相媲美甚至更优的性能,并显著提升了处理高分辨率图像时的计算与内存效率。
本文提出了一种用于语言-图像预训练的简单成对 Sigmoid 损失函数 (Sigmoid loss),它将对比学习任务转化为对图文对的独立二元分类,从而解耦了损失计算与批次大小 (batch size) 的依赖,实现了更高的内存效率和在小批量数据下更优的性能。
本文提出了Qwen2-VL系列多模态模型,通过创新的原生动态分辨率机制和多模态旋转位置编码(M-RoPE),使模型能像人一样处理任意分辨率的图像和视频,并在广泛的多模态基准测试中展现出与GPT-4o等顶尖模型相媲美的性能。
本文提出了一种具身多模态语言模型 PaLM-E,通过将图像等连续的真实世界传感器数据直接注入到预训练语言模型的词嵌入空间,从而在一个统一的模型中实现了机器人规划、视觉问答和语言理解等多种任务,并证明了跨领域联合训练带来的正向知识迁移效应。
本文介绍并开源了一款名为OpenVLA的7B参数视觉-语言-动作(Vision-Language-Action, VLA)模型,该模型通过在包含970k真实世界机器人演示的大规模多样化数据集上进行训练,其通用操作能力不仅超越了参数量大7倍的闭源模型RT-2-X,并且首次系统地展示了如何利用参数...
本文是一份关于多模态深度学习的综合性技术手册,系统性地梳理了该领域从基础的单模态技术到前沿的多模态架构,核心在于根据模态间的交互方式对多模态模型进行了清晰的分类,并展望了未来的发展趋势。
本文提出了一个名为 MM-Vet 的新基准,旨在通过评估大型多模态模型(LMMs)在整合多种核心视觉语言(VL)能力以解决复杂任务时的表现,来系统性地衡量其综合智能水平,并为此设计了一个基于大型语言模型(LLM)的自动化评估器。
本文提出了 MathVista,一个全面的基准测试,旨在系统性地评估基础模型在视觉情境下的数学推理能力,并揭示了即便是最先进的 GPT-4V 模型,其性能也与人类水平存在显著差距。
本文提出了InstructBLIP,一个基于预训练模型BLIP-2的视觉语言指令微调框架,通过引入一个创新的指令感知查询转换器(Q-Former),使模型能根据文本指令提取相应的视觉特征,从而在广泛的未见过的视觉语言任务上实现了最先进的零样本(zero-shot)泛化能力。
本文通过对LLaVA框架进行简单而有效的改进,即采用MLP视觉-语言连接器、引入带有响应格式化提示的学术VQA数据等,构建了LLaVA-1.5,一个在11个基准上达到SOTA、同时保持极高数据和计算效率的大型多模态模型基线。
近年来,大型语言模型 (Large Language Models, LLMs) 取得了显著进展,通过扩大数据和模型规模,展现出指令遵循 (instruction following)、上下文学习 (In-Context Learning, ICL) 和思维链 (Chain of Though...
本文提出了一个全面的评估框架,对ChatGPT在多任务、多语言、多模态、推理、幻觉和交互性方面进行了系统的量化评估,揭示了其在多数零样本任务上的卓越表现,同时也指出了其在低资源语言、复杂推理和事实性方面的显著局限。