多模态&视觉 第4页

谷歌打通10+款3D游戏:揭秘通用键鼠AI智能体SIMA

当前的人工智能可以在瞬间写出复杂的底层代码,或者在围棋棋盘上碾压人类世界冠军,却在被要求控制虚拟角色“走到飞船旁边”时显得笨拙无比。这正是莫拉维克悖论在虚拟世界中的真实写照:对AI来说,处理高度抽象的语言和逻辑相对容易,但要在复杂的三维环境中进行基础的感知与行动,却面临着巨大的挑战。

Seedance 2.0登顶Arena:原生多模态音视频生成架构揭秘

视频生成大模型的演进正面临一个极为棘手的瓶颈。过去,各类模型往往擅长生成单一片段的视觉奇观。但在复杂物理交互、精准指令控制以及原生音视频同步上,却频频暴露出深层缺陷。如何让大模型真正理解现实世界的物理法则,并实现高度可控的多模态联合合成?

Kimi K2.5: Visual Agentic Intelligence

Kimi K2.5重磅开源:多模态联合增强,Agent推理提速4.5倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

LinMU: Multimodal Understanding Made Linear

告别 !LinMU让多模态大模型实现线性复杂度,推理提速9倍。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Vision Transformers are Circulant Attention Learners

ViT暗藏“循环”玄机?清华新作:用FFT将注意力复杂度降至。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Visual Language Hypothesis

字节跳动硬核推导:视觉理解的本质是“纤维丛”?揭秘Expand-and-Snap背后的拓扑真相。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。

Diffusion Language Models are Super Data Learners

扩散语言模型(DLM)研究发现,在训练数据有限、计算资源充足的实验条件下,扩散模型可能比同规模自回归模型获得更好的数据利用效率。本文解读这种“智能交叉”现象的实验设计、计算开销和适用条件,避免将特定设置下的结果推广为全面优势。

SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding

本文提出了一种名为 SlideAgent 的分层智能体框架,通过设置全局、页面、元素三个级别的专业智能体,将复杂的多页视觉文档理解任务分解,先构建独立于查询的结构化知识库,再进行针对性推理,从而显著提升了大型语言模型在处理幻灯片等文档时的细粒度理解和推理能力。

BaseReward: A Strong Baseline for Multimodal Reward Model

本文通过一系列详尽的实验,系统性地探究了构建高性能多模态奖励模型的关键要素,总结出一套清晰的“配方”,并基于此提出了一款名为 BaseReward 的强大基线模型,在多个主流基准测试中达到了新的SOTA水平。

Inpainting-Guided Policy Optimization for Diffusion Large Language Models

本文提出了一种名为 IGPO (Inpainting-Guided Policy Optimization) 的强化学习框架,它利用扩散大语言模型 (dLLM) 独特的“填补” (inpainting) 能力,通过在探索过程中策略性地注入部分真实推理线索,从而有效解决强化学习中的探索效率低下和...

Process-Supervised Reinforcement Learning for Interactive Multimodal Tool-Use Agents

本文提出了一种名为“回合级评审强化学习” (Turn-level Adjudicated Reinforcement Learning, TARL) 的流程监督方法,该方法利用大型语言模型 (LLM) 作为裁判提供细粒度的回合级奖励,并结合混合任务训练策略,以解决长程交互中的信用分配和探索不足...