多模态&视觉 第3页

FlashRT:引导Coding Agent重写多模态部署,延迟最高降低70倍

卡耐基梅隆大学(CMU)、超威半导体(AMD)与纽约州立大学布法罗分校的研究团队提出了一套全新系统 FlashRT。该方案打破了“为人手写调度器”或“用规则编译器解决一切”的传统思路,转而将系统级优化任务交给大模型编码智能体(Coding Agent)。

GlanceWAM:把未来视觉想象移出控制主路,48ms解码破解机器人两难

由来自 Drexel、Northeastern、Purdue 和 Virginia Tech 的研究团队最新提出的 GlanceWAM ,给出了破解这一困局的优雅答案。该工作指出,现存的“速度与成功率不可兼得”并非视觉前瞻本身的内在缺陷,而是因为传统方案机械地把庞大的视频生成绑死在毫秒级的高频...

DataSpace:异构工作区分析新基准,顶尖多模态模型准确率仅66.34%

在企业和科研机构的实际业务中,当分析师需要计算一份基金风险指标或核对季度供应链数据时,答案几乎从来不会现成地躺在某一张干净的数据库表格里。现实中的核心证据往往支离破碎:计算规则可能写在管理规范的PDF报告中,行业基准可能来自一段会议演示视频的解说旁白,而原始的交易明细则分散在本地的SQLite...

从全Softmax转向混合架构:SANA-Video 2.0用25%锚点换来120倍加速

当视频生成的分辨率迈向720p、1080p,生成时长从数秒拉长到数十秒甚至一分钟时,扩散模型底层的计算范式正撞上一堵难以逾越的显存与算力墙。目前开源和闭源的主流视频扩散Transformer(VideoDiT),大多重度依赖全时空三维Softmax注意力。

AtlasVLA:仅凭单腕相机,如何在长程操作中超越多视角基线?

在具身智能(EmbodiedAI)的研究中,视觉-语言-动作(Vision-Language-Action,VLA)模型正逐渐成为通向通用机器人操作的核心范式。从基于自回归离散编码生成的OpenVLA,到基于连续轨迹去噪扩散的与CogACT,主流架构都在努力建立“看到什么,就执行什么”的端到端...

Flex-π:视频生成VAE竟能无损编码3D点云!真机成功率提升6倍

在具身智能与通用机器人操作领域,世界-动作模型(World-ActionModels,简称WAM)正在成为一种极具竞争力的新范式。相比于传统的视觉-语言-动作模型(VLA),WAM的核心优势在于“通过预测未来以更好地执行动作”:它让策略网络在生成控制指令的同时,联合预测环境未来的观测状态,从而...

LUCAID:多模态智能体协同九大模块,前瞻临床验证达93%一致性

在肺癌精准医疗的实际诊疗中,病理评估早已超越单纯的“看切片定良恶性”。临床医生制定靶向治疗、免疫治疗或抗体偶联药物(ADC)方案,必须依赖组织形态学(H&E)、免疫组织化学(IHC)多标志物以及分子变异数据的深度整合。

Robostral Navigate:单目视觉超越多相机系统,训练Token缩减22倍

当整个行业都在试图通过堆叠激光雷达、深度相机全景阵列甚至预先构建的高精地图来提升机器人的导航成功率时,Mistral团队给出了一个截然不同的答案。他们带来的最新成果RobostralNavigate,不仅是一个拥有80亿参数的视觉语言模型(VLM),更代表了一种极简、高泛化性的具身智能扩展路线。

TurboVLA:V+L直接映射,0.9G显存达成32Hz实时控制!

在具身智能与机器人控制领域,视觉-语言-动作模型(Vision-Language-Action,VLA)在过去两年中确立了统治地位。从RT-2到OpenVLA,主流的研究范式几乎全部围绕着一个核心思路展开:将庞大的大语言模型(LLM)作为感知与动作之间的中央处理器。

Qwen-CUA:纯视觉键鼠交互机制,OSWorld基准达到87.6分

长期以来,人工智能在数字世界中的行动能力主要依赖于代码生成和应用程序接口(API)。现代大语言模型已经能够熟练地编写程序或调用各类软件工具,但在真实的人类工作环境中,大量的数字化工作远远超出了这些接口的覆盖范围。

DeepMind推出AMIE视频版:临床问诊得分83%超越人类医生

在医疗人工智能的演进历程中,基于文本的大语言模型已经展示了令人瞩目的疾病诊断和医学推理能力。然而,真实的医患问诊从来不是一个纯粹的文本交换过程。在临床实践中,医生通过观察患者的面部表情、倾听咳嗽的音色、评估患者的体态和动作(如呼吸困难或静息震颤),不断捕获关键的非语言线索。

腾讯UI-Mate:多模态演示解锁GUI智能体,OSWorld达77.0%

图形用户界面(GUI)智能体展现出了将自然语言意图转化为跨软件生态多步操作的巨大潜力。然而,从基准测试的进步到真实世界的可靠部署,GUI智能体一直被两大瓶颈死死卡住:一是训练层面的数据稀缺与分布偏差;二是交互层面的提示词歧义与执行不可靠。

VibeWorlding:腾讯等开源3D构建框架,RL让开源Agent超越GPT-5.5

在游戏开发、物理仿真以及具身智能等前沿领域,根据用户的自然语言指令快速构建可交互的开放式3D世界,一直是一项极具挑战性的核心任务。近年来,随着多模态大语言模型(MLLM)的爆发,学术界和工业界开始尝试利用多模态Agent来实现3D世界构建的自动化。

MOONSHOT:Google与OpenAI提出多目标剪枝框架,大模型困惑度降低32.6%

随着当代视觉与大语言模型(LLMs)参数规模的指数级增长,其在推理阶段所消耗的计算资源与显存带宽已成为实际部署中的严峻挑战。在众多模型压缩策略中,网络剪枝(NetworkPruning)因其能够直接移除冗余权重而备受关注。特别是在大模型时代,传统的“剪枝-微调”范式由于高昂的重训练成本变得不再现实。

千亿参数的基石:预训练基础模型(PFMs)跨模态演进全解析

深度学习的演进史上,很少有技术能像如今的大模型这样,在短短几年内彻底重塑整个行业的底层逻辑。过去,研究人员习惯于针对单一任务从零开始训练模型;而现在,整个AI界都在拥抱一种全新的范式:“预训练+微调”。

移除AI游戏就崩溃?53款案例深度解析真正的AI原生游戏

当非玩家角色能够滔滔不绝地与你自由对话,或者任务系统能够自动生成无尽的支线时,这是否意味着我们已经踏入了AI原生游戏的时代?许多开发者将生成式大模型直接塞入游戏,仅仅将其作为剧情的“润色工具”或NPC的“聊天外挂”。然而,真正的革命并非如此简单。

拒绝“特权幻觉”!DOPD双重蒸馏让大模型能力狂飙14分

为什么给大模型“开小灶”,它反而越学越傻?在如今的大模型后训练阶段,用一个强大的“老师”模型来指导一个较弱的“学生”模型,已经成为提升性能的标准操作。为了让老师教得更好,研究人员往往会给老师提供一些特权信息(PrivilegedInformation),比如数学题的解题提示,或者视觉任务中的目...

谷歌Gemini 1.5硬核解析:挑战1000万Token上下文,解锁多模态推理新极限

大模型领域的“军备竞赛”正从参数量向上下文窗口急剧转移。当业界还在为几十万Token的窗口欢呼时,谷歌丢出了一枚重磅炸弹。该研究正式推出了Gemini1.5系列模型,最高支持令人咋舌的1000万Token的上下文。这意味着什么?它能一口气吞下长达107小时的音频数据。

Kimi-VL技术解密:28亿激活参数跑通128K长窗口与多模态慢思考

大模型领域的竞争正从单纯的文本向多模态深度推理演进。近期,以推理见长的开源模型层出不穷,但多模态大模型()在参数规模与推理能力之间往往难以两全。现有的开源视觉语言模型大多依赖密集的庞大架构,且缺乏类似深度思考()的能力。为打破这一僵局,月之暗面发布了最新的多模态技术报告。该研究推出了Kimi-...

AI接管设备?超500篇文献全景解码大模型GUI Agent

当Claude发布其具备“电脑操控”能力的最新模型时,整个科技圈为之震动。这项技术让AI不再局限于聊天窗口,而是真正接管了我们的鼠标和键盘。微软、北京大学与上海人工智能实验室近期联合发布了一项重磅长篇综述。该综述系统梳理了超过500篇核心文献,全面揭开了这项前沿技术的神秘面纱。

看教程学操作:Resource2Skill让Agent性能飙升11.9%

当前的大模型(LLM)不仅需要能言善辩,正越来越被期望能够直接操作软件、调用工具并生成高质量的复杂产物,例如幻灯片、3D场景、CAD设计等。然而,在面对UE5引擎或Blender这种重度依赖操作经验的专业软件时,模型仅凭预训练阶段积累的静态知识往往捉襟见肘。