FlashRT:引导Coding Agent重写多模态部署,延迟最高降低70倍
卡耐基梅隆大学(CMU)、超威半导体(AMD)与纽约州立大学布法罗分校的研究团队提出了一套全新系统 FlashRT。该方案打破了“为人手写调度器”或“用规则编译器解决一切”的传统思路,转而将系统级优化任务交给大模型编码智能体(Coding Agent)。
卡耐基梅隆大学(CMU)、超威半导体(AMD)与纽约州立大学布法罗分校的研究团队提出了一套全新系统 FlashRT。该方案打破了“为人手写调度器”或“用规则编译器解决一切”的传统思路,转而将系统级优化任务交给大模型编码智能体(Coding Agent)。
来自复旦大学、清华大学与合作团队提出的 GameWAM ,打破了这两者之间的界限。作为首个面向原生闭环游戏操作与图形用户界面(GUI)控制的“世界-动作模型”(World–Action Model, WAM),GameWAM 放弃了动作与画面的割裂预测,转而在同一统一框架下。
由来自 Drexel、Northeastern、Purdue 和 Virginia Tech 的研究团队最新提出的 GlanceWAM ,给出了破解这一困局的优雅答案。该工作指出,现存的“速度与成功率不可兼得”并非视觉前瞻本身的内在缺陷,而是因为传统方案机械地把庞大的视频生成绑死在毫秒级的高频...
作者团队在涵盖 LangGraph、AutoGen 以及自研框架,横跨 Qwen-2.5-7B/3B、Llama-3.1-8B 以及商用 Gemini-2.5-flash API 的 2823 个真实智能体轨迹上,构建了一套两阶段防护系统。
在企业和科研机构的实际业务中,当分析师需要计算一份基金风险指标或核对季度供应链数据时,答案几乎从来不会现成地躺在某一张干净的数据库表格里。现实中的核心证据往往支离破碎:计算规则可能写在管理规范的PDF报告中,行业基准可能来自一段会议演示视频的解说旁白,而原始的交易明细则分散在本地的SQLite...
当视频生成的分辨率迈向720p、1080p,生成时长从数秒拉长到数十秒甚至一分钟时,扩散模型底层的计算范式正撞上一堵难以逾越的显存与算力墙。目前开源和闭源的主流视频扩散Transformer(VideoDiT),大多重度依赖全时空三维Softmax注意力。
在具身智能(EmbodiedAI)的研究中,视觉-语言-动作(Vision-Language-Action,VLA)模型正逐渐成为通向通用机器人操作的核心范式。从基于自回归离散编码生成的OpenVLA,到基于连续轨迹去噪扩散的与CogACT,主流架构都在努力建立“看到什么,就执行什么”的端到端...
在具身智能与通用机器人操作领域,世界-动作模型(World-ActionModels,简称WAM)正在成为一种极具竞争力的新范式。相比于传统的视觉-语言-动作模型(VLA),WAM的核心优势在于“通过预测未来以更好地执行动作”:它让策略网络在生成控制指令的同时,联合预测环境未来的观测状态,从而...
在肺癌精准医疗的实际诊疗中,病理评估早已超越单纯的“看切片定良恶性”。临床医生制定靶向治疗、免疫治疗或抗体偶联药物(ADC)方案,必须依赖组织形态学(H&E)、免疫组织化学(IHC)多标志物以及分子变异数据的深度整合。
将大规模视频生成模型转化为机器人的“世界模型”,是具身智能领域最具吸引力的探索方向之一。预训练视频模型在海量真实世界视频中学习到了极其深厚的物理先验:物体如何移动、刚体与流体如何形变、接触碰撞发生时场景如何反馈。
当整个行业都在试图通过堆叠激光雷达、深度相机全景阵列甚至预先构建的高精地图来提升机器人的导航成功率时,Mistral团队给出了一个截然不同的答案。他们带来的最新成果RobostralNavigate,不仅是一个拥有80亿参数的视觉语言模型(VLM),更代表了一种极简、高泛化性的具身智能扩展路线。
在具身智能与机器人控制领域,视觉-语言-动作模型(Vision-Language-Action,VLA)在过去两年中确立了统治地位。从RT-2到OpenVLA,主流的研究范式几乎全部围绕着一个核心思路展开:将庞大的大语言模型(LLM)作为感知与动作之间的中央处理器。
长期以来,人工智能在数字世界中的行动能力主要依赖于代码生成和应用程序接口(API)。现代大语言模型已经能够熟练地编写程序或调用各类软件工具,但在真实的人类工作环境中,大量的数字化工作远远超出了这些接口的覆盖范围。
在医疗人工智能的演进历程中,基于文本的大语言模型已经展示了令人瞩目的疾病诊断和医学推理能力。然而,真实的医患问诊从来不是一个纯粹的文本交换过程。在临床实践中,医生通过观察患者的面部表情、倾听咳嗽的音色、评估患者的体态和动作(如呼吸困难或静息震颤),不断捕获关键的非语言线索。
图形用户界面(GUI)智能体展现出了将自然语言意图转化为跨软件生态多步操作的巨大潜力。然而,从基准测试的进步到真实世界的可靠部署,GUI智能体一直被两大瓶颈死死卡住:一是训练层面的数据稀缺与分布偏差;二是交互层面的提示词歧义与执行不可靠。
在游戏开发、物理仿真以及具身智能等前沿领域,根据用户的自然语言指令快速构建可交互的开放式3D世界,一直是一项极具挑战性的核心任务。近年来,随着多模态大语言模型(MLLM)的爆发,学术界和工业界开始尝试利用多模态Agent来实现3D世界构建的自动化。
随着当代视觉与大语言模型(LLMs)参数规模的指数级增长,其在推理阶段所消耗的计算资源与显存带宽已成为实际部署中的严峻挑战。在众多模型压缩策略中,网络剪枝(NetworkPruning)因其能够直接移除冗余权重而备受关注。特别是在大模型时代,传统的“剪枝-微调”范式由于高昂的重训练成本变得不再现实。
深度学习的演进史上,很少有技术能像如今的大模型这样,在短短几年内彻底重塑整个行业的底层逻辑。过去,研究人员习惯于针对单一任务从零开始训练模型;而现在,整个AI界都在拥抱一种全新的范式:“预训练+微调”。
当非玩家角色能够滔滔不绝地与你自由对话,或者任务系统能够自动生成无尽的支线时,这是否意味着我们已经踏入了AI原生游戏的时代?许多开发者将生成式大模型直接塞入游戏,仅仅将其作为剧情的“润色工具”或NPC的“聊天外挂”。然而,真正的革命并非如此简单。
为什么给大模型“开小灶”,它反而越学越傻?在如今的大模型后训练阶段,用一个强大的“老师”模型来指导一个较弱的“学生”模型,已经成为提升性能的标准操作。为了让老师教得更好,研究人员往往会给老师提供一些特权信息(PrivilegedInformation),比如数学题的解题提示,或者视觉任务中的目...
大模型领域的“军备竞赛”正从参数量向上下文窗口急剧转移。当业界还在为几十万Token的窗口欢呼时,谷歌丢出了一枚重磅炸弹。该研究正式推出了Gemini1.5系列模型,最高支持令人咋舌的1000万Token的上下文。这意味着什么?它能一口气吞下长达107小时的音频数据。
大模型领域的竞争正从单纯的文本向多模态深度推理演进。近期,以推理见长的开源模型层出不穷,但多模态大模型()在参数规模与推理能力之间往往难以两全。现有的开源视觉语言模型大多依赖密集的庞大架构,且缺乏类似深度思考()的能力。为打破这一僵局,月之暗面发布了最新的多模态技术报告。该研究推出了Kimi-...
当Claude发布其具备“电脑操控”能力的最新模型时,整个科技圈为之震动。这项技术让AI不再局限于聊天窗口,而是真正接管了我们的鼠标和键盘。微软、北京大学与上海人工智能实验室近期联合发布了一项重磅长篇综述。该综述系统梳理了超过500篇核心文献,全面揭开了这项前沿技术的神秘面纱。
当前的大模型(LLM)不仅需要能言善辩,正越来越被期望能够直接操作软件、调用工具并生成高质量的复杂产物,例如幻灯片、3D场景、CAD设计等。然而,在面对UE5引擎或Blender这种重度依赖操作经验的专业软件时,模型仅凭预训练阶段积累的静态知识往往捉襟见肘。