AtlasVLA:仅凭单腕相机,如何在长程操作中超越多视角基线?
在具身智能(EmbodiedAI)的研究中,视觉-语言-动作(Vision-Language-Action,VLA)模型正逐渐成为通向通用机器人操作的核心范式。从基于自回归离散编码生成的OpenVLA,到基于连续轨迹去噪扩散的与CogACT,主流架构都在努力建立“看到什么,就执行什么”的端到端...
在具身智能(EmbodiedAI)的研究中,视觉-语言-动作(Vision-Language-Action,VLA)模型正逐渐成为通向通用机器人操作的核心范式。从基于自回归离散编码生成的OpenVLA,到基于连续轨迹去噪扩散的与CogACT,主流架构都在努力建立“看到什么,就执行什么”的端到端...
大语言模型与多模态视觉模型(VLM)正在迅速成为具身智能体的“推理大脑”。然而,真正将视觉语言模型置于物理机器人中时,研究者往往会遭遇一个尖锐的矛盾:机器人的真实执行过程本质上是高频迭代的动态闭环,机器人的每一次机械臂抬起、每一次底盘移动,都会立即重构周围的几何场景与物理状态,从而不断产生全新...
在具身智能与机器人控制领域,视觉-语言-动作模型(Vision-Language-Action,VLA)在过去两年中确立了统治地位。从RT-2到OpenVLA,主流的研究范式几乎全部围绕着一个核心思路展开:将庞大的大语言模型(LLM)作为感知与动作之间的中央处理器。
在具身智能(EmbodiedAI)的实际部署中,环境始终充满了不确定性。无论是执行过程中的物理偏移、传感器带来的部分可观察性,还是多智能体协同中的突发状况,都迫使智能体必须频繁地进行“重新规划(Replanning)”以纠正错误。
在视觉-语言-动作(Vision-Language-Action,VLA)模型的演进路径上,行业正面临一个关键的架构分岔口。当前主流的范式倾向于将预训练的视觉语言模型(VLM)与一个独立训练的动作专家(如基于流匹配或扩散模型的策略头)拼接。
当前具身智能与机器人学习正经历一场深度的范式革命。以往大放异彩的视觉-语言-动作模型(Vision-Language-Action,VLA)正逐渐暴露出其在物理世界中的局限性。以直接将多模态观察映射为底层动作为核心,这些模型本质上仍是“纯反应式”的系统。
自动驾驶的“认知”革命:大模型如何攻克7大核心推理挑战?。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
本文提出了DR. WELL,一个去中心化的神经符号框架,该框架通过结构化的协商协议和动态演化的符号世界模型,使基于大语言模型(LLM)的具身智能体能够高效地进行协作规划、学习与自我优化。
面向具身智能的世界模型综合综述。本文系统梳理其研究背景、核心方法、关键实验结果、现有局限以及后续工程实践启示。
A Vision-Language-Action Flow Model for General Robot Control。
本文介绍了 BridgeData V2,一个大规模、多样化的机器人操作行为数据集,旨在推动可扩展机器人学习的研究。该数据集包含在24个环境中、使用一个公开可用的低成本机器人收集的超过6万条轨迹,并证明了其能够支持多种主流学习算法训练出可泛化到新任务、新环境甚至新机构的策略。
本文提出了一套名为 ALOHA 的低成本开源双臂遥操作硬件系统,并结合一种名为 ACT 的新型模仿学习算法,通过预测动作序列(Action Chunking)而非单步动作,成功地让低成本机器人学会了多种以往需要昂贵设备才能完成的精细操作任务。
本文介绍了一款名为 Octo 的开源通用机器人策略 (generalist robot policy),它是一个基于 Transformer 的大型策略模型,在迄今为止最大的机器人操作数据集 (Open X-Embodiment) 的 800k 条轨迹上进行预训练,能够通过简单的微调高效适应具...
OpenVLA是一个开源7B视觉语言动作模型,使用97万条真实机器人演示进行训练。本文解读其视觉编码、语言骨干和动作预测方式,说明LoRA微调及量化部署的实验结果,并讨论跨机器人适配、计算资源和实际使用边界。
本文提出了一种具身多模态语言模型 PaLM-E,通过将图像等连续的真实世界传感器数据直接注入到预训练语言模型的词嵌入空间,从而在一个统一的模型中实现了机器人规划、视觉问答和语言理解等多种任务,并证明了跨领域联合训练带来的正向知识迁移效应。
本文提出了一种名为 Voyager 的具身智能体,它首次利用大型语言模型(LLM)实现了在《我的世界》(Minecraft) 开放世界中的无干预终身学习,通过自动课程、可不断增长的技能库和迭代提示机制,持续探索、获取技能并做出新发现。