本学习大纲面向具身智能初学者,目标是帮助读者建立对具身智能研究方向、核心任务、常用技术栈和典型实验平台的整体认知,为后续参与真实科研项目打下基础。
学习重点不在于一开始就掌握完整机器人系统,而是先理解:
- 具身智能研究什么问题;
- 它和传统 AI、机器人学之间有什么区别;
- 当前主流研究方向和常见平台有哪些;
- 作为 CS 背景的学生,应该从哪些切入点入门。
具身智能与很多传统人工智能方向的核心区别在于:智能体需要在一个物理环境中,通过感知、决策和行动形成闭环。
这个“身体”不一定是真实机器人,也可以是仿真环境中的虚拟智能体。例如,在 Habitat、AI2-THOR、CARLA、Isaac Sim 等平台中,智能体虽然没有真实物理本体,但依然具有视角、动作空间、运动约束、环境反馈等具身属性。
因此,具身智能关注的不只是“模型能不能回答正确”,而是:
- 能不能理解当前环境;
- 能不能根据目标做出决策;
- 能不能把决策转化为可执行动作;
- 能不能在执行失败后根据反馈调整策略;
- 能不能在真实或仿真的交互环境中完成任务。
简单来说,传统 AI 更常处理静态输入输出,例如图像分类、文本生成、问答推理;而具身智能更强调 感知 - 规划 - 行动 - 反馈 的闭环过程。
机器人学是一个非常庞大的工程体系,涵盖机械结构、硬件电路、嵌入式系统、传感器、运动控制、定位建图、路径规划、人机交互等多个层面。每个模块本身都需要深厚的专业积累。
而现在 AI 语境下常说的“具身智能”,通常更强调:如何用人工智能方法提升机器人或虚拟智能体的感知、理解、规划和决策能力。
也就是说,具身智能不是要替代传统机器人学,而是在机器人技术栈的上层引入更强的学习、推理和泛化能力。例如:
- 用视觉语言模型理解复杂任务指令;
- 用大模型进行任务分解和长程规划;
- 用强化学习或模仿学习学习低层动作策略;
- 用多模态模型对场景进行语义理解;
- 用世界模型或仿真环境生成可交互经验。
对于 CS 背景的学生来说,入门具身智能时不一定要从机械、硬件和控制底层开始,但需要理解这些模块的基本作用。只有知道上层算法最终如何落到执行系统上,才能更好地理解什么是“可执行的智能”。
对于初学者来说,最快的方式不是一开始就系统阅读大量论文,而是先通过综述、博客、开源项目和 demo 建立直观认识。
具身智能吸引人的地方在于它有明确的应用场景:机器人导航、家务操作、移动抓取、自动驾驶、人形机器人、多智能体协作等。一个好的长期方向,往往不是“最热门”的方向,而是你看到实验效果、应用场景或系统 demo 后,即使它只是一个 demo,也真正感兴趣并愿意持续投入的方向。
需要注意的是:好方向不一定等于容易实现,也不一定等于短期内能做出完整系统。
但是,具身智能仍处在快速发展阶段,很多方向都可以设计出简化版本或最小可行实验。例如:
- 真实机器人太复杂,可以先从仿真平台开始;
- 多任务操作太复杂,可以先做单目标导航;
- 长程任务规划太复杂,可以先做简单的任务分解;
- 多模态闭环系统太复杂,可以先做离线 benchmark 评测。
因此,初学阶段更重要的是找到一个清晰、可实现、可验证的小切口。
具身本体与底层系统主要包括机械结构、硬件系统和嵌入式软件。对于 CS 背景的学生来说,这通常不是最主要的研究切入点,但它是理解具身智能系统边界的重要基础。
因为任何上层智能算法最终都需要被真实系统执行。机器人能不能稳定移动、能不能安全抓取、传感器数据是否可靠、控制指令是否实时,都会直接影响具身智能算法的实际效果。
机械结构决定机器人能否承受负载、保持稳定运动、完成特定动作,并满足长期使用和量产需求。
从直观上看,机械结构设计包括使用 SolidWorks、Fusion 360、Creo 等软件进行零部件和装配体建模,然后通过 3D 打印、CNC 加工或工厂制造得到真实部件。
但实际工程远不只是“画零件”。结构设计需要在成本、重量、强度、加工难度、装配精度和可靠性之间做权衡,并涉及理论力学、材料力学、机械原理、机械设计等知识。
对于具身智能初学者,不需要一开始深入掌握机械设计,但至少应理解:
- 机器人形态会限制其动作能力;
- 机械结构会影响算法可执行性;
- 仿真中的理想动作在真实机器人上可能不可行;
- 真实系统中的误差、摩擦、负载和碰撞不能被忽略。
机器人硬件系统决定整机的供电、计算、通信、驱动、传感器接口和系统可靠性。
它不仅影响机器人能不能运行,也影响机器人能不能长时间稳定运行、能不能量产、能不能在复杂环境下保持可靠工作。
机器人硬件需要面对许多工程问题,例如:
- 电源管理与动态功率波动;
- 电机驱动与伺服控制;
- 传感器接口与数据同步;
- 电磁干扰与信号稳定性;
- 震动、冲击、温度变化等环境因素;
- 整机布线、散热、可靠性和可维护性。
常见技术方向包括电力电子、电源管理、嵌入式硬件开发、电机驱动、传感器硬件适配、整机系统集成与可靠性设计等。
对于 CS 背景的学生来说,硬件系统不一定是主要研究方向,但需要知道:硬件能力决定了算法能够运行在什么平台上,以及能否满足实时性、稳定性和功耗要求。
机器人嵌入式开发负责连接上层算法与底层执行系统。它将高层决策转化为电机、驱动器和传感器可以执行或反馈的指令。
嵌入式系统通常涉及:
- 主控固件开发;
- 操作系统移植;
- 外设驱动开发;
- 传感器数据采集;
- 电机控制接口;
- 实时任务调度;
- 通信协议适配;
- 与上层 ROS/算法系统对接。
需要注意的是,常见的机器人计算平台可以大致分为几类:
- 边缘 AI 计算平台:如 NVIDIA Jetson AGX Orin、Jetson Orin Nano,适合运行视觉模型、深度学习模型和机器人上层算法;
- 单板计算机:如 Raspberry Pi,适合轻量级感知、通信、控制和原型验证;
- 微控制器/实时控制板:如 STM32、ESP32、Arduino、Teensy 等,更常用于电机控制、传感器采集和实时底层控制;
- 工业控制器或专用驱动器:常用于对稳定性、实时性和可靠性要求更高的机器人系统。
因此,AGX Orin 和树莓派更准确地说是机器人系统中的计算平台或边缘计算平台,不应简单等同于传统意义上的嵌入式控制板。
对于具身智能算法方向的学生来说,不一定需要深入做底层固件开发,但应该了解:
- 传感器数据如何进入算法系统;
- 算法输出如何变成机器人动作;
- 上层规划和底层控制之间如何通信;
- 为什么真实机器人实验会受到延迟、误差和硬件限制影响;
- ROS/ROS2 在机器人软件栈中扮演什么角色。
这部分是算法和真实执行之间的接口。理解它,有助于避免只在仿真中有效、但无法真实落地的方法设计。
传统机器人感知主要包括视觉识别、目标检测、语义分割、深度估计、点云处理、SLAM、定位建图、多传感器融合等方向。这些技术的核心目标是帮助机器人回答几个基础问题:我在哪里?周围有什么?物体在哪里?环境结构是什么?哪些区域可以通行或交互?
但在当前多模态大模型快速发展的背景下,具身感知的研究重点正在发生变化。我们不再只关注机器人能否检测出物体或重建地图,而是进一步关注:智能体能否理解物理空间、推断遮挡区域、判断物体之间的空间关系,并将这些理解转化为可执行的任务规划。
因此,这里更推荐从 空间智能 的角度理解具身感知。所谓空间智能,不只是识别图像中有什么,而是理解物体、位置、朝向、遮挡、可达性、功能属性和动作后果之间的关系。对于具身智能来说,空间理解能力可以被看作连接“视觉输入”和“行动决策”的关键桥梁。
需要注意的是,VLM/MLLM 并不能完全替代传统机器人感知。深度、位姿、轨迹、碰撞检测、可通行区域等信息仍然依赖几何感知、SLAM、传感器融合和运动控制系统。更合理的理解是:传统感知提供可靠的几何和状态基础,VLM/MLLM 提供更强的语义理解、空间推理和任务上下文建模能力。
这一方向可以分为以下几个核心分支。
第一类方向关注如何评测和提升 VLM/MLLM 的空间理解能力。它们不一定直接完成机器人任务,而是研究模型是否具备理解三维空间、推断不可见区域、进行视角转换和预测动作后果的能力。
例如,李飞飞、Jiajun Wu 等团队近期提出的 ESI-Bench 将空间智能放到具身交互闭环中评测。它不再假设模型拥有完整观察,而是要求智能体通过移动、感知和操作主动获取信息,进而回答与遮挡、容器、功能、动态变化等相关的空间问题。该 benchmark 强调一个重要观点:具身空间智能不是被动看图,而是在 perception-action loop 中通过行动获得更有用的观察。
另一个典型工作是 MindCube,它关注 VLM 是否能从有限视角构建类似人类的空间心理模型,用于评测模型在位置理解、视角转换和动态想象方面的能力。其核心问题是:模型能否根据少量观察推断完整空间结构,并进行“如果我移动/旋转,会看到什么”的推理。结果显示,直接使用现有 VLM 往往表现较弱,而引入 cognitive map 并采用 “map-then-reason” 的方式可以显著提升空间推理能力。
这类工作适合作为新手理解“具身感知”的切入点,因为它们把问题从普通视觉识别提升到了更接近具身智能本质的层面:模型不仅要知道图像中有什么,还要知道这些物体在空间中如何组织、智能体应该如何改变视角、以及行动会带来什么新的观察。
可以将这一方向概括为:空间理解大模型主要研究 VLM/MLLM 是否具备三维空间表征、视角推理、遮挡推断、动态想象和主动感知能力。它们构成了具身智能中的高层“感知大脑”,为后续导航、操作和任务规划提供空间语义基础。
第二类方向不只是评测模型是否具备空间能力,而是进一步研究:如何把空间理解能力转化为更强的具身任务执行能力。
这类工作通常会把 VLM/MLLM 的空间理解结果转化为更结构化的中间表示,例如场景图、语义地图、拓扑图、对象关系图或任务相关的空间记忆。然后,智能体再基于这些表示进行导航、操作或任务规划。
例如,ESCA 就是一个代表性方向。它通过构建结构化的 scene graph 来增强 embodied agent 的环境理解能力,使智能体不只是看到图像,而是获得关于物体、关系和上下文的结构化表示。ESCA 的核心思想是:如果 agent 能够获得更清晰的场景关系表示,就能减少感知错误,并进一步提升具身任务中的决策和规划表现。
这类方法的价值在于,它们弥补了端到端 MLLM agent 的一个常见缺陷:模型虽然能生成自然语言推理过程,但内部缺少稳定、可更新、可验证的空间状态表示。因此,单纯依赖图像输入和语言 CoT,容易出现物体位置混淆、空间关系错误、长期记忆丢失和规划不可执行等问题。
更合理的具身规划框架通常需要显式维护某种环境状态,例如:
- 当前可见物体有哪些;
- 物体之间有什么空间关系;
- 哪些目标已经被访问过;
- 哪些区域仍然未知;
- 哪些物体可能被遮挡或位于容器中;
- 当前任务目标和环境状态之间有什么差距;
- 下一步行动应该获取新信息,还是直接执行任务。
因此,这一方向可以概括为:空间理解增强具身规划的核心目标,是将 VLM/MLLM 的感知与推理能力转化为可用于行动决策的结构化环境表征,从而提升导航、操作、探索和长程任务规划的可靠性。
具身智能中最核心、最热门的两个方向是 具身操作 和 具身导航。如果进一步对应到当前大模型时代的研究脉络,最典型的两个关键词就是 VLA 和 VLN。
其中,VLN(Vision-and-Language Navigation)主要研究智能体如何根据自然语言指令,在视觉环境中完成导航任务。例如,给定指令“走出卧室,经过走廊,在厨房的水壶旁停下”,智能体需要理解语言、识别环境、规划路径并判断何时停止。
而 VLA(Vision-Language-Action)更强调把视觉输入、语言指令和机器人动作统一建模,使模型可以直接从图像和语言中输出可执行动作。当前 VLA 更多出现在机器人操作和真实机械臂控制中,例如“把苹果放进碗里”“打开抽屉”“把杯子移到桌子右侧”。
因此,可以这样理解:VLN 关注“智能体如何在环境中移动到正确位置”,VLA 关注“智能体如何根据视觉和语言直接产生动作”。 前者更偏导航任务,后者更偏通用机器人策略范式。
这两个方向之所以重要,是因为它们分别对应具身智能中的两个基础能力:移动能力和操作能力。一个智能体如果不能可靠导航,就无法到达任务现场;如果不能可靠操作,就无法真正改变环境状态。未来更完整的 embodied agent,往往需要同时具备导航、操作、记忆、任务规划和交互能力。
VLN 的基本问题是:智能体能否根据自然语言指令,在视觉环境中完成路径跟随和目标到达。
早期 VLN 的代表性 benchmark 是 Room-to-Room(R2R)。R2R 基于 Matterport3D 室内扫描环境,提出了在真实建筑图像中执行自然语言导航指令的问题,被认为是 VLN 方向的经典起点之一。原始设定中,智能体通常在预定义的离散导航图上移动,每一步从候选视角中选择下一个位置。这个设定降低了底层运动控制难度,使研究重点集中在语言理解、视觉匹配和路径规划上。
在这个阶段,VLN 的核心问题可以概括为:
- 如何把语言指令和视觉观察对齐;
- 如何判断“左转”“经过桌子”“在门口停下”等短语对应环境中的哪个位置;
- 如何在多步决策中避免走偏;
- 如何判断任务什么时候完成;
- 如何提升 unseen scenes 上的泛化能力。
这一时期的方法通常采用 sequence-to-sequence、cross-modal attention、模仿学习和强化学习等技术。智能体输入当前视觉观察和语言指令,输出下一步导航动作。研究重点更多是 instruction following,也就是“能不能按照人类指令走到正确位置”。
R2R 等早期 VLN 任务虽然推动了方向发展,但也存在一个问题:离散导航图简化了真实机器人的运动难度。真实机器人不是在预定义节点之间瞬移,而是需要连续控制、避障、转向、定位和处理运动误差。
因此,后续出现了 VLN-CE(Vision-and-Language Navigation in Continuous Environments)。VLN-CE 将 VLN 推向更接近真实机器人的连续环境,智能体需要根据第一视角视觉和语言指令执行连续控制动作,而不是只在离散图节点之间选择移动。该任务基于 Habitat 平台,并支持 R2R 和 RxR 等数据。
这一变化非常关键。它意味着 VLN 的研究问题从“语言和路径是否匹配”进一步变成:
- 机器人如何在连续空间中稳定执行导航;
- 如何处理碰撞、转向误差和局部避障;
- 如何将高层语言目标转化为低层运动控制;
- 如何在局部观察有限的情况下构建记忆;
- 如何在真实机器人或更真实仿真中保持鲁棒性。
也就是说,VLN 不再只是一个视觉语言匹配问题,而开始变成真正的具身决策问题。
随着大模型和多模态模型的发展,VLN 方向也开始发生变化。早期 VLN 更像“按照给定路线描述走路”,而现在研究者越来越关注更开放的导航能力,例如:
- 根据自然语言目标寻找物体;
- 根据语义常识推断目标位置;
- 在未知环境中主动探索;
- 使用地图、记忆和场景图进行长期规划;
- 结合 VLM/LLM 进行目标推理和决策;
- 从单目标导航走向多目标、顺序目标和长程任务导航。
例如,传统 VLN 指令可能是“出门左转,经过沙发,在厨房停下”,而更开放的具身导航指令可能是“帮我找到可以装水的容器”或“去一个适合看电视的地方”。后者不再只是执行路径,而需要理解物体功能、场景语义和人类意图。
因此,VLN 的研究重点正在从 route following 转向 goal-directed embodied navigation。模型不仅要知道“怎么走”,还要知道“为什么要去那里”“那里是否满足任务需求”“如果没找到目标应该怎么重新规划”。
对于新手来说,可以把 VLN 的发展理解为三步:
- 指令跟随阶段:根据语言描述沿路线走到终点;
- 连续控制阶段:在更真实的环境中完成可执行导航;
- 开放目标阶段:结合语义、地图、记忆和大模型进行目标驱动导航。
与 VLN 相比,VLA 的问题更接近机器人操作和控制。它的目标是让模型能够根据视觉观察和语言指令直接输出动作,从而完成抓取、移动、放置、开关、整理等任务。
在 VLA 出现之前,机器人操作通常采用更模块化的路线:感知模块识别物体,规划模块生成动作目标,控制模块执行轨迹。这个路线可解释、可控,但泛化能力有限,面对开放词汇指令、复杂语义关系和未知物体时容易受限。
大模型进入机器人之后,早期代表性思路并不是直接让 LLM 控制电机,而是让 LLM 做高层任务分解,再通过已有技能库执行。SayCan 就是这一阶段的重要代表。它的核心思想是:语言模型负责判断某个技能是否适合当前任务,价值函数或可供性模型负责判断这个技能在当前环境中是否可执行,最终选择既“有用”又“可做”的技能。
这一阶段解决了一个重要问题:LLM 虽然很会生成计划,但它不知道机器人真实能不能做到。因此,必须用技能可供性来约束语言规划,避免生成听起来合理但无法执行的动作。
可以把这个阶段概括为:LLM 负责想,机器人技能库负责做;系统的关键是让语言计划受到真实可执行能力的约束。
真正让 VLA 成为一个独立范式的,是 RT-1、RT-2 这一类工作。
RT-1 提出了 Robotics Transformer,用大规模真实机器人轨迹训练一个能够从图像和语言中输出动作的模型。它强调一个观点:机器人策略也可以像语言模型一样通过大量、多任务、多物体、多环境的数据训练获得更强泛化能力。
RT-2 则进一步提出 Vision-Language-Action model,将互联网规模视觉语言预训练与机器人动作数据结合起来。RT-2 的关键思想是把机器人动作表示为 token,使模型能够像生成文本一样生成动作,从而把 VLM 的语义知识迁移到机器人控制中。
这个变化非常重要。传统机器人学习通常是“视觉特征 + 控制策略”,而 VLA 试图统一成:
图像 + 语言指令 -> 多模态模型 -> 动作 token / 动作序列
这使得机器人策略不再只是针对某个任务训练的小模型,而开始向“机器人基础模型”靠近。
VLA 的核心价值在于:
- 可以利用大规模视觉语言预训练带来的语义知识;
- 可以通过机器人轨迹数据学习动作执行;
- 可以适应多任务、多物体和多场景;
- 可以把语言理解和动作控制放进统一模型;
- 有机会从单一技能走向通用机器人策略。
早期 VLA 工作大多依赖大型研究机构的真实机器人数据和封闭模型,普通研究者很难复现。后来,Open X-Embodiment、Octo、OpenVLA 等工作推动了 VLA 的开源化和可复现化。
Open X-Embodiment 汇集了来自不同机器人平台的大规模真实机器人轨迹数据,项目页面显示其包含超过 100 万条真实机器人轨迹,覆盖 22 种机器人 embodiment。它的意义在于:机器人学习开始从小规模单平台数据,走向跨机器人、跨任务、跨实验室的数据整合。
Octo 是一个开源通用机器人策略,使用 Open X-Embodiment 数据训练,支持语言指令或目标图像输入,并强调能够适配不同传感器和动作空间。论文摘要显示,Octo 使用约 800k 条轨迹训练,并在多个机器人平台上验证了其作为通用策略初始化的能力。
OpenVLA 则是当前开源 VLA 方向中非常重要的代表。其项目页面介绍,OpenVLA 是一个 7B 参数开源 VLA 模型,在 Open X-Embodiment 的 970k 机器人 episodes 上训练,支持多机器人控制,并可通过参数高效微调适配新机器人场景。
这一阶段的关键词是 generalist robot policy。也就是说,研究者不再满足于训练一个只能完成单一任务的策略,而是希望构建一个可以通过少量微调适配不同机器人、不同任务和不同场景的通用机器人模型。
关于最热门的这两个方向,我这里只介绍它们的技术路线发展历程。一是因为热门技术意味着更快的迭代过程和更高的学习成本,例如学习 VLA,必然要对 pi 系列模型做系统认知;二是笔者可能也讲得不够清楚。因此我希望抛砖引玉,引导大家去自主关注这个方向的最新技术。
具身任务与运动规划,即 Task and Motion Planning(TAMP),关注的是如何把一个高层任务目标转化为可执行的行动序列。它不仅要解决“应该先做什么、后做什么”的任务规划问题,还要考虑动作是否满足环境状态、物体关系、可达性和执行约束。同时,它也是神经符号系统应用于具身任务的主要方向。
这一方向最经典的任务形态是 家庭场景中的长程指令执行。
需要注意的是,ALFRED、ALFWorld 这类 benchmark 严格来说并不是完整机器人学意义上的 TAMP,因为它们通常将底层运动控制离散化或抽象为预定义动作。但它们非常适合作为具身任务规划的入门切口,因为它们保留了 TAMP 中最关键的几个问题:长程任务分解、状态变化、动作前置条件、环境交互和执行反馈。
ALFWorld 把具身任务抽象到 TextWorld 中,使智能体可以先在文本环境中学习高层策略,再迁移到视觉具身环境中执行。它的意义在于提出了一种“文本符号世界 - 视觉具身世界”对齐的研究范式,非常适合研究语言规划、符号状态和具身执行之间的关系。
ALFRED 则要求智能体根据自然语言指令和第一视角视觉观察,在 AI2-THOR 家庭环境中完成多步任务,例如拿取、加热、冷却、清洗、放置等。它的核心价值在于把自然语言理解、视觉 grounding、物体交互和长程动作序列结合起来,而不是只评测静态图像理解或单步动作预测。
从 TAMP 的角度看,ALFRED/ALFWorld 关心的不是机械臂轨迹规划,而是更高层的具身任务逻辑:
- 如何把自然语言任务拆解为子目标;
- 如何判断动作的前置条件是否满足;
- 如何维护物体状态和环境状态;
- 如何在执行失败后重新规划;
- 如何把符号计划落到交互环境中。
因此,这类任务可以被理解为抽象化的 embodied TAMP:它弱化了连续运动规划,但保留了任务规划与环境交互的核心结构。
在具身任务规划中,最自然的一类方法是 神经符号方法。它的基本思想是:让神经模型负责语言理解、视觉感知和语义推理,让符号系统负责状态表示、动作约束、逻辑推理和可执行性验证。
这类方法通常包含几个关键模块:
- 用 LLM/VLM 理解自然语言任务和当前环境;
- 将环境转化为符号状态或结构化表示;
- 用规划器生成动作序列;
- 用前置条件和状态转移检查动作是否合法;
- 在失败后更新状态并重新规划。
这类方法的优势是结构清晰、可解释性强,并且比较适合长程任务;不足是需要设计动作空间、状态表示和技能接口,系统工程成本较高。
可以将神经符号路线概括为:LLM/VLM 负责理解和生成候选计划,符号规划器负责约束、验证和重规划。
另一类路线更接近当前流行的 LLM agent 思路:直接让 LLM/VLM 扮演任务规划器,根据语言指令、环境观察和历史反馈不断生成下一步动作。
这类方法通常不追求完整形式化建模,而是强调:
- prompt-based planning;
- chain-of-thought / reflection;
- tool use;
- memory;
- feedback-driven replanning;
- interaction loop。
它的优点是灵活、易扩展,能够快速适配不同环境和任务;缺点是计划可靠性不足,容易出现幻觉动作、遗漏前置条件、状态跟踪错误和长程目标漂移。
因此,当前更可靠的 agentic 方法通常不会让 LLM 完全自由生成动作,而是会加入环境反馈、动作约束、状态检查或外部 verifier。例如 ReflAct 强调将决策持续 grounding 到当前状态和目标一致性上,并在 ALFWorld 上报告了相对 ReAct 的显著提升。
这类方法可以理解为从经典 TAMP 向 embodied agent 的过渡:传统 TAMP 重视形式化约束;LLM agent 重视开放任务适应性;现代具身规划正在尝试把两者结合起来。
更近一步的趋势是:用 TAMP 思想补足 VLA 模型在长程任务中的不足。
VLA 模型擅长从视觉和语言中直接输出动作,但它们通常更适合短程、局部、反应式控制。对于长程任务,例如“整理厨房”“准备早餐”“把多个物体按类别放好”,单纯依赖 VLA 容易遇到几个问题:
- 长程任务目标难以保持;
- 中间状态难以显式维护;
- 动作前置条件容易被忽略;
- 执行失败后缺乏结构化恢复机制;
- 模型可能生成局部合理但全局错误的动作。
因此,越来越多工作开始把 TAMP、world model 或结构化 planner 放在 VLA 之上,形成更 agentic 的系统架构。
例如,VLM-TAMP 明确指出,VLM 可以生成看似合理的高层计划,但无法保证这些动作对具体机器人来说是几何和运动学可行的;因此需要结合 TAMP,对长程操作任务进行可行性约束和规划验证。
此外,一些较新的工作开始用层级 world model 或逻辑状态转移模型为 VLA 提供中间指导。H-WM 这类方法尝试同时预测逻辑状态和视觉状态转移,用结构化中间状态来指导 VLA 完成长程任务。
这一趋势非常重要,因为它说明 VLA 并不一定会完全替代 TAMP。更可能的路线是:
VLA 负责局部动作生成和技能执行,TAMP/Planner 负责长程任务组织、状态约束和失败恢复。
换句话说,未来的机器人 agent 很可能不是一个单一端到端模型,而是一个由 VLM/LLM、VLA、TAMP、world model、memory 和 verifier 共同组成的混合系统。
具身智能不仅是模型研究,还需要依赖可交互的软件系统和仿真平台。不同平台面向的任务不同:有的用于机器人系统开发,有的用于导航与交互任务评测,有的用于高保真仿真和数据生成。初学阶段不需要掌握所有工具,但需要知道它们各自适合什么问题。
ROS / ROS2 是机器人系统中最常见的软件框架。它不是某个具体算法,而是用于组织机器人系统中不同模块的通信和运行。
在一个真实机器人系统中,通常会有相机节点、雷达节点、定位节点、建图节点、规划节点、控制节点等。ROS2 通过 topic、service、action 等机制,让这些模块可以交换图像、点云、位姿、地图、目标点和控制指令。
对于具身智能来说,ROS2 的意义在于连接上层智能模型和底层机器人执行系统。例如,VLM/LLM 输出一个目标位置或操作指令后,往往需要通过 ROS2 传给导航、机械臂或控制模块。
新手需要重点理解:
- ROS2 是机器人系统的通信和组织框架;
- topic 用于连续数据流,例如图像、点云、里程计;
- action 常用于长时间任务,例如导航到目标点;
- rviz 可用于可视化机器人状态、地图和传感器数据;
- ROS2 是从仿真走向真实机器人的重要接口。
Gazebo 是机器人领域经典的仿真平台,常与 ROS/ROS2 配合使用。它适合测试机器人模型、传感器、控制器、导航算法和多机器人系统。
与具身智能中常用的任务平台不同,Gazebo 更偏传统机器人系统仿真。它关注机器人本体、传感器、运动控制、碰撞和环境交互,适合学习机器人软件栈和真实系统部署流程。
新手可以把 Gazebo 理解为:Gazebo 用来模拟机器人本体和传感器,ROS2 用来组织算法和控制模块。
如果目标是学习移动机器人导航、SLAM、Nav2、传感器仿真和机器人系统集成,Gazebo 是非常常见的入门平台。
在具身智能研究中,Habitat 和 AI2-THOR 是两个非常重要的平台。
Habitat 更适合导航类任务,例如 ObjectNav、ImageNav、VLN、室内空间探索和语义地图构建。它提供高效的室内三维仿真环境,适合研究智能体如何在复杂空间中移动、感知和寻找目标。
AI2-THOR 更适合家庭交互和任务规划类任务。它包含大量室内场景和可交互物体,适合研究物体操作、状态变化、长程任务执行以及 ALFRED 这类 household task。
对于新手来说,如果关注导航和空间智能,可以优先学习 Habitat;如果关注任务规划、物体交互和 embodied agent,可以优先学习 AI2-THOR。
Isaac Sim 是 NVIDIA 推出的高保真机器人仿真平台,适合做高质量视觉仿真、传感器仿真、合成数据生成、机器人操作和 sim-to-real 研究。
相比 Habitat、AI2-THOR,Isaac Sim 更强调真实感渲染、物理仿真、GPU 加速、多传感器支持和机器人系统集成。它适合更接近真实机器人部署的任务,例如机械臂操作、移动机器人、数字孪生、合成数据生成和高保真仿真测试。
不过,Isaac Sim 的学习成本和硬件要求较高。对于初学者,不建议一开始就直接从 Isaac Sim 入门,除非研究目标明确是高保真仿真、机器人操作数据生成或 sim-to-real。
待补充。
笔者并不具备一个较深的思维层级去解析具身的各个环节,但尽量从一个 junior 机器人全栈工程师的角度,并借助 AI,去理解具身智能这个概念。因此,本文更关注全链路的机器人技术、相关领域的技术发展脉络,也希望借此来梳理一下目前的发展现状。
个人浅浅的观点是,具身智能尚处在萌芽阶段,不同学派对于这个问题的认识角度差异很大,呈现出一幅勃勃生机、万物竞发的现象(谁都看不起谁 .dog)。
最后用 Feifei Li 的话来总结:我们现在正处于一个关键时刻,我认为这是一个非常激动人心和令人兴奋的时代,在这个时代里,我们将有更多的时间来研究如何将机器人、人工智能和人类结合在一起。
- https://github.com/TianxingChen/Embodied-AI-Guide
- https://lain-database.feishu.cn/wiki/PgYswrFOZixDJEkilrPcSJ1cnRD?from=from_copylink
- https://tairanhe.com/podcast_en
- https://app.podwise.ai/dashboard/podcasts/189
- https://www.douyin.com/user/MS4wLjABAAAAZPstUu9iFMwBuEBSFKApjQNapsOALhNY3F4vOsocv-BTRZOlVALEDt-idVlRoX_H
- huamnfive(微信公众号)
这里只列出几个主要的技术博客。具身领域有很多活跃的技术分享者,他们有一个共同特点:写得都比我好 😂。希望大家多关注他们的分享。文中所有相关领域、相关方向的论文,都可以借助 AI 或检索工具实现扩展阅读,也欢迎和笔者交流:VX: cy1076525520。