# 《具身智能》第二章逐字稿 ## P1【认识 AI 的 身体】 【本页目标】 建立本章整体路线,明确本章关注的是机器人身体的组成、运动与软件描述。 【预计播报时长】约 1 分 40 秒 【语音逐字稿】 同学们好,上一章我们认识了具身智能的基本概念,知道智能只有进入物理世界、通过行动产生反馈,才真正具有“具身”的含义。这一章,我们把视线从机器人的“大脑”移到它的“身体”。 请先看右侧这张机器人海报。青色头部代表感知,黄色核心代表决策,粉色和绿色的四肢代表执行。左下方的三枚标签,也把本章主线压缩成了三个词:感知、决策、执行。机器人先用传感器看见和感受环境,再由控制器或模型计算下一步,最后通过电机、机械臂和工具真正行动。 本章不要求大家推导复杂的运动学公式。我们的目标更实际:当你看到一个机器人时,能够说出它有哪些传感器、关节怎样运动、位置是相对哪个坐标系描述的,以及软件如何读取它的结构。后面进入平台实操时,相机画面、关节角度、力传感器数值和机器人模型就不会再是陌生参数。 接下来,我们先把看似分散的硬件拼成一条完整的信息链。 ## P2【身体不是零件堆,是一个 持续闭环】 【本页目标】 理解感知、决策、执行三层的功能分工,以及三层如何形成持续闭环。 【预计播报时长】约 2 分 30 秒 【语音逐字稿】 这一页最重要的不是记住三只彩色方框,而是看懂它们之间的方向。动画从左向右流动:感知层先获取环境信息,决策层据此计算动作,执行层再让物理世界发生变化。下方的虚线回路把结果送回起点,说明机器人必须重新感知。 先看青色的感知层。相机和激光雷达提供视觉与距离,IMU 提供运动和姿态变化,力传感器反映接触力,编码器报告关节角度。它们回答的是“现在发生了什么”。 黄色的决策层回答“下一步做什么”。简单任务可以依赖预设规则与 PID 控制,数据驱动任务可以使用行为克隆或强化学习策略,更前沿的系统还会使用大模型或 VLA,把语言理解与动作输出连接起来。 绿色的执行层回答“怎样真正做出来”。电机或液压装置驱动机构运动,机械臂传递运动,夹爪和工具头直接接触环境。比如机器人发现前方障碍物后,决策层改变运动指令,执行层转向;转向之后,障碍物在传感器中的位置已经变化,所以系统必须再次感知。 请注意底部结论中的“连续循环”。只完成一次感知和一次动作,不足以应对不断变化的真实环境。机器人的智能,正是在感知、决策、执行和再感知的闭环中持续运行的。 ## P3【机器人的 五官 各管一件事】 【本页目标】 区分常见传感器所获取的信息,并建立传感器与典型任务之间的对应关系。 【预计播报时长】约 3 分 10 秒 【语音逐字稿】 这一页把感知层画成一张放射式“感官地图”。请观察中心黄色圆,它代表感知层;五条虚线向外连接五类传感器,强调它们不是重复配置,而是在采集不同维度的信息。 左上角的 RGB 相机负责颜色图像,RGB-D 相机在颜色之外还提供每个像素的距离,因此可以支持三维感知和避障。右上角的激光雷达通过测距获得周围环境的距离信息,适合三百六十度扫描、建图和导航。 左下角的 IMU 类似人的平衡感,测量加速度、角速度和姿态变化。右下角的力或扭矩传感器类似触觉,告诉机器人关节或末端受到了多大的力,精密装配和碰撞检测都依赖这类反馈。下方的编码器则记录关节已经转过多少角度,是精确控制关节位置的重要依据。 在“数采工厂”模块中,同学们会同时看到相机画面、关节角度和力传感器数值。这些不同数据流会被一起记录,成为训练机器人的材料。这里要建立一个边界意识:相机能看到颜色,却不能直接替代力反馈;IMU 能感知运动,却不能替代固定环境测距。底部结论的意思是,单一传感器不能包办全部感知任务,我们必须根据任务选择并组合传感器。 ## P4【从 规则 到 VLA:决策能力逐层上升】 【本页目标】 区分三类决策方式,并理解决策策略与计算硬件是两个相互配合的维度。 【预计播报时长】约 2 分 50 秒 【语音逐字稿】 请看左侧阶梯。最下层是传统控制器,按照预设规则或 PID 方法工作;中间是从数据中学习的 AI 模型,包括行为克隆和强化学习;最上层是大模型或 VLA,它可以理解语言指令,并把视觉、语言与动作联系起来。动画强调的是语义理解和泛化能力逐层增加,而不是说上层一定在所有任务中替代下层。 对于目标明确、实时性要求高的底层控制,预设规则仍然重要。面对状态复杂、规则难以穷举的任务,可以让 AI 模型从数据中学习策略。需要理解开放式语言指令时,大模型或 VLA 才体现出更强的能力。选择哪一种,取决于任务,而不是只看技术名称是否新。 再看右侧倾斜的计算机架。工控机负责承载复杂模型与系统软件,GPU 负责加速神经网络推理,像 MCU 或 PLC 这样的设备则适合完成底层、实时的动作控制。也就是说,左侧回答“用什么决策方法”,右侧回答“在哪种硬件上运行”。 底部结论把这两条线合在一起:策略决定做什么,硬件保证它能及时算出来。下一页,我们继续追踪这条信息链,看计算结果如何变成真实动作。 ## P5【把计算结果变成 物理动作】 【本页目标】 理解执行器与末端执行器的区别,并比较四类常见执行器的特征。 【预计播报时长】约 2 分 40 秒 【语音逐字稿】 这张图是一条从控制信号到物理接触的动力管线。请沿箭头从左向右看:控制器先发出信号,中间的执行器把信号转化为运动,最后由末端执行器接触并改变环境。 中间四个方块对应四类常见执行器。伺服电机可以精确控制转动角度,因此是工业机械臂的主流选择。步进电机按固定步长转动,结构简单、成本较低,但精度表现一般。液压执行器依靠液压油驱动,能够提供很大的力量。气动执行器由压缩空气驱动,速度快,但精度相对较低。 右侧黄色区域画的是末端执行器,也就是机器人的“手”。两指或多指夹爪最常见;吸盘适合吸取表面平整的物体;灵巧手尝试完成更精细的操作;焊枪、喷枪和螺丝刀等工具头则面向专门任务。 这里容易混淆两个概念。执行器解决“如何产生运动和力量”,末端执行器解决“用什么部件完成具体操作”。一台机械臂可以由伺服电机驱动,同时根据任务更换夹爪、吸盘或工具头。底部结论因此强调:前者提供运动,后者直接接触环境。 ## P6【关节只有两种基本动作: 转 与 移】 【本页目标】 区分旋转关节和平移关节,理解关节如何组成机器人的运动链。 【预计播报时长】约 2 分 20 秒 【语音逐字稿】 机器人机构看起来可以做出很多复杂动作,但这一页把基本关节压缩成左右两类。左侧青色区域是旋转关节,粉色连杆绕白色轴心摆动,类似门围绕合页转动。机械臂上的大多数关节属于这一类,每个关节都对应一个关节角度,常用度或弧度表示。 右侧黄色区域是平移关节。绿色滑块沿两条直线导轨移动,类似抽屉被拉出和推回。龙门架和线性导轨就是常见例子。它不改变转角,而是改变沿某条直线的位置。 中间的“VS”不是说两者互相排斥,而是帮助我们抓住变量差异:旋转关节改变角度,平移关节改变直线位移。机器人从基座到末端,往往由多个关节和刚性连杆依次连接,前一个关节的运动会带动后面的整段结构,因此形成一条运动链。 请用手臂做一个简单类比:肘部弯曲接近旋转关节;而抽屉沿滑轨移动接近平移关节。理解这两个基本动作以后,下一页的“自由度”就容易解释了。 ## P7【六轴机械臂为什么是 6 自由度 ?】 【本页目标】 理解自由度的直观含义,以及六个旋转关节与末端位置、姿态之间的关系。 【预计播报时长】约 2 分 50 秒 【语音逐字稿】 请先看左侧机械臂示意图。J1 到 J6 是六个可以独立转动的关节,彩色圆点会依次脉冲,提示我们:所谓“六轴”,不是六个传感器,也不是六个部件同时启动,而是六个独立旋转关节。 在本章的直观定义中,一个机器人有多少个独立可动的关节,就有多少个自由度。平面移动小车通常可以用前后运动和转向来理解两个自由度;工业机械臂常见六个;人形机器人则可能达到二十个以上。自由度越多,动作越灵活,同时控制难度也会提高。 右侧公式把六自由度拆成两组。三维空间中的位置需要 x、y、z 三个参数;物体朝向还需要绕三个轴的旋转角度,也就是三个姿态参数。三个位置信息加三个姿态信息,共同构成六个参数。六个独立关节角度组合起来,就能够确定末端在可达空间中的位置和朝向。 请注意“可达”这个条件。机械臂仍然受到连杆长度和关节转动范围限制,并不是能到达无限空间。底部结论要大家记住的是:六个关节角度共同编码末端的三维位置与三维姿态。 ## P8【同一个位置,要先说清楚 参考谁】 【本页目标】 理解世界、基座、末端和相机坐标系各自的原点与用途。 【预计播报时长】约 2 分 50 秒 【语音逐字稿】 这一页的核心问题是“参考谁”。同一个物体,如果相对于房间角落、机器人底座、夹爪中心或相机光心来描述,会得到不同的坐标值。因此只说一组三维数字,没有说明坐标系,这组数字就不完整。 请看左侧工作空间。左下角的 WORLD 是世界坐标系,通常固定在环境中的某个不动点,用来描述物体的绝对位置。机械臂底部的 BASE 是基座坐标系,它跟随机器人底座。机械臂尖端的 END 是末端坐标系,原点位于夹爪或工具中心,用来表达机器人的“手”在哪里、朝向哪里。右下角的 CAMERA 是相机坐标系,原点位于相机光心,坐标轴跟随相机的观察方向。 动画依次画出彩色坐标轴,是在提醒我们:每个坐标系都有自己的方向。比如目标在相机前方,并不意味着它在世界坐标系的某一固定轴正方向,必须经过坐标系之间的转换,软件才能把相机观察变成机械臂动作。 右侧四个节点从全局环境走到局部传感器,展示了不同参考层级。底部结论可以压缩成一句话:坐标值必须和参考坐标系绑定,才能准确表达“在哪里、朝哪看”。 ## P9【URDF:机器人的 静态结构说明书】 【本页目标】 能够说明 URDF 记录哪些静态结构与关节约束,并区分它与运行时状态数据。 【预计播报时长】约 3 分 10 秒 【语音逐字稿】 URDF 的全称是 Unified Robot Description Format,也就是统一机器人描述格式。它是一种 XML 格式,用标准方式告诉软件:机器人由哪些部分组成、这些部分如何连接、各自有什么静态物理属性,以及关节允许怎样运动。 请看左侧树图。青色方块是 Link,也就是连杆,可以把它理解成机器人的“骨头”。粉色圆点是 Joint,也就是关节,它连接父连杆和子连杆,并定义两者如何相对运动。从 base_link 出发,结构一层层分到 upper_arm、sensor_link、end_link 和 camera_link,形成从基座到末端的树形关系。虚线流动强调的是连接关系,而不是数据传输速度。 再看右侧“URDF 写什么”。Link 描述外形、碰撞形状、质量与惯性;Joint 描述父子连杆、关节类型、转轴和限位;Tree 表示 Link 与 Joint 交替连接形成的层级。最后一项 NOT STATE 特别重要:URDF 不记录机器人此刻的关节角度、温度或故障。 因此,URDF 更像一份静态结构说明书,而不是实时体检报告。仿真与运动规划软件可以依据它建立机器人模型、检查碰撞并读取关节边界;机器人当前处于什么角度、温度是否异常、有没有故障,则要由传感器和运行时状态数据提供。记住这个边界,下一页再看 RGB-D 相机怎样为运行中的机器人补充实时距离信息。 ## P10【RGB-D:给每个像素补上 距离】 【本页目标】 理解 RGB-D 相机相对普通相机增加的信息,并比较三种主流深度获取方式。 【预计播报时长】约 3 分 10 秒 【语音逐字稿】 普通 RGB 相机告诉我们每个像素是什么颜色,却不直接告诉我们它离相机多远。RGB-D 中的字母 D 代表 Depth,也就是深度。请看左侧两块画面:彩色图保留物体外观,右侧深度图用灰度层次表示距离。扫描线从画面掠过,强调深度不是整张图只有一个数,而是每个像素都有对应的距离值。 右侧列出三种深度获取技术。结构光会投射已知光斑图案,根据图案变形计算深度,近距离精度高,适合室内。飞行时间,也就是 ToF,会发射光并测量往返时间,较远距离表现较好,抗干扰能力较强。双目视觉用两个摄像头模拟双眼,根据视差计算深度,不主动投射光,室外也可以使用。 获得距离以后,机器人才能判断物体在三维空间中的位置,抓取时才知道手应该伸多远;导航时才能判断障碍物的距离和形状;结合颜色和深度,模型也更容易理解物体大小与空间关系。后续平台会把 RGB 图像和深度图成对保存,用于导航避障等模型训练。 底部结论说“把二维像素补成三维距离”,这正是 RGB-D 的价值。它并没有替代颜色图,而是在颜色信息旁边增加空间尺度。 ## P11【IMU 能短时推算,但会产生 积分漂移】 【本页目标】 理解 IMU 的组成、积分漂移的产生机制,以及多传感器融合为何必要。 【预计播报时长】约 3 分 10 秒 【语音逐字稿】 IMU 是 Inertial Measurement Unit,也就是惯性测量单元。常见 IMU 包含三轴加速度计和三轴陀螺仪,有时还会加入磁力计。加速度计测量三个方向的加速度,陀螺仪测量绕三个轴的角速度,磁力计则提供类似指南针的方向参考。 请沿右侧管线观察漂移怎样产生。传感器先测得加速度和角速度;对这些量积分,可以估计速度与角度;再对速度积分,可以估计位置。问题在于,原始测量中的微小误差也会被一起积分。粉色斜纹误差带从左到右逐渐变宽,表示误差随时间累积,最终让估计位置越来越不准确。这就是积分漂移,不是传感器在机身上物理松动。 IMU 的优势是高频、连续,短时间内即使视觉暂时不可用,也能帮助机器人估计运动和姿态。但它不适合单独承担长期稳定定位。下方青色条给出解决思路:把 IMU 与相机或激光雷达融合,用外部观测持续纠正漂移。视觉惯性里程计,也就是 VIO,以及 SLAM,都可以利用这种互补关系。 所以底部结论同时指出能力与边界:IMU 擅长高频短时运动感知,长期定位必须依靠多传感器融合校正。 ## P12【把机器人的 身体地图 装进脑中】 【本页目标】 用五个知识模块回顾本章,并建立进入数据采集实操前的统一认知框架。 【预计播报时长】约 2 分 30 秒 【语音逐字稿】 现在用这五张不同颜色的卡片回顾本章。 第一,三层闭环。感知获取环境信息,决策计算下一步,执行改变物理世界,变化后的环境再被感知。第二,关节与自由度。旋转关节改变角度,平移关节改变直线位置;独立可动关节的数量帮助我们直观理解机器人的自由度。第三,坐标系。世界、基座、末端和相机坐标系分别回答“相对于谁”,坐标只有绑定参考系才有明确意义。 第四,URDF。Link 描述刚性连杆,Joint 描述连杆之间的运动关系,树形结构和物理属性让仿真与控制软件能够加载机器人。第五,深度与惯性。RGB-D 给出每个像素的空间距离,IMU 提供高频运动信息;深度并不等于姿态,惯性推算也不能长期替代外部定位,两者都有明确边界。 请观察每张卡片底部的小图,它们分别把闭环、运动链、坐标轴、结构树和传感器信息压缩成视觉符号。如果这五个图形能让你快速说出对应概念,本章的身体地图就已经建立起来了。 下一章将进入“数采工厂”模块。届时,相机帧、关节角度和力传感器数值会从概念变成真实数据流,也会成为训练机器人的“教材”。 ## P13【单选题:身体地图 校准】 【本页目标】 通过八道讲义原题检查传感器、关节、URDF、坐标系和末端执行器等核心概念。 【预计播报时长】约 7 分 30 秒 【语音逐字稿】 下面进入八道单选题。页面一次显示一题,请先独立选择,再点击选项查看讲义解析;题内的上一题和下一题只切换题目,不会让课件翻页。 第一题,RGB-D 相机相比普通 RGB 相机多获取了什么信息?请在更多颜色通道、每个像素到相机的距离、物体温度和声音信息之间作答。 【互动停顿】停顿五秒,等待学生选择。 正确答案是 B,每个像素到相机的距离。字母 D 代表 Depth,增加深度后,系统才能感知三维空间结构。 第二题,六轴工业机械臂的“六个轴”指什么? 【互动停顿】停顿五秒,等待学生选择。 正确答案是 B,六个可以独立转动的旋转关节。它们的角度组合确定末端的位置与姿态,不是六种传感器或六盏指示灯。 第三题,URDF 文件的核心作用是什么? 【互动停顿】停顿五秒,等待学生选择。 正确答案是 B,用标准化格式描述机器人的结构。URDF 定义连杆、关节、碰撞形状、质量与惯性,是仿真和控制加载模型的基础。 第四题,哪种传感器最适合测量机械臂关节受到的外力? 【互动停顿】停顿五秒,等待学生选择。 正确答案是 C,力或扭矩传感器。它能测量力与力矩,适用于碰撞检测和精密装配。相机和激光雷达主要观察外部环境,IMU 主要感知惯性运动。 第五题,世界坐标系通常固定在哪里? 【互动停顿】停顿五秒,等待学生选择。 正确答案是 B,环境中的某个固定点。世界系是全局参考,基座系固定在机器人底座,末端系位于夹爪或工具中心。 第六题,IMU 的“漂移”问题指什么? 【互动停顿】停顿五秒,等待学生选择。 正确答案是 B,加速度和角速度的误差随时间累积,使定位越来越不准。漂移是积分误差问题,不是 IMU 在物理上松动。 第七题,末端执行器是机器人的哪个部分? 【互动停顿】停顿五秒,等待学生选择。 正确答案是 C,也就是机器人“手”的部分,包括夹爪、吸盘和工具头等,它负责直接与环境交互。 第八题,哪种传感器最适合自动驾驶汽车的三百六十度环境测距? 【互动停顿】停顿五秒,等待学生选择。 正确答案是 C,激光雷达。它通过发射激光束测量环境距离,可以进行三百六十度扫描,常用于自动驾驶、建图和导航。 八道题完成后,请看累计得分,并回到答错的题目复查。最容易混淆的三组概念是:RGB 与 RGB-D、IMU 与力传感器、执行器与末端执行器。 ## P14【简答一:三层 架构】 【本页目标】 用“名称、功能、硬件例子、闭环关系”完整表述感知—决策—执行三层架构。 【预计播报时长】约 3 分 20 秒 【语音逐字稿】 第一道简答题是:请简述机器人“感知—决策—执行”三层架构分别对应什么功能,并各举一个具体硬件例子。 请先不要展开答案。可以在纸上画三个相连的方框,每个方框写出层级名称、功能和一个硬件例子,最后再补一条返回箭头。 【互动停顿】停顿二十秒,等待学生组织答案。 现在点击“查看讲义标准答案”核对。感知层负责获取环境信息,相当于机器人的五官,例如 RGB-D 相机可以同时获取彩色图像和深度信息。决策层根据感知信息计算应该执行什么动作,相当于机器人的大脑,例如运行 AI 模型的工控机或 GPU。执行层负责实际执行物理动作,相当于机器人的肌肉和手,例如伺服电机驱动机械臂运动,夹爪抓取物体。 完整答案还要说明三层形成持续闭环:执行后环境改变,系统重新感知,再决策、再执行。评分时,三层名称和功能正确占三分,各给出一个硬件例子占两分。容易丢分的情况,是只写“感知、决策、执行”三个词,却没有解释功能,或者把夹爪误写成决策硬件。 ## P15【简答二:为什么恰好是 六自由度 ?】 【本页目标】 准确解释自由度,并建立六个自由度与三维位置、三维姿态的对应关系。 【预计播报时长】约 3 分 10 秒 【语音逐字稿】 第二道简答题是:什么是自由度,也就是 DoF?为什么六轴机械臂有六个自由度? 请按两步作答。第一步给出自由度的定义;第二步解释六这个数字如何拆成“三加三”。 【互动停顿】停顿二十秒,等待学生组织答案。 现在展开讲义标准答案。自由度是指机器人独立可动的关节数量,它决定了机器人的灵活程度。六轴机械臂有六个旋转关节,对应三维空间中描述物体位置和姿态所需的六个参数:三个位置参数,也就是 x、y、z;再加三个姿态参数,也就是绕三个轴的旋转角度。 因此,六个独立关节的角度组合,可以让末端到达三维空间中的任意可达位置,并以相应朝向对准目标。这里仍要保留“可达”这个条件,因为连杆长度和关节范围构成机械边界。 评分要点是:自由度定义正确占两分,解释三个位置加三个姿态占三分。只写“因为有六个轴”属于重复题干,没有说明六个自由度为什么能描述末端位姿。 ## P16【简答三:为什么机器人需要 深度 ?】 【本页目标】 说明 RGB-D 的信息增量,并从抓取、导航、场景理解和仿真迁移解释深度的重要性。 【预计播报时长】约 3 分 40 秒 【语音逐字稿】 最后一道简答题是:RGB-D 相机相比普通 RGB 相机有什么优势?在具身智能数据采集中,为什么深度信息很重要? 请先用一句话回答“多了什么”,再至少列出两个应用原因。不要只写“更准确”,而要说明准确在哪里、支持什么任务。 【互动停顿】停顿二十秒,等待学生组织答案。 现在展开讲义标准答案。RGB-D 相机在普通彩色图像之外,还能获取每个像素到相机的距离,也就是深度信息。 深度的重要性可以从四个方面说明。第一,三维空间感知。机器人抓取物体时必须知道目标在空间中的精确位置,只看二维图像难以判断距离。第二,避障导航。深度让机器人知道障碍物的距离和形状,从而规划安全路径。第三,场景理解。把颜色和深度结合起来,模型能更好理解物体大小与空间关系。第四,仿真到真实迁移。在仿真中渲染的深度图可以与真实深度图对齐,帮助模型从仿真迁移到真实环境。 评分时,说明深度信息是什么占一分,至少列出两个重要性原因占四分。容易混淆的是把“深度”理解成图像内容更有思想深度;这里的深度是明确的物理距离。 到这里,第二章的课件与测验全部结束。我们已经完成从身体架构、传感器、关节、坐标系到 URDF 的认知准备。下一章将把这些概念带进平台,开始实际的数据采集。