# 《具身智能基础》第十章逐字稿

## P1【教会机器人 安全到达】

【本页目标】建立导航避障从观测到控制动作的章节主线。

【预计播报时长】约 1 分 20 秒

【语音逐字稿】

前面几章已经完成场景、相机、轨迹和渲染数据，现在要让这些原材料真正变成机器人的行动能力。请看右侧地图：青色起点与绿色终点之间分布着多个障碍物，黄色虚线路径绕开障碍逐步接近目标。动画沿路径推进，对应“观察、决策、移动”的连续循环。导航避障的任务不是画出一条漂亮曲线，而是在给定起点、终点和环境障碍的条件下，持续输出安全控制动作。底部结论将问题压缩成一句话：把“看到什么、要去哪”转换成“此刻怎么走”。本章会从任务定义、数据组织和行为克隆训练出发，再讨论分布偏移、评估指标与安全层，最后完成讲义原有训练实操。

## P2【从起点到终点，路径必须 零碰撞】

【本页目标】理解导航模型的输入、策略与输出闭环。

【预计播报时长】约 1 分 30 秒

【语音逐字稿】

请从左到右阅读这个控制闭环。输入端包含 RGB 图像、深度图和目标位置：RGB 告诉模型场景外观，深度提供前方物体距离，目标位置告诉机器人要去哪里。中央黑色圆形是导航策略，它把观测映射为决策；右侧输出端不是障碍物名称，也不是完整三维地图，而是此刻要执行的线速度和角速度。动画让信息沿虚线进入策略再流向动作，说明导航是逐时刻反复运行的过程。机器人每移动一步都会得到新的观测，再做下一次决策。底部结论强调，在给定观测、目标和障碍物的条件下，模型输出两个速度，最终形成从起点到终点的无碰撞路径。

## P3【不是会走，而是 走得好】

【本页目标】掌握成功率、碰撞率和路径长度比 SPL 三项核心指标。

【预计播报时长】约 1 分 35 秒

【语音逐字稿】

这三个仪表盘分别回答三类问题。绿色成功率判断机器人是否到达终点，方向是越高越好；粉色碰撞率统计运动中是否撞到障碍，方向是越低越好；黄色 SPL，也就是路径长度比，衡量实际路线与理想路线的效率，越接近一越好。动画让三根指针分别转动，提醒我们不能只看单一指标。一个机器人可能成功到达，却频繁擦碰障碍；也可能完全不碰撞，但绕了很远才到终点。讲义和竞赛都特别重视成功率与碰撞率，而 SPL 补充了效率维度。底部结论就是评价逻辑：成功率衡量能否到达，碰撞率衡量是否安全，SPL 衡量路径是否高效。

## P4【每个样本，都把观察连到 动作】

【本页目标】识别导航训练样本的输入字段和专家动作标签。

【预计播报时长】约 1 分 40 秒

【语音逐字稿】

左侧蓝色和黄色框分别是六百四十乘四百八十的 RGB 与深度图，中间菱形是终点相对机器人位置 dx、dy，右侧粉色框是专家动作，包括线速度 v 和角速度 ω。虚线把这四部分绑定成一个样本，动画强调“当前看见什么”必须与“专家此刻怎么做”严格对应。专家动作可以来自遥操作数据，也可以由 A 星、RRT 等规划算法生成；前者更接近人类自然操作，后者成本较低。训练时模型并不是直接学习整条路线，而是反复学习从当前观测到当前动作的映射。底部结论指出，RGB、深度和目标位置是输入，专家速度指令是标签。这个配对关系正是行为克隆能够成立的基础。

## P5【场景必须隔离，不能让模型 偷看答案】

【本页目标】理解按场景划分训练、验证和测试集的必要性。

【预计播报时长】约 1 分 40 秒

【语音逐字稿】

页面左侧训练区占百分之八十，包含场景一、二、三；右侧验证集和测试集各占百分之十，分别使用场景四和场景五。中间粗黑线写着 SCENE FIREWALL，代表场景之间必须隔离。动画让各场景进入自己的区域，禁止同一场景跨越边界。如果把同一仓库的不同帧随机分到训练集和测试集，模型可能记住墙体和箱子的具体位置，测试分数看起来很高，却没有学到面对新环境的导航能力。这就是数据泄漏导致的评估虚高。底部结论强调，训练、验证和测试必须按场景划分，而不是简单按图片随机划分。这样测试结果才真正反映未见场景中的泛化能力。

## P6【翻转图像，也要翻转 转向标签】

【本页目标】理解几何数据增强必须同步变换动作标签。

【预计播报时长】约 1 分 30 秒

【语音逐字稿】

左侧原图表示机器人向左转，角速度是正零点四；经过中央 H-FLIP 水平镜像后，右侧轨迹变为向右转，因此角速度必须变成负零点四。动画把弯曲箭头从左向右镜像，直观展示标签为何要取反。数据增强的目的是用较低成本增加样本变化，但导航样本同时包含图像与动作，两者必须保持物理一致。如果只翻转图像而保留原角速度，模型会在相同视觉状态下收到互相矛盾的监督信号，增强反而制造错误数据。随机裁剪和颜色抖动主要改变视觉外观，而水平翻转涉及方向语义，必须同步处理动作。底部结论明确要求：图像翻转后角速度取反，不能只改输入不改标签。

## P7【把专家动作当作 标准答案】

【本页目标】掌握行为克隆的监督学习机制和 MSE 训练流程。

【预计播报时长】约 1 分 45 秒

【语音逐字稿】

这一页是一条模仿流水线。左侧专家数据提供观测到动作的配对；模型根据同一观测预测线速度和角速度；中央粉色菱形计算 MSE，也就是预测动作与专家动作之间的平方误差；右侧再根据损失更新参数。动画从专家数据推进到预测、误差和更新，表示这个过程会在多个样本和多个训练轮次中重复。行为克隆的优势是简单直观，不需要模型先在环境里随机探索；它的上限也很明确，模型学习的是专家表现，通常不能自然超越专家。底部结论说，行为克隆通过动作误差训练模型模仿专家。下一页会打开模型内部，观察三种输入怎样融合并输出两个连续速度。

## P8【三路特征融合，输出 两个速度】

【本页目标】理解 RGB、深度与目标位置三路特征的融合结构。

【预计播报时长】约 1 分 45 秒

【语音逐字稿】

左侧三条支路采用不同处理方式。RGB 图像通过 CNN 提取外观特征，深度图通过 CNN 提取几何距离特征，二维目标位置通过全连接层转成目标特征。三条虚线汇入中央 FEATURE CONCAT，将特征拼接后送入全连接层；右侧输出线速度和角速度，讲义给出的范围都在负一到一之间。动画让三路信息先独立进入，再在中心合流，说明多模态并不是把原始数据简单堆在一起，而是先提取各自有效表示再融合。RGB 帮助识别环境，深度直接支持避障，目标信息决定运动方向。底部结论概括为：三路特征独立提取、融合，再回归两个速度。

## P9【偏一步，就进入 没见过的世界】

【本页目标】理解行为克隆的分布偏移与纠错数据、DAgger 的作用。

【预计播报时长】约 1 分 50 秒

【语音逐字稿】

黑色粗线代表专家走过的轨迹，训练数据主要来自这些状态；粉色虚线表示模型在推理中出现一次小偏差后进入未知区域，接下来每一步都缺少相似训练样本，错误可能继续累积。动画让分叉点之后的路径逐渐偏离，展示分布偏移不是一次孤立错误，而是一条恶化链。右上绿色模块给出两种补救：加入故意偏离后再纠正回来的轨迹，或者使用 DAgger 收集模型自己犯错时的状态，再让专家补充正确动作并加入训练集。底部结论指出，行为克隆偏离专家分布后会错误累积，而纠错轨迹与 DAgger 是让模型在未知状态下补课。这个问题也解释了为什么只看训练损失远远不够。

## P10【既看评估报告，也加一道 安全刹车】

【本页目标】结合训练曲线、测试指标与安全层判断模型能否可靠执行。

【预计播报时长】约 1 分 45 秒

【语音逐字稿】

左侧是训练与验证损失曲线。如果训练损失继续下降、验证损失反而上升，说明模型可能过拟合。中间测试报告回到成功率、碰撞率和 SPL 三项核心指标，并应进一步查看窄通道、多障碍物等高风险场景。右侧绿色菱形是安全层，它位于模型输出和真实执行之间，利用深度图检查动作是否可能碰撞；发现危险时，可以把动作覆写为停止或转向。动画让评估结果进入安全闸门，表达离线分数与在线防护缺一不可。底部结论强调，先用三指标评估策略，再用安全层拦截危险动作。它不是替代模型训练，而是部署时的最后一道防线。

## P11【从训练样本，到 安全动作】

【本页目标】整合导航模型的数据、训练、纠错、评估与安全闭环。

【预计播报时长】约 1 分 35 秒

【语音逐字稿】

总结图从左到右列出四个关键环节。SAMPLE 把观察绑定到专家动作；SPLIT 按场景完成八十、十、十的数据隔离；BC POLICY 用 MSE 学习模仿专家；DEPLOY READY 则加入三指标评估、纠错数据和安全层，最终才输出可执行的安全动作。动画依次连通这些模块，说明成功的导航模型不是只靠一个网络结构，而是由数据质量、评估方法和安全设计共同决定。底部结论再次强调四个支点：按场景划分、行为克隆、分布偏移纠错和安全过滤。下面进入讲义原有单选、判断和实操，请先独立作答，再查看即时解析。

## P12【单选题 · 10题】

【本页目标】检查导航输出、行为克隆、数据划分、指标、过拟合和安全层知识。

【预计播报时长】约 4 分 20 秒

【语音逐字稿】

请每题先思考再点击。第一题答案 B，导航模型输出线速度和角速度。第二题答案 B，行为克隆把专家操作当标准答案。第三题答案 B，分布偏移指模型偏离专家路径后进入没见过的状态并累积错误。第四题答案 B，数据必须按场景划分。第五题答案 B，核心指标是成功率、碰撞率和 SPL。第六题答案 B，水平翻转后角速度取反。第七题答案 B，竞赛核心关注成功率和碰撞率。第八题答案 C，“可以超越专家”不是行为克隆的优点。第九题答案 B，训练损失下降而验证损失上升是过拟合信号，需要更多数据或正则化。第十题答案 B，安全层位于输出与执行之间，检测并拦截可能碰撞的动作。完成后查看累计得分，并针对错题回看相应知识页。

## P13【判断题 · 5题】

【本页目标】辨析深度输入、MSE、数据质量、临界避障与 DAgger。

【预计播报时长】约 3 分 00 秒

【语音逐字稿】

判断题同样先作答再看解析。第一题“导航只需要 RGB，不需要深度图”是错误的；深度图提供直接距离信息，通常显著提升避障精度。第二题是正确的，行为克隆动作回归常用预测动作与专家动作的均方误差。第三题“数据越多表现一定越好”是错误的；数据收益会递减，多样性与边缘情况覆盖比只增加数量更重要。第四题是正确的，频繁碰撞可能来自训练集中缺少距离很近的临界避障样本。第五题是正确的，DAgger 收集模型犯错时的状态，由专家补充正确动作后加入训练集，从而缓解分布偏移。页面内的上一题、下一题只切换判断题，不会触发课件翻页。

## P14【实操 · 训练导航避障模型】

【本页目标】按讲义参数完成行为克隆训练、评估、可视化测试和报告。

【预计播报时长】约 2 分 25 秒

【语音逐字稿】

请先完成任务，再展开评分标准。训练数据至少来自两个场景，每个场景五百帧以上；在模型训练模块创建行为克隆任务，设置五十轮、批次大小三十二、学习率零点零零一；训练完成后记录成功率和碰撞率，并在三个不同场景中进行可视化测试。提交物包括含成功率、碰撞率和 SPL 的评估截图，一段至少三十秒且展示两个场景的导航录屏，以及二百到三百字训练报告。报告要说明场景数量和总帧数，分析哪些场景表现好或差，并提出至少两条具体改进。展开后可见讲义评分：训练成功并完成评估占百分之三十；成功率达到百分之七十五及以上占百分之三十；报告分析深入、建议具体占百分之四十。完成这一闭环后，下一章将从行为克隆继续走向扩散策略和 VLA。
