# 《具身智能基础》第十二章逐字稿

## P1【跨过最后一道 现实鸿沟】

【本页目标】建立从仿真模型到真实可用系统的部署主线。

【预计播报时长】约 1 分 20 秒

【语音逐字稿】

我们已经在仿真中训练出导航模型，但仿真高分不等于真实可用。请看右侧：左边是整洁、规则的 SIM 世界，右边是真实环境，同一个箱子会因为光照、纹理和拍摄条件显得不同；中间粉色裂缝就是 Sim-to-Real Gap。绿色虚线路径跨过裂缝，依次对应随机化、适配和安全部署。动画表达的不是把模型文件简单复制到机器人，而是一整套跨域工程。底部结论强调，仿真成绩只是起点，真实环境稳定运行才算部署完成。本章会解释差距来源、域随机化、在线增广、真实数据微调、边缘端格式转换、三层安全以及低速测试回流闭环。

## P2【仿真冠军，到了现实 可能撞墙】

【本页目标】理解 Sim-to-Real Gap 的定义、计算方式与严重程度。

【预计播报时长】约 1 分 35 秒

【语音逐字稿】

左侧仿真区域显示较高成功率，右侧真实世界出现性能下降，中间交叉线把这一下落标成 GAP。页面下方给出计算式：Sim-to-Real Gap 等于仿真成功率减去真实成功率。动画让性能从左侧高位掉到右侧低位，直观表现“同一个模型、换一个世界”带来的变化。讲义给出判断边界：差距超过百分之二十说明问题严重，需要干预；差距小于百分之五说明泛化较好。需要注意，差距是同一指标在两个域中的对比，不能只看真实成功率本身。底部结论指出，Sim-to-Real Gap 就是仿真训练模型进入真实环境后出现的性能下降。下一页我们把这道差距拆成三类来源。

## P3【差距来自视觉、物理和 传感器】

【本页目标】区分视觉、物理和传感器三类域差异。

【预计播报时长】约 1 分 40 秒

【语音逐字稿】

这页使用圆形、菱形、圆形三个不同区域。左侧视觉差异包括光照、阴影、纹理和白平衡；同一个仿真中的纯红箱子，在真实环境中可能偏橙、有高光和磨损。中央物理差异包括摩擦、质量、打滑和阻尼；仿真地面摩擦固定，现实中的瓷砖、地毯和水泥会让运动结果不同。右侧传感器差异包括噪点、延迟和测量误差。动画让三类差异依次出现，说明现实性能下降往往不是单一原因。底部结论说，真实环境会同时改变外观、运动规律和观测质量。解决 Sim-to-Real 问题，必须让训练覆盖这些变化，而不是只把材质调得更逼真。

## P4【不要只做得像，要做得 足够多样】

【本页目标】理解域随机化的覆盖面思维。

【预计播报时长】约 1 分 35 秒

【语音逐字稿】

虚线椭圆表示域随机化后的仿真范围，里面分布着光照、纹理、位置、噪声和物理参数的不同变化；中央真实世界只是这个大范围中的一个组合。动画让这些随机因素围绕 REAL WORLD 展开，表达域随机化的核心不是追求某一张仿真图和现实一模一样，而是让仿真足够多样。只拟合一个真实场景，换光照或换地面后仍可能失败；覆盖足够宽时，现实变化更可能落在模型见过的范围内。底部结论强调，域随机化扩大仿真覆盖面，让真实环境成为多样性中的一种。随后我们再看训练阶段如何继续制造变化。

## P5【每轮在线增广，都看见 新变化】

【本页目标】掌握在线数据增广的方式与优势。

【预计播报时长】约 1 分 40 秒

【语音逐字稿】

中央图像周围连接五类操作：亮度与对比度、高斯噪声、随机裁剪加缩放、颜色抖动，以及一个明确的提醒“不要删除训练数据”。动画让不同变换按轮次进入同一图像，表示每个 epoch 都可以看到略有不同的版本。数据增广必须在不改变任务语义的前提下增加视觉变化；删除数据只是减少样本，不属于增广。讲义推荐训练时在线执行，而不是预先保存大量变体，因为在线增广更节省存储，组合也更丰富，能够降低模型背诵固定图像的风险。底部结论说，每轮略有不同的图像比离线复制更省空间也更防过拟合。

## P6【大量仿真预训练，少量真实 微调】

【本页目标】理解域适配的预训练加真实数据微调路线。

【预计播报时长】约 1 分 40 秒

【语音逐字稿】

左侧是大量 SIM DATA，它用低成本仿真样本训练导航基础能力；中间箭头写着 GENERAL FEATURES，代表边缘、形状等底层特征具有通用性；右侧菱形只放入少量真实数据，用来微调光照、纹理等高层环境特征。动画从大规模仿真流向小规模真实微调，说明域适配不是抛弃原模型从头训练。完全用真实数据代价高，而只用仿真又无法适应真实外观。预训练加微调保留了两者优势。底部结论指出，域适配保留仿真学到的通用能力，再用少量真实数据调整环境特征。完成跨域后，模型还需要在机器人本体上低延迟运行。

## P7【模型留在机器人，延迟 更低】

【本页目标】理解边缘端部署相对云端的延迟、网络和隐私优势。

【预计播报时长】约 1 分 35 秒

【语音逐字稿】

左侧 EDGE 或 JETSON 把模型直接放在机器人本体，页面标出低于十毫秒的本地推理，以及低延迟、隐私和离线可用；右侧 CLOUD 需要通过网络往返，中间红叉表示网络可能延迟或断连。动画先点亮本地模型，再中断云端链路，说明导航控制为什么不能把全部安全依赖交给 WiFi。边缘端不一定提高模型精度，它的价值是及时、稳定和数据不出本地；代价是算力有限，需要选择合适模型和推理格式。讲义推荐 Jetson Orin Nano 作为课程导航模型的性价比方案。底部结论强调，把推理留在机器人本体，才能获得低延迟、离线可用与本地隐私。

## P8【.pth 经过 ONNX，最终变成 TensorRT】

【本页目标】掌握 PyTorch 到 ONNX 再到 TensorRT 的部署格式链。

【预计播报时长】约 1 分 40 秒

【语音逐字稿】

左侧圆形是训练得到的 PyTorch 点 pth 文件；中央 ONNX 菱形是跨框架的中间交换格式，通过 torch.onnx.export 导出；右侧 TensorRT 点 engine 文件针对 NVIDIA GPU 进行推理优化，最终部署到 Jetson。动画沿虚线完成三段转换，说明 ONNX 与 TensorRT 的角色不同。ONNX 方便模型交换和验证，TensorRT 才是讲义推荐的 Jetson 最终部署格式。转换后还必须验证输出与原始模型一致，不能只确认文件生成成功。底部结论概括为：PyTorch 用于训练，ONNX 负责交换，TensorRT 负责边缘 GPU 优化推理。格式准备好后，动作仍不能直接无条件送给电机。

## P9【三层安全，硬件急停 最高优先】

【本页目标】掌握软件、固件、硬件三层安全架构和故障安全原则。

【预计播报时长】约 1 分 50 秒

【语音逐字稿】

这张盾牌从内到外展示安全层级。最内层 L1 是软件碰撞预测，根据深度图检查前方距离；小于零点三米且模型想前进时强制停止，小于零点五米时可减速到百分之三十。中层 L2 是固件力矩限制，关节超出安全阈值自动停止。最外层 L3 是物理急停，它不依赖软件，按下后直接切断电机电源，因此优先级最高。动画让盾牌逐层展开，表示安全能力必须独立于概率模型。右下角还写着故障安全：如果读不到深度图，默认停止并报警，而不是放行动作。底部结论明确排序为物理急停、力矩限制、碰撞预测、AI 输出。

## P10【低速起步，把异常送回 训练环】

【本页目标】掌握仿真训练到真实迭代的六步部署闭环。

【预计播报时长】约 1 分 50 秒

【语音逐字稿】

请沿椭圆依次看六个节点。第一步在仿真中训练，并使用域随机化与增广；第二步导出并验证模型；第三步搭建边缘端 CUDA、TensorRT、OpenCV 等环境；第四步用仿真数据在边缘端离线测试，还要模拟障碍检查安全层；第五步进入真实环境，但先以百分之三十速度验证，再逐步提高速度和场景复杂度；第六步把异常转成新数据，调整随机化参数并微调模型。粉色回流箭头从迭代优化返回训练，说明部署不是一次性交付。底部结论强调，低速起步和异常回流缺一不可，真实问题必须进入下一轮数据与参数更新。

## P11【真实考验，才算 真正能用】

【本页目标】整合跨域、边缘推理、安全与真实迭代四项部署条件。

【预计播报时长】约 1 分 35 秒

【语音逐字稿】

总结图从左到右列出真实部署的四个支柱。BRIDGE GAP 使用域随机化、在线增广和真实微调缩小差距；EDGE 通过 ONNX 与 TensorRT 把模型放到边缘设备；SAFETY 建立软件、固件与硬件急停三层独立保护；REAL TEST 从低速开始，记录异常并持续迭代。动画连接这些模块，说明任何单项都不能代表部署完成。只有格式转换而没有跨域，模型可能看不懂现实；只有高成功率而没有安全层，偶发错误仍会造成损害。底部结论强调，缩小域差距、优化边缘推理、独立安全保护和真实迭代共同决定部署质量。下面进入原讲义测验。

## P12【单选题 · 8题】

【本页目标】检查 Sim-to-Real、随机化、边缘端、格式转换与故障安全知识。

【预计播报时长】约 3 分 40 秒

【语音逐字稿】

请先作答再看解析。第一题答案 B，Sim-to-Real Gap 是仿真模型到真实环境后性能明显下降。第二题答案 B，域随机化要让仿真足够多样，使现实成为其中一种。第三题答案 B，边缘端优势是低延迟、断网可用和隐私。第四题答案 D，安全层最高优先级是物理急停。第五题答案 C，Jetson 推荐最终使用 TensorRT 引擎，转换路径通常是 PyTorch、ONNX、TensorRT。第六题答案 C，删除数据不是增广。第七题答案 B，安全层无法读取深度图时应默认停止并报警。第八题答案 B，域适配是用少量真实数据微调仿真预训练模型。完成后查看得分，并回看相关部署环节。

## P13【判断题 · 5题】

【本页目标】辨析差距阈值、在线增广、Jetson 算力、安全独立性和低速测试。

【预计播报时长】约 3 分 00 秒

【语音逐字稿】

第一题是错误的，仿真百分之九十五、真实百分之九十，差距为百分之五，并不属于超过百分之二十的严重情况。第二题是错误的，讲义推荐训练时在线增广，而不是预先离线生成。第三题是正确的，Jetson Orin Nano 约四十 TOPS、功耗七到十五瓦，适合课程中的中等复杂度导航模型。第四题是错误的，安全层应独立于 AI 模型运行，避免模型进程崩溃时保护同步失效。第五题是错误的，首次真实部署应从约百分之三十速度开始，确认基础功能后再逐步加速。每题点击后阅读讲义解析，题内上一题和下一题不会触发课件翻页。
