# 《具身智能基础》第六章逐字稿

课程：具身智能  
章节：第六章 USD 场景搭建——从模型到场景  
页面依据：`具身智能第六章-HTML课件.html`

## P1【把模型积木 拼成世界】
【本页目标】建立场景是资产关系、物理规则与任务空间共同组成的认识。
【预计播报时长】约 1 分 20 秒
【语音逐字稿】
上一章我们学会了查看单个 USD 模型，这一章要把模型组合成可执行任务的场景。请看右侧仓储视图：地面、货架、机械臂、箱子和坐标线不是随意摆放，它们围绕分拣任务形成空间关系。

一个模型只说明“有什么”，场景还要回答“在哪里、能否碰撞、受不受重力、相机能否看见”。因此，场景搭建既是视觉设计，也是物理和任务设计。下一页先建立完整工作顺序。

## P2【四步，把资产变成 场景】
【本页目标】掌握导入、布局、物理、光照保存四步流程。
【预计播报时长】约 1 分 50 秒
【语音逐字稿】
请沿虚线从左向右观察。第一步导入模型，准备地面、机器人和物体资产。第二步布局，设置位置、旋转、缩放和操作空间。第三步定义碰撞与刚体，让物体能按预期交互。第四步设置光照、检查可见性并保存 USD。

顺序很重要。若尚未确定物体位置就反复调整光照，后续布局变化会让工作返工；若没有物理预览就保存，穿透和漂浮问题会进入后续标注与渲染。下一页先看资产从哪里来。

## P3【三种来源， 同一入口】
【本页目标】区分教学专用资产、官方资产库与本地 USD，并理解 Reference 导入。
【预计播报时长】约 1 分 50 秒
【语音逐字稿】
左侧三类资产沿虚线进入 Reference。教学团队资产包括电力巡检和仓储设备；官方与 GSO 资产提供杯子、箱子、工具等常见物体；本地 USD 则承载教师或团队自有模型。三种来源最终进入同一个 Stage。

导入后仍应保留清晰的 Prim 路径与来源关系，不能只看中央视口是否出现模型。这样资产更新、替换和排错才有依据。下一页进入场景中最基本的三种变换。

## P4【位置、角度、大小， 分开控制】
【本页目标】理解 Translate、Rotate、Scale 与 W、E、R 快捷键。
【预计播报时长】约 1 分 50 秒
【语音逐字稿】
中央黄色方块带有三轴操纵器。W 对应 Translate，沿 X、Y、Z 改变位置；E 对应 Rotate，改变对象朝向；R 对应 Scale，改变尺寸。三者分别回答在哪里、朝哪里和有多大。

实操中要注意坐标单位与轴方向。物体位置正确但朝向错误，夹爪仍可能抓不到；缩放模型后，碰撞几何也要重新检查。下一页把单个物体的变换放回整个任务布局中。

## P5【好布局，先留出 安全空间】
【本页目标】掌握地面、碰撞余量、相机视野与任务物体四条布局原则。
【预计播报时长】约 2 分 10 秒
【语音逐字稿】
这张蓝图先画地面和边界，再用红色虚线圈出机械臂工作范围。讲义建议周围至少预留臂展的一点二倍，避免机械臂运动时碰到货架。左上相机的视锥要覆盖任务区域，待操作箱子和目标区则应放在可达、可见的位置。

布局不是为了画面均衡，而是为了任务可执行。地面对不齐会导致物体漂浮，相机漏掉关键区域会影响后续数据，工作空间不足则产生碰撞。下一页区分视觉模型和物理碰撞外壳。

## P6【看见的形状，不等于 碰撞形状】
【本页目标】理解 Render Mesh 与 Collision Geometry 的不同用途。
【预计播报时长】约 2 分 0 秒
【语音逐字稿】
左侧渲染网格由大量三角形组成，负责物体看起来是否精细。右侧碰撞几何采用更简单的 Box、Sphere 或 Convex Hull，供物理引擎快速判断接触。若直接用复杂网格做动态碰撞，计算成本通常更高，也可能更不稳定。

碰撞形状要足够贴合，但不追求与视觉表面每个细节一致。箱子和书本优先用 Box，圆形物体可用 Sphere，复杂形状可考虑凸包。下一页继续选择正确的刚体类型。

## P7【静态、动态、运动学， 别设反】
【本页目标】区分 Static、Dynamic 与 Kinematic 三种刚体状态。
【预计播报时长】约 2 分 0 秒
【语音逐字稿】
左侧 Static 用于地面和墙壁，这些对象固定不动。中间 Dynamic 用于箱子、杯子等待操作物体，它们受重力和碰撞力影响。右侧 Kinematic 按预设轨迹运动，适合由程序直接控制的位置变化。

如果把地面误设为动态，环境可能被碰撞推动；如果箱子没有设为动态，它就不会自然下落或被抓取。底部结论给出最基本配置边界。下一页看如何用 Sublayer 管理复杂场景。

## P8【复杂场景， 分层管理】
【本页目标】理解主场景与环境、机器人、物体、光照子图层的组织方式。
【预计播报时长】约 1 分 50 秒
【语音逐字稿】
最上方 `warehouse_scene.usd` 是主场景，下面分别连接环境层、机器人层、物体层和光照层。环境层放地面与货架，机器人层记录机械臂与初始位姿，物体层放箱子托盘，光照层保存灯光。

分层后，不同成员可以独立编辑，替换机器人也不必重做环境。开关某层还可以快速检查它对结果的影响。需要注意，分层本身不直接提高物理精度，它解决的是组织、协作和复用。下一页将这些图层组合成分拣任务蓝图。

## P9【分拣场景，先画 任务蓝图】
【本页目标】把机械臂、物体、目标区和相机围绕同一任务组织起来。
【预计播报时长】约 2 分 0 秒
【语音逐字稿】
请以俯视图观察。黄色边框是工作台，中央机械臂的可达范围以圆形标出，四个箱子分布在可操作区域，右侧目标区接收分拣结果，左上相机视锥覆盖桌面。

场景的每个对象都应回答一个任务问题：机械臂能否到达，箱子是否可抓，目标区是否清楚，相机是否看见全过程。先画任务关系再摆模型，可以减少后续返工。下一页进入保存前最重要的物理预览。

## P10【先跑物理，再 保存场景】
【本页目标】掌握预览、发现问题、修正碰撞与刚体、稳定后保存的调试循环。
【预计播报时长】约 2 分 0 秒
【语音逐字稿】
从左侧 PLAY 开始，物理预览可能暴露穿透桌面、漂浮、倾倒或碰撞形状偏差。中间列出问题，右侧 FIX 指向碰撞几何与刚体配置，修正后再次运行；只有物体稳定，才进入下方 SAVE。

若箱子穿透桌面，优先检查桌面和箱子的碰撞形状、刚体类型，而不是调整光照或相机。这个排错顺序能避免用无关参数解释物理错误。下一页总结整条场景验证链。

## P11【场景搭建，是一条 验证链】
【本页目标】回顾资产、布局、物理和分层四项检查。
【预计播报时长】约 1 分 40 秒
【语音逐字稿】
这一页从左到右回顾：资产应通过 Reference 保持来源可追踪；布局要检查变换、操作余量和相机视野；物理要配置碰撞与刚体；Layer 则支持独立编辑和组合保存。最后的 PREVIEW 对整条链做运行验证。

一个场景画面好看但物体穿透，不能算可用；物理正确但相机看不到任务区，也不能服务后续数据。接下来用原讲义测验检查这些边界。

## P12【单选题 · 8题】
【本页目标】检查搭建流程、变换、碰撞、刚体、Sublayer 和布局规范。
【预计播报时长】约 8 分 0 秒
【语音逐字稿】
第一题答案 B，顺序是导入、布局、物理、光照保存。第二题答案 B，Translate 控制三轴位置。第三题答案 C，方块物体适合 Box。第四题答案 B，地面与墙壁用 Static。第五题答案 C，Sublayer 的主要价值是非破坏组织与协作。

第六题答案 C，W 移动、E 旋转、R 缩放。第七题答案 B，穿透通常来自碰撞形状或刚体配置。第八题答案 B，机械臂周围至少预留臂展一点二倍。请先作答，再查看讲义解析，不要只记字母。

## P13【实操一 · 仓储分拣】
【本页目标】完成可运行的机械臂分拣箱子仓储场景。
【预计播报时长】约 4 分 0 秒
【语音逐字稿】
按验收条件搭建：地面至少四米乘四米并设为静态；机械臂基座固定；桌面放至少三个动态箱子和一个托盘；为对象配置合适碰撞；设置均匀光照和覆盖桌面的俯视相机。运行物理预览，箱子应稳定停在桌面上。

提交场景 USD、斜上方整体截图和物理运行截图。展开后可见讲义评分：完整性百分之四十、物理正确百分之三十、布局百分之二十、截图百分之十。讲义没有规定统一坐标，以验收现象为准。

## P14【实操二 · Sublayer】
【本页目标】拆分并验证环境、物体、光照子图层的组合效果。
【预计播报时长】约 4 分 0 秒
【语音逐字稿】
把地面墙壁保存为 `env.usd`，箱子托盘保存为 `objects.usd`，灯光保存为 `lights.usd`，再由主场景组合三层与机器人。开关可见性检查独立控制，并修改一个箱子颜色，确认主场景自动更新。

提交四个 USD 文件、关闭物体层后的截图和一百字以内的分层优势说明。讲义评分为分层正确百分之四十、组合成功百分之三十、可见性有效百分之二十、说明准确百分之十。下一章将使用这个场景进行 VLM 自动标注。
