# 《具身智能基础》第八章逐字稿 ## P1【给 AI 一双 好眼睛】 【本页目标】建立“相机参数决定单帧、轨迹规划决定整组数据”的章节主线。 【预计播报时长】约 1 分 20 秒 【语音逐字稿】 这一章,我们要给具身智能系统装上一双真正可用的“眼睛”。请先看右侧画面:中央是相机,周围分布着多个拍摄位置,虚线把这些位置连接成一条运动路径。这个图同时指出了本章的两个关键词。第一个是相机参数,它决定每一帧能看见什么、看得多宽、距离信息是否可用;第二个是轨迹规划,它决定整组数据有没有死角、是否重复、是否被遮挡。动画会让视点沿路径依次出现,提醒我们数据不是一张孤立图片,而是一组具有空间关系的观察。底部结论强调:一帧质量由参数决定,一组数据的覆盖质量由轨迹决定。接下来我们先处理单帧,再把单帧组织成可靠的数据集。 ## P2【五个参数,决定 看见什么】 【本页目标】识别虚拟相机设置中的五类关键参数及其数据意义。 【预计播报时长】约 1 分 35 秒 【语音逐字稿】 请把目光放到中央的镜头图形。五个参数从不同方向连到镜头,说明它们共同决定相机如何采样场景。分辨率决定图像由多少像素构成;FOV,也就是视场角,决定画面覆盖范围;位置、高度和距离决定观察点在哪里;Yaw、Pitch、Roll 分别描述相机朝向的三个旋转维度;Near 和 Far 则限定深度记录的有效范围。动画中的连线依次激活,表达的不是五个互不相关的开关,而是一套联合约束。比如视场角扩大后,画面覆盖会变化,拍摄距离和目标尺寸也要一起检查。因此底部结论说,相机参数不是单纯的画面美化选项,而是训练数据的采样条件。参数一旦设置不合理,后续轨迹再复杂,也只是批量产生不合格的帧。 ## P3【看得更宽,也可能 变得更歪】 【本页目标】理解视场角扩大带来的覆盖收益与边缘畸变代价。 【预计播报时长】约 1 分 30 秒 【语音逐字稿】 这一页把三种视场角并排放置。左侧四十五度的视锥较窄,覆盖范围小,但边缘形变相对较弱;中间是讲义推荐的七十到九十度,它在导航视野和画面形变之间取得平衡;右侧一百二十度覆盖最宽,但红色弧线提示边缘会出现明显的鱼眼式透视畸变。动画让三个视锥逐步张开,帮助我们观察一个直接的因果关系:视场角越大,不等于数据质量越高。对导航任务来说,系统既要看到前方较大区域,也不能让物体在边缘被过度拉伸。底部结论因此给出明确范围:导航常用七十到九十度,既覆盖前方,又控制超广角畸变。后面设计轨迹时,也要用这个视野范围检查盲区,而不是只看相机经过了哪些位置。 ## P4【RGB 说是什么,深度说 有多远】 【本页目标】区分 RGB 外观信息与深度距离信息的作用。 【预计播报时长】约 1 分 30 秒 【语音逐字稿】 请观察左右两幅对应图。左边的 RGB 画面保留类别、颜色和纹理,我们能看出一个粉色方块和一个黄色圆形,它回答的是“这是什么、长什么样”。右边的深度图刻意弱化颜色,用灰度和轮廓表达像素到相机的距离,它回答的是“它离我多远”。动画会让外观图形和距离图形相互对应,提醒我们两类信息描述的是同一场景的不同维度。具身智能不仅要识别目标,还要决定能否靠近、是否需要避障,以及空间结构如何组织,所以距离信息不能由颜色图像简单替代。底部结论指出,深度图为每个像素记录距离,是导航避障和三维理解的关键输入。下一页开始,我们把单帧信息扩展为相机在空间中的连续观察。 ## P5【好轨迹,要满足 三个条件】 【本页目标】掌握轨迹质量的三个判断条件:全覆盖、多视角和运动合理。 【预计播报时长】约 1 分 35 秒 【语音逐字稿】 中央黑色圆形代表相机轨迹,周围三块彩色区域给出三条硬条件。第一是全覆盖,任务区域不能留下死角;第二是多视角,讲义要求同一物体从三到五个角度观察;第三是运动合理,路径应当连续、平滑,并且不能穿越实体。动画让三个条件依次与相机连接,表示缺少任何一个,轨迹都不完整。只追求覆盖,可能得到突然跳跃或穿模的运动;只追求路径平滑,又可能一直从相似角度拍摄,数据缺少变化;拍了很多角度,如果仍存在遮挡,也不能形成有效样本。因此底部结论把三者合在一起:轨迹既要覆盖任务区域,又要提供多视角,并符合真实相机运动规律。接下来三页会分别展示环绕、俯视扫描和线性轨迹的适用关系。 ## P6【环绕:目标始终在 画面中心】 【本页目标】理解环绕轨迹的目标锁定方式与关键参数。 【预计播报时长】约 1 分 25 秒 【语音逐字稿】 这一页的黄色方块是目标,四个青色相机位于椭圆轨迹的不同方向。请注意粉色朝向线始终指向目标,说明环绕不是相机简单绕圈,而是相机位置变化的同时持续锁定同一对象。轨迹需要设定半径、高度、角度范围和拍摄点数量;这些参数共同决定目标在画面中的大小、观察角度以及采样密度。动画沿椭圆推进,并让相机朝向同步转动,直观表现“位置变化、目标不丢”的机制。环绕轨迹适合从多个方向认识同一物体,但必须检查机械臂或场景物体是否挡住视线。底部结论强调,环绕的关键是持续锁定目标并避免遮挡。后面的实操会要求我们用明确参数建立一条环绕轨迹,并用预览确认这两个条件。 ## P7【俯视扫描:像 扫地机器人】 【本页目标】理解蛇形俯视扫描如何实现区域全覆盖。 【预计播报时长】约 1 分 20 秒 【语音逐字稿】 请看舞台中的蛇形虚线。相机保持固定高度,从一侧移动到另一侧,到边缘后转向,再沿相邻通道返回。它与扫地机器人的覆盖方式相似:不是围着一个目标拍,而是系统地扫过整个区域。动画让扫描点沿虚线向前移动,帮助我们检查相邻路径之间是否留下空白。俯视扫描适合全局理解和仓储盘点,因为它能够把大范围场景切分为连续的观察带。设计时既要保证路径间距能够覆盖区域,也要考虑相邻图片需要足够重叠,避免两条扫描带之间出现盲区。底部结论说,俯视扫描用蛇形路径覆盖整个区域。它解决的是面状覆盖问题,而下一页的线性轨迹更像机器人沿走廊或道路向前运动。 ## P8【线性:模拟机器人 向前走】 【本页目标】认识线性轨迹的适用场景及前向视野检查重点。 【预计播报时长】约 1 分 20 秒 【语音逐字稿】 画面中央是一条黄色通道,三个相机位置沿中心线向前排列。线性轨迹由起点、终点和运动速度定义,适用于导航、走廊和道路等方向明确的场景。动画让相机沿虚线前进,表达连续的第一视角观察。线性看似最简单,但不能只确认“从起点到了终点”。我们还要检查相机朝向是否与运动方向一致,前方障碍是否遮挡主要视野,以及近处地面能否进入画面。前面讲到的视场角和向下十五到三十度的俯仰角,都会影响这些内容。底部结论提醒:线性轨迹适合导航数据,但仍要检查前进方向上的遮挡与近地视野。也就是说,路径几何正确只是第一步,采到的画面真正可用才是结果。 ## P9【多点巡检:每一站都要 看清目标】 【本页目标】理解 Waypoint 巡检对覆盖、视角和路径效率的联合优化。 【预计播报时长】约 1 分 35 秒 【语音逐字稿】 这一页有三个巡检点。WP1 从正面、零点六米观察设备 A;WP2 从斜上三十度、零点八米观察设备 B;WP3 从侧面、零点六米观察设备 C。虚线路径把三个航点连接起来,动画会依次点亮各站,说明相机不仅要到达位置,还要在每一站看清指定目标。Waypoint 规划同时处理三个问题:设备是否全部覆盖,观察角度是否有差异,以及总路径是否尽量短。若只追求最短路径,某些目标可能被遮挡;若只追求丰富角度,路径又可能产生不必要的往返。黑色提示框写着“覆盖优先,路径尽量短”,给出了正确优先级。底部结论进一步概括:覆盖、多角度和总路径长度需要一起优化,这正是巡检任务的核心。 ## P10【先预览,再保存 .traj】 【本页目标】掌握模块 B 从加载场景到保存轨迹文件的完整流程。 【预计播报时长】约 1 分 30 秒 【语音逐字稿】 请沿着从左到右的流程阅读。第一步加载 USD 场景;第二步设置相机,例如一千二百八十乘七百二十分辨率和七十五度视场角;第三步建立轨迹,这里组合了环绕与线性方式;第四步必须预览,重点检查遮挡和死角;最后才保存 PATH 点 TRAJ 文件,其中记录 JSON 形式的航点信息。动画让箭头依次推进,强调流程不能跳过预览直接保存。因为参数表和轨迹线看起来正确,不代表每一个拍摄画面都可用。只有在预览中,我们才能发现机械臂挡住目标、相机穿过物体或者某个区域始终没有被观察。底部结论说,轨迹文件记录位置、朝向与拍摄参数,而预览是发现遮挡和盲区的最后机会。这个顺序也将成为后面批量渲染的输入基础。 ## P11【参数定一帧,轨迹定 数据集】 【本页目标】整合相机参数、RGB-D、轨迹原则与四类路径的知识结构。 【预计播报时长】约 1 分 35 秒 【语音逐字稿】 我们用这张总图收束全章。最左侧 CAMERA 代表单帧采样条件,包括视场角和俯仰角;接着是 RGB-D,它把“是什么”和“有多远”组合起来;中间的 RULES 汇总全覆盖、多视角和运动合理三项轨迹原则;右侧 PATHS 列出环绕、扫描、线性和 Waypoint 四种轨迹。动画会让四个模块依次连通,形成从单帧到数据集的完整链路。请注意,不能先随意画一条路径,再期待通过渲染补救参数问题;也不能只把一帧调得漂亮,却忽略整个场景是否被完整观察。底部结论就是本章最重要的操作顺序:先用参数保证每帧可用,再用轨迹保证场景覆盖、多视角和运动可信。下面进入讲义原有测验与实操,请先独立判断,再展开答案和评分标准。 ## P12【单选题 · 8题】 【本页目标】用讲义原有八道单选题检查参数、轨迹和数据类型的理解。 【预计播报时长】约 3 分 40 秒 【语音逐字稿】 这一页采用一题一题浏览的方式。每题出现后,请先阅读全部选项,暂时不要急着点击。第一题问一百二十度视场角的问题,正确答案是“边缘鱼眼畸变”,因为超广角会造成明显的边缘透视畸变。第二题问导航场景推荐的俯仰角,答案是“向下十五到三十度”,这样能够兼顾前方障碍和近处地面。第三题问多角度认识同一物体最适合哪种轨迹,答案是“环绕 Orbit”,因为它持续朝向目标。第四题问 Waypoint 巡检的核心,答案是“覆盖全部设备、多角度且路径高效”。第五题问相邻图片建议至少多少重叠率,答案是百分之五十,用来减少盲区。第六题问预览发现机械臂遮挡如何调整,答案是提高高度、调整半径或路径,而不是忽略遮挡。第七题问深度图用途,答案是提供像素距离,用于导航和三维重建。第八题问模块 B 的保存格式,答案是点 traj,也就是记录航点位置、朝向和拍摄参数的 JSON 轨迹文件。完成后请看累计得分,并回到错题对应的知识页复盘。 ## P13【实操一 · 环绕轨迹】 【本页目标】依据讲义参数完成箱体环绕轨迹并按原评分标准自检。 【预计播报时长】约 2 分 00 秒 【语音逐字稿】 请先不要展开评分标准,先根据题目独立完成任务。我们要为一个箱子设置环绕轨迹并预览。讲义给出的参数是:分辨率一千二百八十乘七百二十,视场角七十五度,半径零点八米,高度一点零米,环绕一百八十度,共三十个拍摄点,并且要求目标始终可见、没有遮挡。提交成果包括点 traj 轨迹文件、一张能够看见环绕路径的俯视截图,以及一个相机预览画面。完成后点击“显示交付与评分标准”进行核对。讲义评分为:参数正确占百分之二十五,轨迹无遮挡占百分之三十,目标始终可见占百分之二十五,截图清晰占百分之二十。这里没有额外编造标准答案,因为实操结果要由你的轨迹文件和预览证据来证明。检查时尤其关注相机是否持续朝向箱子,而不是只看轨迹是否形成弧线。 ## P14【实操二 · 多点巡检】 【本页目标】按讲义航点完成三设备巡检路径,并说明视角与距离差异。 【预计播报时长】约 2 分 10 秒 【语音逐字稿】 最后一个任务要求用三个箱子模拟三个待检设备点。请先按讲义设置航点:WP1 位于左箱正面零点六米;WP2 位于中箱斜上三十度、距离零点八米;WP3 位于右箱侧面零点六米。每个航点渲染一张画面并进行预览。提交成果包括轨迹文件、标注三个 Waypoint 的俯视图,以及一百字说明,用来解释三个航点为什么采用不同角度和距离。完成后再展开讲义评分标准:航点合理占百分之三十,每点目标清晰占百分之三十,路径高效占百分之二十,简述准确占百分之二十。评估时先检查三个设备是否都被清楚观察,再检查路径是否存在无意义往返。到这里,本章从相机单帧参数一直走到完整巡检轨迹,为下一章的离屏批量渲染准备好了可靠输入。