# 《具身智能基础》第七章逐字稿

课程：具身智能  
章节：第七章 VLM 自动标注——AI 帮你标注数据  
页面依据：`具身智能第七章-HTML课件.html`

## P1【AI 先标 人来验】
【本页目标】建立 VLM 预标注与人工质量审核协同的总体认识。
【预计播报时长】约 1 分 20 秒
【语音逐字稿】
上一章的场景已经能运行，但模型训练还需要带标签的数据。请看右侧：VLM 先为箱子生成边界和类别、材质、可抓取性等候选信息，最后由 HUMAN 标记确认。

这里的关键词是“候选”。VLM 可以把人工从零开始的工作变成检查和修正，但它会错标、漏标，也无法可靠给出精确物理量。最终质量仍要由人工和统一标准负责。下一页先回答为什么训练数据需要标签。

## P2【没有答案的图， 教不会模型】
【本页目标】理解标注如何把原始图像变成监督学习教材。
【预计播报时长】约 1 分 50 秒
【语音逐字稿】
左侧 RAW IMAGE 只有像素，模型不知道哪个区域是箱子，也不知道材质和可抓取性。经过 ADD LABELS，右侧图像增加边界与“箱子、塑料、可抓取”等答案，才形成监督学习可以使用的输入与目标。

标注的核心不是让画面更漂亮，而是给数据增加语义。若标签错误，模型会把错误关系当作学习目标。底部结论强调，标注定义了什么才算正确答案。下一页比较具身智能中常见的标注类型。

## P3【同一个物体， 六种答案】
【本页目标】区分类别、框、分割、关键点、轨迹和属性标注。
【预计播报时长】约 2 分 0 秒
【语音逐字稿】
请沿虚线观察六种输出。类别标注回答物体是什么；边界框给出大致位置；分割掩码精确到像素；关键点标记特定部位；轨迹记录动作序列；属性则补充材质、质量或可抓取性。

不同训练任务需要不同答案粒度。分类任务不必承担像素掩码成本，抓取和场景理解则可能同时需要类别、位置与属性。选择标注类型应从模型最终要做什么倒推。下一页看 VLM 怎样改变标注工作量。

## P4【从零作业，变成 批改作业】
【本页目标】比较纯人工标注与 VLM 预标注加人工审核的工作重心。
【预计播报时长】约 1 分 50 秒
【语音逐字稿】
左侧纯人工流程从找物体、画框、描边到填属性都由人完成。右侧先由 VLM 给出类别、掩码和材质候选，再由人工修改、补漏和确认。讲义给出的效率提升约为八到十倍。

效率来源不是审核消失，而是起点提高。人工从“生产所有标签”转向“判断候选答案是否可信”。因此，越追求速度越要建立审核规则，否则错误也会被批量放大。下一页拆解平台的实际 VLM 管线。

## P5【图像 + 指令，输出 候选标签】
【本页目标】理解图像、Prompt、VLM、格式转换、叠加审核六步流程。
【预计播报时长】约 2 分 10 秒
【语音逐字稿】
左侧场景图像与标注 Prompt 一起进入 VLM。模型输出类别、框或掩码、材质和属性推断；平台再把结果转换为标注格式，并叠加到视口中等待人工确认。

这条管线有两个容易忽略的点。第一，Prompt 要说明需要哪些标签；第二，VLM 的自然语言输出必须转换成系统可保存的结构。动画从双输入汇聚到候选标签，再进入人工审核，表达的就是人机协同而非一步自动完成。下一页明确模型能力边界。

## P6【会看大概， 不会精确测量】
【本页目标】区分 VLM 擅长的语义判断与不擅长的精确物理测量。
【预计播报时长】约 2 分 0 秒
【语音逐字稿】
绿色区域表示 VLM 通常能较好完成常见物体识别、大致材质颜色判断和空间关系描述。红色区域列出边界：精确质量、精确尺寸以及被遮挡对象的细边界，不应只靠视觉猜测。

质量和尺寸应读取 3D 模型、物理属性或传感器数据；掩码边缘则要人工检查。把猜测值当测量值，会让标注看似完整却缺乏依据。下一页进入标准审核三步流程。

## P7【预标注之后，必须过 三道门】
【本页目标】掌握预标注、人工校验、确认保存的顺序。
【预计播报时长】约 1 分 50 秒
【语音逐字稿】
第一道门是 VLM 自动预标注，提供候选。第二道门是人工校验，逐项检查类别、掩码和属性，并执行修改、新增或删除。第三道门是统一标准下的确认，随后才写入 USD 属性并导出。

不能把“模型已经标了”当作“标注已经完成”。若直接跳到保存，系统性错标会进入训练集。底部结论把流程压缩为预标注、修正、确认保存。下一页按错误类型学习针对性修复。

## P8【错在哪里，就 修哪里】
【本页目标】掌握类别错误、掩码偏差、漏标与属性缺失的修正方法。
【预计播报时长】约 2 分 0 秒
【语音逐字稿】
页面中心 REVIEW 向四类错误发散。类别错误用标签下拉框修改；掩码偏差用笔刷添加缺失区域、用橡皮擦去掉多余区域；漏标物体需要手动新增；物理属性缺失则应回到场景参数核对后补齐。

修正方法应对应错误根因。塑料杯被标成玻璃瓶，不需要重新导入场景；质量缺失也不应让 VLM继续猜。下一页建立判定标注是否合格的四项质量标准。

## P9【高质量标注， 四项同时过关】
【本页目标】区分完整性、准确性、精确性和一致性。
【预计播报时长】约 2 分 10 秒
【语音逐字稿】
完整性检查有没有漏掉物体；准确性检查类别与属性是否正确；精确性检查掩码边界是否贴合，讲义给出 IoU 不低于百分之九十的参考；一致性要求同类物体采用同一套标准。

四项不能互相替代。没有漏标但类别错，数据仍不可用；单张掩码很精细但同类命名不一致，也会干扰学习。底部结论强调，更多错误数据不能补偿系统性质量问题。下一页看确认后的数据流向哪里。

## P10【确认一次，写入 两类出口】
【本页目标】理解标注写入 USD Prim 属性与导出标准格式两类结果。
【预计播报时长】约 1 分 50 秒
【语音逐字稿】
左侧是已确认标签集，中间 SAVE 同步到两类出口。上方把标签写入 USD Prim 的自定义属性，让语义与场景对象保持关联；下方可导出 COCO、YOLO 或 JSON 等格式，进入后续训练管线。

保存后还要重新打开或悬停验证，确认标签与正确 Prim 对应。只有文件成功写出，不代表语义映射一定正确。下一页总结整个人机协同闭环。

## P11【机器提速， 人工保质】
【本页目标】回顾 VLM 预标注、人工审核、质量门和保存导出。
【预计播报时长】约 1 分 40 秒
【语音逐字稿】
从左到右看：VLM 提供预标注，人工负责改错、补漏和确认；质量门检查完整、准确、精确和一致；最终保存到 USD 或导出标准格式。这条链缺少任何一环，都可能把问题带到训练阶段。

可靠自动标注不是追求“无人参与”，而是让机器承担重复劳动，让人集中处理判断和边界问题。接下来进入原讲义题库与三项实操。

## P12【单选题 · 10题】
【本页目标】检查标注目的、VLM 角色、流程、类型、边界、质量和保存方式。
【预计播报时长】约 9 分 0 秒
【语音逐字稿】
前五题答案依次是 B、B、C、C、C：标注提供带答案教材；VLM 是预标注助手；之后必须人工校验；像素级答案是语义分割；精确质量尺寸不是 VLM 擅长项。

后五题答案依次是 C、C、B、B、B：类别错在标签面板修正；掩码贴边属于精确性；笔刷修补掩码；标注写入 USD 属性并可导出；垃圾进垃圾出说明标注质量决定模型学习质量。请逐题先思考，再展开解析。

## P13【实操一 · 单物体全流程】
【本页目标】完成一个箱子的 VLM 预标注、属性核验、掩码修正与确认。
【预计播报时长】约 4 分 0 秒
【语音逐字稿】
打开仓储场景进入标注模式，运行 VLM，选中红箱子。检查类别、材质、颜色、质量和可抓取性；用笔刷与橡皮擦让掩码贴合边缘，确认后保存带彩色掩码和标签的截图。

讲义评分为预标注成功百分之二十、属性正确百分之三十、掩码精确百分之三十、截图清晰百分之二十。物理属性以实际场景参数为准，不提供统一猜测值。

## P14【实操二 · 三物体标注】
【本页目标】完整标注两个箱子与一个托盘并验证导出。
【预计播报时长】约 4 分 0 秒
【语音逐字稿】
为三个物体填写类别、材质、颜色、质量与可抓取性，逐一修正掩码并检查漏标错标。保存后悬停验证标签，再导出 JSON。提交含标注场景、整体掩码截图和导出文件。

讲义评分为完整性百分之三十、属性正确百分之三十、掩码精确百分之二十、保存导出成功百分之二十。重点是三者都使用同一标注标准。

## P15【实操三 · 错误排查】
【本页目标】系统发现并修复预设的漏标、错类、掩码和属性错误。
【预计播报时长】约 4 分 0 秒
【语音逐字稿】
打开教师提供的错误场景，逐物体检查。错误至少覆盖漏标、类别错误、掩码不精确和物理属性缺失中的三项。每发现一项，都记录位置、错误类型、依据和修正方法，保存修正后场景。

讲义评分为找全错误百分之四十、修正方法正确百分之四十、报告清晰百分之二十。这项实操训练的不是点击速度，而是建立可重复的质量审计顺序。下一章将设置相机与轨迹，为批量渲染准备视角。
