# 《具身智能基础》第十一章逐字稿 ## P1【机器人从模仿者 走向理解者】 【本页目标】建立行为克隆、扩散策略和 VLA 的能力进化主线。 【预计播报时长】约 1 分 20 秒 【语音逐字稿】 上一章我们用行为克隆让机器人模仿专家,但模仿只是策略学习的起点。请看右侧三段式进化图:BC 对应 IMITATE,重点是复现专家动作;扩散策略对应 GENERATE,能够从动作分布中生成清晰方案;VLA 对应 UNDERSTAND,把视觉、语言和动作连成一个能够理解任务的系统。动画依次点亮三个节点,表示能力并非简单替换,而是在不同任务条件下逐步扩展。底部结论说,策略模型正在从复现动作走向生成方案与理解任务。本章不进行平台操作,而是建立选型所需的知识地图:什么时候用 BC,为什么扩散策略适合多方案,VLA 又如何把语言和世界知识带入机器人控制。 ## P2【给 AI 看人怎么做,让它 学着做】 【本页目标】理解模仿学习与行为克隆之间的包含关系。 【预计播报时长】约 1 分 30 秒 【语音逐字稿】 画面左侧是人类专家,中间黄色菱形是模仿学习,右侧是形成动作策略的机器人。动画沿“专家示范、观察动作配对、机器人执行”推进,直观表达模仿学习的核心:给 AI 看人类怎么做,让它学着做。行为克隆是模仿学习中最直接的方法,它把每一帧专家观测与动作当作监督答案;模仿学习的范畴则更宽,还会关注如何收集、修正和利用专家行为。这个关系不能颠倒,不能把整个模仿学习等同于某一个具体网络。底部结论强调,模仿学习以专家示范为监督,行为克隆只是其中一种方法。理解这个基础后,我们再看行为克隆为何会学到“表面规律”。 ## P3【学到相关性,不等于理解 为什么】 【本页目标】用减速与转弯例子理解行为克隆的因果混淆。 【预计播报时长】约 1 分 40 秒 【语音逐字稿】 左侧专家轨迹中,驾驶者总是先减速、再转弯;中央模型因此观察到“减速之后经常转弯”;右侧突发障碍则暴露问题:模型可能等待熟悉的减速信号,而没有理解障碍出现才是需要及时调整动作的条件。动画让“先减速、再转弯”的链条进入黑色模型,再把错误推断送到突发场景。因果混淆指模型抓住了相关性,却没有理解动作背后的因果关系。训练集上这种模式可能表现很好,换到新的事件顺序就会失败。底部结论说,行为克隆可能复制表面共现,却没有学会真正因果条件。这也是为什么只增加同类专家轨迹不一定解决泛化问题。 ## P4【先模仿获得基线,再用奖励 继续优化】 【本页目标】理解模仿学习与强化学习的互补使用路线。 【预计播报时长】约 1 分 35 秒 【语音逐字稿】 左侧青色区域代表模仿学习:利用已有专家示范快速得到一个“能用”的策略;右侧黄色区域代表强化学习:让策略与环境交互,并通过奖励信号继续优化。中间粗箭头写着 BASELINE FIRST,动画从左向右推进,给出讲义的实战建议。直接从随机动作开始强化学习,探索成本可能很高;只做模仿又受专家数据和专家能力上限约束。因此主流路线是先让模型通过示范站起来,再让它通过奖励改善效率或突破边界。底部结论强调,模仿学习负责快速可用,强化学习负责后续优化。下一部分会介绍另一种思路:不直接回归一个动作,而是生成完整动作分布。 ## P5【从动作噪声中,一步步 去噪成轨迹】 【本页目标】理解扩散策略把动作序列作为去噪生成目标。 【预计播报时长】约 1 分 40 秒 【语音逐字稿】 左侧黑框中的折线代表随机动作噪声,中央 DENOISE 菱形表示从时间步 T 逐步走向零,右侧绿色框最终得到清晰、连续的动作序列。动画让杂乱折线经过多步处理后变得平滑,借用了扩散图像模型“从噪声恢复内容”的直觉。不同之处只是生成对象从像素变成了机器人动作。视觉观测和任务条件会约束去噪方向,使最终轨迹符合当前场景。扩散策略不是一次直接猜出线速度和角速度,而是通过多步采样得到一段动作。底部结论指出,它把动作序列当作生成目标,从噪声中逐步恢复连贯方案。这个机制带来了下一页最重要的多模态优势。 ## P6【两扇门都能走,不要输出 中间值】 【本页目标】理解扩散策略表达多种合理动作方案的能力。 【预计播报时长】约 1 分 35 秒 【语音逐字稿】 中央黑墙两侧各有一扇可通过的门。绿色路径走左门,黄色路径走右门,两者都是合理专家方案。若行为克隆使用简单回归把左右动作平均,可能得到粉色的正中间方向,恰好撞墙。扩散策略学习的是动作分布,可以在推理时采样出“走左边”或“走右边”中的一个清晰方案,而不是模糊中间值。动画让两条可行路径分开展开,再把平均路径指向墙体,直观显示多模态决策为什么重要。底部结论说,扩散策略能表达多种合理动作分布,避免危险平均。它更有表达力,但也需要付出多步去噪的时间成本。 ## P7【精细动作更强,但反应 更慢】 【本页目标】认识扩散策略在任务速度与精细度上的适用边界。 【预计播报时长】约 1 分 35 秒 【语音逐字稿】 左侧绿色区域列出装配、手术和慢速精细操作,这些任务允许模型花时间生成平滑、细致的动作序列;中央时钟表示多步去噪;右侧粉色区域是快速导航和低延迟避障,它们要求看到危险后迅速反应。动画让时钟在两类任务之间转动,提醒我们算法能力不能脱离延迟要求。扩散策略的多模态表达和轨迹质量是优势,但每次推理需要多步采样,速度通常慢于一次前向输出的行为克隆。因此讲义当前定位是:慢速精细操作更适合扩散策略,快速导航中 BC 或强化学习仍是主流。底部结论把这一边界明确写出,选型时不能只看算法新旧。 ## P8【看到画面,听懂指令,再 做出动作】 【本页目标】理解 VLA 在视觉与动作之间加入语言理解的核心能力。 【预计播报时长】约 1 分 40 秒 【语音逐字稿】 左侧同时输入摄像头画面和一句自然语言指令,例如“把杯子放到桌上”;中央 VLA 模块利用世界知识理解当前画面和任务;右侧再输出动作 Token 和机器人指令。动画让视觉与语言汇入同一大脑,再向动作端流动。传统行为克隆主要解决“看到什么就做什么”,VLA 则补上“用户到底要我做什么”的理解环节。VL 模型可以回答画面里有什么,VLA 多了行动维度,要把理解转成具体控制。底部结论说,VLA 在视觉和动作之间加入语言理解,使机器人能够按自然语言完成任务。下一页会打开这个大脑的 Token 流程。 ## P9【视觉 Token 与语言 Token,在 LLM 中 会合】 【本页目标】掌握 VLA 的视觉编码、语言编码、联合推理与动作解码流程。 【预计播报时长】约 1 分 50 秒 【语音逐字稿】 请从左侧两条支路开始。图像经过 ViT 等视觉编码器变成视觉 Token;文字指令经过分词器变成语言 Token。两类 Token 一起进入中央 LLM,模型结合预训练世界知识进行联合推理,再在右侧输出动作 Token。最后由解码器把动作 Token 转换为关节角度、末端位姿等机器人可执行指令。动画先分别生成两类 Token,再让它们在 LLM 中会合,强调视觉和语言都不是装饰输入。VLA 的关键创新,是复用语言模型已经学到的对象、用途和常识,不需要从零建立全部世界知识。底部结论概括为:先编码、再联合推理、最后解码成动作。 ## P10【RT-2 借知识,Octo 降门槛】 【本页目标】认识 RT-2 与 Octo 的代表性价值及 VLA 当前局限。 【预计播报时长】约 1 分 40 秒 【语音逐字稿】 左侧 RT-2 的箭头从 LLM 指向机器人控制,代表它证明了大语言模型中的世界知识可以直接迁移到动作决策。例如模型知道可乐罐与可回收之间的关系,就能把常识用于新组合任务。右侧 Octo 标出 OPEN SOURCE、九千三百万参数和消费级 GPU,说明它通过开源和较小规模降低了学生与独立开发者研究 VLA 的门槛。动画分别强调“知识迁移”和“开放可用”。页面底部同时保留限制:推理慢、算力需求高,以及幻觉可能产生危险动作。底部结论没有宣称某个模型解决了全部问题,而是分别指出 RT-2 的概念突破与 Octo 的工程普及价值。 ## P11【从模仿、生成,到 理解】 【本页目标】依据任务固定性、多方案需求和语言泛化需求选择策略模型。 【预计播报时长】约 1 分 35 秒 【语音逐字稿】 总结图把三类策略放在同一条进化轴上。BC 快、简单,适合固定任务和高质量专家数据;扩散策略能够表达多种方案并生成精细轨迹,但推理更慢;VLA 同时处理视觉和语言,借助世界知识获得更强语义泛化,不过成本和安全问题仍然明显。动画从左到右推进,不代表所有任务都必须升级到最右侧,而是能力与代价同步增加。底部结论直接给出选型:固定任务选 BC,多方案精细操作选扩散,需要自然语言与泛化时考虑 VLA。下面进入讲义原有单选和三道简答,请先组织自己的答案,再展开参考答案。 ## P12【单选题 · 8题】 【本页目标】检查模仿学习、因果混淆、扩散多模态和 VLA 模型知识。 【预计播报时长】约 3 分 40 秒 【语音逐字稿】 请先逐题思考。第一题答案 B,模仿学习是观察并模仿人类专家。第二题答案 B,因果混淆是学到相关性而非因果关系。第三题答案 C,扩散策略的最大优势是支持多模态决策,可输出多种合理方案。第四题答案 B,VLA 代表 Vision、Language、Action。第五题答案 B,RT-2 证明语言模型世界知识可以用于机器人控制。第六题答案 D,“无法理解自然语言”不是 VLA 的局限,理解语言正是其核心能力;真实局限包括推理慢、算力高和幻觉风险。第七题答案 B,BC 最适合任务固定且专家数据优质的场景。第八题答案 B,Octo 开源且可在消费级 GPU 上运行。答完后请根据累计得分回看相应机制页。 ## P13【简答一 · 分布偏移】 【本页目标】用生活化例子解释分布偏移和 DAgger 的缓解机制。 【预计播报时长】约 2 分 10 秒 【语音逐字稿】 请先用自己的话回答,不要立即展开答案。一个完整回答至少应包含“训练状态范围、推理偏离、错误累积、纠错方法”四点。讲义参考答案用学车作比喻:新手只在空旷练习场学习,一旦进入没见过的真实路口就不知道如何处理,而且可能越错越远。机器人同样如此,一个稍微偏离专家轨迹的动作会把它带入训练集中没有的状态,后续预测更不准确,最终形成恶性循环。DAgger 的做法是收集模型犯错时的状态,请专家补充正确动作,再把这些样本加入训练集,让模型学会偏离后如何纠正。现在可以点击按钮,逐段核对讲义原文。 ## P14【简答二 · VLA 三步流程】 【本页目标】准确复述 VLA 的两路编码、联合推理和动作输出。 【预计播报时长】约 2 分 00 秒 【语音逐字稿】 请先按步骤组织答案。第一步是视觉编码,ViT 等视觉编码器把摄像头图像转换为视觉 Token;第二步是语言编码,文本分词器把“把杯子放在桌上”等指令转换为语言 Token;第三步是联合推理与动作输出,两类 Token 一起进入 LLM,模型利用预训练世界知识理解看到什么和要做什么,再输出动作 Token。动作 Token 还要经过解码器,转成关节角度或末端位姿等具体指令。核心角色是 LLM,它充当融合视觉、语言并做决策的大脑。完成口头回答后再展开讲义参考答案,检查是否遗漏了动作解码这一步。 ## P15【简答三 · 泛化能力对比】 【本页目标】比较 BC、扩散策略与 VLA 的泛化能力及原因。 【预计播报时长】约 2 分 20 秒 【语音逐字稿】 先给出顺序,再解释原因。讲义答案认为泛化能力从低到高是行为克隆、扩散策略、VLA。BC 逐帧模仿,不理解高层任务语义,场景变化后容易失效;扩散策略通过去噪学习动作分布,对噪声和变化更鲁棒,也能表达多种合理方案,但仍主要学习动作模式,没有真正理解任务目标;VLA 借用语言模型的世界知识和语义理解,即使没有见过“蓝色杯子”这一具体组合,只要理解杯子概念,就可能依据语言指令寻找并操作。因此它面对新物体和新场景的潜力更强。点击按钮查看完整参考答案时,也要保留边界意识:泛化更强不代表推理更快或部署更安全。