# 第五章《多模态 AI：让机器“看懂”世界、“说出”声音》高校课堂版语音逐字稿

适用对象：高校非相关专业学生

前置知识：一般数字素养；已了解大语言模型的基本概念

本章学习结果：

1. 能够说明多模态 AI 与 VLM 的基本工作链路。
2. 能够比较文生图、文生视频、机器人多模态闭环与 TTS 的关键机制。
3. 能够用本章概念分析一个图文理解、机器人或语音产品方案。

建议课堂时长：45 分钟

预计纯语音时长：约 28 分钟

课堂时间构成：讲述 28 分钟 + 思考与讨论 9 分钟 + 测评反馈 8 分钟

使用说明：仅将各页“语音逐字稿”正文送入 TTS；互动停顿和教师提示不送入 TTS。

---

## P1【让机器看懂世界】讲解焦点

【本页目标】学生能够说出多模态 AI 为什么比纯文本处理更接近人类对环境的感知。

【预计播报时长】约 1 分 20 秒

【语音逐字稿】

这一章我们讨论多模态 AI。先看右侧这个由视觉、听觉、触觉和文本围成的圆：人类理解一间屋子，并不是只读一段文字，而是会把眼睛看到的画面、耳朵听到的声音，以及身体接收到的触觉线索合在一起判断。比如我们看到沙发上的猫，又听到它打呼噜，才会推断这只猫处于放松状态。

传统纯文本 AI 更像只会读书的学习者，主要处理文字；多模态 AI 则尝试让机器同时处理图像、声音，甚至触觉等多种信息。注意，这不等于把更多文件塞进系统，而是要让不同来源的信息能够互相补充、共同参与理解。后面我们会先拆开“机器怎么看懂图片”，再讨论它怎样生成画面、声音和行动。

【互动停顿】请学生用 10 秒想一想：如果只给一句“桌上有一个倒下的杯子”，缺少什么信息才能判断该怎么处理？

## P2【多模态 AI 让信息一起理解】讲解焦点

【本页目标】学生能够定义多模态 AI，并区分多种数据输入与多种信息融合。

【预计播报时长】约 2 分钟

【语音逐字稿】

请按画面从左到中间再到右侧阅读。左边是文本和图像，右边是音频和触觉，中间黄色框写的是“多种信息通道，同时处理和理解”。这就是多模态的核心，不是限定某两种模态，也不是必须凑齐所有模态，而是让系统能把来自不同通道的信息放到同一项理解任务里。

以讲义中的图文场景为例：给 AI 一张金毛犬趴在草地上的照片，再问“照片里有什么”，系统可以识别物体和场景；如果继续问光线、时间或狗的状态，它需要把图像特征和文字问题结合起来推理。这个能力通常称为视觉语言理解。文字负责提出问题和语义约束，图像提供场景证据；两者若不能对齐，系统就只能分别处理，无法形成完整回答。

所以，本页的判断标准很简单：只要系统能同时接收多种信息，并让这些信息相互影响最终理解，它就在做多模态处理。下一页我们把这条“融合”链拆成三个可见部件。

## P3【VLM 的三段链路 看见 · 对齐 · 推理】讲解焦点

【本页目标】学生能够按顺序说明 VLM 的视觉编码、连接层对齐和语言模型推理过程。

【预计播报时长】约 2 分 30 秒

【语音逐字稿】

这一页的阅读方向非常明确，从左到右。最左边的视觉编码器相当于 VLM 的眼睛。图片不能直接以人类看到的方式交给语言模型，因此视觉编码器会把图片切成若干小块，也就是 Patch，再把图像中的物体、颜色、场景和空间关系转成向量表示。

中间黄色的连接层是翻译官。视觉编码器输出的是图像向量，语言模型习惯处理的是文本语义空间中的表示，两边原本“语言不通”。连接层把图像向量映射到语言模型能够接收的空间，这一步叫跨模态对齐。

最右边的大语言模型才是综合推理的位置。它接收已经对齐的图像特征，再结合用户的文字问题，例如“图里的人在做什么”，生成与画面相关的文本回答。请把这条链记成三个动词：先编码，再对齐，最后推理。VLM 和传统纯文本 LLM 的关键差异，也正是在第一步多出了图像信息的入口。

【教师提示】可指向三段箭头，强调连接层不是装饰模块，而是两种向量表示之间的对齐桥梁。

## P4【不同 VLM，共同处理图文关系】讲解焦点

【本页目标】学生能够理解代表模型的共同任务与差异维度。

【预计播报时长】约 1 分 50 秒

【语音逐字稿】

这一页不是让大家背模型名称，而是用五个不同高度的色块提醒我们：不同 VLM 的实现与侧重点不一样，但它们都在解决图像和文字如何共同参与理解的问题。讲义列出了 GPT-4V 或 GPT-4o、Gemini、通义千问-VL、GLM-4V 和 InternVL2 等代表。

从画面下方的小标签看，有的强调图像、语音、视频的实时交互，有的从训练阶段就融合文本、图像、音频和代码，也有的强调中文场景或开源生态。对学习者来说，更重要的不是把它们排出绝对强弱，而是先问任务需要什么：是图文问答、中文理解、实时交互，还是可部署、可扩展的方案。

同样的“看图回答问题”，在不同模型上可能得到不同表现；原因不仅在模型名称，还与输入质量、问题表达和具体场景有关。接下来我们从“理解图片”转向“根据文字生成图片”，看看生成模型如何把文字要求变成像素。

## P5【扩散模型： 从噪声回到画面】讲解焦点

【本页目标】学生能够用“从噪声到清晰图像”的过程解释扩散模型。

【预计播报时长】约 2 分 30 秒

【语音逐字稿】

请看这一页的三个区域。左边是一团纯噪声，讲义把它比作粗糙的大理石；中间是反复去噪的步骤；右边是最终清晰的图像。文生图的核心引擎之一是扩散模型。它并不是像画家那样从空白纸上一笔一笔画，而是从随机噪声开始，在文字提示的约束下逐步去掉不符合目标的部分。

训练阶段可以理解为先把清晰图片逐渐加噪，直到接近雪花屏，让模型学习“清晰画面是怎样被破坏的”。生成阶段则反过来：给定文字提示，模型从噪声出发，经过多轮去噪，让画面越来越接近提示中的对象、场景和风格。画面中的四条步骤条正是在表达这种逐步收敛。

所以，“一只穿宇航服的柴犬在月球漫步”不是被直接存成一张现成图片，而是作为生成过程的语义约束。讲义推荐即梦和可灵作为国内实操工具。生成结果仍需要人工检查，因为文字要求能否被准确落实，要看最终图像中的细节是否符合任务。

## P6【视频生成多出的难题：时间一致性】讲解焦点

【本页目标】学生能够说明文生视频为什么比文生图多出时间维度的挑战。

【预计播报时长】约 1 分 50 秒

【语音逐字稿】

左边红色标签写着“一张图 versus 一段连续画面”，右边四个蓝色小框代表连续视频帧。文生图只需要让一张静态画面看起来合理；文生视频则要求每一帧不仅各自看起来合理，还要和前后帧接得上。

这就是讲义强调的时间一致性。人物动作不能突然跳变，光影不能无故闪烁，物体也不能在相邻帧中凭空出现或消失。换句话说，视频模型不仅在回答“这一帧像什么”，还要处理“这一帧和上一帧、下一帧是什么关系”。

因此，视频生成即使画面已经足够清晰，也不代表结果可用。实际项目中还要检查运动是否连贯、主体是否稳定，必要时进行人工筛选和后期调整。下一页我们把多模态能力放进机器人，看看理解不再停在屏幕上时会发生什么。

## P7【机器人从“盲动”到感知—理解—行动】讲解焦点

【本页目标】学生能够描述多模态机器人从环境信息到物理动作的闭环。

【预计播报时长】约 2 分 30 秒

【语音逐字稿】

这一页的三块色板构成一个闭环。第一步是感知：机器人通过摄像头、麦克风、激光雷达和触觉传感器获取环境信息。比如家庭服务机器人发现地上有一个苹果，最先得到的是视觉、空间或触觉等原始线索，而不是现成的行动命令。

第二步是理解，这是中间黄色模块的任务。多模态模型把不同传感器信息融合起来，识别“这是什么、在哪里、是否属于当前环境”，再结合任务目标作出判断。讲义中的例子是：系统识别地上的苹果，并推断它更适合被放回果盘或冰箱。

第三步才是行动。机器人要把理解结果转成移动、抓取、放置等具体指令，其中仍涉及路径规划、运动控制和抓取策略。传统工业机器人常能重复预编程动作，但环境变化后未必知道怎样调整；多模态闭环的价值，是让系统能够根据环境信息重新理解任务，再决定行动。下一页会说明，为什么机器人常常先在虚拟环境训练。

## P8【数字孪生： 先练再上场】讲解焦点

【本页目标】学生能够解释数字孪生如何为具身智能机器人提供安全训练场。

【预计播报时长】约 2 分 10 秒

【语音逐字稿】

请看左右两块大面板：一侧是真实世界，一侧是数字孪生，中间虚线框写着“反复训练、技能迁移”。数字孪生不是简单生成一个虚拟形象，而是在虚拟空间中建立真实场景或物理实体的高精度映射。机器人可以先在这个副本里反复训练、试错，再把学到的技能迁移到现实中执行。

它的直接价值有两个。第一，降低成本和安全风险。真实机器人摔倒、抓取失败或碰撞设备都可能带来代价，而虚拟环境允许重复实验。第二，可以模拟火灾、设备故障等极端或罕见场景，让机器人先学习应对，再进入真实任务。

讲义把它比作飞行模拟驾驶舱：飞行员先在模拟环境中练习各种紧急情况，熟练后才进入真飞机。这个类比帮助我们理解训练顺序，但也要注意，虚拟场景与真实世界仍需尽量对齐；迁移到真实环境后，仍要验证机器人是否真的能稳定执行。

## P9【TTS：从“拼音素”到拟人声音】讲解焦点

【本页目标】学生能够按技术演进解释 TTS 自然度提高的原因，并指出零样本语音克隆的风险。

【预计播报时长】约 2 分 20 秒

【语音逐字稿】

TTS 是 Text-to-Speech，也就是文本转语音。它把书面文字自动转换成自然语音，是多模态系统重要的输出端。导航播报、智能音箱、有声书和客服语音，都是日常可见的应用。

画面像一段向上攀登的阶梯。第一代拼接合成会预先录好很多音素片段，再像拼积木一样拼出语音，优点是思路直接，缺点是声音容易生硬。第二代参数合成用统计模型生成语音参数，比拼接自然一些，但仍有明显电子感。第三代深度学习合成使用深度神经网络从文本端到端生成语音波形，成为当前主流，因此语音的自然度明显提升。

最右边的最新阶段是零样本语音克隆：只需几秒目标说话人的音频，就能模仿音色、语调和语速。它带来更灵活的表达，也带来深度伪造风险。因此，技术能力越接近真实声音，使用时越需要审慎判断来源、授权和用途。

## P10【三种 TTS 工具 各有主场】讲解焦点

【本页目标】学生能够根据批量生成、商业品质和实时低延迟三类交付场景选择合适的 TTS 工具。  
【预计播报时长】约 1 分 10 秒

【语音逐字稿】

请先看页面上方的场景提示，再从左到右比较三种工具。Edge-TTS 免费开源，支持多种中文发音人，也可以由 Python 调用，因此更适合本地开发和有声内容的批量生成。讯飞语音强调自然度、方言与情感合成，更适合商业产品、智能硬件和呼叫中心。火山引擎 TTS 支持流式合成、延迟较低且声音库丰富，更适合实时交互、直播和短视频配音。

这里不存在对所有任务都最好的单一工具。选择机制应从交付条件倒推：需要低成本批量处理时关注可调用性；需要面向用户的成品时关注自然度与服务能力；需要边生成边播放时重点检查流式能力和延迟。底部结论把这三条压缩为“批量、商业品质、实时延迟”。下一页再讨论选定工具之后，声音质量应该怎样评价。

## P11【声音好不好，不能只听“像不像真人”】讲解焦点

【本页目标】学生能够使用自然度、清晰度和情感表现力评价 TTS 输出。

【预计播报时长】约 1 分 40 秒

【语音逐字稿】

这一页用三个圆点代替单一排名。左下是清晰度，表示每个字能不能被听清；中间是自然度，表示声音是否接近真人表达；右上是情感表现力，表示系统能否根据语境调整语气，例如开心时上扬、严肃时下沉。

讲义还提到自然度通常可以用 MOS，也就是平均意见分衡量。但课堂中更重要的是理解：一个声音即使听起来很自然，也可能因为吐字不清、停顿错误或情绪不合场景而不适合使用。反过来，语音清楚但机械，也会影响听众体验。

所以评价 TTS 不要只问“像不像真人”，而要同时问“听不听得清”“语气合不合适”。这三个维度会在下一页和前面的图文理解、内容生成、机器人行动一起被重新串联。

## P12【一章串起：多模态如何连通世界】讲解焦点

【本页目标】学生能够把本章的理解、生成、行动与表达四类能力连接成整体框架。

【预计播报时长】约 1 分 40 秒

【语音逐字稿】

这一页用三张不同颜色的回顾卡收束全章。左侧“看懂”回顾 VLM 的三段管线：视觉编码、连接层对齐和语言模型推理。中间“生成”把扩散去噪与视频时序一致性放在一起，提醒我们生成内容不是一次性产出，而是一个受提示约束的过程。右侧“行动与表达”则把机器人闭环和 TTS 放回现实交互中。

把这三张卡连起来，多模态 AI 的价值就更清楚了：它能把不同形式的信息纳入理解，把语言要求转为画面或语音，也能在机器人场景中把环境感知连接到物理行动。每一环都有能力边界，尤其需要人工验证输出、检查真实环境中的表现，并对风险负责。

下面进入测验。请不要只记答案字母，而是把每道题放回这一章的机制图里判断。

## P13【单选题 · 8 题】讲解焦点

【本页目标】学生能够用本章机制完成 8 道讲义原题的判断。

【预计播报时长】约 5 分钟

【语音逐字稿】

这一页一次显示一题，顶部进度条会记录当前题号，答题后会锁定选项并显示讲义解析。请大家先独立作答，每题至少用一句话说明自己的依据。前四题分别检查多模态的定义、VLM 三组件顺序、扩散模型的去噪比喻，以及文生视频的时间一致性；后四题检查机器人闭环、数字孪生、零样本语音克隆和国内可用工具。

作答时，尤其注意题目里的“只能”“必须”“最大挑战”“核心闭环”等限定词。它们要求大家回答的不是某个产品名称，而是本章讲过的机制和适用边界。完成后再点击下一题或查看反馈。

【互动停顿】每题留 20 秒。学生选择后，由页面显示正确答案与讲义解析。

【教师提示】反馈时依次回扣：多种通道的融合、视觉编码器到语言模型的顺序、噪声逐步去除、连续帧一致性、感知到行动的闭环、虚拟训练到真实迁移，以及合规工具使用。

## P14【简答题 · VLM 原理】讲解焦点

【本页目标】学生能够用完整机制链比较 VLM 与纯文本 LLM。

【预计播报时长】约 2 分钟

【语音逐字稿】

请先读题，不要立刻点击“显示讲义参考答案”。这题要求两部分：第一，解释 VLM 的工作原理；第二，说明它和传统纯文本 LLM 的核心区别。建议大家先用三句组织答案：图片先怎样进入系统，图像表示怎样和文字语义对齐，最后模型怎样根据图和问题生成回答。

第二部分要回到输入能力的差异。纯文本 LLM 只能直接处理文字；VLM 增加了视觉理解能力，因此能围绕图片内容回答问题。不要只写“VLM 更强”，而要说清楚“多了什么输入、经过什么过程、输出因此发生什么变化”。

【互动停顿】给学生 60 秒列出“编码—对齐—推理”三个关键词，再展开讲义参考答案核对。

【教师提示】展开后强调：参考答案中的比喻用于建立直觉，评分时仍以三段机制链和核心区别是否说清为准。

## P15【简答题 · 机器人与数字孪生】讲解焦点

【本页目标】学生能够把多模态价值与数字孪生训练价值放进同一论证中。

【预计播报时长】约 2 分钟

【语音逐字稿】

这一题有两个层次。先回答多模态 AI 为什么对机器人重要：机器人需要通过视觉、听觉、触觉等信息感知环境，模型再把这些信息融合为对场景和任务的理解，最后形成行动计划。这里不要把“看见”直接等同于“会做”，中间的理解与决策才是闭环的关键。

再举数字孪生的例子。一个合格答案要说明，虚拟环境建立的是对真实场景的高精度映射，机器人可以在其中反复试错，减少现实训练成本和风险，并能训练极端或罕见场景。最后补上一句技能迁移到真实环境后仍需验证，说明你理解了虚拟训练与现实执行之间的关系。

【互动停顿】给学生 60 秒画一个“感知—理解—行动—虚拟训练”的关系图，再展开参考答案。

## P16【简答题 · AI 绘本朗读助手】讲解焦点

【本页目标】学生能够把 VLM 与 TTS 组合成源讲义给出的三模块产品方案。

【预计播报时长】约 2 分钟

【语音逐字稿】

最后一道题要求设计“AI 绘本朗读助手”。先不要急着报工具名称，先把系统按输入、处理、输出拆开。输入是绘本图片；第一模块是图文理解，由 VLM 识别画面内容、角色、场景和情绪，并生成朗读文本和角色标注。第二模块是语音合成，把文本转成自然语音，并为不同角色匹配不同发音人。第三模块可以是音频后处理，为成品加入背景音乐、音效或混音。

在工具选择上，讲义给出的国内方案包括通义千问-VL、GLM-4V、Edge-TTS 和讯飞语音。答题时要说明这些工具分别服务哪个模块，而不是简单罗列名称。最后用一条流程线收束：绘本图片进入 VLM，生成的文本和角色标注进入 TTS，多发音人语音再经过音频合成，输出最终配音文件。

【互动停顿】给学生 90 秒画出三模块流程，再点击按钮展开讲义参考答案对照。

【教师提示】评价重点是模块分工清楚、流程顺序正确，并且工具选择与图文理解或语音合成的职责对应。
