# 《AI基础》第四章逐字稿

课程：AI基础  
章节：第四章 计算机视觉  
页面依据：`AI基础第四章-HTML课件.html`  
讲授说明：本稿严格按照课件页面顺序编排，测验答案均来自原始讲义。

## P1【机器如何 看懂世界？】

【本页目标】
建立本章主线：机器不是像人一样直接“看见”物体，而是把图像转换为数字，再从数字中学习可用于判断的模式。

【预计播报时长】约 1 分 30 秒

【语音逐字稿】
这一章我们进入计算机视觉。请先观察封面：左侧的问题是“机器如何看懂世界”，右侧的视觉图形把图像、像素、特征和任务连接起来。这里的“看懂”要加引号，因为计算机并没有人的眼睛和生活经验。摄像头先把光线记录成图像，图像再被表示为一组数值；模型随后从大量样本中寻找数值模式，并把这些模式映射为类别、位置或者像素标签。

因此，本章不会把视觉模型描述成拥有直觉的观察者，而是沿着一条可解释的技术链路展开：图像怎样变成数字，卷积神经网络怎样逐层抽取特征，视觉大模型提供了哪些新能力，以及模型怎样进入工业巡检的数据闭环。带着这个问题继续往下看：同一张图，机器究竟可以输出哪些不同层次的答案？

## P2【三种 视觉任务】

【本页目标】
区分图像分类、目标检测和语义分割三种基础视觉任务。

【预计播报时长】约 2 分 30 秒

【语音逐字稿】
请看舞台中的三种输出形式。第一种是图像分类，它回答“整张图主要是什么”，输出通常是一个类别标签。第二种是目标检测，它不仅回答“有什么”，还要用矩形框说明“在哪里”。第三种是语义分割，它把判断推进到像素级，为图像中的每一个像素分配类别。

可以用三个问题记住它们：分类问“是什么”，检测问“是什么、在哪里”，分割问“每一个像素属于什么”。动画把三种结果依次呈现，是为了让我们看到输出粒度在不断变细。需要注意，语义分割区分类别，但通常不区分同一类别中的不同个体；要区分第一只猫和第二只猫，需要实例分割。

底部结论强调的不是三个名称，而是任务目标决定输出结构。实际项目开始前，先明确需要类别、位置还是像素边界，才能选择合适的标注方式、模型和评价指标。下一页我们就把这种“粒度变化”展开来看。

## P3【从整图到 像素】

【本页目标】
理解视觉任务从整图标签、多个检测框到像素标签的输出粒度变化。

【预计播报时长】约 2 分 0 秒

【语音逐字稿】
这一页把三种任务放在同一条尺度上。最左侧是整图级输出，一张图对应一个主要标签；中间是目标级输出，一张图可以得到多个类别和多个矩形框；最右侧是像素级输出，图像中的区域被逐像素标记。

请跟随动画从左向右观察。输出越精细，训练数据的标注成本通常也越高。给整张图标一个类别相对直接，逐个画框需要更多时间，而精确勾画像素边界更细致。因此，不能简单地认为粒度越细就越好。若业务只需要判断产品是否合格，分类可能已经足够；若需要定位裂纹，就要考虑检测或分割。

本页底部结论可以概括为：视觉任务的差异，本质上是答案粒度的差异。选择任务时应从业务要采取的动作倒推，而不是先选一个听起来更先进的模型。接下来我们再向底层走一步，看看所有这些任务共同接收的数字输入。

## P4【图像的 数字语言】

【本页目标】
理解数字图像由像素组成，以及 RGB 通道数值如何表示颜色。

【预计播报时长】约 2 分 20 秒

【语音逐字稿】
人看到的是颜色和形状，计算机接收到的首先是一张数字矩阵。请看舞台中的像素放大效果：一幅彩色图像由许多像素组成，每个像素通常包含红、绿、蓝三个通道，也就是 RGB。

页面中的示例数值是 R 为 216、G 为 74、B 为 138。每个通道通常在 0 到 255 之间变化，三个数值组合后形成一种颜色。动画让三个通道依次进入像素，是为了说明屏幕上的颜色不是一个抽象名称，而是可计算的数字组合。整张图像则可以理解为大量 RGB 数值按空间位置排列形成的张量。

这也解释了模型为什么能够处理图像：它并不是直接理解“猫”或“裂纹”，而是先对这些数字进行运算，再逐步抽取稳定模式。底部结论所说的“图像是数字语言”，就是本章后续机制的起点。下一页我们来看 CNN 怎样从低级数字模式走向高级语义。

## P5【CNN 逐层看懂】

【本页目标】
理解卷积神经网络从浅层特征到深层语义的层级抽取过程。

【预计播报时长】约 2 分 30 秒

【语音逐字稿】
请从左向右观察 CNN 的层级展开。较浅的网络层通常对边缘、线条、颜色变化等低级特征敏感；再往后，模型会把这些简单特征组合成眼睛、耳朵、纹理等局部结构；到了更深的层，局部结构继续组合，形成与“猫”等完整物体相关的语义表示。

这里不要把每一层理解成由工程师手工写好的识别规则。训练开始时，模型参数并不知道哪一种边缘属于猫。它通过样本和误差反馈不断调整，逐渐形成对完成任务有帮助的特征。动画中的逐层点亮，表达的正是“简单模式逐步组合为复杂模式”。

因此，CNN 的重要思想不是一次跳到最终答案，而是建立特征层级。底部结论可以这样理解：深层语义建立在浅层视觉模式之上。现在我们已经知道模型内部大致学什么，下一页继续回答它是怎样学会的。

## P6【训练就是 反复纠错】

【本页目标】
掌握监督训练中从标注数据、预测、损失到参数更新的循环。

【预计播报时长】约 2 分 30 秒

【语音逐字稿】
这一页是一条循环，而不是一条走完就结束的直线。第一步，模型接收带有正确标签的训练数据；第二步，根据当前参数给出一次预测；第三步，把预测与正确答案比较，计算损失；第四步，根据误差方向调整参数；随后再用新的样本或新的批次重复这个过程。

请观察循环箭头和反复脉冲的节点。它们提示我们，训练的关键不是模型第一次猜对，而是每次猜错之后都获得一个可用于修正的信号。经过许多轮迭代，损失通常逐步下降，模型在训练任务上的预测能力逐渐提高。

不过，训练误差下降不等于真实场景一定可靠，还要用未参与参数更新的验证集和测试集检查泛化表现。底部结论“训练就是反复纠错”，概括了优化过程的核心逻辑。接下来，我们从传统 CNN 转向能够连接图像、文字和提示信息的视觉大模型。

## P7【视觉大模型 三件套】

【本页目标】
区分 CLIP、SAM 与 Grounding DINO 的核心能力和适用输出。

【预计播报时长】约 3 分 0 秒

【语音逐字稿】
这一页列出三种代表性能力。先看 CLIP，它通过大量图文配对数据学习图像与文字之间的语义关系，因此可以进行图文检索和零样本分类。所谓零样本，是指面对新的文字类别时，可以利用图文空间进行匹配，而不必为每个新类别都重新训练一个固定分类头。

再看 SAM，也就是 Segment Anything Model。它的核心是通用分割，可以根据点击、框选等提示，从图像中分割目标。第三个是 Grounding DINO，它把自然语言描述与开放词汇目标检测结合起来。用户描述想找的物体，模型尝试在图像中给出对应检测框。

请跟随三个模块的动画分别观察“图文连接”“轮廓生成”和“文字指向框选”。三者不是互相替代：CLIP偏向语义对齐，SAM偏向分割，Grounding DINO偏向文本驱动的开放检测。底部结论提醒我们，视觉大模型扩展了人与视觉系统交互的方式。下一页把这些能力放进真实巡检流程。

## P8【巡检 数据流水线】

【本页目标】
理解输电线路等工业巡检中从采集、标注、训练到预警的数据流程。

【预计播报时长】约 2 分 40 秒

【语音逐字稿】
请沿着舞台中的流水线依次观察。首先由无人机等设备采集巡检照片；原始照片还不能直接用于监督训练，需要人工标记缺陷的位置和类型；标注完成后划分训练、验证和测试数据，页面给出的示意比例是百分之七十、百分之二十和百分之十；随后训练模型，并根据场景部署到云端或边缘设备；运行时完成实时推理，在发现疑似缺陷后发出预警。

这里最容易被忽略的是数据多样性。若训练集只有晴天、单一角度或单一地域，模型在新的光照和环境中可能表现下降。因此，采集阶段就要覆盖多种条件。动画中的数据块持续向前移动，表达的是每一步都为下一步提供输入，任何一环质量不足都会影响最终结果。

底部结论强调：工业视觉系统不是只有一个模型文件，而是一整条数据与工程流水线。下一页进一步说明，模型上线之后为什么仍然不是终点。

## P9【部署不是 终点】

【本页目标】
理解边缘与云端协同，以及误检、漏检样本如何推动模型持续迭代。

【预计播报时长】约 2 分 40 秒

【语音逐字稿】
这一页展示的是部署后的闭环。边缘端可以放在无人机或机器人附近，承担快速筛查。为了适应有限算力，模型可能采用量化、剪枝或蒸馏等压缩方法。云端拥有更强的计算资源，可以对疑难样本做更深入的分析。系统输出后还需要人工复核，尤其要关注误检和漏检。

请观察反馈箭头如何从真实运行结果重新回到数据端。误检和漏检并不只是失败记录，它们也是下一轮优化最有价值的难例。把这些样本收集起来、补充标注并重新训练，模型才可能逐步适应新设备、新环境和新缺陷。

因此，部署不是把模型交付后就结束，而是数据闭环的新起点。底部结论可以归纳为：可靠的视觉系统依靠“边缘筛查、云端分析、人工复核、数据回流”的持续协作。下面进入本章总结，把整条认知链重新压缩一次。

## P10【本章 总结】

【本页目标】
回顾视觉任务、数字图像、特征学习、视觉大模型和工业闭环五个关键模块。

【预计播报时长】约 2 分 30 秒

【语音逐字稿】
请利用这一页的微型图形完成一次回顾。第一，分类、检测和分割对应不同的输出粒度：整图标签、目标框和像素标签。第二，图像在计算机中由像素及 RGB 数值表示。第三，CNN 从边缘和纹理等浅层特征逐步组合出更高层的语义。第四，CLIP、SAM 和 Grounding DINO 分别拓展了图文对齐、通用分割和文本驱动开放检测能力。第五，真实项目要经历采集、标注、训练、部署、反馈和再训练的数据闭环。

把这些内容连成一句话：机器先把世界转换成数字，再通过训练学习特征，最后把视觉能力嵌入可持续迭代的业务流程。底部结论不是说模型已经像人一样理解世界，而是强调它能在明确任务和数据条件下形成可用的视觉判断。

接下来进入原讲义测验。请先独立作答，再使用课件交互查看答案和解析。

## P11【单选题 · 10题】

【本页目标】
通过十道原讲义单选题检查三种视觉任务、CNN、视觉大模型和数据闭环的理解。

【预计播报时长】约 10 分 0 秒

【语音逐字稿】
这一页采用一题一题浏览的方式。每道题请先选择答案，再查看反馈，不要一开始就展开解析。

第一题，图像分类的核心目标是什么？请先思考。正确答案是 C，判断整张图像属于哪个类别。矩形框属于目标检测，像素分类属于语义分割，自然语言描述属于图像描述。

第二题，目标检测中的矩形框主要有什么作用？正确答案是 B，标示目标在图像中的位置。矩形框通常用坐标表示，并与类别标签配合说明框内是什么。

第三题，语义分割与目标检测最大的区别是什么？正确答案是 B。语义分割输出像素级标签，目标检测输出矩形框与类别标签。关键区别是输出粒度，而不是简单比较速度。

第四题，CNN 较浅的层通常提取什么特征？正确答案是 B，边缘、纹理和颜色等低级特征。更深层才逐渐形成完整物体相关的语义表示。

第五题，关于 CLIP 的正确描述是什么？正确答案是 B。CLIP 从大量图文配对中学习语义关系，可以支持图文检索和零样本分类；它不是专门的目标检测模型。

第六题，SAM 的核心能力是什么？正确答案是 B，自动或交互式地分割图像中的任意物体。它不是美颜、图像描述或超分辨率工具。

第七题，Grounding DINO 相比传统固定类别检测模型的突出优势是什么？正确答案是 B。用户可以通过自然语言指定检测目标，模型具备开放词汇检测能力。这里不应把优势误解为一定更快。

第八题，在 AI 数据闭环中，哪个阶段使用标注数据调整模型参数？正确答案是 C，模型训练。采集获取原始数据，标注补充标签，部署则让训练后的模型进入运行环境。

第九题，工业巡检中哪种做法有助于提升泛化能力？正确答案是 B，采集多种光照、角度和地域的样本。单一环境的数据容易让模型只适应有限条件。

第十题，哪种工具适合图像数据标注？正确答案是 B，LabelStudio。它支持分类、检测和分割等多种标注任务；其余选项分别偏向图像编辑、文字处理和视频剪辑。

完成后请看累计得分。如果某一道题答错，不只记选项字母，而要回到“任务目标、输出形式、模型能力、数据阶段”这四类概念中定位混淆点。

## P12【判断题 · 5题】

【本页目标】
辨析视觉任务边界、SAM 的泛化能力以及部署后的数据闭环。

【预计播报时长】约 6 分 0 秒

【语音逐字稿】
最后是五道判断题。仍然请先作答，再查看课件给出的即时反馈。

第一题：图像分类可以在一张图中识别多个不同类别物体，并给出它们的位置。答案是错误。图像分类通常给整张图一个类别标签，同时识别多个物体并定位属于目标检测任务。

第二题：语义分割能为每个像素分类，所以也能区分同一类别的不同个体。答案是错误。语义分割区分类别，不区分同类个体；区分第一只猫和第二只猫需要实例分割。

第三题：SAM 无须针对某个特定新类别重新训练，也可以尝试分割未见过的物体。答案是正确。讲义将其概括为零样本泛化能力，它来自大规模训练形成的通用分割能力。

第四题：模型完成部署就表示项目结束，不再需要更新。答案是错误。部署后还要持续收集误检与漏检样本，补充标注、重新训练并更新模型。

第五题：输电线路巡检中的无人机照片可以不经标注，直接用于监督学习训练。答案是错误。原始照片缺少缺陷位置和类型标签，需要先经过人工标注，模型才能建立输入与正确目标之间的对应关系。

五题共同提醒我们：判断一个说法是否成立，要看它是否混淆了任务边界、输出粒度或项目阶段。到这里，第四章从视觉输入、模型学习到工程闭环的内容就完成了。

## P13【测验分数统计】

【本页目标】
汇总单选题与判断题的答题结果，并依据分项得分定位需要复习的知识模块。

【预计播报时长】约 1 分 0 秒

【语音逐字稿】
最后请看测验分数统计页。表格把单选题十题、每题五分和判断题五题、每题四分分别汇总，满分合计七十分。页面下方会同步显示两类题目的答对数量、分项得分与当前总分，因此这里不是一道新题，也不需要再次作答。

请先比较单选和判断两个分项：如果单选失分较多，应回到分类、检测、分割、CNN 和视觉大模型等概念页，检查任务与机制是否混淆；如果判断失分较多，应重点复核那些带有适用条件和能力边界的表述。分数的作用是定位薄弱点，而不是替代对原理的解释。到这里，本章从图像的数字表示、特征学习到部署闭环和测验反馈已经完整结束。
