# 第七章《AI 伦理与安全》逐字稿

适用对象：高校学生。前置知识：了解大模型与具身智能的基本概念。

## P1【给技术 系上安全带】
【本页目标】理解安全是 AI 应用的基本约束。
【预计播报时长】约 1 分钟
【语音逐字稿】这一章讨论 AI 不该做什么，以及出错后如何把风险控制在可验证范围内。请看中心的安全环：隐私、验证、急停和责任共同组成安全带。AI 越能影响现实，越不能只看它能否完成任务，还要看数据从哪里来、结果如何核验、发生事故时谁能停止和纠正。

## P2【隐私保护的 三道防线】
【本页目标】区分三种隐私保护方法。
【预计播报时长】约 1 分钟
【语音逐字稿】请从左到右看三道防线。数据脱敏先去除姓名、证件号等直接身份信息；联邦学习让数据留在本地，只上传模型更新；差分隐私用适度噪声降低反推出个人信息的可能。它们解决的是不同层面的暴露风险，不能只依赖其中一种。

## P3【偏见如何被 自动放大】
【本页目标】说明算法偏见的来源链。
【预计播报时长】约 1 分钟
【语音逐字稿】这条链从历史偏见开始，经过采样偏差和标注偏见，最后被模型固化为自动规则。偏见通常不是 AI 凭空发明，而是数据已经包含不均衡和旧有选择。数据审计、公平性指标和人工抽检的作用，就是在这条链上尽早发现并减少问题。

## P4【99% 与 70% 暴露了什么】
【本页目标】理解总体指标不能代替分组检查。
【预计播报时长】约 1 分钟
【语音逐字稿】屏幕用红色和蓝色路障对比训练数据不均衡的后果。红色样本多，所以识别率高；蓝色样本少，模型就把路障错误地学成了红色物体。评估 AI 时不能只报一个总体准确率，还要按类别、地区或使用场景分别检查表现。

## P5【流畅不等于 真实】
【本页目标】定义 AI 幻觉并说明其风险。
【预计播报时长】约 1 分钟
【语音逐字稿】请比较左右两张卡。可核验事实有来源和证据；AI 幻觉则是内容流畅、自信，却可能编造事实、引用或推理前提。大模型擅长预测下一个词，不等于自动查阅可靠数据库。因此，重要信息必须回到来源和证据中验证。

## P6【应对幻觉的 五步验证】
【本页目标】能够使用五步验证法核验输出。
【预计播报时长】约 1 分钟
【语音逐字稿】五步验证依次是追问来源、交叉验证、逻辑审查、人工判断和限定范围。面对不确定内容，先让系统说明不知道，再寻找独立来源核对，而不是让同一个模型反复证明自己正确。验证的目的不是承诺彻底消除幻觉，而是降低错误进入决策的概率。

## P7【看起来像真的 也要验来源】
【本页目标】说明深度伪造的识别原则。
【预计播报时长】约 1 分钟
【语音逐字稿】深度伪造可以影响图像、音频和视频。细节检查可以观察边缘、眨眼、光影、呼吸声与背景噪声，但最重要的仍是追溯原始来源，并寻找独立渠道证实。检测工具是辅助证据，不应成为唯一依据。还要注意，单个画面细节即使自然，也不能证明内容真实；高质量伪造可能避开某一项检查。较可靠的流程是先保存原始链接和时间信息，再回到发布者、现场记录或独立媒体等可追溯来源核对。同样，发现可疑内容时不要急于转发，应把“来源是否可核验”放在“画面是否逼真”之前。

## P8【当 AI 有了身体 错误会碰到现实】
【本页目标】识别具身智能的四类风险。
【预计播报时长】约 1 分钟
【语音逐字稿】当系统进入机器人等物理环境，错误从信息世界进入现实世界。感知错误会认错对象，策略失误会走错路径，硬件失控可能无法停止，对抗攻击会诱导系统误判。风险不是单一模型问题，而是感知、控制和环境共同作用的结果。

## P9【安全不是一层 是三层防线】
【本页目标】区分软件、硬件和流程安全层。
【预计播报时长】约 1 分钟
【语音逐字稿】第一层软件安全包括置信度阈值和动作限制；第二层硬件安全包括急停按钮、碰撞检测和安全围栏；第三层流程安全包括双人确认、模拟先行和日志追溯。关键思想是冗余：即使软件出错，也应有独立的物理和流程措施接住风险。

## P10【AI 出错时 谁来负责】
【本页目标】说明责任应回到具体人类行为。
【预计播报时长】约 1 分钟
【语音逐字稿】AI 不是法律责任主体。训练数据或设计有问题时，开发者和数据提供方应承担相应责任；使用者需要按规范操作并复核关键结果；恶意攻击者应对攻击行为负责。责任归属必须结合具体场景，但不能因为系统复杂就让责任消失。

## P11【把安全带 扣在全过程】
【本页目标】整合本章三类安全任务。
【预计播报时长】约 1 分钟
【语音逐字稿】请用三张卡回顾本章。守住数据，要保护隐私并审计偏见；守住信息，要核验幻觉和伪造；守住行动，要用三层防线约束具身系统。安全不是最后加一个开关，而是从数据到部署全过程的设计责任。

## P12【单选题 8 题】
【本页目标】独立检验安全概念。
【预计播报时长】约 3 分钟
【语音逐字稿】请逐题作答，不要急着查看反馈。答题时尤其区分“降低风险”和“完全消除风险”，并留意算法偏见的来源、急停按钮的安全层级以及模拟先行的流程作用。完成后再根据讲义解析回看自己的依据。
【教师提示】学生作答后再讲解答案与解析。

## P13【判断题 5 题】
【本页目标】用机制而非直觉判断安全说法。
【预计播报时长】约 2 分钟
【语音逐字稿】每条判断题都要求你说出理由。联邦学习为什么有助于隐私，为什么幻觉不能被完全消除，以及为何硬件安全可在软件失效后继续工作，都是本章关键机制。先判断，再展开本题解析。

## P14【案例：招聘系统 偏见事件】
【本页目标】诊断算法偏见并提出可操作修复方案。
【预计播报时长】约 3 分钟，另含讨论时间
【语音逐字稿】请阅读案例数据，先不要展开参考答案。问题不只是某些学校比例高，而是历史招聘偏好被模型学成了自动筛选规则。请先指出偏见及其数据根源，再提出至少三条可操作改进措施，例如数据审计、分组公平性指标、人工复审和持续监控。完成后再对照讲义评分要点。
【教师提示】答案展开后，按“识别问题、解释根源、建议具体性”反馈。
