# 《AI基础》第二章逐字稿

## P1【大模型基础】
【本页目标】明确本章从 Token、训练到部署的学习范围。
【预计播报时长】约 1 分 0 秒
【语音逐字稿】
这一页是“大模型：AI 的操作系统”的开场。这里的操作系统是教学比喻，指许多写作、翻译、代码和文档分析应用，都依赖大模型提供通用能力。本章从最小的 Token 开始，依次解释模型如何生成语言、如何训练，以及怎样在效率和数据安全之间选择部署方式。请带着一个边界问题学习：回答流畅并不等于事实一定正确，最后仍要由人核验结果和承担后果。接下来先看大模型最基本的生成动作。

## P2【LLM 本质：词语接龙机器】
【本页目标】理解 LLM 根据上文预测下一个 Token 的机制。
【预计播报时长】约 1 分 20 秒
【语音逐字稿】
请看画面中的“今天天气真”。模型会给“好、热、差”等候选片段不同概率，选择较合理的一个，再把结果接回上文，继续预测下一个 Token。这就是大语言模型的核心过程：根据已见文本生成后续片段，而不是在数据库里直接检索固定答案。因为它从海量文本中学习了语言模式，所以能写作、翻译和编程；例如一个自然的句子可以逐步接续出来。但是，概率上通顺不等于事实为真，因此需要验证来源和关键结论。下一页解释这些语言片段是什么。

## P3【Token 是语言原子】
【本页目标】区分 Token、汉字和词，并理解其成本含义。
【预计播报时长】约 1 分 15 秒
【语音逐字稿】
画面把“人工智能”切成“人工”和“智能”，说明 Token 不是单纯的汉字计数，而是模型内部处理文本的最小片段。中文、英文、标点、空格和代码符号都可能按不同方式切分。例如“ChatGPT”可被拆为多个片段。因为 API 输入和输出通常按 Token 计费，长文本、表格和代码的消耗会不同；但 Token 也不等于一个完整词。理解它，才能判断一次请求的成本和容量。下一页把容量问题放到上下文窗口中。

## P4【上下文窗口：短期记忆】
【本页目标】说明上下文窗口的作用与“遗忘”原因。
【预计播报时长】约 1 分 15 秒
【语音逐字稿】
请看中间黄色区域，它代表模型一次能看到的 Token 窗口。窗口越大，模型越能同时处理长文档和多轮对话；如果对话超过上限，最早的内容会被截断，表现得像忘记了。例如分析很长的 PDF 时，窗口不足就需要分段、摘要和交叉核对。窗口大小只决定“看得见多少”，并不保证模型一定理解正确或不会遗漏条件。下一页比较不同模型在实际场景中的特点。

## P5【国产大模型：各有看家本领】
【本页目标】根据任务需求而非热度进行模型选择。
【预计播报时长】约 1 分 20 秒
【语音逐字稿】
这一页把模型能力按场景提示出来：DeepSeek 强调开源、性价比和中文能力，Kimi 突出长上下文与文档分析，其他模型也在企业生态、多模态、日常对话、科研或代码方面各有侧重。选择时要先问任务、成本和数据是否敏感。例如长报告阅读可看上下文能力，涉密文档则要进一步考虑部署位置。模型没有脱离条件的“最好”，能力和约束必须一起判断。下面进入训练流程，看看这些能力怎样形成。

## P6【预训练：博览群书】
【本页目标】解释预训练的数据、任务和局限。
【预计播报时长】约 1 分 20 秒
【语音逐字稿】
请看左侧网页、书籍、论文和代码，它们代表预训练使用的海量公开文本。模型反复根据上文猜下一个 Token，并通过调整参数逐渐学习语言规律和世界知识。例如看到“中国的首都是”，它会提高“北京”等候选的概率。预训练让模型获得基础能力，但训练数据质量参差不齐，因此它仍可能续写而不善于按指令回答。下一页的监督微调，正是为了解决“会续写但不会好好回答”的问题。

## P7【监督微调：学会答题】
【本页目标】理解 SFT 如何让模型学习问答格式。
【预计播报时长】约 1 分 15 秒
【语音逐字稿】
画面中的用户问题、标准问答对和“会聊天”展示了 SFT，也就是监督微调。训练者提供高质量问答示例，模型通过模仿学习按指令组织答案。例如“请解释人工智能”会对应清晰、合适的回答格式。SFT 能改善对话与表达，但不等于它已经安全或永远可靠，因为回答质量还可能不稳定。下一页将看到人类反馈怎样进一步影响模型偏好。

## P8【RLHF：价值观对齐】
【本页目标】理解人类偏好排序与奖励模型的作用。
【预计播报时长】约 1 分 20 秒
【语音逐字稿】
请看多个回答经过人类排序，再经过奖励反馈回到模型的箭头。RLHF 让模型针对同一问题生成多个回答，由人类比较哪一个更有帮助、更安全或更清楚，再用这些偏好训练奖励模型并强化较好的输出。例如它能促使模型减少不合适的表达。但是，对齐并不等于模型拥有人的价值观，也不表示没有风险；高风险任务仍需人工审核。下一页把三阶段串成完整顺序。

## P9【三阶段训练：顺序不能颠倒】
【本页目标】掌握预训练、SFT、RLHF 的递进关系。
【预计播报时长】约 1 分 10 秒
【语音逐字稿】
这条管线从左到右依次是预训练、SFT、RLHF：预训练给基础知识，SFT 给问答格式，RLHF 给人类偏好对齐。因为后一步建立在前一步基础上，所以顺序不能简单颠倒；例如没有语言能力，就无法有效学习复杂对话格式。三阶段共同改善能力，但仍不消除事实错误和责任边界。接下来把技术选择放到云端和本地部署的现实条件中。

## P10【云端 vs 本地：效率与安全】
【本页目标】比较两种部署方式的适用场景。
【预计播报时长】约 1 分 20 秒
【语音逐字稿】
左侧云端部署打开网页即可使用，算力强、体验快，但数据需要上传；右侧本地部署需要 GPU 和环境配置，却可以离线运行、定制并让数据留在本地。例如日常学习和快速体验通常适合云端，涉密合同和内部文档优先考虑本地。选择取决于数据敏感性、硬件和成本，不能只看便利。下一页给出教学团队采用的混合方案。

## P11【教学团队策略：混合部署】
【本页目标】理解混合部署如何平衡效率与安全。
【预计播报时长】约 1 分 10 秒
【语音逐字稿】
请看云端 VLM、本地服务器和数据标注平台形成的闭环。教学团队日常标注可用云端模型自动预标注，以提高效率；涉密客户数据则在本地服务器处理，以降低上传风险。这个案例说明部署不是非此即彼：如果任务不敏感，可优先效率；当数据受限时，本地处理是重要条件。混合方案把不同约束分流处理。下一页回收本章三条主线。

## P12【本章总结：模型心脏】
【本页目标】回顾 Token、训练与部署三项核心知识。
【预计播报时长】约 1 分 0 秒
【语音逐字稿】
这一页的三张卡片对应 TOKEN、TRAIN 和 DEPLOY。Token 是模型读写语言的单位，训练通常依次经过预训练、SFT 和 RLHF，部署则要平衡云端效率与本地隐私。它们共同解释了大模型如何产生能力、为何存在边界，以及如何在项目中合理使用。下面进入讲义原有实操，先实际体验模型并核验输出，再比较不同 Prompt 带来的结果差异。

## P13【讲义实操：注册并体验 DeepSeek / Kimi】

【本页目标】完成一次知识问答和一次代码挑战，并依据实际结果记录模型表现。
【预计播报时长】约 2 分 0 秒
【语音逐字稿】
请按画面从左到右完成这项实操。先访问页面列出的 DeepSeek 或 Kimi，完成注册和登录；平台入口或登录方式如果发生变化，以当时实际界面为准。登录后输入讲义原始问题：“请用二百字介绍人工智能的发展历程。”不要只看文字是否流畅，还要记录生成大约用了多久，并核对其中的时间、事件和结论有没有事实错误。

接着输入右侧的代码任务：“请帮我写一个 Python 函数，判断一个数字是否是质数，并添加注释解释每一步。”检查函数能否运行、判断逻辑是否正确、注释是否真正解释了步骤。模型生成了回答，只代表任务进入验证阶段；知识内容要回查证据，代码要实际运行。完成记录后，下一页再比较两个不同 Prompt 的输出差异。

## P14【讲义实操：对比两个 Prompt】
【本页目标】按讲义完成两个 Prompt 的对比记录。
【预计播报时长】约 1 分 0 秒
【语音逐字稿】
请在 DeepSeek 或 Kimi 中依次输入“推荐三本好书”和“你是一名大学图书馆管理员，请为大一新生推荐三本必读好书，并说明推荐理由”。比较结果的具体程度，并用三到五句话记录角色、对象、数量和理由要求造成的影响。先独立完成，再展开讲义提示：Prompt 越具体，回答通常越贴近任务，这也是下一章 Prompt 工程的起点。

## P15【单选题·10题】
【本页目标】独立检验本章的机制与部署知识。
【预计播报时长】约 1 分 10 秒
【语音逐字稿】
请逐题完成十道单选题，再查看反馈。题目依次考查下一个 Token 预测、Token 定义、上下文窗口、预训练、SFT 与 RLHF 的区别、DeepSeek 特点、本地部署场景、训练顺序、Token 估算和混合部署。作答时先判断题目问的是机制、数据、顺序还是场景；看到涉密合同，应优先联想到数据隐私。错题请回到相应知识页核对解析。

## P16【简答题·3题】
【本页目标】按讲义评分要点组织三道简答。
【预计播报时长】约 1 分 20 秒
【语音逐字稿】
请先独立回答三题，再点击“显示参考答案”。第一题要说明 Token 不是字也不是词，并举“人工智能”及标点等例子；第二题要按预训练、SFT、RLHF 的顺序写出目标和数据类型；第三题面对敏感内部文档，应说明本地部署的数据安全、合规、成本和定制性，也可补充非敏感任务走云端的混合方案。答案展开只用于核对评分要点，不要替代自己的思考。
