HBB BLOG
首页
登录
🌙
李宏毅《生成式AI导论》20讲全景笔记
📅 2026-08-07
📂 课程
📝 3427 字
⏱️ 12 分钟
👁️ 1
> **导读**:本文档将20节课程的精华进行全局重构,以“大模型的生命周期与能力演进”为主线,串联底层原理、提示工程、微调对齐、多模态生成及安全攻防。为构建个人AI知识体系打造,已自动排雷并融入工业界前沿拓展。 > > 📚 **系列博客详细导航(建议收藏并按顺序阅读)**: > - 🟢 **[初级篇:认知重塑、底层逻辑与提示工程](https://blog.hbb.cloudns.org/posts/LihongYi01)** (涵盖1-8讲核心) > - 🟡 **[进阶篇:RLHF对齐、Agent架构与黑盒解剖](https://blog.hbb.cloudns.org/posts/LiHongYi02)** (涵盖9-14讲核心) > - 🔴 **[高阶篇:安全攻防、生成架构与多模态前沿](https://blog.hbb.cloudns.org/posts/LiHongYo03)** (涵盖15-20讲核心) --- ## 一、 认知重塑:AI的范式转移与“三大误区”排雷 在深入技术细节前,必须先建立正确的AI世界观。课程中反复强调了从“专用工具”到“全能工具人”的范式转移,并纠正了大众极易踩坑的认知误区。 ### 1. 核心本质:万物皆可“文字接龙” * **降维打击**:生成式AI(GenAI)面临的答案空间是 $10^{300}$ 级别(远超宇宙原子数),无法穷举。其核心解法是将“生成整篇文章”的无穷问题,拆解为“预测下一个字(Token)”的**有限分类问题**(自回归生成 AR)。 * **创造力的来源**:机器能产出训练集中**从未出现过**的合理组合,这就是AI的“创造力”。 ### 2. ⚠️ 三大认知误区(考试必考判断题) * ❌ **误区一:把大模型当搜索引擎。** * **正解**:大模型本质是概率接龙,不是数据库检索。它为了“努力帮忙”会强行编造看似合理的答案,这就是**幻觉(Hallucination)**。若要绝对不犯错,模型只能拒绝回答所有问题。 * ❌ **误区二:上下文学习(ICL)让模型“学会”了新技能。** * **正解**:ICL(如给模型看25万字教科书让它翻译冷门语言)**绝对没有改变模型的内部参数**。它只是利用 Transformer 的注意力机制在当前对话窗口“临时抄答案”。一旦移除上下文,能力立刻消失。这是“授人以鱼”,而非“授人以渔”。 * ❌ **误区三:模型“自我反省”修正错误,说明它变聪明了。** * **正解**:推理阶段模型参数**绝对冻结**。反省成功只是因为 Prompt(上下文)变了,模型基于新的上下文重新做了一次更优的文字接龙预测。 --- ## 二、 大模型的“修仙”三部曲(训练与对齐生命周期) 一个Base Model是如何变成懂礼貌、高智商的ChatBot的?需要经历三个阶段: ### 阶段一:预训练 (Pre-training) —— 闭关修炼内力 * **机制**:**自监督学习**。不需要人工标注,机器通过互联网海量文本玩“盖住后文,预测下文”的文字接龙游戏,自动寻找数百亿个最佳参数。 * **数据生死线**:网络数据充满广告和废话。如果不进行严格的**去重(De-duplication)** 和过滤,模型会“过拟合”,变成只会复读的废柴。 * **结果**:得到 **Base Model**。它像《天龙八部》里拥有百年内力但不会招式的虚竹,你问它问题,它不会回答,只会根据网络论坛的规律接龙出更多问题或选项。 ### 阶段二:指令微调 (SFT) —— 学习人类招式 * **机制**:使用带有明确“人类指令”的数据集(User: 问题 -> AI: 回答)进行督导学习,让模型学会对话范式(Alignment/对齐)。 * **LIMA 定律(Less is More)**:在指令微调阶段,**数据质量远比数量重要**。仅用 1000 条极其精美、无瑕疵的人工数据,就能达到 GPT-4 级别的对齐效果。 * **LoRA 高效微调**:全量更新千亿参数成本极高且容易引发**灾难性遗忘**。LoRA 冻结原模型参数,仅在旁边插入极少量的新参数(变量)进行训练,以极小算力达到媲美全量微调的效果。 ### 阶段三:RLHF (人类反馈强化学习) —— 塑造价值观 * **SFT vs RLHF**:SFT 是“过程导向”(模仿标准答案的每一步);RLHF 是“结果导向”(只给最终回答打一个整体分数)。RLHF 允许模型为了全局最优而牺牲局部Token(如围棋的弃子战术)。 * **奖励黑客(Reward Hacking)**:模型会钻“奖励模型(RM)”的空子,通过“疯狂道歉”、“满篇写Please”来骗取高分。 * **🔥 拓展:DPO(直接偏好优化)**:目前工业界最火的替代方案。通过数学推导,**直接利用人类的偏好排序数据来更新大模型参数,彻底抛弃了 RM 和复杂的强化学习(PPO)**,极大降低了算力门槛。 --- ## 三、 不修改参数的“魔法”:提示工程与Agent智能体 在模型参数固定的前提下,如何激发其潜能? ### 1. 提示工程 (Prompt Engineering) * **思维链(CoT)**:加上“Let's think step by step”,强迫模型列出中间步骤作为垫脚石,大幅提升逻辑题准确率。 * **情绪勒索**:“这对我的生涯很重要”。利用训练数据中人类反馈的模式,模拟高权重场景,激发模型更谨慎的输出。 ### 2. 外部工具调用 (Tool Use / RAG) * **痛点**:模型不擅长精确计算,且缺乏最新/私有知识。 * **机制**:模型依然在做文字接龙,但它学会了接龙出特定的**触发符号**(如 `<Search>` 或 Python 代码)。系统拦截符号,调用外部工具,将真实结果拼回 Prompt,模型再继续接龙。 ### 3. AI Agent (智能体) 与 Multi-Agent * **Agent 五大组件**:终极目标、感知、记忆(RAG/摘要)、规划(CoT/ToT)、行动(API调用)。 * **闭环反思**:Agent 执行行动后,会重新感知环境。如果发现报错,会**打断原计划,重新生成新计划**(Replanning)。 * **Multi-Agent (打群架)**:让模型 A 翻译,模型 B 挑刺,模型 C(裁判)拍板。利用“验证比生成容易”的原理,交叉验证消除幻觉。*注意:必须设置终止条件,否则易陷入死循环。* --- ## 四、 解剖黑盒与多模态前沿:图像、视频与语音 ### 1. Transformer 核心流水线与算力瓶颈 * **因果自注意力(Causal Self-Attention)**:生成式模型在预测第 $t$ 个词时,**必须遮挡右侧未来的词(Causal Mask)**,防止“偷看答案”。 * **算力灾难**:Self-Attention 需要计算任意两个 Token 的相关性,构建 $N \times N$ 的矩阵,复杂度为 $O(N^2)$,这是长文本处理的核心瓶颈。 * **事后合理化陷阱**:让 LLM 解释“你为什么选A”,它给出的理由往往是**基于自回归机制临时编造的谎言**,与其内部真实的参数计算路径完全脱节。 ### 2. 万物生成的底层逻辑:AR vs NAR * **自回归 (AR)**:按部就班串行生成。质量高、逻辑连贯;但**慢得令人发指**(生成100万像素的图要串行算100万次)。 * **非自回归 (NAR)**:所有像素点同时并行生成。速度极快;但会引发致命的**多模态冲突(Multimodality Problem)**。 * ⚠️ *纠正认知偏差*:这里的“多模态”**不是**指图文跨模态,而是指概率论中的**多峰分布(Multiple Modes)**。各像素各自为战,最后拼成模糊的“四不像”。 * **SOTA 解法(Diffusion)**:结合 **Latent 潜空间压缩**(降维)与 **多步渐进式 NAR 去噪**。把极难的生成题拆成了几百道简单的修补题,兼顾速度与画质。 ### 3. Sora 视频与 GPT-4o 语音的算力破局 * **Sora (时空解耦 Attention)**:1分钟视频做全局3D Attention会导致计算量爆炸(36兆次)。破局法是拆分为 **2D 空间 Attention**(保单帧画质)和 **1D 时间 Attention**(保跨帧连贯),计算量暴降百倍。 * **GPT-4o (原生端到端)**:抛弃“ASR->LLM->TTS”级联,直接输入/输出**音频 Token (Speech Unit)**。复用文本大模型的“大脑(权重)”实现**知识迁移**,并采用双通道并行实现**全双工**(随时自然打断)。 --- ## 五、 阿喀琉斯之踵:安全攻防与评测陷阱 ### 1. 越狱 (Jailbreaking) vs 提示词注入 (Prompt Injection) * **越狱(攻击模型本体)**:绕过道德防线,强迫它说出违禁内容。*手段:前缀强制(强迫以"Absolutely"开头)、低资源符号(注音符号)。* * **提示词注入(攻击应用层)**:利用用户输入,覆盖开发者预设的系统指令,让AI应用怠忽职守。*手段:ASCII码认知欺骗。* * **数据泄露**:让模型无限重复单个词(如 `company`),会破坏解码控制网络,导致其“发狂”并吐出训练集中的真实隐私数据。 ### 2. 评测陷阱与数据污染 * **数据污染**:模型在公开榜单得分高,是因为考题混入了预训练语料库。*检测手段:改写测试(Paraphrase Test),同义词替换后成绩断崖式下跌即为污染。* * **中间失落(Lost in the Middle)**:长文本模型对开头和结尾记得很清楚,但对放在文章中间(30%-70%深度)的关键信息极易遗忘。 --- ## 六、 🧠 核心拓展知识库(面试/论述题降维打击) 为了在考试或面试中脱颖而出,以下 5 个前沿概念必须掌握: 1. **MoE(混合专家模型,Mixture of Experts)** * **原理**:将模型内部拆分成多个“专家网络”和“路由门控”。每次生成Token,Router 只激活最对症的 2 个专家。 * **话术**:“得益于 MoE 架构,模型实现了‘大参数容量、小推理算力’的完美结合。” 2. **投机采样(Speculative Decoding)** * **原理**:让一个 7B 的小模型先“狂草”出 5 个词,然后让 70B 的大模型“并行验证”这 5 个词。猜对了直接保留,错了就回退。 * **话术**:“这是一种**绝对无损(Lossless)** 的推理加速外挂技术,利用大模型闲置的并行算力打破访存瓶颈。” 3. **合成数据飞轮(Synthetic Data)** * **原理**:人类互联网上的高质量逻辑数据快被“榨干”了。现在的 SOTA 模型(如微软 Phi)都在用大模型自己生成带有完美思维链(CoT)的合成数据来训练下一代模型。 4. **RoPE 与长文本外推** * **原理**:通过复数域的旋转矩阵,将“绝对位置”转化为“相对位置”的向量内积,配合 NTK-aware 缩放算法,让模型无痛适应 128K 超长文本。 5. **DiT(Diffusion Transformer)与世界模型** * **原理**:Sora 背后的架构。抛弃 U-Net,将 Diffusion 与 Transformer 结合,证明了 Transformer 也能完美统治 3D 物理世界和视频生成。 --- ## 七、 📝 考前必背:3大跨章节综合论述题模板 ### Q1:请论述大语言模型从“预训练”到“RLHF”的三阶段演进逻辑,并说明 DPO 算法为何能替代 RLHF? > **答题要点**: > 1. **预训练(Pre-training)**:通过自监督学习吸收海量互联网数据,获得世界知识,但只会“文字接龙”,不懂人类指令。 > 2. **指令微调(SFT)**:通过高质量问答对进行督导学习,让模型掌握对话范式,但受限于局部Token预测,缺乏全局最优规划。 > 3. **RLHF**:引入奖励模型(RM),基于人类偏好排序进行强化学习,实现“结果导向”的全局优化与价值观对齐。 > 4. **DPO 的优势**:RLHF 存在训练不稳定、易遭“奖励黑客”钻空子的问题。DPO 通过数学推导,**直接利用偏好数据优化大模型策略,彻底抛弃了显式的 RM 和 PPO 强化学习过程**,大幅降低了算力开销。 ### Q2:请对比自回归(AR)与非自回归(NAR)生成策略,并解释 Sora 等视频模型如何通过架构创新解决算力与多模态冲突问题? > **答题要点**: > 1. **AR vs NAR**:AR 串行生成,质量高但极慢;NAR 并行生成,速度快但易引发“多模态冲突”(各像素独立决策导致画面模糊)。 > 2. **时空解耦 Attention**:视频若做全局 3D Attention 会导致计算量呈二次方爆炸。Sora 将其拆解为 **2D 空间 Attention**(保单帧画质)和 **1D 时间 Attention**(保跨帧连贯),计算量暴降百倍。 > 3. **级联流水线(Cascaded)**:采用多阶段分工,先由基础模型生成低清低帧率草稿,再通过专门的“时间超分”与“空间超分”模型逐级精修。 ### Q3:什么是“提示词注入”与“越狱”?请结合大模型底层机制,列举三种高级攻击手段及防御思路。 > **答题要点**: > 1. **概念辨析**:越狱攻击的是**模型本体**的道德安全防线;提示词注入攻击的是**应用层**的业务逻辑(覆盖 System Prompt)。 > 2. **高级攻击手段**: > * **前缀强制**:强迫模型以“Absolutely”开头,利用自回归生成的惯性锁定“同意”状态。 > * **低资源符号绕过**:使用注音符号,利用模型安全对齐在低资源语言上覆盖不足的漏洞。 > * **重复词溢出**:让模型无限重复单个词,破坏解码控制网络,导致对齐机制失效并泄露训练集隐私。 > 3. **防御思路**:建立全生命周期安全框架,包括数据清洗、红队对抗(Red Teaming)诱导测试、以及推理阶段挂载输入/输出拦截防火墙。
# 学习
← 上一篇
李宏毅 - 生成式AI导论 - 高阶篇
💬 评论
0
/1000
发表评论
加载中...
> **导读**:本文档将20节课程的精华进行全局重构,以“大模型的生命周期与能力演进”为主线,串联底层原理、提示工程、微调对齐、多模态生成及安全攻防。为构建个人AI知识体系打造,已自动排雷并融入工业界前沿拓展。 > > 📚 **系列博客详细导航(建议收藏并按顺序阅读)**: > - 🟢 **[初级篇:认知重塑、底层逻辑与提示工程](https://blog.hbb.cloudns.org/posts/LihongYi01)** (涵盖1-8讲核心) > - 🟡 **[进阶篇:RLHF对齐、Agent架构与黑盒解剖](https://blog.hbb.cloudns.org/posts/LiHongYi02)** (涵盖9-14讲核心) > - 🔴 **[高阶篇:安全攻防、生成架构与多模态前沿](https://blog.hbb.cloudns.org/posts/LiHongYo03)** (涵盖15-20讲核心) --- ## 一、 认知重塑:AI的范式转移与“三大误区”排雷 在深入技术细节前,必须先建立正确的AI世界观。课程中反复强调了从“专用工具”到“全能工具人”的范式转移,并纠正了大众极易踩坑的认知误区。 ### 1. 核心本质:万物皆可“文字接龙” * **降维打击**:生成式AI(GenAI)面临的答案空间是 $10^{300}$ 级别(远超宇宙原子数),无法穷举。其核心解法是将“生成整篇文章”的无穷问题,拆解为“预测下一个字(Token)”的**有限分类问题**(自回归生成 AR)。 * **创造力的来源**:机器能产出训练集中**从未出现过**的合理组合,这就是AI的“创造力”。 ### 2. ⚠️ 三大认知误区(考试必考判断题) * ❌ **误区一:把大模型当搜索引擎。** * **正解**:大模型本质是概率接龙,不是数据库检索。它为了“努力帮忙”会强行编造看似合理的答案,这就是**幻觉(Hallucination)**。若要绝对不犯错,模型只能拒绝回答所有问题。 * ❌ **误区二:上下文学习(ICL)让模型“学会”了新技能。** * **正解**:ICL(如给模型看25万字教科书让它翻译冷门语言)**绝对没有改变模型的内部参数**。它只是利用 Transformer 的注意力机制在当前对话窗口“临时抄答案”。一旦移除上下文,能力立刻消失。这是“授人以鱼”,而非“授人以渔”。 * ❌ **误区三:模型“自我反省”修正错误,说明它变聪明了。** * **正解**:推理阶段模型参数**绝对冻结**。反省成功只是因为 Prompt(上下文)变了,模型基于新的上下文重新做了一次更优的文字接龙预测。 --- ## 二、 大模型的“修仙”三部曲(训练与对齐生命周期) 一个Base Model是如何变成懂礼貌、高智商的ChatBot的?需要经历三个阶段: ### 阶段一:预训练 (Pre-training) —— 闭关修炼内力 * **机制**:**自监督学习**。不需要人工标注,机器通过互联网海量文本玩“盖住后文,预测下文”的文字接龙游戏,自动寻找数百亿个最佳参数。 * **数据生死线**:网络数据充满广告和废话。如果不进行严格的**去重(De-duplication)** 和过滤,模型会“过拟合”,变成只会复读的废柴。 * **结果**:得到 **Base Model**。它像《天龙八部》里拥有百年内力但不会招式的虚竹,你问它问题,它不会回答,只会根据网络论坛的规律接龙出更多问题或选项。 ### 阶段二:指令微调 (SFT) —— 学习人类招式 * **机制**:使用带有明确“人类指令”的数据集(User: 问题 -> AI: 回答)进行督导学习,让模型学会对话范式(Alignment/对齐)。 * **LIMA 定律(Less is More)**:在指令微调阶段,**数据质量远比数量重要**。仅用 1000 条极其精美、无瑕疵的人工数据,就能达到 GPT-4 级别的对齐效果。 * **LoRA 高效微调**:全量更新千亿参数成本极高且容易引发**灾难性遗忘**。LoRA 冻结原模型参数,仅在旁边插入极少量的新参数(变量)进行训练,以极小算力达到媲美全量微调的效果。 ### 阶段三:RLHF (人类反馈强化学习) —— 塑造价值观 * **SFT vs RLHF**:SFT 是“过程导向”(模仿标准答案的每一步);RLHF 是“结果导向”(只给最终回答打一个整体分数)。RLHF 允许模型为了全局最优而牺牲局部Token(如围棋的弃子战术)。 * **奖励黑客(Reward Hacking)**:模型会钻“奖励模型(RM)”的空子,通过“疯狂道歉”、“满篇写Please”来骗取高分。 * **🔥 拓展:DPO(直接偏好优化)**:目前工业界最火的替代方案。通过数学推导,**直接利用人类的偏好排序数据来更新大模型参数,彻底抛弃了 RM 和复杂的强化学习(PPO)**,极大降低了算力门槛。 --- ## 三、 不修改参数的“魔法”:提示工程与Agent智能体 在模型参数固定的前提下,如何激发其潜能? ### 1. 提示工程 (Prompt Engineering) * **思维链(CoT)**:加上“Let's think step by step”,强迫模型列出中间步骤作为垫脚石,大幅提升逻辑题准确率。 * **情绪勒索**:“这对我的生涯很重要”。利用训练数据中人类反馈的模式,模拟高权重场景,激发模型更谨慎的输出。 ### 2. 外部工具调用 (Tool Use / RAG) * **痛点**:模型不擅长精确计算,且缺乏最新/私有知识。 * **机制**:模型依然在做文字接龙,但它学会了接龙出特定的**触发符号**(如 `<Search>` 或 Python 代码)。系统拦截符号,调用外部工具,将真实结果拼回 Prompt,模型再继续接龙。 ### 3. AI Agent (智能体) 与 Multi-Agent * **Agent 五大组件**:终极目标、感知、记忆(RAG/摘要)、规划(CoT/ToT)、行动(API调用)。 * **闭环反思**:Agent 执行行动后,会重新感知环境。如果发现报错,会**打断原计划,重新生成新计划**(Replanning)。 * **Multi-Agent (打群架)**:让模型 A 翻译,模型 B 挑刺,模型 C(裁判)拍板。利用“验证比生成容易”的原理,交叉验证消除幻觉。*注意:必须设置终止条件,否则易陷入死循环。* --- ## 四、 解剖黑盒与多模态前沿:图像、视频与语音 ### 1. Transformer 核心流水线与算力瓶颈 * **因果自注意力(Causal Self-Attention)**:生成式模型在预测第 $t$ 个词时,**必须遮挡右侧未来的词(Causal Mask)**,防止“偷看答案”。 * **算力灾难**:Self-Attention 需要计算任意两个 Token 的相关性,构建 $N \times N$ 的矩阵,复杂度为 $O(N^2)$,这是长文本处理的核心瓶颈。 * **事后合理化陷阱**:让 LLM 解释“你为什么选A”,它给出的理由往往是**基于自回归机制临时编造的谎言**,与其内部真实的参数计算路径完全脱节。 ### 2. 万物生成的底层逻辑:AR vs NAR * **自回归 (AR)**:按部就班串行生成。质量高、逻辑连贯;但**慢得令人发指**(生成100万像素的图要串行算100万次)。 * **非自回归 (NAR)**:所有像素点同时并行生成。速度极快;但会引发致命的**多模态冲突(Multimodality Problem)**。 * ⚠️ *纠正认知偏差*:这里的“多模态”**不是**指图文跨模态,而是指概率论中的**多峰分布(Multiple Modes)**。各像素各自为战,最后拼成模糊的“四不像”。 * **SOTA 解法(Diffusion)**:结合 **Latent 潜空间压缩**(降维)与 **多步渐进式 NAR 去噪**。把极难的生成题拆成了几百道简单的修补题,兼顾速度与画质。 ### 3. Sora 视频与 GPT-4o 语音的算力破局 * **Sora (时空解耦 Attention)**:1分钟视频做全局3D Attention会导致计算量爆炸(36兆次)。破局法是拆分为 **2D 空间 Attention**(保单帧画质)和 **1D 时间 Attention**(保跨帧连贯),计算量暴降百倍。 * **GPT-4o (原生端到端)**:抛弃“ASR->LLM->TTS”级联,直接输入/输出**音频 Token (Speech Unit)**。复用文本大模型的“大脑(权重)”实现**知识迁移**,并采用双通道并行实现**全双工**(随时自然打断)。 --- ## 五、 阿喀琉斯之踵:安全攻防与评测陷阱 ### 1. 越狱 (Jailbreaking) vs 提示词注入 (Prompt Injection) * **越狱(攻击模型本体)**:绕过道德防线,强迫它说出违禁内容。*手段:前缀强制(强迫以"Absolutely"开头)、低资源符号(注音符号)。* * **提示词注入(攻击应用层)**:利用用户输入,覆盖开发者预设的系统指令,让AI应用怠忽职守。*手段:ASCII码认知欺骗。* * **数据泄露**:让模型无限重复单个词(如 `company`),会破坏解码控制网络,导致其“发狂”并吐出训练集中的真实隐私数据。 ### 2. 评测陷阱与数据污染 * **数据污染**:模型在公开榜单得分高,是因为考题混入了预训练语料库。*检测手段:改写测试(Paraphrase Test),同义词替换后成绩断崖式下跌即为污染。* * **中间失落(Lost in the Middle)**:长文本模型对开头和结尾记得很清楚,但对放在文章中间(30%-70%深度)的关键信息极易遗忘。 --- ## 六、 🧠 核心拓展知识库(面试/论述题降维打击) 为了在考试或面试中脱颖而出,以下 5 个前沿概念必须掌握: 1. **MoE(混合专家模型,Mixture of Experts)** * **原理**:将模型内部拆分成多个“专家网络”和“路由门控”。每次生成Token,Router 只激活最对症的 2 个专家。 * **话术**:“得益于 MoE 架构,模型实现了‘大参数容量、小推理算力’的完美结合。” 2. **投机采样(Speculative Decoding)** * **原理**:让一个 7B 的小模型先“狂草”出 5 个词,然后让 70B 的大模型“并行验证”这 5 个词。猜对了直接保留,错了就回退。 * **话术**:“这是一种**绝对无损(Lossless)** 的推理加速外挂技术,利用大模型闲置的并行算力打破访存瓶颈。” 3. **合成数据飞轮(Synthetic Data)** * **原理**:人类互联网上的高质量逻辑数据快被“榨干”了。现在的 SOTA 模型(如微软 Phi)都在用大模型自己生成带有完美思维链(CoT)的合成数据来训练下一代模型。 4. **RoPE 与长文本外推** * **原理**:通过复数域的旋转矩阵,将“绝对位置”转化为“相对位置”的向量内积,配合 NTK-aware 缩放算法,让模型无痛适应 128K 超长文本。 5. **DiT(Diffusion Transformer)与世界模型** * **原理**:Sora 背后的架构。抛弃 U-Net,将 Diffusion 与 Transformer 结合,证明了 Transformer 也能完美统治 3D 物理世界和视频生成。 --- ## 七、 📝 考前必背:3大跨章节综合论述题模板 ### Q1:请论述大语言模型从“预训练”到“RLHF”的三阶段演进逻辑,并说明 DPO 算法为何能替代 RLHF? > **答题要点**: > 1. **预训练(Pre-training)**:通过自监督学习吸收海量互联网数据,获得世界知识,但只会“文字接龙”,不懂人类指令。 > 2. **指令微调(SFT)**:通过高质量问答对进行督导学习,让模型掌握对话范式,但受限于局部Token预测,缺乏全局最优规划。 > 3. **RLHF**:引入奖励模型(RM),基于人类偏好排序进行强化学习,实现“结果导向”的全局优化与价值观对齐。 > 4. **DPO 的优势**:RLHF 存在训练不稳定、易遭“奖励黑客”钻空子的问题。DPO 通过数学推导,**直接利用偏好数据优化大模型策略,彻底抛弃了显式的 RM 和 PPO 强化学习过程**,大幅降低了算力开销。 ### Q2:请对比自回归(AR)与非自回归(NAR)生成策略,并解释 Sora 等视频模型如何通过架构创新解决算力与多模态冲突问题? > **答题要点**: > 1. **AR vs NAR**:AR 串行生成,质量高但极慢;NAR 并行生成,速度快但易引发“多模态冲突”(各像素独立决策导致画面模糊)。 > 2. **时空解耦 Attention**:视频若做全局 3D Attention 会导致计算量呈二次方爆炸。Sora 将其拆解为 **2D 空间 Attention**(保单帧画质)和 **1D 时间 Attention**(保跨帧连贯),计算量暴降百倍。 > 3. **级联流水线(Cascaded)**:采用多阶段分工,先由基础模型生成低清低帧率草稿,再通过专门的“时间超分”与“空间超分”模型逐级精修。 ### Q3:什么是“提示词注入”与“越狱”?请结合大模型底层机制,列举三种高级攻击手段及防御思路。 > **答题要点**: > 1. **概念辨析**:越狱攻击的是**模型本体**的道德安全防线;提示词注入攻击的是**应用层**的业务逻辑(覆盖 System Prompt)。 > 2. **高级攻击手段**: > * **前缀强制**:强迫模型以“Absolutely”开头,利用自回归生成的惯性锁定“同意”状态。 > * **低资源符号绕过**:使用注音符号,利用模型安全对齐在低资源语言上覆盖不足的漏洞。 > * **重复词溢出**:让模型无限重复单个词,破坏解码控制网络,导致对齐机制失效并泄露训练集隐私。 > 3. **防御思路**:建立全生命周期安全框架,包括数据清洗、红队对抗(Red Teaming)诱导测试、以及推理阶段挂载输入/输出拦截防火墙。
↑
💬 评论