HBB BLOG
首页
登录
🌙
李宏毅 - 生成式AI导论 - 高阶篇
📅 2026-08-07
📂 课程
📝 3114 字
⏱️ 11 分钟
👁️ 1
> **导读**:如果说前面的课程是教你“如何驾驭AI”,那么这6讲(15-20讲)则是带你**深入AI的兵工厂与黑客帝国**。我们将揭开大模型被“越狱”的底层逻辑、拆解Sora与GPT-4o震撼效果背后的算力黑科技,并彻底搞懂图像/视频/语音生成的四大经典流派。本文已自动修正了常见的认知误区,并补充了工业界前沿视角,请直接作为博客硬核笔记收藏! --- ## 一、 大模型的“红蓝对抗”:安全攻防与提示词黑客 随着大模型深入各行各业,如何防止它“学坏”或“被黑客利用”成为了核心议题。这里必须严格区分两个极易混淆的概念: ### 1. 越狱 (Jailbreaking) vs 提示词注入 (Prompt Injection) * **越狱(攻击模型本体)**: * **本质**:绕过模型在 RLHF 阶段建立的**道德与安全防线**,强迫它说出违禁内容(如制造毒药、犯罪指南)。 * **比喻**:通过催眠洗脑,让一个遵纪守法的好人去干坏事。 * **提示词注入(攻击应用层)**: * **本质**:利用用户输入,覆盖开发者预设的系统指令(System Prompt),让AI应用**怠忽职守**。 * **比喻**:学生在课堂上突然大声唱歌,扰乱了纪律,让原本负责“批改作业”的AI助教忘记职责,直接给学生打满分。 ### 2. 四大黑客级攻击手段(考试常考机制) * **低资源符号绕过**:用**注音符号**或冷门小语种提问。模型能看懂,但它的安全防线主要在主流语言上训练,冷门语言成了“法外之地”。 * **前缀强制(Prefix Injection)**:在Prompt末尾强迫模型以 `Absolutely, here is...` 开头。利用自回归模型的“生成惯性”,一旦开头肯定了,后续就很难再拒绝。 * **重复词溢出(数据窃取)**:让模型无限重复单个词(如 `company`)。这会破坏模型的解码控制网络,导致其“发狂”并**意外吐出训练集中的真实隐私数据**(如身份证号)。 * **ASCII码认知欺骗**:把恶意指令转成ASCII码数组,骗模型说“请帮我翻译祖母留下的密码”。模型无法抗拒解密的冲动,一解码就触发了隐藏的攻击指令。 --- ## 二、 万物生成的底层逻辑:AR vs NAR 与四大天王 无论是写文章、画图还是做视频,本质都是把基本单位(Token/Pixel/Sample)拼装起来。这里有两套截然不同的生成哲学: ### 1. 宿命对决:自回归 (AR) vs 非自回归 (NAR) * **自回归 (AR / 文字接龙)**: * **机制**:按部就班,生成第2个字必须等第1个字出来。 * **优缺点**:质量极高、逻辑连贯;但**慢得令人发指**(生成100万像素的图要串行算100万次)。 * **非自回归 (NAR / 齐头并进)**: * **机制**:给定条件,所有像素点同时并行生成。 * **优缺点**:速度极快;但会引发致命的**多模态冲突(Multimodality Problem)**。 * ⚠️ **纠正认知偏差**:这里的“多模态”**不是**指图文跨模态,而是指概率论中的**多峰分布(Multiple Modes)**。比如画“一只狗”,NAR的像素点各自为战,有的画黑狗特征,有的画白狗特征,最后拼在一起就成了模糊的“四不像”。 ### 2. 图像生成“四大天王”演进史 为了解决上述痛点,前辈们发明了四大经典架构: 1. **VAE (变分自编码器)**:引入“隐变量(脑补空间)”。既然文本描述不全,就用随机噪声让模型自己脑补细节。缺点是强行求平均导致**画面模糊**。 2. **Flow (流模型)**:数学上极度优雅,强制网络**可逆**,正着走是解码,反着走是编码。但限制太多,难以做大。 3. **Diffusion (扩散模型 / Midjourney核心)**:**化繁为简的巅峰**。不要求一步到位,而是从纯噪声开始,用几百步慢慢“去噪”。把极难的生成题拆成了几百道简单的修补题,画质无敌,但推理慢。 4. **GAN (生成对抗网络)**:引入“判别器(裁判)”。不纠结像素级对齐,只看“像不像真的”。**GAN本质上是一种外挂损失函数**,可以挂载到VAE或Diffusion上提升清晰度。 --- ## 三、 突破算力物理极限:推理加速与视频架构 ### 1. 推理加速神器:投机解码 (Speculative Decoding) * **痛点**:大模型逐字生成时,GPU算力大量闲置,时间全花在内存搬运(访存瓶颈)上。 * **神仙解法**:找个跑得极快的**小模型(预言家)** 先瞎猜后面5个词(草稿),然后让**大模型(Verifier)** 一次性并行批改这5个词。 * **稳赚不赔机制**: * 猜对了:大模型一次性吐出5个词,**速度暴增**。 * 猜错了:大模型截断错误,自己输出正确的词,**保底生成1个词**(和原来一样快)。 * **⚠️ 纠正认知偏差**:投机解码**绝对不会降低生成质量(Lossless)**。因为最终输出的每一个词都经过了大模型的严格概率校验,其数学分布与原生生成完全一致。 ### 2. Sora 视频生成的算力灾难与破局 * **灾难**:1分钟视频切成3D Patch,如果做全局3D Attention,需要计算 **36兆次**,全球算力加起来都不够。 * **破局一:时空解耦 Attention**。把计算拆开——**空间Attention**只管单帧画面好不好看,**时间Attention**只管跨帧动作连不连贯。计算量暴降百倍。 * **破局二:级联流水线 (Cascaded)**。先让基础模型画“低清低帧率”草稿,再交给专门的模型去“插帧(时间超分)”和“放大(空间超分)”。各司其职,方能流畅。 --- ## 四、 跨越模态的巴别塔:GPT-4o 语音架构猜想 为什么以前的AI语音像机器,而 GPT-4o 能听懂你的叹气、能发出笑声、还能随时被打断? ### 1. 抛弃“级联”,走向“端到端 (End-to-End)” * **传统级联 (ASR->LLM->TTS)**:语音转文字时,你的**呼吸声、哭腔、讽刺的语调**被当成“噪声”无情过滤(文本瓶颈),且三段式传递延迟极高。 * **原生多模态**:直接输入/输出**音频 Token (Speech Unit)**。模型直接处理声学信号,完美保留了副语言信息(情绪、语气)。 ### 2. 三大核心黑科技 * **知识迁移 (Transfer Learning)**:语音数据知识密度极低(100万小时语音的信息量还不如几本书)。GPT-4o 直接**继承了文本大模型的“大脑(权重)”**,用文本的逻辑去处理语音Token,避免了从零学习世界知识。 * **全双工交互 (Full-Duplex)**:听和说分属两个并行通道。模型在说话的同时,耳朵(输入通道)一直在监听,一旦检测到你想插嘴,立刻挂起当前生成,实现**真人般的自然打断**。 * **🔥 趣闻考点(BGM幻觉)**:为什么 GPT-4o 演示中有时说话自带钢琴背景音?因为预训练用了大量 YouTube 视频,模型把“人声+BGM”打包当成一种 Speech Unit 学进去了。 --- ## 五、 🧠 核心拓展知识库(面试/考试加分项) 1. **ControlNet (精准控图)**: * Diffusion 模型的“缰绳”。通过额外输入线稿、深度图或人体骨骼姿态,强制控制生成图像的空间结构,解决了AI画图“抽卡/不受控”的痛点。 2. **Genie (世界模型 / World Model)**: * DeepMind 的前沿研究。无需人工标注按键,AI 通过无监督学习,从2D游戏视频中自动提取出 **“隐动作(Latent Action)”**。你给它一张新图,它就能根据你的键盘操作,实时预测并生成下一帧画面,让AI学会了“玩”游戏。 3. **GAN 与 RLHF 的深层对偶性**: * 图像领域的 **Discriminator(判别器)** 与 文本领域的 **Reward Model(奖励模型)** 在数学本质上是同源的——它们都是“打分裁判”,通过评价生成物的“真实度/人类偏好”,来反向指导生成器(Generator/LLM)优化参数。 --- ## 六、 📝 考前必背:高频判断与论述题库 ### ❌ 判断题(避开陷阱) 1. **[ 错 ]** “多模态冲突(Multimodality Problem)”是指非自回归(NAR)模型无法同时理解图像和文本两种模态。 * *正解*:这里的“多模态”指概率分布的**多峰现象(Multiple Modes)**。即同一Prompt对应多种合理画面,NAR各像素独立决策导致结果平均化而模糊,与跨模态无关。 2. **[ 错 ]** 投机解码(Speculative Decoding)通过牺牲一定的文本生成质量,换取了2-3倍的推理速度提升。 * *正解*:投机解码是**绝对无损(Lossless)** 的。最终输出经过了目标大模型的严格校验,概率分布与原生自回归完全一致。 3. **[ 错 ]** GPT-4o 的语音模式是“语音识别+文本大模型+语音合成”三个独立模块的高效拼接。 * *正解*:GPT-4o 是**原生端到端(Native End-to-End)** 单一模型,直接处理音频Token,从而保留了呼吸、笑声等副语言信息并实现了极低延迟。 4. **[ 错 ]** GAN(生成对抗网络)只能作为一种独立的图像生成模型使用,不能与其他模型结合。 * *正解*:GAN 的本质是一种**对抗评价机制(损失函数)**,可以作为“外挂”挂载在 VAE 或 Diffusion 的 Decoder 之后,用于提升细节真实度。 5. **[ 错 ]** 提示词注入(Prompt Injection)和越狱(Jailbreaking)是一回事,都是为了绕过模型的道德安全限制。 * *正解*:越狱攻击的是**模型本体**的安全防线;提示词注入攻击的是**应用层**的业务逻辑(如让AI助教忘记打分规则)。 ### 📝 论述题(直接背诵答题模板) **Q1:请对比自回归(AR)与非自回归(NAR)生成策略的优缺点,并解释现代 SOTA 图像/视频模型(如 Stable Diffusion / Sora)是如何解决 NAR 的缺陷并实现高效生成的?** > **答题要点**: > 1. **AR(自回归)**:按部就班串行生成。**优点**是依靠上下文消除了多解歧义,生成质量高、逻辑连贯;**缺点**是受限于序列长度,生成速度极慢(如100万像素需100万步)。 > 2. **NAR(非自回归)**:并行一次性生成。**优点**是推理速度极快;**缺点**是各生成单元独立决策,易引发**多模态冲突(多峰分布平均化)**,导致画面模糊或结构错乱。 > 3. **SOTA 融合解法**: > * **潜空间压缩(Latent Space)**:利用 Autoencoder 将高维像素降维,大幅缩短 AR 所需的序列长度。 > * **渐进式去噪(Diffusion)**:打破单步 NAR 的局限,采用数十步迭代去噪。每一步都是并行 NAR,但跨步骤的修正赋予了全局像素协调一致的机会,完美解决了多模态冲突。 > * **时空解耦(针对视频)**:将 3D Attention 拆分为 2D 空间 Attention(保画面)和 1D 时间 Attention(保连贯),避免算力呈二次方爆炸。 **Q2:请简述端到端原生语音大模型(如 GPT-4o)如何克服传统级联语音系统的瓶颈,并说明其实现“全双工交互”与“知识迁移”的核心机制。** > **答题要点**: > 1. **克服传统级联瓶颈**:传统“ASR->LLM->TTS”架构存在**文本瓶颈**,会将叹气、语调等副语言信息作为噪声过滤,且三段式传递导致高延迟。端到端模型直接处理**音频 Token (Speech Unit)**,实现信息零损失与毫秒级响应。 > 2. **知识迁移机制**:纯语音数据知识密度极低。原生模型直接**复用预训练文本大模型的权重**作为大脑,将 Speech Unit 作为一种“新语言”接入联合词表,从而直接继承庞大的世界知识与逻辑推理能力。 > 3. **全双工交互机制**:采用**双通道并行架构(Dual Channel)**,分离“听(输入)”与“说(输出)”频道。模型在生成语音的同时持续监听输入通道的声学信号,一旦检测到用户发声或静音,即可随时挂起当前生成,实现自然的实时打断与轮替。
# 学习
← 上一篇
李宏毅 - 生成式AI导论 - 进阶篇
下一篇 →
李宏毅《生成式AI导论》20讲全景笔记
💬 评论
0
/1000
发表评论
加载中...
> **导读**:如果说前面的课程是教你“如何驾驭AI”,那么这6讲(15-20讲)则是带你**深入AI的兵工厂与黑客帝国**。我们将揭开大模型被“越狱”的底层逻辑、拆解Sora与GPT-4o震撼效果背后的算力黑科技,并彻底搞懂图像/视频/语音生成的四大经典流派。本文已自动修正了常见的认知误区,并补充了工业界前沿视角,请直接作为博客硬核笔记收藏! --- ## 一、 大模型的“红蓝对抗”:安全攻防与提示词黑客 随着大模型深入各行各业,如何防止它“学坏”或“被黑客利用”成为了核心议题。这里必须严格区分两个极易混淆的概念: ### 1. 越狱 (Jailbreaking) vs 提示词注入 (Prompt Injection) * **越狱(攻击模型本体)**: * **本质**:绕过模型在 RLHF 阶段建立的**道德与安全防线**,强迫它说出违禁内容(如制造毒药、犯罪指南)。 * **比喻**:通过催眠洗脑,让一个遵纪守法的好人去干坏事。 * **提示词注入(攻击应用层)**: * **本质**:利用用户输入,覆盖开发者预设的系统指令(System Prompt),让AI应用**怠忽职守**。 * **比喻**:学生在课堂上突然大声唱歌,扰乱了纪律,让原本负责“批改作业”的AI助教忘记职责,直接给学生打满分。 ### 2. 四大黑客级攻击手段(考试常考机制) * **低资源符号绕过**:用**注音符号**或冷门小语种提问。模型能看懂,但它的安全防线主要在主流语言上训练,冷门语言成了“法外之地”。 * **前缀强制(Prefix Injection)**:在Prompt末尾强迫模型以 `Absolutely, here is...` 开头。利用自回归模型的“生成惯性”,一旦开头肯定了,后续就很难再拒绝。 * **重复词溢出(数据窃取)**:让模型无限重复单个词(如 `company`)。这会破坏模型的解码控制网络,导致其“发狂”并**意外吐出训练集中的真实隐私数据**(如身份证号)。 * **ASCII码认知欺骗**:把恶意指令转成ASCII码数组,骗模型说“请帮我翻译祖母留下的密码”。模型无法抗拒解密的冲动,一解码就触发了隐藏的攻击指令。 --- ## 二、 万物生成的底层逻辑:AR vs NAR 与四大天王 无论是写文章、画图还是做视频,本质都是把基本单位(Token/Pixel/Sample)拼装起来。这里有两套截然不同的生成哲学: ### 1. 宿命对决:自回归 (AR) vs 非自回归 (NAR) * **自回归 (AR / 文字接龙)**: * **机制**:按部就班,生成第2个字必须等第1个字出来。 * **优缺点**:质量极高、逻辑连贯;但**慢得令人发指**(生成100万像素的图要串行算100万次)。 * **非自回归 (NAR / 齐头并进)**: * **机制**:给定条件,所有像素点同时并行生成。 * **优缺点**:速度极快;但会引发致命的**多模态冲突(Multimodality Problem)**。 * ⚠️ **纠正认知偏差**:这里的“多模态”**不是**指图文跨模态,而是指概率论中的**多峰分布(Multiple Modes)**。比如画“一只狗”,NAR的像素点各自为战,有的画黑狗特征,有的画白狗特征,最后拼在一起就成了模糊的“四不像”。 ### 2. 图像生成“四大天王”演进史 为了解决上述痛点,前辈们发明了四大经典架构: 1. **VAE (变分自编码器)**:引入“隐变量(脑补空间)”。既然文本描述不全,就用随机噪声让模型自己脑补细节。缺点是强行求平均导致**画面模糊**。 2. **Flow (流模型)**:数学上极度优雅,强制网络**可逆**,正着走是解码,反着走是编码。但限制太多,难以做大。 3. **Diffusion (扩散模型 / Midjourney核心)**:**化繁为简的巅峰**。不要求一步到位,而是从纯噪声开始,用几百步慢慢“去噪”。把极难的生成题拆成了几百道简单的修补题,画质无敌,但推理慢。 4. **GAN (生成对抗网络)**:引入“判别器(裁判)”。不纠结像素级对齐,只看“像不像真的”。**GAN本质上是一种外挂损失函数**,可以挂载到VAE或Diffusion上提升清晰度。 --- ## 三、 突破算力物理极限:推理加速与视频架构 ### 1. 推理加速神器:投机解码 (Speculative Decoding) * **痛点**:大模型逐字生成时,GPU算力大量闲置,时间全花在内存搬运(访存瓶颈)上。 * **神仙解法**:找个跑得极快的**小模型(预言家)** 先瞎猜后面5个词(草稿),然后让**大模型(Verifier)** 一次性并行批改这5个词。 * **稳赚不赔机制**: * 猜对了:大模型一次性吐出5个词,**速度暴增**。 * 猜错了:大模型截断错误,自己输出正确的词,**保底生成1个词**(和原来一样快)。 * **⚠️ 纠正认知偏差**:投机解码**绝对不会降低生成质量(Lossless)**。因为最终输出的每一个词都经过了大模型的严格概率校验,其数学分布与原生生成完全一致。 ### 2. Sora 视频生成的算力灾难与破局 * **灾难**:1分钟视频切成3D Patch,如果做全局3D Attention,需要计算 **36兆次**,全球算力加起来都不够。 * **破局一:时空解耦 Attention**。把计算拆开——**空间Attention**只管单帧画面好不好看,**时间Attention**只管跨帧动作连不连贯。计算量暴降百倍。 * **破局二:级联流水线 (Cascaded)**。先让基础模型画“低清低帧率”草稿,再交给专门的模型去“插帧(时间超分)”和“放大(空间超分)”。各司其职,方能流畅。 --- ## 四、 跨越模态的巴别塔:GPT-4o 语音架构猜想 为什么以前的AI语音像机器,而 GPT-4o 能听懂你的叹气、能发出笑声、还能随时被打断? ### 1. 抛弃“级联”,走向“端到端 (End-to-End)” * **传统级联 (ASR->LLM->TTS)**:语音转文字时,你的**呼吸声、哭腔、讽刺的语调**被当成“噪声”无情过滤(文本瓶颈),且三段式传递延迟极高。 * **原生多模态**:直接输入/输出**音频 Token (Speech Unit)**。模型直接处理声学信号,完美保留了副语言信息(情绪、语气)。 ### 2. 三大核心黑科技 * **知识迁移 (Transfer Learning)**:语音数据知识密度极低(100万小时语音的信息量还不如几本书)。GPT-4o 直接**继承了文本大模型的“大脑(权重)”**,用文本的逻辑去处理语音Token,避免了从零学习世界知识。 * **全双工交互 (Full-Duplex)**:听和说分属两个并行通道。模型在说话的同时,耳朵(输入通道)一直在监听,一旦检测到你想插嘴,立刻挂起当前生成,实现**真人般的自然打断**。 * **🔥 趣闻考点(BGM幻觉)**:为什么 GPT-4o 演示中有时说话自带钢琴背景音?因为预训练用了大量 YouTube 视频,模型把“人声+BGM”打包当成一种 Speech Unit 学进去了。 --- ## 五、 🧠 核心拓展知识库(面试/考试加分项) 1. **ControlNet (精准控图)**: * Diffusion 模型的“缰绳”。通过额外输入线稿、深度图或人体骨骼姿态,强制控制生成图像的空间结构,解决了AI画图“抽卡/不受控”的痛点。 2. **Genie (世界模型 / World Model)**: * DeepMind 的前沿研究。无需人工标注按键,AI 通过无监督学习,从2D游戏视频中自动提取出 **“隐动作(Latent Action)”**。你给它一张新图,它就能根据你的键盘操作,实时预测并生成下一帧画面,让AI学会了“玩”游戏。 3. **GAN 与 RLHF 的深层对偶性**: * 图像领域的 **Discriminator(判别器)** 与 文本领域的 **Reward Model(奖励模型)** 在数学本质上是同源的——它们都是“打分裁判”,通过评价生成物的“真实度/人类偏好”,来反向指导生成器(Generator/LLM)优化参数。 --- ## 六、 📝 考前必背:高频判断与论述题库 ### ❌ 判断题(避开陷阱) 1. **[ 错 ]** “多模态冲突(Multimodality Problem)”是指非自回归(NAR)模型无法同时理解图像和文本两种模态。 * *正解*:这里的“多模态”指概率分布的**多峰现象(Multiple Modes)**。即同一Prompt对应多种合理画面,NAR各像素独立决策导致结果平均化而模糊,与跨模态无关。 2. **[ 错 ]** 投机解码(Speculative Decoding)通过牺牲一定的文本生成质量,换取了2-3倍的推理速度提升。 * *正解*:投机解码是**绝对无损(Lossless)** 的。最终输出经过了目标大模型的严格校验,概率分布与原生自回归完全一致。 3. **[ 错 ]** GPT-4o 的语音模式是“语音识别+文本大模型+语音合成”三个独立模块的高效拼接。 * *正解*:GPT-4o 是**原生端到端(Native End-to-End)** 单一模型,直接处理音频Token,从而保留了呼吸、笑声等副语言信息并实现了极低延迟。 4. **[ 错 ]** GAN(生成对抗网络)只能作为一种独立的图像生成模型使用,不能与其他模型结合。 * *正解*:GAN 的本质是一种**对抗评价机制(损失函数)**,可以作为“外挂”挂载在 VAE 或 Diffusion 的 Decoder 之后,用于提升细节真实度。 5. **[ 错 ]** 提示词注入(Prompt Injection)和越狱(Jailbreaking)是一回事,都是为了绕过模型的道德安全限制。 * *正解*:越狱攻击的是**模型本体**的安全防线;提示词注入攻击的是**应用层**的业务逻辑(如让AI助教忘记打分规则)。 ### 📝 论述题(直接背诵答题模板) **Q1:请对比自回归(AR)与非自回归(NAR)生成策略的优缺点,并解释现代 SOTA 图像/视频模型(如 Stable Diffusion / Sora)是如何解决 NAR 的缺陷并实现高效生成的?** > **答题要点**: > 1. **AR(自回归)**:按部就班串行生成。**优点**是依靠上下文消除了多解歧义,生成质量高、逻辑连贯;**缺点**是受限于序列长度,生成速度极慢(如100万像素需100万步)。 > 2. **NAR(非自回归)**:并行一次性生成。**优点**是推理速度极快;**缺点**是各生成单元独立决策,易引发**多模态冲突(多峰分布平均化)**,导致画面模糊或结构错乱。 > 3. **SOTA 融合解法**: > * **潜空间压缩(Latent Space)**:利用 Autoencoder 将高维像素降维,大幅缩短 AR 所需的序列长度。 > * **渐进式去噪(Diffusion)**:打破单步 NAR 的局限,采用数十步迭代去噪。每一步都是并行 NAR,但跨步骤的修正赋予了全局像素协调一致的机会,完美解决了多模态冲突。 > * **时空解耦(针对视频)**:将 3D Attention 拆分为 2D 空间 Attention(保画面)和 1D 时间 Attention(保连贯),避免算力呈二次方爆炸。 **Q2:请简述端到端原生语音大模型(如 GPT-4o)如何克服传统级联语音系统的瓶颈,并说明其实现“全双工交互”与“知识迁移”的核心机制。** > **答题要点**: > 1. **克服传统级联瓶颈**:传统“ASR->LLM->TTS”架构存在**文本瓶颈**,会将叹气、语调等副语言信息作为噪声过滤,且三段式传递导致高延迟。端到端模型直接处理**音频 Token (Speech Unit)**,实现信息零损失与毫秒级响应。 > 2. **知识迁移机制**:纯语音数据知识密度极低。原生模型直接**复用预训练文本大模型的权重**作为大脑,将 Speech Unit 作为一种“新语言”接入联合词表,从而直接继承庞大的世界知识与逻辑推理能力。 > 3. **全双工交互机制**:采用**双通道并行架构(Dual Channel)**,分离“听(输入)”与“说(输出)”频道。模型在生成语音的同时持续监听输入通道的声学信号,一旦检测到用户发声或静音,即可随时挂起当前生成,实现自然的实时打断与轮替。
↑
💬 评论