HBB BLOG
首页
登录
🌙
李宏毅 - 生成式AI导论 - 初级篇
📅 2026-08-07
📂 课程
📝 3361 字
⏱️ 12 分钟
👁️ 11
> **导读**:本文档将8节课程的核心精华进行了系统化重组,从底层原理(文字接龙)到前沿应用(Multi-Agent),专为期末考试与知识体系构建打造。文中已自动修正了部分常见的认知偏差,并拓展了工业界前沿视角,非常适合直接作为博客笔记随时复习。 --- ## 一、 认知重塑:AI的范式转移与生命周期 ### 1. 从“专用工具”到“全能工具人” * **过去(专才)**:AI 是单一功能的工具(如 Google 翻译、垃圾邮件分类器),被动执行预设功能。 * **现在(通才/工具人)**:以 ChatGPT 为代表的生成式 AI 没有特定功能,需靠**指令(Prompt)驱动**。它的能力边界取决于用户的提问方式。 * **隐喻**:《葬送的芙莉莲》中,80年前无敌的“杀人魔法”如今被普通防御挡住。这映射了 AI 领域的 **SOTA(当前最优)模型贬值极快**,不要神话现有技术,掌握底层原理才能应对技术迭代。 ### 2. 技术的“半衰期”与 ArXiv 生态 * **技术迭代速度**:AI 领域以“月/周”为单位迭代。2019年“毁天灭地”的 GPT-2(15亿参数),如今只是课堂作业模型(70亿参数)的 1/4。 * **ArXiv 的重要性**:传统国际会议审稿需 1.5 年,技术发表即过时。因此,AI 研究者优先在 **ArXiv(预印本平台)** 发布论文,抢占首发权。 ### 3. 评估的困境:“哈哈哈100次”实验 * **现象**:让模型说100次“哈哈哈”。Gemini 做了500次(过度顺从),TaiDe 做一半觉得没意义停止,GPT-3.5 直接拒绝。 * **本质**:生成式 AI 的答案空间无限,**没有绝对的标准答案**。评估高度主观,取决于用户对“听话”与“智能”的权衡。 * **幻觉(Hallucination)的真相**:模型犯错并非故意欺骗,而是为了“努力帮忙”强行生成看似合理的答案。若要完全不犯错,模型只能拒绝回答所有问题。 --- ## 二、 底层逻辑:万物皆可“文字接龙” ### 1. 概念辨析:AI、ML 与 GenAI * **AI(人工智能)**:一个模糊的**目标**(让机器展现智慧)。 * **ML(机器学习)**:实现目标的**手段**(让机器自动从数据中找函数参数)。 * **GenAI(生成式AI)**:明确的**子目标**(产生复杂、有结构、**无法穷举**的物件,如文章、图像)。 * *拓展*:分类(Classification)是在有限选项中做选择题;生成(Generation)是在 $10^{300}$ 种可能性中写作文。 ### 2. 核心机制:自回归生成(Auto-regressive Generation) * **降维打击**:将“生成整篇文章”的无穷问题,拆解为“预测下一个字(Token)”的**有限分类问题**(从几千个常用字中选概率最高的一个)。 * **创造力来源**:机器能产出训练集中**从未出现过**的合理组合,这就是 AI 的“创造力”。 ### 3. 大模型的“修仙”第一阶段:预训练(Pre-training) * **自监督学习**:不需要人工标注,机器通过互联网海量文本玩“盖住后文,预测下文”的文字接龙游戏,自动寻找数百亿个最佳参数。 * **数据清洗的生死线**:网络数据充满广告和废话。如果不进行严格的**去重(De-duplication)** 和过滤,模型会“过拟合(Overfitting)”,变成只会复读的废柴。 * **Base Model 的“答非所问”**:刚预训练完的模型(如早期的 GPT-3)像《天龙八部》里拥有百年内力但不会招式的虚竹。你问它“机器学习是什么?”,它不会解释,而是根据网络论坛的规律,接龙出“这门课好不好过?”或四个选择题选项。**它只会接龙,不会回答问题。** --- ## 三、 不修改参数的“魔法”:提示工程 (Prompt Engineering) 在模型参数固定(冻结)的前提下,通过优化输入来激发潜能。 ### 1. 神奇咒语与心理暗示 * **思维链(CoT, Chain of Thought)**:加上“Let's think step by step”,强迫模型列出中间步骤。本质是利用文字接龙特性,用中间步骤作为垫脚石,大幅提升数学/逻辑题准确率。 * **情绪勒索**:“这对我的生涯很重要”、“做不好会受罚”。利用训练数据中人类反馈的模式,模拟高权重场景,激发模型更谨慎的输出。(注:说“请/谢谢”等礼貌用语通常无显著效果)。 ### 2. 上下文学习(ICL, In-Context Learning) * **机制**:提供几个范例(Few-shot)或长篇背景资料(如25万字的卡拉蒙语教科书),让模型模仿。 * **⚠️ 核心考点(极易错)**:**ICL 绝对没有改变模型的内部参数!** 它只是利用 Transformer 的注意力机制在当前对话窗口“临时抄答案”。一旦移除上下文(教科书),能力立刻消失。这是“授人以鱼”,而非“授人以渔”。 ### 3. 高阶推理:ToT 与 自我反省 * **自我反省(Reflection)**:让模型检查自己的答案。注意,反省成功**不是因为模型变聪明了(参数未变)**,而是基于新的上下文重新做了一次更优的文字接龙。 * **自我一致性(Self-Consistency)**:模型输出本质是**概率分布+掷骰子**。让模型回答同一问题多次,取“多数决(Majority Vote)”,可有效过滤偶然错误。 * **思维树(ToT)**:任务拆解 + 多分支采样(掷骰子) + 自我评估,是解决复杂问题的究极形态。 ### 4. 外部工具调用(Tool Use / RAG) * **痛点**:模型不擅长精确计算,且缺乏最新/私有知识。 * **机制**:模型依然在做文字接龙,但它学会了接龙出特定的**触发符号**(如 `<Search>` 或 Python 代码)。系统拦截符号,调用搜索引擎或代码解释器,将真实结果拼回 Prompt,模型再继续接龙。 * *纠正*:GPT-4 展现出的“写代码->执行->报错->修正”的工程师闭环能力,**并非纯文本模型自带**,而是结合了**代码解释器(Code Interpreter)** 等外部工具的结果。 --- ## 四、 进阶架构:多智能体协作 (Multi-Agent) 单一模型容易陷入幻觉或逻辑死胡同,通过“打群架”可实现群体智能。 ### 1. 多模型辩论(Debate)与裁判机制 * 让模型 A 翻译,模型 B 挑刺,模型 C(裁判)拍板。利用“验证比生成容易”的原理,交叉验证消除幻觉。 * **避坑指南**:必须设置终止条件或引入独立裁判,否则两个模型会陷入无限死循环或达成“错误的共识”。 ### 2. 角色扮演流水线(如 ChatDev) * 通过 Prompt 赋予模型不同职业(产品经理、程序员、测试员),形成流水线。 * **本质**:利用**角色设定(Persona)** 限制模型的发散空间,强迫其专注特定任务,将复杂的软件工程降维成模型易于处理的单步小任务。 --- ## 五、 改动参数的“手术”:指令微调与开源革命 如何让“只会接龙”的 Base Model 变成“听懂人话”的 ChatBot? ### 1. 大模型的“修仙”第二阶段:指令微调(Instruction Tuning) * 使用带有明确“人类指令”的数据集(User: 问题 -> AI: 回答)进行督导学习,让模型学会对话范式(Alignment/对齐)。 * **数据之争**: * *Google FLAN 路线*:使用学术界死板的 NLP 数据集(如阅读理解),模型懂语法但不懂聊天。 * *OpenAI InstructGPT 路线*:收集**真实用户**的高频提问(写诗、写代码、请假条),模型高度契合人类意图,完成降维打击。 ### 2. 高效微调:LoRA 与 Adapter * 全量更新千亿参数成本极高且容易引发**灾难性遗忘**(学了新知识,忘了旧知识)。 * **LoRA 机制**:冻结原模型参数,仅在旁边插入极少量的新参数(变量)进行训练。以极小算力达到媲美全量微调的效果。 ### 3. 开源逆袭与 LIMA 定律 * **逆向工程(Alpaca)**:开源社区没有真实用户数据,就用强大的 ChatGPT 自动生成问答对,喂给开源底座(如 LLaMA)学习,打破数据垄断。 * **LIMA 定律(Less is More)**:在指令微调阶段,**数据质量远比数量重要**。仅用 1000 条极其精美、无瑕疵的人工数据,就能达到 GPT-4 级别的对齐效果。 --- ## 六、 🧠 核心拓展知识库(面试/考试加分项) 为了应对深度考试或面试,以下概念需额外掌握: 1. **Temperature(温度参数)**: * 控制模型“掷骰子”的随机性。`Temperature = 0` 时,模型总是选概率最高的词(确定性,适合代码/数学);`Temperature > 0` 时,引入随机性(创造性,适合写诗/头脑风暴)。 2. **RLHF(基于人类反馈的强化学习)**: * InstructGPT 背后的终极武器。在指令微调之后,让人类对模型的多个回答进行排序,训练一个“奖励模型(Reward Model)”,再用强化学习(PPO)优化大模型,使其符合人类的道德观和价值观(防越狱、防歧视)。 3. **Attention Mechanism(注意力机制)**: * ICL(上下文学习)之所以有效,全靠 Transformer 架构中的 Attention。它允许模型在生成下一个词时,回头看 Prompt 中的每一个字,并分配权重。这就是模型能在 25 万字教科书中“精准抄答案”的物理基础。 4. **Catastrophic Forgetting(灾难性遗忘)**: * 神经网络在微调(Fine-tuning)学习新领域知识时,会覆盖掉预训练阶段学到的通用知识。这就是为什么讲师说微调像“大脑手术”,风险极高,通常需要配合 LoRA 或混合回放技术来缓解。 --- ## 七、 📝 考前必背:高频判断题与论述题题库 ### ❌ 判断题(避开陷阱) 1. **[ 错 ]** 课程主要教授如何熟练使用 ChatGPT 的各种提示词技巧。 * *正解*:具体技巧易过时,课程核心是理解底层原理(从观众到魔术师)。 2. **[ 错 ]** 语言模型在经历多次“自我反省”并修正错误后,其内部参数得到了升级。 * *正解*:推理阶段参数**绝对冻结**。反省成功只是因为 Prompt(上下文)变了,模型做出了新的预测。 3. **[ 错 ]** GPT-3 刚完成预训练时,可以直接像现在的 ChatGPT 一样完美回答问题。 * *正解*:预训练模型只会“文字接龙”,面对提问可能会接龙出更多问题或选项,必须经过指令微调。 4. **[ 错 ]** 在多模型讨论中,只要让模型无限制互相讨论,最终一定能得到绝对正确的答案。 * *正解*:极易陷入死循环或“错误共识”,必须引入裁判模型或限制回合数。 5. **[ 错 ]** 在指令微调阶段,数据量越大,模型表现一定越好。 * *正解*:LIMA 定律证明,Alignment 阶段**质量远重于数量**,1000条高质量数据胜过数万条低质数据。 ### 📝 论述题(直接背诵答题模板) **Q1:请结合“文字接龙”与“排列组合”,论述生成式AI如何解决“从无穷可能性中生成合理内容”的难题?** > **答题要点**: > 1. **量级差异**:生成任务(如写文章)的组合空间极大(如 $10^{300}$),远超宇宙原子数,传统穷举搜索完全失效。 > 2. **化整为零(自回归)**:通过“文字接龙”策略,将生成整段话拆解为一系列“预测下一个字”的步骤。 > 3. **降维打击**:每一步预测本质上是一个**分类问题**。常用汉字仅几千个,机器只需在有限选项中计算概率并选出最高者。 > 4. **总结**:通过深度学习强大的概率拟合能力,机器将“无穷生成”降维为“有限分类”序列,从而展现出创造力。 **Q2:请简述大语言模型调用外部工具(如 RAG 或 代码解释器)的底层运行机制,及其解决的先天缺陷。** > **答题要点**: > 1. **先天缺陷**:大模型存在幻觉、缺乏实时资讯,且不擅长精确数学运算。 > 2. **核心本质**:模型底层依然在做**文字接龙**,但学会了生成特定的**触发符号/代码指令**。 > 3. **中断与接管**:系统检测到触发符号后,**强制暂停**模型生成,启动外部工具(搜索或运行代码)。 > 4. **反哺与接力**:系统将外部真实结果作为文本拼接到原 Prompt 中,模型读取新上下文**继续文字接龙**,输出融合真实数据的最终答案。 **Q3:对比分析 Google FLAN 路线与 OpenAI InstructGPT 路线在数据选择上的根本差异及结果。** > **答题要点**: > 1. **FLAN(传统NLP范式)**:使用学术界标准数据集(如阅读理解),任务死板,脱离日常场景,导致模型“懂语法但不懂聊天”。 > 2. **InstructGPT(真实需求范式)**:收集真实用户的高频提问(头脑风暴、写代码等),高度契合人类交互意图(Alignment),用户体验呈降维打击。 > 3. **开源补充**:开源界通过逆向工程(如 Alpaca 借用 ChatGPT 生成数据)弥补了真实数据的缺失,推动了平民化微调。
# 学习
← 上一篇
吴恩达《AI for Everyone 给所有人的AI课》
下一篇 →
李宏毅 - 生成式AI导论 - 进阶篇
💬 评论
0
/1000
发表评论
加载中...
> **导读**:本文档将8节课程的核心精华进行了系统化重组,从底层原理(文字接龙)到前沿应用(Multi-Agent),专为期末考试与知识体系构建打造。文中已自动修正了部分常见的认知偏差,并拓展了工业界前沿视角,非常适合直接作为博客笔记随时复习。 --- ## 一、 认知重塑:AI的范式转移与生命周期 ### 1. 从“专用工具”到“全能工具人” * **过去(专才)**:AI 是单一功能的工具(如 Google 翻译、垃圾邮件分类器),被动执行预设功能。 * **现在(通才/工具人)**:以 ChatGPT 为代表的生成式 AI 没有特定功能,需靠**指令(Prompt)驱动**。它的能力边界取决于用户的提问方式。 * **隐喻**:《葬送的芙莉莲》中,80年前无敌的“杀人魔法”如今被普通防御挡住。这映射了 AI 领域的 **SOTA(当前最优)模型贬值极快**,不要神话现有技术,掌握底层原理才能应对技术迭代。 ### 2. 技术的“半衰期”与 ArXiv 生态 * **技术迭代速度**:AI 领域以“月/周”为单位迭代。2019年“毁天灭地”的 GPT-2(15亿参数),如今只是课堂作业模型(70亿参数)的 1/4。 * **ArXiv 的重要性**:传统国际会议审稿需 1.5 年,技术发表即过时。因此,AI 研究者优先在 **ArXiv(预印本平台)** 发布论文,抢占首发权。 ### 3. 评估的困境:“哈哈哈100次”实验 * **现象**:让模型说100次“哈哈哈”。Gemini 做了500次(过度顺从),TaiDe 做一半觉得没意义停止,GPT-3.5 直接拒绝。 * **本质**:生成式 AI 的答案空间无限,**没有绝对的标准答案**。评估高度主观,取决于用户对“听话”与“智能”的权衡。 * **幻觉(Hallucination)的真相**:模型犯错并非故意欺骗,而是为了“努力帮忙”强行生成看似合理的答案。若要完全不犯错,模型只能拒绝回答所有问题。 --- ## 二、 底层逻辑:万物皆可“文字接龙” ### 1. 概念辨析:AI、ML 与 GenAI * **AI(人工智能)**:一个模糊的**目标**(让机器展现智慧)。 * **ML(机器学习)**:实现目标的**手段**(让机器自动从数据中找函数参数)。 * **GenAI(生成式AI)**:明确的**子目标**(产生复杂、有结构、**无法穷举**的物件,如文章、图像)。 * *拓展*:分类(Classification)是在有限选项中做选择题;生成(Generation)是在 $10^{300}$ 种可能性中写作文。 ### 2. 核心机制:自回归生成(Auto-regressive Generation) * **降维打击**:将“生成整篇文章”的无穷问题,拆解为“预测下一个字(Token)”的**有限分类问题**(从几千个常用字中选概率最高的一个)。 * **创造力来源**:机器能产出训练集中**从未出现过**的合理组合,这就是 AI 的“创造力”。 ### 3. 大模型的“修仙”第一阶段:预训练(Pre-training) * **自监督学习**:不需要人工标注,机器通过互联网海量文本玩“盖住后文,预测下文”的文字接龙游戏,自动寻找数百亿个最佳参数。 * **数据清洗的生死线**:网络数据充满广告和废话。如果不进行严格的**去重(De-duplication)** 和过滤,模型会“过拟合(Overfitting)”,变成只会复读的废柴。 * **Base Model 的“答非所问”**:刚预训练完的模型(如早期的 GPT-3)像《天龙八部》里拥有百年内力但不会招式的虚竹。你问它“机器学习是什么?”,它不会解释,而是根据网络论坛的规律,接龙出“这门课好不好过?”或四个选择题选项。**它只会接龙,不会回答问题。** --- ## 三、 不修改参数的“魔法”:提示工程 (Prompt Engineering) 在模型参数固定(冻结)的前提下,通过优化输入来激发潜能。 ### 1. 神奇咒语与心理暗示 * **思维链(CoT, Chain of Thought)**:加上“Let's think step by step”,强迫模型列出中间步骤。本质是利用文字接龙特性,用中间步骤作为垫脚石,大幅提升数学/逻辑题准确率。 * **情绪勒索**:“这对我的生涯很重要”、“做不好会受罚”。利用训练数据中人类反馈的模式,模拟高权重场景,激发模型更谨慎的输出。(注:说“请/谢谢”等礼貌用语通常无显著效果)。 ### 2. 上下文学习(ICL, In-Context Learning) * **机制**:提供几个范例(Few-shot)或长篇背景资料(如25万字的卡拉蒙语教科书),让模型模仿。 * **⚠️ 核心考点(极易错)**:**ICL 绝对没有改变模型的内部参数!** 它只是利用 Transformer 的注意力机制在当前对话窗口“临时抄答案”。一旦移除上下文(教科书),能力立刻消失。这是“授人以鱼”,而非“授人以渔”。 ### 3. 高阶推理:ToT 与 自我反省 * **自我反省(Reflection)**:让模型检查自己的答案。注意,反省成功**不是因为模型变聪明了(参数未变)**,而是基于新的上下文重新做了一次更优的文字接龙。 * **自我一致性(Self-Consistency)**:模型输出本质是**概率分布+掷骰子**。让模型回答同一问题多次,取“多数决(Majority Vote)”,可有效过滤偶然错误。 * **思维树(ToT)**:任务拆解 + 多分支采样(掷骰子) + 自我评估,是解决复杂问题的究极形态。 ### 4. 外部工具调用(Tool Use / RAG) * **痛点**:模型不擅长精确计算,且缺乏最新/私有知识。 * **机制**:模型依然在做文字接龙,但它学会了接龙出特定的**触发符号**(如 `<Search>` 或 Python 代码)。系统拦截符号,调用搜索引擎或代码解释器,将真实结果拼回 Prompt,模型再继续接龙。 * *纠正*:GPT-4 展现出的“写代码->执行->报错->修正”的工程师闭环能力,**并非纯文本模型自带**,而是结合了**代码解释器(Code Interpreter)** 等外部工具的结果。 --- ## 四、 进阶架构:多智能体协作 (Multi-Agent) 单一模型容易陷入幻觉或逻辑死胡同,通过“打群架”可实现群体智能。 ### 1. 多模型辩论(Debate)与裁判机制 * 让模型 A 翻译,模型 B 挑刺,模型 C(裁判)拍板。利用“验证比生成容易”的原理,交叉验证消除幻觉。 * **避坑指南**:必须设置终止条件或引入独立裁判,否则两个模型会陷入无限死循环或达成“错误的共识”。 ### 2. 角色扮演流水线(如 ChatDev) * 通过 Prompt 赋予模型不同职业(产品经理、程序员、测试员),形成流水线。 * **本质**:利用**角色设定(Persona)** 限制模型的发散空间,强迫其专注特定任务,将复杂的软件工程降维成模型易于处理的单步小任务。 --- ## 五、 改动参数的“手术”:指令微调与开源革命 如何让“只会接龙”的 Base Model 变成“听懂人话”的 ChatBot? ### 1. 大模型的“修仙”第二阶段:指令微调(Instruction Tuning) * 使用带有明确“人类指令”的数据集(User: 问题 -> AI: 回答)进行督导学习,让模型学会对话范式(Alignment/对齐)。 * **数据之争**: * *Google FLAN 路线*:使用学术界死板的 NLP 数据集(如阅读理解),模型懂语法但不懂聊天。 * *OpenAI InstructGPT 路线*:收集**真实用户**的高频提问(写诗、写代码、请假条),模型高度契合人类意图,完成降维打击。 ### 2. 高效微调:LoRA 与 Adapter * 全量更新千亿参数成本极高且容易引发**灾难性遗忘**(学了新知识,忘了旧知识)。 * **LoRA 机制**:冻结原模型参数,仅在旁边插入极少量的新参数(变量)进行训练。以极小算力达到媲美全量微调的效果。 ### 3. 开源逆袭与 LIMA 定律 * **逆向工程(Alpaca)**:开源社区没有真实用户数据,就用强大的 ChatGPT 自动生成问答对,喂给开源底座(如 LLaMA)学习,打破数据垄断。 * **LIMA 定律(Less is More)**:在指令微调阶段,**数据质量远比数量重要**。仅用 1000 条极其精美、无瑕疵的人工数据,就能达到 GPT-4 级别的对齐效果。 --- ## 六、 🧠 核心拓展知识库(面试/考试加分项) 为了应对深度考试或面试,以下概念需额外掌握: 1. **Temperature(温度参数)**: * 控制模型“掷骰子”的随机性。`Temperature = 0` 时,模型总是选概率最高的词(确定性,适合代码/数学);`Temperature > 0` 时,引入随机性(创造性,适合写诗/头脑风暴)。 2. **RLHF(基于人类反馈的强化学习)**: * InstructGPT 背后的终极武器。在指令微调之后,让人类对模型的多个回答进行排序,训练一个“奖励模型(Reward Model)”,再用强化学习(PPO)优化大模型,使其符合人类的道德观和价值观(防越狱、防歧视)。 3. **Attention Mechanism(注意力机制)**: * ICL(上下文学习)之所以有效,全靠 Transformer 架构中的 Attention。它允许模型在生成下一个词时,回头看 Prompt 中的每一个字,并分配权重。这就是模型能在 25 万字教科书中“精准抄答案”的物理基础。 4. **Catastrophic Forgetting(灾难性遗忘)**: * 神经网络在微调(Fine-tuning)学习新领域知识时,会覆盖掉预训练阶段学到的通用知识。这就是为什么讲师说微调像“大脑手术”,风险极高,通常需要配合 LoRA 或混合回放技术来缓解。 --- ## 七、 📝 考前必背:高频判断题与论述题题库 ### ❌ 判断题(避开陷阱) 1. **[ 错 ]** 课程主要教授如何熟练使用 ChatGPT 的各种提示词技巧。 * *正解*:具体技巧易过时,课程核心是理解底层原理(从观众到魔术师)。 2. **[ 错 ]** 语言模型在经历多次“自我反省”并修正错误后,其内部参数得到了升级。 * *正解*:推理阶段参数**绝对冻结**。反省成功只是因为 Prompt(上下文)变了,模型做出了新的预测。 3. **[ 错 ]** GPT-3 刚完成预训练时,可以直接像现在的 ChatGPT 一样完美回答问题。 * *正解*:预训练模型只会“文字接龙”,面对提问可能会接龙出更多问题或选项,必须经过指令微调。 4. **[ 错 ]** 在多模型讨论中,只要让模型无限制互相讨论,最终一定能得到绝对正确的答案。 * *正解*:极易陷入死循环或“错误共识”,必须引入裁判模型或限制回合数。 5. **[ 错 ]** 在指令微调阶段,数据量越大,模型表现一定越好。 * *正解*:LIMA 定律证明,Alignment 阶段**质量远重于数量**,1000条高质量数据胜过数万条低质数据。 ### 📝 论述题(直接背诵答题模板) **Q1:请结合“文字接龙”与“排列组合”,论述生成式AI如何解决“从无穷可能性中生成合理内容”的难题?** > **答题要点**: > 1. **量级差异**:生成任务(如写文章)的组合空间极大(如 $10^{300}$),远超宇宙原子数,传统穷举搜索完全失效。 > 2. **化整为零(自回归)**:通过“文字接龙”策略,将生成整段话拆解为一系列“预测下一个字”的步骤。 > 3. **降维打击**:每一步预测本质上是一个**分类问题**。常用汉字仅几千个,机器只需在有限选项中计算概率并选出最高者。 > 4. **总结**:通过深度学习强大的概率拟合能力,机器将“无穷生成”降维为“有限分类”序列,从而展现出创造力。 **Q2:请简述大语言模型调用外部工具(如 RAG 或 代码解释器)的底层运行机制,及其解决的先天缺陷。** > **答题要点**: > 1. **先天缺陷**:大模型存在幻觉、缺乏实时资讯,且不擅长精确数学运算。 > 2. **核心本质**:模型底层依然在做**文字接龙**,但学会了生成特定的**触发符号/代码指令**。 > 3. **中断与接管**:系统检测到触发符号后,**强制暂停**模型生成,启动外部工具(搜索或运行代码)。 > 4. **反哺与接力**:系统将外部真实结果作为文本拼接到原 Prompt 中,模型读取新上下文**继续文字接龙**,输出融合真实数据的最终答案。 **Q3:对比分析 Google FLAN 路线与 OpenAI InstructGPT 路线在数据选择上的根本差异及结果。** > **答题要点**: > 1. **FLAN(传统NLP范式)**:使用学术界标准数据集(如阅读理解),任务死板,脱离日常场景,导致模型“懂语法但不懂聊天”。 > 2. **InstructGPT(真实需求范式)**:收集真实用户的高频提问(头脑风暴、写代码等),高度契合人类交互意图(Alignment),用户体验呈降维打击。 > 3. **开源补充**:开源界通过逆向工程(如 Alpaca 借用 ChatGPT 生成数据)弥补了真实数据的缺失,推动了平民化微调。
↑
💬 评论