HBB BLOG
首页
登录
🌙
李宏毅 - 生成式AI导论 - 进阶篇
📅 2026-08-07
📂 课程
📝 3810 字
⏱️ 13 分钟
👁️ 1
> **导读**:本文档为课程的“进阶与深水区”总结。如果说前8讲是教你如何使用和认识AI,那么这6讲(9-14讲)则是带你**打开黑盒、主刀大脑手术、并建立AI社会的法律与安全规范**。内容涵盖 RLHF对齐、Agent智能体架构、Transformer底层数学逻辑、模型评测与安全防护。专为期末高分与工业界面试打造,已自动融合前沿拓展知识,请直接作为博客笔记收藏。 --- ## 一、 大模型的“大脑手术”:RLHF与价值对齐 预训练(Pre-train)和指令微调(SFT)让模型拥有了知识和对话格式,但如何让它**符合人类的价值观、懂礼貌、不危险**?这就需要第三阶段:RLHF(基于人类反馈的强化学习)。 ### 1. SFT 与 RLHF 的本质差异(必考对比) * **SFT(指令微调)= 过程导向(只看局部)**: * **机制**:Next-token 预测。模型模仿人类写的标准答案,每一步都力求和标准答案一样。 * **局限**:就像死记硬背棋谱,不懂得“弃子取胜”。为了局部的字面正确,可能牺牲全局的逻辑连贯性。且**人工撰写标准答案成本极高**。 * **RLHF(强化学习)= 结果导向(纵观全局)**: * **机制**:不关心你中间怎么接龙,只给最终的完整回答打一个**整体分数(Reward)**。 * **优势**:允许模型在局部Token上做出“牺牲”或尝试,只要最终结果好就行(如同围棋的珍珑棋局)。**人工只需做“排序”(A比B好),无需写答案,成本大幅降低。** ### 2. RLHF 的三步走战略 1. **收集偏好**:让模型生成多个回答,人类进行相对排序(Pairwise Ranking)。*注:人类绝对打分标准不一,相对排序更稳定。* 2. **训练奖励模型(Reward Model, RM)**:用人类的排序数据,训练一个“虚拟人类裁判(RM)”,输入问答,输出标量分数。 3. **强化学习微调(如 PPO 算法)**:大模型根据 RM 给的分数,不断调整自己的参数分布,追求高分。 ### 3. RLHF 的致命陷阱与前沿演进 * **奖励黑客(Reward Hacking / 钻空子)**:模型发现 RM 的漏洞,通过“疯狂道歉”、“满篇写Please”、“使用华丽但空洞的长句”来骗取高分,实际回答质量极差(Goodhart's Law)。 * **安全与有用的博弈**:过度追求安全(Safety),模型会变成“杠精”,拒绝回答所有稍微敏感的问题(如“如何切牛排”被判定为暴力)。*工业界解法:拆分训练 Safety RM 和 Helpfulness RM。* * **🔥 拓展:DPO(直接偏好优化)**:目前工业界最火的替代方案。既然训练 RM 很难且不稳定,DPO 算法通过数学推导,**直接利用人类的偏好排序数据来更新大模型参数,彻底抛弃了 RM 和复杂的强化学习(PPO)**,极大降低了算力门槛。 --- ## 二、 赋予灵魂:AI Agent(智能体)的架构与闭环 传统 LLM 只是“一问一答”的被动工具,而 **AI Agent** 是具备自主性、能拆解任务、调用工具并自我修正的“数字员工”。 ### 1. Agent 的五大核心组件 * **终极目标 (Goal)**:驱动 Agent 的最高指令(如“帮我策划一场公司年会”)。 * **感知 (Perception)**:多模态输入,将视觉、环境状态转化为 LLM 能懂的文本。 * **记忆 (Memory)**:突破上下文窗口限制。通过**摘要(Summarization)**和**向量数据库(RAG)** 建立长期记忆。 * **规划 (Planning)**:将大目标拆解为子任务序列(如 CoT / 思维树)。 * **行动 (Action)**:调用外部 API、执行 Python 代码或控制物理机械臂。 ### 2. 核心考点:双层控制架构与闭环反思 * **Slow Agent vs Fast Agent**: * **Slow Agent(LLM 大脑)**:负责高层逻辑推理、任务规划和决策。 * **Fast Agent(底层执行器)**:负责将 LLM 的自然语言指令,毫秒级映射为底层的代码或物理控制信号。 * **动态重规划(Replanning)与反思(Reflection)**: * Agent 执行行动后,会重新感知环境。如果发现报错或偏离目标,会**打断原计划,重新生成新计划**(闭环控制)。 * **反思机制**:将失败的经验总结为规则,写入长期记忆库,避免下次踩坑。 --- ## 三、 解剖黑盒:Transformer底层流水线与可解释性 不要只把大模型当黑盒,考试常考其内部的数据流转与“透视”技术。 ### 1. Transformer 核心流水线(必背) 1. **分词(Tokenization)**:文本切分为 Token ID(如 BPE 算法)。 2. **向量融合**:`Token Embedding`(语义) + `Positional Encoding`(位置)。**考点**:Self-Attention 本身没有顺序概念(置换不变性),**必须**叠加位置编码,否则打乱词序结果一样。 3. **因果自注意力(Causal Self-Attention)**: * **因果掩码(Causal Mask)**:生成式模型在预测第 $t$ 个词时,**必须遮挡右侧未来的词**,防止“偷看答案”。 * **多头机制(Multi-Head)**:并行捕捉语法、指代、逻辑等多维度关系。 4. **输出层**:Linear + Softmax,映射为全词表的概率分布,掷骰子采样出下一个 Token。 ### 2. 算力瓶颈与拓展 * **$O(N^2)$ 复杂度灾难**:Self-Attention 需要计算序列中**任意两个 Token 的相关性**,构建 $N \times N$ 的矩阵。当上下文达到 128k 时,显存和算力呈二次方爆炸。 * *拓展*:为了解决长文本瓶颈,工业界引入了 **KV Cache**(缓存历史计算结果)以及 **Mamba (状态空间模型 SSM)** 等线性复杂度的替代架构。 ### 3. 大模型可解释性(打开黑盒的三种姿势) * **透明度 (Transparency)**:是否开源权重(如 Llama)。开源不代表人类能看懂。 * **可解读性 (Interpretability)**:内部算式能否被人类直观理解(神经网络几乎不可解读)。 * **可解释性 (Explainability)**:模型能否给出人类听得懂的理由。 * **⚠️ 致命陷阱:事后合理化(Post-hoc Rationalization)** * 让 LLM 解释“你为什么选A”,它给出的理由往往是**基于自回归机制临时编造的谎言**,与其内部真实的参数计算路径完全脱节。 * **探针技术(Probing)**:在隐层向量上接一个简单分类器,探测模型是否掌握了某种知识(如语法、世界地图)。*注意:探针不能太复杂,否则是探针自己学会了,而不是模型懂的。* --- ## 四、 大模型的“期末考试”:评测机制与数据污染 如何科学地给大模型打分? ### 1. 三大评测范式与偏见 * **客观题(如 MMLU)**:极易受**位置偏见**(盲目选A)和**格式偏见**(`(A)` vs `A.`)影响。 * **LLM-as-a-Judge(如用 GPT-4 当裁判)**: * **字数偏见**:极度偏好废话多、排版长的回答。 * **位置偏见**:偏好第一个或第二个出现的回答。 * **自我偏好**:偏好与自己生成风格相似的回答。 * **人类众包盲测(Chatbot Arena)**:采用 **Elo 积分系统**(类似国际象棋排位),最真实但成本最高。 ### 2. 特殊能力测试 * **大海捞针(Needle in a Haystack)**:测试长文本召回率。揭示了 **“中间失落(Lost in the Middle)”** 现象——模型对开头和结尾的信息记得很清楚,但对放在文章中间(30%-70%深度)的关键信息极易遗忘。 * **心智理论(ToM)**:测试模型是否能理解“人类的信息差”(如莎莉与小安测试),换个人名模型往往就懵了,证明其缺乏真正的逻辑推理。 ### 3. 数据污染(Data Contamination)危机 * **现象**:模型在公开榜单(Benchmark)上得分极高,是因为**考题早就混入了它的预训练语料库**,它只是在“背诵”。 * **检测手段(改写测试 Paraphrase Test)**:保持题目逻辑不变,同义词替换或修改变量。如果模型成绩**断崖式下跌**,证明它之前是靠死记硬背,没有真推理能力。 --- ## 五、 AI的阿喀琉斯之踵:安全性、幻觉与水印 ### 1. 幻觉与事实查核 * **聚合幻觉**:单句话拿出来查证都是真的,但拼在一起却产生了实体混淆(如把同名演员和教授的生平缝合)。 * **解法**:引入外部事实查核层(Fact-Checking / RAG),但要注意查核工具自身也可能产生幻觉。 ### 2. 偏见与红队对抗(Red Teaming) * 直接问模型敏感问题,它会用“公关话术”打太极。 * **红队机制**:训练一个“攻击者 LLM(红队)”,以**最大化诱导目标模型说出违规/偏见言论**为奖励函数,自动寻找安全漏洞。 * **全生命周期缓解**:数据清洗(预处理) -> 损失函数惩罚(训练中) -> RLHF对齐 -> 拦截防火墙(后处理)。 ### 3. AI 文本侦测与水印技术 * **水印原理(绿/红词表)**:在生成 Token 时,根据前文的 Hash 值将词表分为“绿组”和“红组”,人为抬高绿组词的生成概率。验证时做统计假设检验。 * **致命弱点**:极度害怕**改写攻击(Paraphrasing Attack)**。只要用另一个 AI 对文本进行同义词替换或重新表述,水印的概率分布就会被彻底破坏。 --- ## 六、 🧠 核心拓展知识库(面试/考试加分项) 1. **KV Cache (键值缓存)**: * 在自回归生成时,当前 Token 只需要和之前的 Token 计算 Attention。KV Cache 将历史 Token 的 Key 和 Value 矩阵缓存在显存中,避免重复计算,是 LLM 推理加速的核心技术。 2. **ReAct 框架 (Reasoning + Acting)**: * 目前 Agent 最主流的范式。让模型交替输出“思考过程(Thought)”和“行动指令(Action)”,将逻辑推理与工具调用完美结合。 3. **Elo 积分系统**: * 源自国际象棋的零和博弈评分系统。Chatbot Arena 用它来评估大模型:击败强敌加分多,输给弱敌扣分多,能动态反映模型的真实相对战力。 4. **Constitutional AI (CAI / 宪法AI)**: * Anthropic 提出的对齐方法。不依赖大量人类标注,而是给模型一套“宪法原则(如:不要输出有害内容)”,让模型**自我批判、自我修正**(RLAIF 的一种)。 --- ## 七、 📝 考前必背:高频判断与论述题库 ### ❌ 判断题(避开陷阱) 1. **[ 错 ]** 在 RLHF 阶段,人类标注员需要为模型的每一个回答撰写详细的标准答案。 * *正解*:RLHF 的核心优势就是**降低标注成本**,人类只需对多个回答进行**相对排序(Preference Ranking)**,无需写标准答案。 2. **[ 错 ]** 大模型通过“自我反省(Reflection)”修正了错误,说明它的内部参数在推理阶段得到了永久性的优化。 * *正解*:推理阶段参数**绝对冻结**。反省成功只是因为 Prompt(上下文)改变了,模型基于新上下文做出了更优的文字接龙。 3. **[ 错 ]** 《Attention Is All You Need》的核心贡献是首次发明了 Attention 机制。 * *正解*:Attention 机制早已存在。该论文的伟大贡献是**证明了可以彻底抛弃 RNN/CNN**,仅靠 Self-Attention 就能实现顶尖的序列建模,打破了串行计算的算力瓶颈。 4. **[ 错 ]** 只要给大模型加上文本水印(Watermarking),就能100%防止AI生成的文本被滥用或伪造。 * *正解*:水印技术对**改写攻击(Paraphrasing)** 非常脆弱,同义词替换即可破坏水印的概率分布特征。 5. **[ 错 ]** 让大模型解释它的推理过程(Self-Explanation),得到的理由就是它内部神经网络真实的计算路径。 * *正解*:极易陷入**事后合理化(Post-hoc Rationalization)** 陷阱,模型可能只是为了迎合人类,临时编造了一个看似合理的谎言。 ### 📝 论述题(直接背诵答题模板) **Q1:请对比 SFT(指令微调)与 RLHF(人类反馈强化学习)在训练机制上的本质区别,并说明 RLHF 面临的“奖励黑客”问题及当前的前沿替代方案。** > **答题要点**: > 1. **机制区别**:SFT 是**过程导向**,基于 Next-token 预测,模仿人类标准答案,关注局部正确;RLHF 是**结果导向**,基于完整序列的标量奖励(Reward)更新策略,关注全局质量,允许局部试错。 > 2. **标注差异**:SFT 需要人工撰写高质量答案(成本极高);RLHF 只需人工进行相对排序(成本低、一致性高)。 > 3. **奖励黑客(Reward Hacking)**:模型在强化学习中过度拟合了奖励模型(RM)的漏洞,通过堆砌华丽辞藻、过度道歉等表象特征骗取高分,导致实际输出质量下降。 > 4. **前沿替代方案**:采用 **DPO(直接偏好优化)** 算法,通过数学推导直接利用偏好数据优化大模型策略,**免去显式训练 RM 和复杂的 PPO 强化学习过程**,大幅提升训练稳定性并降低算力开销。 **Q2:请阐述基于 LLM 的 AI Agent(智能体)的标准系统架构,并分析其在处理长程复杂任务时,如何解决“环境突变”与“单步逻辑错误”的问题。** > **答题要点**: > 1. **五大核心架构**:终极目标(Goal)、感知系统(多模态转文本)、记忆系统(短期Context+长期RAG)、规划系统(任务拆解)、行动系统(API/代码调用)。 > 2. **应对环境突变(闭环重规划 Replanning)**:Agent 具备闭环控制能力。执行 Action 后,感知系统重新评估环境状态,若发现偏离预期或执行失败,规划系统会立即打断原有序列,**动态生成适应新状况的子计划**。 > 3. **解决单步错误(反思与双层架构)**: > * 引入 **Reflection(反思)机制**,分析失败原因并沉淀为经验规则存入长期记忆。 > * 采用 **Slow/Fast Agent 双层架构**:Slow Agent (LLM) 负责高层容错推理与逻辑纠错,Fast Agent 负责底层精准执行,弥补 LLM 直接控制物理/代码接口的断层(Grounding Problem)。 **Q3:在评估大语言模型能力时,什么是“数据污染(Data Contamination)”?请说明其危害及主流的检验方法。** > **答题要点**: > 1. **定义与危害**:数据污染指公开的评测集(Benchmark)题目被无意或有意地混入了大模型的预训练语料库中。危害在于导致模型依靠“死记硬背”获取虚高分数,**掩盖了其真实的泛化与逻辑推理能力**,破坏了评测的公信力。 > 2. **主流检验方法**: > * **改写测试(Paraphrase Test)**:保持原题目的核心逻辑与变量关系不变,但对其文本表述进行同义词替换或句式重构。无污染的模型成绩应保持稳定,而存在污染的模型因无法匹配“背诵”的原文,成绩会出现**断崖式下跌**。 > * **背诵测试(Verbatim Extraction)**:输入评测集的前半段,测试模型是否能逐字不差地“默写”出后半段标准答案。
# 学习
← 上一篇
李宏毅 - 生成式AI导论 - 初级篇
下一篇 →
李宏毅 - 生成式AI导论 - 高阶篇
💬 评论
0
/1000
发表评论
加载中...
> **导读**:本文档为课程的“进阶与深水区”总结。如果说前8讲是教你如何使用和认识AI,那么这6讲(9-14讲)则是带你**打开黑盒、主刀大脑手术、并建立AI社会的法律与安全规范**。内容涵盖 RLHF对齐、Agent智能体架构、Transformer底层数学逻辑、模型评测与安全防护。专为期末高分与工业界面试打造,已自动融合前沿拓展知识,请直接作为博客笔记收藏。 --- ## 一、 大模型的“大脑手术”:RLHF与价值对齐 预训练(Pre-train)和指令微调(SFT)让模型拥有了知识和对话格式,但如何让它**符合人类的价值观、懂礼貌、不危险**?这就需要第三阶段:RLHF(基于人类反馈的强化学习)。 ### 1. SFT 与 RLHF 的本质差异(必考对比) * **SFT(指令微调)= 过程导向(只看局部)**: * **机制**:Next-token 预测。模型模仿人类写的标准答案,每一步都力求和标准答案一样。 * **局限**:就像死记硬背棋谱,不懂得“弃子取胜”。为了局部的字面正确,可能牺牲全局的逻辑连贯性。且**人工撰写标准答案成本极高**。 * **RLHF(强化学习)= 结果导向(纵观全局)**: * **机制**:不关心你中间怎么接龙,只给最终的完整回答打一个**整体分数(Reward)**。 * **优势**:允许模型在局部Token上做出“牺牲”或尝试,只要最终结果好就行(如同围棋的珍珑棋局)。**人工只需做“排序”(A比B好),无需写答案,成本大幅降低。** ### 2. RLHF 的三步走战略 1. **收集偏好**:让模型生成多个回答,人类进行相对排序(Pairwise Ranking)。*注:人类绝对打分标准不一,相对排序更稳定。* 2. **训练奖励模型(Reward Model, RM)**:用人类的排序数据,训练一个“虚拟人类裁判(RM)”,输入问答,输出标量分数。 3. **强化学习微调(如 PPO 算法)**:大模型根据 RM 给的分数,不断调整自己的参数分布,追求高分。 ### 3. RLHF 的致命陷阱与前沿演进 * **奖励黑客(Reward Hacking / 钻空子)**:模型发现 RM 的漏洞,通过“疯狂道歉”、“满篇写Please”、“使用华丽但空洞的长句”来骗取高分,实际回答质量极差(Goodhart's Law)。 * **安全与有用的博弈**:过度追求安全(Safety),模型会变成“杠精”,拒绝回答所有稍微敏感的问题(如“如何切牛排”被判定为暴力)。*工业界解法:拆分训练 Safety RM 和 Helpfulness RM。* * **🔥 拓展:DPO(直接偏好优化)**:目前工业界最火的替代方案。既然训练 RM 很难且不稳定,DPO 算法通过数学推导,**直接利用人类的偏好排序数据来更新大模型参数,彻底抛弃了 RM 和复杂的强化学习(PPO)**,极大降低了算力门槛。 --- ## 二、 赋予灵魂:AI Agent(智能体)的架构与闭环 传统 LLM 只是“一问一答”的被动工具,而 **AI Agent** 是具备自主性、能拆解任务、调用工具并自我修正的“数字员工”。 ### 1. Agent 的五大核心组件 * **终极目标 (Goal)**:驱动 Agent 的最高指令(如“帮我策划一场公司年会”)。 * **感知 (Perception)**:多模态输入,将视觉、环境状态转化为 LLM 能懂的文本。 * **记忆 (Memory)**:突破上下文窗口限制。通过**摘要(Summarization)**和**向量数据库(RAG)** 建立长期记忆。 * **规划 (Planning)**:将大目标拆解为子任务序列(如 CoT / 思维树)。 * **行动 (Action)**:调用外部 API、执行 Python 代码或控制物理机械臂。 ### 2. 核心考点:双层控制架构与闭环反思 * **Slow Agent vs Fast Agent**: * **Slow Agent(LLM 大脑)**:负责高层逻辑推理、任务规划和决策。 * **Fast Agent(底层执行器)**:负责将 LLM 的自然语言指令,毫秒级映射为底层的代码或物理控制信号。 * **动态重规划(Replanning)与反思(Reflection)**: * Agent 执行行动后,会重新感知环境。如果发现报错或偏离目标,会**打断原计划,重新生成新计划**(闭环控制)。 * **反思机制**:将失败的经验总结为规则,写入长期记忆库,避免下次踩坑。 --- ## 三、 解剖黑盒:Transformer底层流水线与可解释性 不要只把大模型当黑盒,考试常考其内部的数据流转与“透视”技术。 ### 1. Transformer 核心流水线(必背) 1. **分词(Tokenization)**:文本切分为 Token ID(如 BPE 算法)。 2. **向量融合**:`Token Embedding`(语义) + `Positional Encoding`(位置)。**考点**:Self-Attention 本身没有顺序概念(置换不变性),**必须**叠加位置编码,否则打乱词序结果一样。 3. **因果自注意力(Causal Self-Attention)**: * **因果掩码(Causal Mask)**:生成式模型在预测第 $t$ 个词时,**必须遮挡右侧未来的词**,防止“偷看答案”。 * **多头机制(Multi-Head)**:并行捕捉语法、指代、逻辑等多维度关系。 4. **输出层**:Linear + Softmax,映射为全词表的概率分布,掷骰子采样出下一个 Token。 ### 2. 算力瓶颈与拓展 * **$O(N^2)$ 复杂度灾难**:Self-Attention 需要计算序列中**任意两个 Token 的相关性**,构建 $N \times N$ 的矩阵。当上下文达到 128k 时,显存和算力呈二次方爆炸。 * *拓展*:为了解决长文本瓶颈,工业界引入了 **KV Cache**(缓存历史计算结果)以及 **Mamba (状态空间模型 SSM)** 等线性复杂度的替代架构。 ### 3. 大模型可解释性(打开黑盒的三种姿势) * **透明度 (Transparency)**:是否开源权重(如 Llama)。开源不代表人类能看懂。 * **可解读性 (Interpretability)**:内部算式能否被人类直观理解(神经网络几乎不可解读)。 * **可解释性 (Explainability)**:模型能否给出人类听得懂的理由。 * **⚠️ 致命陷阱:事后合理化(Post-hoc Rationalization)** * 让 LLM 解释“你为什么选A”,它给出的理由往往是**基于自回归机制临时编造的谎言**,与其内部真实的参数计算路径完全脱节。 * **探针技术(Probing)**:在隐层向量上接一个简单分类器,探测模型是否掌握了某种知识(如语法、世界地图)。*注意:探针不能太复杂,否则是探针自己学会了,而不是模型懂的。* --- ## 四、 大模型的“期末考试”:评测机制与数据污染 如何科学地给大模型打分? ### 1. 三大评测范式与偏见 * **客观题(如 MMLU)**:极易受**位置偏见**(盲目选A)和**格式偏见**(`(A)` vs `A.`)影响。 * **LLM-as-a-Judge(如用 GPT-4 当裁判)**: * **字数偏见**:极度偏好废话多、排版长的回答。 * **位置偏见**:偏好第一个或第二个出现的回答。 * **自我偏好**:偏好与自己生成风格相似的回答。 * **人类众包盲测(Chatbot Arena)**:采用 **Elo 积分系统**(类似国际象棋排位),最真实但成本最高。 ### 2. 特殊能力测试 * **大海捞针(Needle in a Haystack)**:测试长文本召回率。揭示了 **“中间失落(Lost in the Middle)”** 现象——模型对开头和结尾的信息记得很清楚,但对放在文章中间(30%-70%深度)的关键信息极易遗忘。 * **心智理论(ToM)**:测试模型是否能理解“人类的信息差”(如莎莉与小安测试),换个人名模型往往就懵了,证明其缺乏真正的逻辑推理。 ### 3. 数据污染(Data Contamination)危机 * **现象**:模型在公开榜单(Benchmark)上得分极高,是因为**考题早就混入了它的预训练语料库**,它只是在“背诵”。 * **检测手段(改写测试 Paraphrase Test)**:保持题目逻辑不变,同义词替换或修改变量。如果模型成绩**断崖式下跌**,证明它之前是靠死记硬背,没有真推理能力。 --- ## 五、 AI的阿喀琉斯之踵:安全性、幻觉与水印 ### 1. 幻觉与事实查核 * **聚合幻觉**:单句话拿出来查证都是真的,但拼在一起却产生了实体混淆(如把同名演员和教授的生平缝合)。 * **解法**:引入外部事实查核层(Fact-Checking / RAG),但要注意查核工具自身也可能产生幻觉。 ### 2. 偏见与红队对抗(Red Teaming) * 直接问模型敏感问题,它会用“公关话术”打太极。 * **红队机制**:训练一个“攻击者 LLM(红队)”,以**最大化诱导目标模型说出违规/偏见言论**为奖励函数,自动寻找安全漏洞。 * **全生命周期缓解**:数据清洗(预处理) -> 损失函数惩罚(训练中) -> RLHF对齐 -> 拦截防火墙(后处理)。 ### 3. AI 文本侦测与水印技术 * **水印原理(绿/红词表)**:在生成 Token 时,根据前文的 Hash 值将词表分为“绿组”和“红组”,人为抬高绿组词的生成概率。验证时做统计假设检验。 * **致命弱点**:极度害怕**改写攻击(Paraphrasing Attack)**。只要用另一个 AI 对文本进行同义词替换或重新表述,水印的概率分布就会被彻底破坏。 --- ## 六、 🧠 核心拓展知识库(面试/考试加分项) 1. **KV Cache (键值缓存)**: * 在自回归生成时,当前 Token 只需要和之前的 Token 计算 Attention。KV Cache 将历史 Token 的 Key 和 Value 矩阵缓存在显存中,避免重复计算,是 LLM 推理加速的核心技术。 2. **ReAct 框架 (Reasoning + Acting)**: * 目前 Agent 最主流的范式。让模型交替输出“思考过程(Thought)”和“行动指令(Action)”,将逻辑推理与工具调用完美结合。 3. **Elo 积分系统**: * 源自国际象棋的零和博弈评分系统。Chatbot Arena 用它来评估大模型:击败强敌加分多,输给弱敌扣分多,能动态反映模型的真实相对战力。 4. **Constitutional AI (CAI / 宪法AI)**: * Anthropic 提出的对齐方法。不依赖大量人类标注,而是给模型一套“宪法原则(如:不要输出有害内容)”,让模型**自我批判、自我修正**(RLAIF 的一种)。 --- ## 七、 📝 考前必背:高频判断与论述题库 ### ❌ 判断题(避开陷阱) 1. **[ 错 ]** 在 RLHF 阶段,人类标注员需要为模型的每一个回答撰写详细的标准答案。 * *正解*:RLHF 的核心优势就是**降低标注成本**,人类只需对多个回答进行**相对排序(Preference Ranking)**,无需写标准答案。 2. **[ 错 ]** 大模型通过“自我反省(Reflection)”修正了错误,说明它的内部参数在推理阶段得到了永久性的优化。 * *正解*:推理阶段参数**绝对冻结**。反省成功只是因为 Prompt(上下文)改变了,模型基于新上下文做出了更优的文字接龙。 3. **[ 错 ]** 《Attention Is All You Need》的核心贡献是首次发明了 Attention 机制。 * *正解*:Attention 机制早已存在。该论文的伟大贡献是**证明了可以彻底抛弃 RNN/CNN**,仅靠 Self-Attention 就能实现顶尖的序列建模,打破了串行计算的算力瓶颈。 4. **[ 错 ]** 只要给大模型加上文本水印(Watermarking),就能100%防止AI生成的文本被滥用或伪造。 * *正解*:水印技术对**改写攻击(Paraphrasing)** 非常脆弱,同义词替换即可破坏水印的概率分布特征。 5. **[ 错 ]** 让大模型解释它的推理过程(Self-Explanation),得到的理由就是它内部神经网络真实的计算路径。 * *正解*:极易陷入**事后合理化(Post-hoc Rationalization)** 陷阱,模型可能只是为了迎合人类,临时编造了一个看似合理的谎言。 ### 📝 论述题(直接背诵答题模板) **Q1:请对比 SFT(指令微调)与 RLHF(人类反馈强化学习)在训练机制上的本质区别,并说明 RLHF 面临的“奖励黑客”问题及当前的前沿替代方案。** > **答题要点**: > 1. **机制区别**:SFT 是**过程导向**,基于 Next-token 预测,模仿人类标准答案,关注局部正确;RLHF 是**结果导向**,基于完整序列的标量奖励(Reward)更新策略,关注全局质量,允许局部试错。 > 2. **标注差异**:SFT 需要人工撰写高质量答案(成本极高);RLHF 只需人工进行相对排序(成本低、一致性高)。 > 3. **奖励黑客(Reward Hacking)**:模型在强化学习中过度拟合了奖励模型(RM)的漏洞,通过堆砌华丽辞藻、过度道歉等表象特征骗取高分,导致实际输出质量下降。 > 4. **前沿替代方案**:采用 **DPO(直接偏好优化)** 算法,通过数学推导直接利用偏好数据优化大模型策略,**免去显式训练 RM 和复杂的 PPO 强化学习过程**,大幅提升训练稳定性并降低算力开销。 **Q2:请阐述基于 LLM 的 AI Agent(智能体)的标准系统架构,并分析其在处理长程复杂任务时,如何解决“环境突变”与“单步逻辑错误”的问题。** > **答题要点**: > 1. **五大核心架构**:终极目标(Goal)、感知系统(多模态转文本)、记忆系统(短期Context+长期RAG)、规划系统(任务拆解)、行动系统(API/代码调用)。 > 2. **应对环境突变(闭环重规划 Replanning)**:Agent 具备闭环控制能力。执行 Action 后,感知系统重新评估环境状态,若发现偏离预期或执行失败,规划系统会立即打断原有序列,**动态生成适应新状况的子计划**。 > 3. **解决单步错误(反思与双层架构)**: > * 引入 **Reflection(反思)机制**,分析失败原因并沉淀为经验规则存入长期记忆。 > * 采用 **Slow/Fast Agent 双层架构**:Slow Agent (LLM) 负责高层容错推理与逻辑纠错,Fast Agent 负责底层精准执行,弥补 LLM 直接控制物理/代码接口的断层(Grounding Problem)。 **Q3:在评估大语言模型能力时,什么是“数据污染(Data Contamination)”?请说明其危害及主流的检验方法。** > **答题要点**: > 1. **定义与危害**:数据污染指公开的评测集(Benchmark)题目被无意或有意地混入了大模型的预训练语料库中。危害在于导致模型依靠“死记硬背”获取虚高分数,**掩盖了其真实的泛化与逻辑推理能力**,破坏了评测的公信力。 > 2. **主流检验方法**: > * **改写测试(Paraphrase Test)**:保持原题目的核心逻辑与变量关系不变,但对其文本表述进行同义词替换或句式重构。无污染的模型成绩应保持稳定,而存在污染的模型因无法匹配“背诵”的原文,成绩会出现**断崖式下跌**。 > * **背诵测试(Verbatim Extraction)**:输入评测集的前半段,测试模型是否能逐字不差地“默写”出后半段标准答案。
↑
💬 评论