09 指令微调:训练一个能听懂指令的 AI 助手

发布时间:2026/9/2 16:18:24
09 指令微调:训练一个能听懂指令的 AI 助手 09 指令微调:训练一个能听懂指令的 AI 助手系列第 9 篇,也是"主线剧情"的收官篇。前面我们有了一个会生成文本、会分类的 GPT。这一篇做最关键的一步:指令微调(Instruction Finetuning)——让模型能听懂"请把这句话改成被动语态"这种指令并正确回答。对应《从零构建大模型》第 7 章:指令数据集准备、自定义 collate、掩码策略、训练、响应提取,以及用另一个 LLM(Llama 3 + Ollama)自动化打分评估。1. 从"能补全"到"能听话"预训练模型本质是"文本补全器":给它开头它续写。但面对指令——“将主动语句转换为被动语句:‘The chef cooks the meal every day.’”预训练 GPT-2 会怎么做?书中实测:它只会复述输入,甚至把指令也原样抄回来,根本不做转换。指令微调就是在带标注的 (指令, 正确回答) 数据上继续训练,让模型学会"按指令办事"。这是 ChatGPT 类产品的核心步骤。