generative-ai-for-beginners 第 02 课详解:探索与对比不同的大语言模型——从选型、测试迭代到部署

发布时间:2026/9/7 18:00:40
generative-ai-for-beginners 第 02 课详解:探索与对比不同的大语言模型——从选型、测试迭代到部署 generative-ai-for-beginners 第 02 课详解探索与对比不同的大语言模型——从选型、测试迭代到部署【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners本文基于 generative-ai-for-beginners 课程第 02 课 Exploring and Comparing Different LLMs 展开。该课解决的是初创团队落地生成式 AI 的关键决策问题面对语音、图像、文本、多模态等众多模型类别如何为具体业务场景选对模型。读完本文你将掌握大语言模型LLM的完整分类体系基础模型与 LLM、开放权重与专有模型、编码器与解码器架构、服务与模型的区别学会在 Azure/Microsoft Foundry 上测试、对比与迭代模型的方法并能按提示工程 → RAG → 微调 → 从头训练的代价阶梯做出正确的模型改进与部署决策。课程定位与学习目标第 01 课已经介绍过生成式 AI 如何改变技术版图、LLM 的工作原理以及像本课程中的教育初创公司这样的企业如何把 LLM 应用到自身场景并实现增长。第 02 课的主题是对比不同类别的 LLM理解它们各自的优缺点——这是选型决策的直接前置知识。本课覆盖三个要点当前模型生态中不同种类的 LLM在 Azure 上针对你的用例测试、迭代和对比不同模型如何部署一个 LLM。学完本课你应当能够为你的用例选择正确的模型理解如何测试、迭代并提升模型性能了解企业部署模型的常见方式。理解不同种类的 LLMLLM 可以按架构、训练数据和用例等多个维度分类。理解这些差异能帮助团队为场景选对模型并知道后续如何测试、迭代和提升性能。需要牢记的一条总原则是模型选择取决于你的目标用途、数据形态、预算上限等多重因素——没有万能模型。按模态与任务领域划分语音与音频识别。Whisper 风格的通用语音识别模型至今仍然实用但生产环境的选择现在也包括更新的语音转文本模型例如gpt-4o-transcribe、gpt-4o-mini-transcribe以及说话人分离diarization变体。选型时应评估语言覆盖范围、说话人分离能力、实时支持、延迟和成本。图像生成。DALL-E 和 Midjourney 是广为人知的图像生成选项但当前 OpenAI 图像 API 的中心是 GPT Image 系列模型如gpt-image-2Stable Diffusion、Imagen、Flux 等其他模型家族同样是常见选择。对比维度包括提示词遵循度、编辑支持、风格控制、安全要求与许可证。本课程的 第 09 课构建图像生成应用 有完整实战。文本生成。文本模型如今横跨前沿模型、推理模型、低延迟小模型与开放权重模型。当前例子包括 OpenAI 的 GPT-5.x 系列、Anthropic 的 Claude 4.x 系列、Google 的 Gemini 3.x 系列、Meta 的 Llama 4 系列以及 Mistral 系列模型。关键建议是不要只按发布日期或价格选型而要对比任务质量、延迟、上下文窗口、工具调用能力、安全行为、区域可用性和总成本。Microsoft Foundry 的模型目录Model Catalog是 Azure 上横向对比可用模型的好入口。多模态。许多当前模型能处理不止文本有些接受图像、音频或视频输入有些能调用工具专用模型还能生成图像、音频或视频。例如当前 OpenAI 模型支持文本与图像输入Gemini 模型依变体不同可支持文本、代码、图像、音频和视频输入Llama 4 的 Scout 与 Maverick 则是原生多模态的开放权重模型。构建工作流之前务必查阅每个模型卡片model card中声明的输入/输出模态——多模态示意图见文首第二张图。选到一个模型只意味着获得基础能力往往还不够企业通常还有自己的私有数据需要让 LLM 感知到。如何接近这些数据正是后文改进 LLM 结果一节要讨论的核心问题。基础模型Foundation Models与 LLM基础模型这一术语由斯坦福大学研究者提出论文 arXiv:2108.07258指满足若干条件的 AI 模型采用无监督学习或自监督学习训练即在未标注的多模态数据上训练训练过程不需要人工标注规模非常大基于超深神经网络拥有数十亿级参数通常作为其他模型的地基可作为起点通过微调fine-tuning在其之上构建其他模型。文首第一张图Foundation Model 分类图直观展示了基础模型、LLM 与其衍生模型之间的关系。用 ChatGPT 做历史案例可以更清楚地说明这一区分早期版本的 ChatGPT 使用 GPT-3.5 作为基础模型OpenAI 随后用对话专用数据和对齐技术alignment techniques训练出一个在聊天机器人等对话场景中表现更好的版本。需要补充的是现代 AI 服务往往在多个模型变体之间做路由因此服务名与底层模型名并不总是一回事——这也是后文服务 vs 模型一节要展开的内容。开放权重/开源模型与专有模型另一种分类维度是模型是否开放权重、开源或专有。开放权重/开源模型会把模型工件权重等开放出来供检查、下载或定制但各家许可证并不相同有些是彻底的开源有些则是带使用限制的开放权重模型。当企业需要更强的部署控制、数据本地性、成本优化或定制能力时这类模型很有价值但团队在生产使用前仍需审查许可证条款、推理服务成本、维护责任、安全更新与评测质量。典型例子包括 Meta Llama 4、部分 Mistral 模型以及 Hugging Face 上托管的大量模型。本课程中 第 16 课开源模型、第 20 课Mistral 系列 和 第 21 课Meta 系列 都有针对具体开放模型的实操例如 Llama 3.170B/405B128k 上下文窗口与 Llama 3.211B/90B Vision的对比与函数调用示例。专有模型由提供商拥有并托管。这类模型通常针对托管生产场景深度优化能提供较强的支持、安全体系、工具集成与规模化能力但客户通常无法检查或修改模型权重且必须审查服务商在隐私、数据保留、合规与可接受使用方面的条款。典型例子包括 OpenAI 模型、Google Gemini 与 Anthropic Claude。按输出类型划分嵌入、图像生成、文本与代码生成LLM 还可以按生成的输出类型分类嵌入Embeddings模型把文本转换为数值形式即嵌入向量作为输入文本的数值表示。嵌入让机器更容易理解词语、句子之间的关系可被分类模型、聚类等下游模型消费这些模型在数值数据上表现更好。嵌入模型也常用于迁移学习先在一个数据量充足的代理任务上构建模型再把模型权重嵌入复用到其他下游任务。图像生成模型用于图像编辑、图像合成与图像翻译。这类模型通常在大型图像数据集如 LAION-5B上训练可以生成新图像也可以通过修补inpainting、超分辨率、上色等技术编辑现有图像。例子包括 GPT Image 系列、Stable Diffusion 系列与 Imagen 系列。文本与代码生成模型用于文本摘要、翻译、问答等。文本生成模型常在大规模文本语料如 BookCorpus上训练可以生成新文本或回答问题代码生成模型如 CodeParrot 一类则在 GitHub 等大规模代码数据集上训练可用于生成新代码或修复既有代码中的 bug。一个可以对照仓库实物的细节本课程 第 08 课构建搜索应用 直接提供了一个由 OpenAI 嵌入模型生成的真实嵌入索引文件 embedding_index_3m.json——它对 YouTube 视频转录稿按3 分钟文本段 约 20 词重叠切块并计算嵌入是嵌入模型输出长什么样、如何组织成索引的最直观样本。架构视角Encoder-Decoder 与 Decoder-only课程用一个出小测验的类比来讲解不同架构你的经理布置任务给学生写一份测验。你有两位同事一位负责出题创作内容另一位负责审阅。内容创作者 ≈ Decoder-only仅解码器模型它看到主题和已写内容就能基于上下文继续生成。它擅长产出有吸引力、信息量大的内容但如果任务只是分类、检索或编码信息它未必是最优选择。GPT 系列与 Llama 系列属于此类。审阅者 ≈ Encoder-only仅编码器模型它通读已写内容与答案理解上下文和两者关系但不擅长生成内容。典型代表是 BERT。既能出题又能审阅的人 ≈ Encoder-Decoder编码器-解码器模型例如 BART 和 T5。这个类比的价值在于提醒开发者架构决定了模型擅长什么任务形态选型时应先明确任务是生成还是理解/检索。服务Service与模型Model的区别服务是云服务商提供的产品通常是模型、数据与其他组件的组合模型是服务的核心组件往往是一个基础模型如某个 LLM。服务通常针对生产使用做了优化常通过图形界面比模型更易用。但服务往往不免费需要订阅或按量付费——换取的是使用服务拥有方的设备与资源从而简化开支、便于扩展。例子是 Azure OpenAI Service按使用量计费pay-as-you-go并在模型能力之上提供企业级安全与负责任的 AI 框架。模型是神经网络工件本身参数、权重、架构、分词器tokenizer及配套配置。要在本地或私有环境运行模型需要合适的硬件、服务基础设施、监控以及合规的开源/开放权重许可证或商业许可证。像 Llama 4、Mistral 这类开放权重模型可以自托管但仍然需要算力与运维能力。一句话总结服务买的是开箱即用模型自托管买的是控制权两者的成本结构完全不同。在 AzureMicrosoft Foundry上测试与迭代不同模型团队探索完模型生态、圈定候选模型后下一步是在自己的数据和工作负载上测试它们——这是一个通过实验与度量进行的迭代过程。课程中提到的大多数模型OpenAI 模型、Llama 4 与 Mistral 等开放权重模型、Hugging Face 上的模型都可以在 Microsoft Foundry Models 中获得。Microsoft Foundry前身 Azure AI Studio/Azure AI Foundry是 Azure 上构建 AI 应用与 Agent 的统一平台帮助开发者管理从实验、评测到部署、监控、治理的全生命周期。其模型目录支持以下关键动作在目录中找到感兴趣的基础模型——包括 Azure 自售模型以及合作伙伴与社区提供商的模型可按任务、提供商、许可证、部署方式或名称过滤查看模型卡片Model Card——含预期用途与训练数据的详细说明、代码样例以及内部评测库上的评测结果通过 Model Benchmarks 面板对比基准——在业界可用的多个模型与数据集之间比较基准判断哪个模型匹配业务场景在自定义训练数据上微调受支持的模型——借助 Foundry 的实验与跟踪能力提升模型在特定工作负载上的表现把原始预训练模型或微调后的版本部署到远程实时推理端点——使用托管计算或无服务器serverless部署选项供应用程序消费。注意目录中并非所有模型当前都支持微调和/或按量部署。具体能力与限制请查看对应模型的模型卡片。仓库源码层面的印证部署的最终目的是让应用能消费这个端点。本仓库的共享工具库 shared/python/api_utils.py 中create_azure_openai_client 展示了课程各课代码实际如何消费 Foundry/Azure OpenAI 端点它读取AZURE_OPENAI_ENDPOINT与AZURE_OPENAI_API_KEY环境变量构造base_url为endpoint/openai/v1/的 OpenAI 客户端走 v1 端点无需api_version并对缺省环境变量、openai包未安装等情况抛出明确的ValueError/ImportError。这正是部署到实时推理端点之后应用侧的标准接入姿势。改进 LLM 结果的四种路径我们已经在 Microsoft Foundry 这类平台上比较了不同模型、在测试数据上评测、改进性能并部署到推理端点。但什么时候才应该选择微调而不是直接用预训练模型还有没有其他提升特定工作负载性能的方法企业要让 LLM 产出自己需要的结果可以按复杂度、成本与质量的递增关系选择以下路径对应文首第三张图企业部署 LLM 的四种方式1. 带上下文的提示工程Prompt Engineering with Context预训练 LLM 在通用自然语言任务上表现良好即使只用一个短提示一个待补全的句子或一个问题——即所谓零样本zero-shot学习。但用户把查询刻画得越详细——附带详细请求与示例也就是上下文Context——答案就越准确、越贴近用户预期。按提示中包含的示例数量区分只含一个示例叫单样本one-shot学习含多个示例叫少样本few-shot学习。这是启动成本最低、最划算的第一步任何模型改进工作都应从这里开始。2. 检索增强生成Retrieval Augmented Generation, RAGLLM 的固有局限是它只能用训练时见过的数据来生成答案——训练截止日之后的事实它一无所知也无法访问非公开信息如公司内部数据。RAG 通过把外部数据以文档块chunks的形式追加进提示词考虑提示长度限制来克服这一点。它依赖向量数据库工具如 Azure Vector Search从各类预定义数据源中检索有用的块再把它们加入提示词的上下文。适用场景企业没有足够的数据、时间或资源去微调 LLM但仍希望提升特定工作负载的表现并降低幻觉、过时或不支持答案的风险。仓库内 第 15 课RAG 与向量数据库 会完整落地这条路径。一个可运行的对照样例在 第 20 课Mistral 模型 中该课用 Mistral Large 2 跑了一个完整的 RAG 最小流水线——用faiss建立IndexFlatL2向量索引依赖faiss-cpu文档按chunk_size 2048切块后用cohere-embed-v3-multilingual计算嵌入对查询检索k2个最相似块再把检索块与问题一起塞进提示词模板交给模型作答凭据则从AZURE_INFERENCE_ENDPOINT/AZURE_INFERENCE_CREDENTIAL环境变量读取。这个 200 行以内的示例把RAG 到底做了什么拆解成了可复制的代码事实。3. 微调模型Fine-tuned Model微调是利用迁移学习适配模型以下游任务或特定问题的过程。与少样本学习和 RAG 不同微调会产出一个新模型其权重和偏置被更新。它需要一组训练样本每条样本由一个输入提示词和对应输出补全构成。课程给出的三个应优先考虑微调的场景希望使用更小的任务专用模型与其反复提示一个大型前沿模型不如微调一个小模型专攻狭窄任务得到成本更低、速度更快的方案延迟敏感特定用例对延迟有要求无法使用超长提示或少样本学习中需要让模型记住的示例数量超出了提示长度上限适配稳定的行为企业拥有大量高质量示例希望模型稳定遵循某任务模式、输出格式、语气或领域风格。注意如果核心问题是不断变化的新鲜事实或私有知识应使用 RAG 而非依赖微调。仓库中 第 18 课微调 对此进一步给出决策清单先明确用例先用提示工程与 RAG 建立基线再评估微调成本模型是否可微调、数据准备工作量、计算开销、数据质量最后确认收益质量是否超过基线、token 成本是否下降、基础模型能否复用到新领域——这套何时微调的自问框架与本课的三种适用场景完全呼应。4. 从头训练模型Trained Model从零训练一个 LLM 毫无疑问是最难、最复杂的路径需要海量数据、专家资源与充足算力。只有在企业拥有强领域专用用例且握有大量领域中心数据时才应考虑这条路径。知识检查与小练习问题提升 LLM 补全结果的好做法有哪些带上下文的提示工程RAG微调模型答案三种都有帮助。先用提示工程与上下文获得快速改进当模型需要最新事实或企业私有数据时使用 RAG当你拥有足够多高质量示例、且需要模型稳定遵循某种任务、格式、语气或领域模式时再选择微调。练习本课建议深入研究 RAG 如何应用到自己的业务。在本仓库内最直接的延伸路径是 第 15 课RAG 与向量数据库——它用教育初创公司的真实场景把课程笔记作为知识库让聊天机器人有据可答演示了从文档摄取、分块、嵌入、向量索引到增强生成的完整机制而 第 08 课构建搜索应用 则提供了嵌入索引的真实数据文件与配套构建脚本scripts 目录说明两者合起来构成 RAG 概念到代码的完整闭环。后续学习路线完成本课后按仓库的课程结构继续深入第 03 课负责任地构建生成式 AI 应用——理解模型选型之后的安全与合规约束第 09 课构建图像生成应用——对应本文图像生成分类的实战第 16 课开源模型、第 20 课Mistral、第 21 课Meta 系列——对应本文开放权重 vs 专有分类的具体模型实操第 18 课微调 LLM——对应本文四种改进路径中的微调路径。本课程的运行环境选项Azure OpenAI Service、Microsoft Foundry Models、OpenAI API、Foundry Local 离线运行与课程代码约定aoai-*、githubmodels-*、oai-*前缀的练习文件详见课程根目录 README 与 第 00 课课程环境搭建。【免费下载链接】generative-ai-for-beginners21 Lessons, Get Started Building with Generative AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-ai-for-beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考