Transformer 与大语言模型:第2章 Transformer 总体架构

发布时间:2026/9/13 21:45:41
Transformer 与大语言模型:第2章 Transformer 总体架构 第2章 Transformer 总体架构本章目标:从整体上理解 Transformer 的结构,知道每个模块负责什么,以及为什么 GPT 只有 Decoder,BERT 只有 Encoder。本章目录2.1 Transformer 到底是什么?2.2 为什么叫 Transformer?2.3 Transformer 架构演进时间线2.4 Transformer 的整体结构2.5 Transformer 的数据入口:文字是如何变成向量的?2.6 Encoder 的结构2.7 Encoder 输出什么?2.8 Decoder 的结构2.9 为什么 Decoder 需要 Cross-Attention?2.10 数据流:一句话是如何被翻译的?2.11 完整数据流:Tensor Shape 如何变化?2.12 为什么 BERT 只有 Encoder?2.13 为什么 GPT 只有 Decoder?2.14 三种架构对比2.15 与 CNN / LSTM 的对比2.16 本章核心思想本章常见误区本章总结本章思考题下一章预告2.1 Transformer 到底是什么?Transformer 是一种神经网络架构(不是某个具体模型),最初用于机器翻译。例如:输入:I love AI 输出:我爱AITransformer 的核心思想只有一句话:不要让信息一步一步传递,而是让每个 Token 直接从所有 Token 中拉取需要的信息。2.2 为什么叫 Transformer?Transformer 的名字来自它的功能:Transform(变换)一个序列的表示。输入是一串 Token 的向量,输出也是一串向量,但每个向量已经包含了整个句子的上下文信息。2.3 Transformer 架构演进时间线2017Google 发布原始TransformerEncoder-Decoder架构用于机器翻译2018OpenAI 发布 GPT-1(Decoder-Only)Google 发布 BERT(Encoder-Only)2019GPT-2 (1.5B 参数)T5(Encoder-Decoder回归)2020GPT-3 (175B 参数,96层)2023Llama 1/2 (Meta)Qwen (阿里巴巴)2024Llama 3, Qwen2,DeepSeek-V2全部 Decoder-Only +MoETransformer 架构演进趋势:2018年之后,生成类任务(对话、写作)统一走向 Decoder-Only;理解类任务(搜索、分类)仍然使用 Encoder-Only。2.4 Transformer 的整体结构原始 Transformer(2017 年论文)由两部分组成:输入序列I love AIEncoderContext Vectors上下文向量Decoder目标序列我爱AI输出序列我 爱 AIEncoder:理解输入句子Decoder:根据理解,生成输出句子但这张图有一个让几乎所有初学者困惑的地方:"目标序列"不就是已经翻译好的中文吗?既然已经知道答案了,为什么还要 Decoder 去翻译?答案是:这张图画的是训练阶段,不是推理阶段。Transformer 有两种完全不同的工作模式。2.5 Transformer 的数据入口:文字是如何变成向量的?在讲 Encoder 的内部结构之前,我们必须先回答一个问题:Transformer 的第一层到底吃进去的是什么?答案是:不是文字,不是 Token ID,而是向量矩阵。完整的入口流程:

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询