Skip to content

主流模型家族

学完原理与实战,最后把视野拉高:现代主流大模型都是「同一个 Transformer 骨架 + 一堆工程升级」。读懂它们的差异,你就能看懂任何一篇新模型的发布。

1. 一张谱系图

                     Transformer (2017)

        ┌───────────────────┼────────────────────┐
        ▼                   ▼                     ▼
   Encoder-only        Encoder-Decoder        Decoder-only  ← 今日绝对主流
    BERT 系             T5 / BART              GPT → LLaMA 系
   (理解/检索)          (转换/生成)              (生成/对话/Agent)

                        ┌──────────────┬───────────┼───────────┐
                        ▼              ▼           ▼           ▼
                     GPT-4/ChatGPT   LLaMA       Qwen      DeepSeek ...
                     (闭源旗舰)     (开源基石)  (中文强)   (MoE/低成本)

2. 现代 Decoder-only 模型的「标准配方」

把本教程的 NanoGPT 和真实大模型对比,会发现结构一脉相承,只是每一块都做了升级:

组件你的 NanoGPT / GPT-2现代大模型(LLaMA/Qwen)收益
位置编码可学习绝对编码RoPE(相对、可外推)长上下文
注意力头MHA 每头独立 KVGQA/MQA 共享 KV省推理显存
归一化Post-LNPre-LN + RMSNorm更稳/更快
FFN 激活ReLU/GELUSwiGLU(门控)同样参数更强
分词字符/BPESentencePiece/BPE 大词表多语言高效
注意力实现SDPA/FlashFlashAttention长序列可行
规模结构稠密部分用 MoE 混合专家大参数小算力
一个现代 Transformer 层(以 LLaMA 为例):
   x → RMSNorm → GQA因果注意力(RoPE) → +残差
     → RMSNorm → SwiGLU前馈(或MoE)   → +残差

3. 几个高频名词解释

  • RMSNorm:LayerNorm 的简化版,只按均方根缩放、不减均值,更快且效果相当。
  • SwiGLU:把 FFN 拆成两条路、用 SiLU 门控相乘,替换普通 GELU-FFN,表达力更强。
  • MoE(混合专家):FFN 换成很多「专家」,每个 token 只激活 top-k 个 → 总参数巨大、但每次算得少。DeepSeek-V3、Mixtral 是代表。
  • KV Cache:见 GPT架构,推理提速的关键。
  • Speculative Decoding(投机解码):用小模型猜、大模型批量验证,加速生成。

4. 训练三阶段:从「会说话」到「说好话」

① 预训练 Pretrain      海量文本, 预测下一词        → 获得语言能力(最贵)

② 指令微调 SFT         少量高质量"指令-回答"对      → 学会"听指令、按格式回答"

③ 对齐 RLHF / DPO      人类偏好信号做强化/偏好优化   → 更有用、更安全、更对齐
  • 结构没变,变的是数据与训练目标。这解释了两个模型架构相同、表现却天差地别。
  • DPO 等偏好优化因免去显式奖励模型,成为更轻量的对齐选择。

5. 开源与闭源代表(了解生态)

开源可自部署:  LLaMA 系列 · Qwen(通义) · DeepSeek · GLM(智谱) · Mistral · Yi
闭源 API:      GPT / Claude / Gemini

对开发者的意义:架构一致,所以同一套微调(LoRA)、推理(vLLM)、RAG 代码,能在这些模型间迁移。本仓库的 book-ragbook-langchain 正是建立在这类模型之上。

6. 前沿方向一瞥

  • 多模态:把图像/音频也编码成 token,喂进同一个 Transformer(ViT、Whisper、GPT-4V、Qwen-VL)。
  • 长上下文:百万 token 级(YaRN、位置外推、稀疏)。
  • 推理增强:思维链、test-time 计算,让模型「想得更久」而非只「更大」。
  • 更高效架构:Mamba/线性注意力等对 O(n²) 的持续挑战。

小结

  • 今日主流 = Decoder-only Transformer + RoPE + GQA + RMSNorm + SwiGLU (+MoE) + FlashAttention
  • 它与你的 NanoGPT 同源,只是每块零件都升级了——你完全看得懂。
  • 大模型能力 = 相同结构 × 预训练/SFT/对齐三阶段 × 数据与规模。
  • 掌握这套「配方语言」,你就能读懂并评估任何新模型。

结语

从「什么是 Transformer」,到注意力、位置编码、三大架构,再到亲手训练一个能续写的 NanoGPT、微调预训练模型,最后接轨现代大模型——你已经走完了一条从原理到实战的完整闭环。继续动手、把语料换成你自己的内容,让这台你自己搭的小机器跑起来,就是对所学最好的巩固。祝学习顺利!