Appearance
主流模型家族
学完原理与实战,最后把视野拉高:现代主流大模型都是「同一个 Transformer 骨架 + 一堆工程升级」。读懂它们的差异,你就能看懂任何一篇新模型的发布。
1. 一张谱系图
Transformer (2017)
│
┌───────────────────┼────────────────────┐
▼ ▼ ▼
Encoder-only Encoder-Decoder Decoder-only ← 今日绝对主流
BERT 系 T5 / BART GPT → LLaMA 系
(理解/检索) (转换/生成) (生成/对话/Agent)
│
┌──────────────┬───────────┼───────────┐
▼ ▼ ▼ ▼
GPT-4/ChatGPT LLaMA Qwen DeepSeek ...
(闭源旗舰) (开源基石) (中文强) (MoE/低成本)2. 现代 Decoder-only 模型的「标准配方」
把本教程的 NanoGPT 和真实大模型对比,会发现结构一脉相承,只是每一块都做了升级:
| 组件 | 你的 NanoGPT / GPT-2 | 现代大模型(LLaMA/Qwen) | 收益 |
|---|---|---|---|
| 位置编码 | 可学习绝对编码 | RoPE(相对、可外推) | 长上下文 |
| 注意力头 | MHA 每头独立 KV | GQA/MQA 共享 KV | 省推理显存 |
| 归一化 | Post-LN | Pre-LN + RMSNorm | 更稳/更快 |
| FFN 激活 | ReLU/GELU | SwiGLU(门控) | 同样参数更强 |
| 分词 | 字符/BPE | SentencePiece/BPE 大词表 | 多语言高效 |
| 注意力实现 | SDPA/Flash | FlashAttention | 长序列可行 |
| 规模结构 | 稠密 | 部分用 MoE 混合专家 | 大参数小算力 |
一个现代 Transformer 层(以 LLaMA 为例):
x → RMSNorm → GQA因果注意力(RoPE) → +残差
→ RMSNorm → SwiGLU前馈(或MoE) → +残差3. 几个高频名词解释
- RMSNorm:LayerNorm 的简化版,只按均方根缩放、不减均值,更快且效果相当。
- SwiGLU:把 FFN 拆成两条路、用 SiLU 门控相乘,替换普通 GELU-FFN,表达力更强。
- MoE(混合专家):FFN 换成很多「专家」,每个 token 只激活 top-k 个 → 总参数巨大、但每次算得少。DeepSeek-V3、Mixtral 是代表。
- KV Cache:见 GPT架构,推理提速的关键。
- Speculative Decoding(投机解码):用小模型猜、大模型批量验证,加速生成。
4. 训练三阶段:从「会说话」到「说好话」
① 预训练 Pretrain 海量文本, 预测下一词 → 获得语言能力(最贵)
│
② 指令微调 SFT 少量高质量"指令-回答"对 → 学会"听指令、按格式回答"
│
③ 对齐 RLHF / DPO 人类偏好信号做强化/偏好优化 → 更有用、更安全、更对齐- 结构没变,变的是数据与训练目标。这解释了两个模型架构相同、表现却天差地别。
- DPO 等偏好优化因免去显式奖励模型,成为更轻量的对齐选择。
5. 开源与闭源代表(了解生态)
开源可自部署: LLaMA 系列 · Qwen(通义) · DeepSeek · GLM(智谱) · Mistral · Yi
闭源 API: GPT / Claude / Gemini对开发者的意义:架构一致,所以同一套微调(LoRA)、推理(vLLM)、RAG 代码,能在这些模型间迁移。本仓库的 book-rag、book-langchain 正是建立在这类模型之上。
6. 前沿方向一瞥
- 多模态:把图像/音频也编码成 token,喂进同一个 Transformer(ViT、Whisper、GPT-4V、Qwen-VL)。
- 长上下文:百万 token 级(YaRN、位置外推、稀疏)。
- 推理增强:思维链、test-time 计算,让模型「想得更久」而非只「更大」。
- 更高效架构:Mamba/线性注意力等对 O(n²) 的持续挑战。
小结
- 今日主流 = Decoder-only Transformer + RoPE + GQA + RMSNorm + SwiGLU (+MoE) + FlashAttention。
- 它与你的 NanoGPT 同源,只是每块零件都升级了——你完全看得懂。
- 大模型能力 = 相同结构 × 预训练/SFT/对齐三阶段 × 数据与规模。
- 掌握这套「配方语言」,你就能读懂并评估任何新模型。
结语
从「什么是 Transformer」,到注意力、位置编码、三大架构,再到亲手训练一个能续写的 NanoGPT、微调预训练模型,最后接轨现代大模型——你已经走完了一条从原理到实战的完整闭环。继续动手、把语料换成你自己的内容,让这台你自己搭的小机器跑起来,就是对所学最好的巩固。祝学习顺利!