Skip to content

Transformer 教程全面系统的 Transformer 学习指南

从注意力机制到小模型训练实战,吃透大模型的地基

快速导航

学习路径

  1. 基础入门 - 简介、发展历史、环境搭建
  2. 核心概念 - 从RNN到Transformer、词嵌入、位置编码、注意力机制、多头注意力、前馈网络与残差连接
  3. 架构详解 - 完整架构、Encoder与Decoder、BERT架构、GPT架构、三大架构对比
  4. Transformers库 - 分词器、模型与推理、数据集处理、训练流程Trainer
  5. 训练实战 - 实战概览、搭建NanoGPT、训练与调参、评估与文本生成、微调预训练模型
  6. 进阶主题 - 高效注意力、位置编码演进RoPE、主流模型家族

本教程以「讲清楚原理 + 动手练到位」为主线:先用图示把每一块机制讲明白,再带你从零实现并训练一个可运行的 Transformer 小模型(NanoGPT),最后延伸到大模型的主流演进方向。