Appearance
从注意力机制到小模型训练实战,吃透大模型的地基
了解 Transformer 是什么、为什么诞生,搭好开发环境
吃透词嵌入、位置编码、注意力机制、多头注意力
逐层拆解 Encoder-Decoder、BERT、GPT 三大范式
使用 HuggingFace Transformers 完成分词、推理与训练
从零搭建并训练一个 NanoGPT 小模型,落到实战
高效注意力、RoPE 位置编码与主流模型家族演进
本教程以「讲清楚原理 + 动手练到位」为主线:先用图示把每一块机制讲明白,再带你从零实现并训练一个可运行的 Transformer 小模型(NanoGPT),最后延伸到大模型的主流演进方向。