Skip to content

Andrej Karpathy 教程

从零手写神经网络到 GPT / Tokenizer 的视频课 + 配套代码,偏直觉与可运行实现。

它是做什么的

官方课表页 Neural Networks: Zero to Hero 定位:用代码从零搭网络,从反向传播讲到现代深度网(含 GPT)。作者认为语言模型是学深度学习的好切入点:即便你最终去做视觉或其他方向,这里练到的张量、优化、架构直觉大多可迁移。前置要求写得很明确:扎实 Python;入门级数学(导数、高斯分布等即可),不要求先啃完一本深度学习教材。课表按视频列出时长与主题,并链到 Discord 讨论。配套 GitHub 仓库提供可运行代码;后期还有 nanoGPT、minbpe 等把课堂内容接到「能训/能复现」的小仓库。

要点

  • micrograd:手写标量 autograd,把 backprop 与训练一步一步讲透(约 2.5h)
  • makemore 系列:字符级语言模型框架(训练、采样、loss)→ MLP → 激活/梯度/BatchNorm 诊断 → 不用 loss.backward() 的手写 backprop → WaveNet 式加深结构与 torch.nn 直觉
  • Let's build GPT:按 Attention 论文与 GPT-2/3 思路,从零实现 GPT;默认你已熟悉自回归语言建模与张量/nn 基础
  • GPT Tokenizer:BPE、encode/decode;大量 LLM「怪行为」如何追溯到分词阶段
  • 配套仓库常见:microgradmakemorenn-zero-to-heronanoGPTminGPTminbpellm.c 等(完整列表见其 GitHub)
  • 课表仍标注 ongoing:以 zero-to-hero 页面 当前列表为准,不必依赖二手目录

适合谁

  • 不满足于只会调 API,想搞清「前向/反向到底在算什么」
  • 有编程基础、愿每集自己敲通
  • 准备读 Transformer 论文或改训练代码前先打底

官方入口

建议怎么用

严格按 zero-to-hero 顺序:micrograd → makemore 各集 → GPT → Tokenizer。跳过前面直接看 GPT,容易只会抄注意力代码、不会查梯度与 shape 问题。每集目标:自己仓库里能跑通对应 notebook/脚本,并改一两个超参观察 loss。有 PyTorch 基础后,用 nanoGPT 做中等规模训练/微调;学分词可对照 minbpe,把课里的 Tokenizer 讲义落到可复用代码。

本站为个人非经营性学习导航。免责声明:信息仅供学习参考,不构成建议或背书;外链与第三方产品归其权利人。详情见 关于本站 · 隐私政策