← 返回藏书阁

MicroGPT

wiki/ai/sources/MicroGPT.md
分类:ai / sources · 更新:2026-06-19 09:05

MicroGPT

来源定位

MicroGPT 是 Karpathy 在 2026-02-12 发布的教育性极简 GPT 实现。官方 blog 将它描述为:一个约 200 行、纯 Python、无外部依赖的单文件脚本,能训练并推理一个 GPT。它包含数据集、tokenizer、autograd engine、GPT-2-like neural network architecture、Adam optimizer、训练循环和推理循环。

GitHub API 查询 karpathy/microgpt 返回 404;当前一手来源是 Karpathy 官方 blog、gist 与 karpathy.ai/microgpt.html,不是独立 GitHub repo。

核心思想

MicroGPT 的价值在于区分“算法本体”和“工程效率”:

  • 算法本体:next-token prediction、tokenization、autograd、Transformer block、optimizer、training loop、sampling。
  • 工程效率:tensor libraries、GPU kernels、distributed training、FlashAttention、data pipelines。

Karpathy 的表述是:这个文件包含“full algorithmic content”;其他东西主要是效率。

与 nanochat 的关系

  • MicroGPT 是最小原子:解释 GPT 为什么能训练和采样。
- [[karpathy-nanochatkarpathy/nanochat]] 是完整 pipeline:解释 ChatGPT-like 系统如何从 tokenizer 到 chat UI 串起来。
  • AutoResearch 则进一步把 pipeline 变成 agent 可自动实验和改进的环境。

三者可以形成 AI-native education 的阶梯:MicroGPT → nanochat → AutoResearch

知识库价值

MicroGPT 对 AI-Self-Improvement-Lab 的启发是:若希望 agent 真正改进系统,环境必须足够小到“可读、可执行、可验证”。极简实现降低了 agent 和人类共同理解的门槛,也使错误定位更容易。

后续跟踪问题

  1. MicroGPT 是否适合作为 Hermes prompt/agent 训练任务的可解释 benchmark?
  2. 能否把“算法本体 vs 工程效率”的拆分方式用于 wiki 工具:先写最小清晰版本,再逐步加速?
  3. MicroGPT、nanochat、AutoResearch 是否会发展成完整 AI 教育课程链?