← 返回藏书阁

karpathy/nanochat

wiki/ai/sources/karpathy-nanochat.md
分类:ai / sources · 更新:2026-06-26 09:03

karpathy/nanochat

来源定位

karpathy/nanochatKarpathy 发布的最小化 LLM 训练实验 harness。README 将它定位为“the simplest experimental harness for training LLMs”:单 GPU 节点可跑,代码保持 minimal / hackable,并覆盖 tokenization、pretraining、finetuning、evaluation、inference 和 chat UI。

它不是生产级训练平台,而是 AI-native education / research 的可读参照:让学习者和 agents 能端到端理解“一个 ChatGPT-like 系统如何被训练、评估和对话”。

关键事实

  • GitHub API 验证:karpathy/nanochat 存在,描述为 “The best ChatGPT that $100 can buy.”;2026-06-19 查询约 55k stars,2026-06-26 查询约 55.4k stars。
  • README 示例称:可以用约 2 小时的 8xH100 GPU 节点、约 $48 成本训练 GPT-2 capability LLM;spot instance 成本可接近 $15。
  • 通过一个复杂度旋钮 --depth 控制模型层数;其他超参(宽度、heads、学习率调整、训练 horizon、weight decay 等)自动计算。

Time-to-GPT-2 leaderboard

nanochat 的核心评估不是“训练一个玩具模型”,而是一个可复现的 Time-to-GPT-2 speedrun:在 8xH100 节点上训练一个 nanochat 模型,使其 DCLM CORE 分数超过 GPT-2 的 0.256525,然后比较训练迭代 wall-clock time。

2026-06-26 抓取的 README leaderboard 显示:

里程碑时间CORE说明
OpenAI GPT-2 checkpoint168h0.25652019 原始参照
d24 baseline3.04h0.25852026-01-29,Karpathy
+fp82.91h0.25782026-02-02
batch size 1M2.76h0.26022026-02-05
AutoResearch round 11.80h0.26902026-03-09
AutoResearch round 21.65h0.26262026-03-14

dev/LEADERBOARD.md 还给出一个重要 governance 规则:即使改动让时间更短,如果实现过于 gnarly、显著 bloat 代码、过于 esoteric,或不能泛化到一组模型深度,也会被折扣。这使 leaderboard 不只是单指标竞赛,而是带有人类审美与可维护性 gate 的 agentic research benchmark。

为什么值得入库

nanochat 与 AutoResearch 形成一组:

  • nanochat 提供一个足够完整但仍可审查的 LLM 训练对象。
  • AutoResearch 在其上运行 agentic research loop:提出假设、修改训练代码、跑实验、按指标保留或回滚。
  • Agentic-Engineering 需要这样的“可验证沙盒”,否则 agent 只是在无边界地生成代码。

使用判断

适合:

  • 学习完整 LLM pipeline。
  • 设计小型训练实验。
  • 作为 agents 自动研究的环境。
  • 训练工程 intuition:tokenizer、pretraining、SFT、eval、inference 如何连接。

不适合:

  • 生产部署。
  • 大规模多节点训练。
  • 需要合规、安全、数据治理的正式模型训练。

后续跟踪问题

  1. nanochat 的 pipeline 是否会成为 Karpathy AI 教育体系的核心“毕业项目”?
  2. AutoResearch 对 nanochat 的自动改动中,哪些能稳定迁移到更大模型?
  3. Hermes/LLM Wiki 是否可以借鉴 --depth 式“单旋钮复杂度”设计,把复杂 workflow 包装成少数可理解参数?
  4. LLM Wiki 的自动摄入是否也应采用 Time-to-GPT-2 式 gate:固定输入预算、固定质量阈值、固定不可牺牲约束,然后优化“高信号知识沉淀效率”?