karpathy/nanochat
karpathy/nanochat
来源定位
karpathy/nanochat 是 Karpathy 发布的最小化 LLM 训练实验 harness。README 将它定位为“the simplest experimental harness for training LLMs”:单 GPU 节点可跑,代码保持 minimal / hackable,并覆盖 tokenization、pretraining、finetuning、evaluation、inference 和 chat UI。
它不是生产级训练平台,而是 AI-native education / research 的可读参照:让学习者和 agents 能端到端理解“一个 ChatGPT-like 系统如何被训练、评估和对话”。
关键事实
- GitHub API 验证:
karpathy/nanochat存在,描述为 “The best ChatGPT that $100 can buy.”;2026-06-19 查询约 55k stars,2026-06-26 查询约 55.4k stars。 - README 示例称:可以用约 2 小时的 8xH100 GPU 节点、约 $48 成本训练 GPT-2 capability LLM;spot instance 成本可接近 $15。
- 通过一个复杂度旋钮
--depth控制模型层数;其他超参(宽度、heads、学习率调整、训练 horizon、weight decay 等)自动计算。
Time-to-GPT-2 leaderboard
nanochat 的核心评估不是“训练一个玩具模型”,而是一个可复现的 Time-to-GPT-2 speedrun:在 8xH100 节点上训练一个 nanochat 模型,使其 DCLM CORE 分数超过 GPT-2 的 0.256525,然后比较训练迭代 wall-clock time。
2026-06-26 抓取的 README leaderboard 显示:
| 里程碑 | 时间 | CORE | 说明 |
| OpenAI GPT-2 checkpoint | 168h | 0.2565 | 2019 原始参照 |
| d24 baseline | 3.04h | 0.2585 | 2026-01-29,Karpathy |
| +fp8 | 2.91h | 0.2578 | 2026-02-02 |
| batch size 1M | 2.76h | 0.2602 | 2026-02-05 |
| AutoResearch round 1 | 1.80h | 0.2690 | 2026-03-09 |
| AutoResearch round 2 | 1.65h | 0.2626 | 2026-03-14 |
dev/LEADERBOARD.md 还给出一个重要 governance 规则:即使改动让时间更短,如果实现过于 gnarly、显著 bloat 代码、过于 esoteric,或不能泛化到一组模型深度,也会被折扣。这使 leaderboard 不只是单指标竞赛,而是带有人类审美与可维护性 gate 的 agentic research benchmark。
为什么值得入库
nanochat 与 AutoResearch 形成一组:
- nanochat 提供一个足够完整但仍可审查的 LLM 训练对象。
- AutoResearch 在其上运行 agentic research loop:提出假设、修改训练代码、跑实验、按指标保留或回滚。
- Agentic-Engineering 需要这样的“可验证沙盒”,否则 agent 只是在无边界地生成代码。
使用判断
适合:
- 学习完整 LLM pipeline。
- 设计小型训练实验。
- 作为 agents 自动研究的环境。
- 训练工程 intuition:tokenizer、pretraining、SFT、eval、inference 如何连接。
不适合:
- 生产部署。
- 大规模多节点训练。
- 需要合规、安全、数据治理的正式模型训练。
后续跟踪问题
- nanochat 的 pipeline 是否会成为 Karpathy AI 教育体系的核心“毕业项目”?
- AutoResearch 对 nanochat 的自动改动中,哪些能稳定迁移到更大模型?
- Hermes/LLM Wiki 是否可以借鉴
--depth式“单旋钮复杂度”设计,把复杂 workflow 包装成少数可理解参数? - LLM Wiki 的自动摄入是否也应采用 Time-to-GPT-2 式 gate:固定输入预算、固定质量阈值、固定不可牺牲约束,然后优化“高信号知识沉淀效率”?