Sequoia Ascent 2026 — Software 3.0, Agentic Engineering, and Jagged Intelligence
Sequoia Ascent 2026 — Software 3.0, Agentic Engineering, and Jagged Intelligence
概要
这是 Karpathy 在 Sequoia Ascent 2026 fireside chat 后发布的整理稿。它把 2026 年的 agentic workflow 讲成一个完整框架:LLM 不再只是 chatbot 或 autocomplete,而是正在成为数字工作的可编程操作层。
核心转变是:程序员不再主要输入一行行代码,而是把任务拆成更大的 macro actions,交给 Claude Code、Codex、Cursor-like agents 等工具执行,再由人类设计上下文、工具、反馈回路、guardrails,并保留最终判断。
核心观点
Software 3.0
Karpathy 把软件演化分成三层:
| 阶段 | 程序在哪里 |
| Software 1.0 | 人类显式写出的代码 |
| Software 2.0 | 通过数据和目标训练进神经网络权重的程序 |
| Software 3.0 | prompt、上下文、工具、示例、记忆、instructions 组成的 LLM 程序 |
在 Software-3.0 中,context window 是新的主要编程介质,LLM 像一个解释器一样执行上下文。传统上需要跨平台 shell script、安装脚本、集成代码的任务,可以越来越多地变成自然语言程序:让 agent 读取环境、尝试、观察错误、调试并完成安装。
Agentic workflow checklist
这篇来源给出一个非常适合落到 Agentic-Engineering / Harness-Engineering 的操作清单:
define the context
define the tools
define the feedback loop
define the guardrails
let agents work
preserve human understanding
这也解释了为什么仅有“更聪明的模型”不够:要让 agent 稳定产出,需要围绕任务构造可执行上下文、工具边界、反馈指标和审查机制。
Verifiability 与 jagged intelligence
Karpathy 的重要区分:传统软件自动化的是“能被 specify 的任务”,LLM/RL 自动化的是“能被 verify 的任务”。因此能力提升会很不均匀:代码、数学、训练实验、测试驱动修改等可验证任务会先出现 capability spike;评价更软、反馈更模糊的任务会慢很多。
来源中的启发式公式:
capability spike ~= verifiability x training attention x data coverage x economic value
这为 Agent-Benchmarks 和 AI-Self-Improvement-Lab 提供了一个设计原则:若希望 agent 自我改进,先把任务放进可验证 sandbox,再谈长循环。
“应用消失”的 MenuGen 例子
MenuGen 原本像传统 AI app:拍菜单、OCR、生成菜品图、渲染 UI、部署前后端、处理 auth/payment/secrets。Karpathy 用它说明另一个趋势:多模态模型可以直接把输入媒体转换成输出媒体——拍菜单,然后让模型把菜品图直接渲染回菜单图上。部分 app stack 被模型能力吞掉。
这不是“用 AI 更快做旧 app”,而是重新判断哪些 app 其实不该以传统软件形态存在。
对 wiki 的意义
- 更新 Agentic-Engineering:补充 Software 3.0、verifiability、agentic workflow checklist。
- 创建 Software-3.0:把“上下文即程序”的框架单独沉淀。
- 对 AI-Self-Improvement-Lab:优先选择可验证实验,避免在没有反馈指标的开放任务上幻想自我改进。
相关
- AutoResearch 是“可验证 sandbox + agent loop”的典型实例。
- Context-Engineering 决定 Software 3.0 程序的主要质量。
- Vibe-Coding 更像面向结果的轻量表达,Agentic-Engineering 则强调可验证、可审查、可持续的 agent 编排。