← 返回藏书阁

AutoResearch

wiki/ai/concepts/AutoResearch.md
分类:ai / concepts · 更新:2026-06-23 09:05

AutoResearch

定义

AutoResearch 是 Karpathy 的自主研究循环实验:让 AI coding agent 在一个小型、真实的 LLM 训练任务上自动提出改动、编辑训练代码、运行固定预算实验、根据指标判断结果,并反复迭代。

核心不是“让 agent 写一次代码”,而是让 agent 运行一个可重复的研究循环:hypothesis → code change → experiment → metric → keep/revert → next hypothesis

机制

karpathy/autoresearch 的核心结构很小:

  • prepare.py:数据准备和运行工具,通常不让 agent 修改。
  • train.py:模型、优化器和训练循环,是 agent 的主要修改面。
  • program.md:人类给 agent 的研究组织说明,相当于轻量级 skill / research brief。

每次实验使用固定训练预算,并用验证指标比较效果。GitHub README 中的关键指标是 val_bpb(validation bits per byte),越低越好。

为什么重要

AutoResearch 把 Agentic-Engineering 的对象从普通软件功能推进到“研究过程本身”。这对个人/团队的启发是:

  1. 把研究问题压缩到一个足够小、可自动运行的环境。
  2. 明确 agent 可以修改什么、不能修改什么。
  3. 固定预算,避免无约束地消耗算力和时间。
  4. 用指标做第一层筛选,但保留人类对方向和意义的判断。
  5. 让 prompt / program.md 也成为可改进的组织代码。

对 Hermes / LLM Wiki 的启发

可以把 AutoResearch 的模式迁移到非训练任务:

  • prompt autoresearch:只允许修改一个 prompt/template,在固定 eval set 上比较。
  • wiki autoresearch:让 agent 提议链接修复、页面拆分、摘要改写,用 lint/检索命中率评估。
  • skill autoresearch:让 agent 改进某个 skill 的步骤,跑真实任务回放判断成功率。

这与 AI-Self-Improvement-Lab 的目标一致:模型权重不变,但通过外部记忆、工具、评估和反思循环提升同一个 agent 的表现。

风险

  • 指标代理问题:val_bpb 或测试集提升不一定等于真实研究价值。
  • 搜索空间漂移:如果不限制可修改范围,agent 可能制造难以审查的复杂性。
  • 结果污染:自动实验日志和中间产物需要严格版本化,否则难以复现。
  • 人类过度信任:AutoResearch 是候选发现系统,不是最终科学判断。

2026-06-23 补充:loopy era 的工作形态信号

今日 radar 读取到的 NextBigFuture 二手汇总把 AutoResearch 放进 Karpathy 所说的 “loopy era”:coding / research agents 不只是一次性回答或补丁生成器,而是能连续运行、编辑代码、跑实验、读取指标、保留有效改动并继续迭代的 loop。虽然该来源不是 Karpathy 一手长文,但它与已有 GitHub / X 线索一致,补强了 AutoResearch 的定位:它是一个小型、可审计的 research loop 原型,而不是单纯的 AutoML demo。

AI-Self-Improvement-Lab 的实践含义是:不要把“自我改进”定义成模型自由探索,而要先定义外部循环结构——可修改文件、固定预算、指标、失败回滚、日志与人工抽查。只有这些边界存在,agent 的持续运行才可能成为知识积累,而不是更快地产生不可审查改动。