karpathy/llm-council
karpathy/llm-council
来源定位
karpathy/llm-council 是 Karpathy 的本地 Web app 实验:用户不是只问一个 LLM,而是把多个模型组成 “LLM Council”。系统把同一个问题发给多个模型,收集初始答案,再让模型匿名互评彼此输出,最后由一个 Chairman LLM 汇总最终回答。
工作流
README 描述的流程分三段:
- First opinions:每个模型独立回答;用户可以逐个查看。
- Review:每个模型看到其他模型的答案,并在匿名条件下按 accuracy / insight 排名,降低对品牌名的偏好。
- Final response:Chairman 模型读取全部回答与评审,合成最终答案。
知识库价值
这个项目的重要性不在 UI,而在 workflow:它把“多模型并排比较”升级成“多模型互审 + 主席汇总”。对 AI-Self-Improvement-Lab 和 Hermes 工作流的启发是:
- 高风险答案可以先由多个模型/子代理给出独立意见。
- 审查阶段应尽量匿名,避免模型根据来源名而非内容质量打分。
- 最终合成者不只是投票器,而要解释差异、吸收强观点、指出不确定性。
风险与边界
- 多模型互评仍可能共享同一类盲点,不能代替真实执行、测试或一手来源。
- Chairman 可能过度平滑少数但正确的异议。
- 成本和延迟随模型数上升,不适合所有日常查询。
- README 明确称这是 99% vibe coded 的 Saturday hack,作者不承诺维护;应看作实验灵感而非稳定基础设施。
可迁移实践
- 代码审查:一个 agent 写 patch,另一个 agent 按测试/安全/schema 评审,第三个合并建议。
- Wiki 更新:一个 agent 生成页面,另一个检查 wikilinks/frontmatter/provenance,主 agent 最终写入。
- 决策题:保留各模型初始意见和互评理由,而不只保留最终答案。