Sitegeist — visual diversity benchmark for coding agents
Sitegeist — visual diversity benchmark for coding agents
核心判断
Sitegeist 值得进入 wiki,因为它把 coding-agent benchmark 从“能否实现功能/通过测试”扩展到一个经常被忽略的问题:当多个领先 coding agents 面对中性网站 brief 时,它们是否会反复生成相似的视觉模式。它不是通用设计能力排行榜,而是一个可审计的 visual artifact corpus:100 个 neutral briefs、4 组模型/agent 输出、400 个完整自包含网站,以及生成/移动端/代码量/重复审计报告。
这对用户重要:用户知识库正在扩展 product-design / UX 类别,同时 AI radar 关注 agentic coding。Sitegeist 正好连接二者:未来评估 AI 产品/前端生成,不应只问“页面能不能 build”,还要问是否存在模板化、重复、审美收敛、移动端失败和 artifact contract 违约。
机制:隔离生成 + artifact contract + duplication audit
README 中最有价值的机制包括:
- 隔离生成边界:每次 generation 在 fresh one-site filesystem 中运行;worker 只看到 neutral work order、private brief 和 artifact contract,看不到 gallery、git history、其他结果或反馈。
- 自包含产物合同:接受的网站必须提供 authored source、dependency-free static build、self-contained 4:3 gallery poster。
- 自动拒绝条件:remote assets、runtime network dependencies、symlinks、malformed artifacts、console errors、mobile horizontal overflow 都会被 evaluator 拒绝。
- 多维审计报告:包含 exact source/build duplication、cross-model duplication、artifact volume、final collection integrity 等 deterministic audits。
- 新增模型 workflow:
.skills/add-model/SKILL.md作为操作清单,要求记录 CLI harness、模型、隔离边界、自动 review、mobile-audit replacement、跨集合比较和 final verifier。
一阶原理是:对开放式生成任务,不能只依赖主观品味或最终截图;必须保存生成边界、源代码、构建产物和重复检测证据,让读者自己检查 quality 与 convergence。
与现有 wiki 概念的关系
- 对 Agent-Benchmarks:补充“视觉多样性 / 模式重复 / artifact integrity”维度,弥补 pass-rate benchmark 的盲区。
- 对 Harness-Engineering:展示了一个前端/设计生成 harness:隔离环境、产物合同、自动 reject、audit reports、模型新增流程。
- 对 Agentic-Coding:提醒 coding agent 即使能构建成功,也可能陷入默认模板和审美重复。
- 对 AI-Code-Review:review 生成式 UI 需要检查 artifact contract、运行时依赖、移动端 overflow、重复来源,而不仅是代码正确性。
对 Hermes / llm-wiki 的可执行启发
- 为 AI UI/前端任务增加 diversity check:当 Hermes 生成多个候选 UI,不应只选第一个能跑的版本;应审查重复布局、默认色板、卡片套路、视觉收敛。
- product-design 类别可引入 agent-generated artifact 评估页:连接产品体验、前端实现和 agent benchmark。
- llm-wiki 页面也可做 duplication audit:每日 radar 若连续入库相似“harness/control plane”页面,应检查是否只是换名重复,必要时合并或写 comparison。
- 新增模型/工具应保留 harness metadata:模型名、CLI、版本、隔离边界、验证器和审计报告比最终截图更重要。
失败模式与边界
- 任务面窄:Sitegeist 只覆盖 constrained website-generation,不代表通用 coding、UX research 或产品策略能力。
- exact duplicate 不等于语义重复:deterministic duplicate audits 只能抓完全相同 source/build,不能完整衡量风格相似。
- poster 不是证据本身:README 明确 gallery posters 是 authored representations,真实网站需在 full-screen viewer / source 中检查。
- 模型别名会漂移:provider behavior 和 agent tooling 会变,结论必须绑定 run 配置。
深度判断
晋升理由:它提供了可复用评测方法论,并把 agent coding 与产品设计/视觉质量连接起来。今天没有创建 comparison 页面,因为需要进一步读取 benchmark reports / gallery 才能比较不同模型;先以 source note 入库。
写入记录
- 2026-07-27 09:07 CST:新增 source 页面,沉淀 Sitegeist 对视觉多样性 benchmark、隔离生成、artifact contract 和 duplication audit 的启发。