← 返回藏书阁

Sitegeist — visual diversity benchmark for coding agents

wiki/ai/sources/sitegeist-visual-diversity-benchmark.md
分类:ai / sources · 更新:2026-07-27 09:09

Sitegeist — visual diversity benchmark for coding agents

核心判断

Sitegeist 值得进入 wiki,因为它把 coding-agent benchmark 从“能否实现功能/通过测试”扩展到一个经常被忽略的问题:当多个领先 coding agents 面对中性网站 brief 时,它们是否会反复生成相似的视觉模式。它不是通用设计能力排行榜,而是一个可审计的 visual artifact corpus:100 个 neutral briefs、4 组模型/agent 输出、400 个完整自包含网站,以及生成/移动端/代码量/重复审计报告。

这对用户重要:用户知识库正在扩展 product-design / UX 类别,同时 AI radar 关注 agentic coding。Sitegeist 正好连接二者:未来评估 AI 产品/前端生成,不应只问“页面能不能 build”,还要问是否存在模板化、重复、审美收敛、移动端失败和 artifact contract 违约。

机制:隔离生成 + artifact contract + duplication audit

README 中最有价值的机制包括:

  1. 隔离生成边界:每次 generation 在 fresh one-site filesystem 中运行;worker 只看到 neutral work order、private brief 和 artifact contract,看不到 gallery、git history、其他结果或反馈。
  2. 自包含产物合同:接受的网站必须提供 authored source、dependency-free static build、self-contained 4:3 gallery poster。
  3. 自动拒绝条件:remote assets、runtime network dependencies、symlinks、malformed artifacts、console errors、mobile horizontal overflow 都会被 evaluator 拒绝。
  4. 多维审计报告:包含 exact source/build duplication、cross-model duplication、artifact volume、final collection integrity 等 deterministic audits。
  5. 新增模型 workflow.skills/add-model/SKILL.md 作为操作清单,要求记录 CLI harness、模型、隔离边界、自动 review、mobile-audit replacement、跨集合比较和 final verifier。

一阶原理是:对开放式生成任务,不能只依赖主观品味或最终截图;必须保存生成边界、源代码、构建产物和重复检测证据,让读者自己检查 quality 与 convergence。

与现有 wiki 概念的关系

  • Agent-Benchmarks:补充“视觉多样性 / 模式重复 / artifact integrity”维度,弥补 pass-rate benchmark 的盲区。
  • Harness-Engineering:展示了一个前端/设计生成 harness:隔离环境、产物合同、自动 reject、audit reports、模型新增流程。
  • Agentic-Coding:提醒 coding agent 即使能构建成功,也可能陷入默认模板和审美重复。
  • AI-Code-Review:review 生成式 UI 需要检查 artifact contract、运行时依赖、移动端 overflow、重复来源,而不仅是代码正确性。

对 Hermes / llm-wiki 的可执行启发

  1. 为 AI UI/前端任务增加 diversity check:当 Hermes 生成多个候选 UI,不应只选第一个能跑的版本;应审查重复布局、默认色板、卡片套路、视觉收敛。
  2. product-design 类别可引入 agent-generated artifact 评估页:连接产品体验、前端实现和 agent benchmark。
  3. llm-wiki 页面也可做 duplication audit:每日 radar 若连续入库相似“harness/control plane”页面,应检查是否只是换名重复,必要时合并或写 comparison。
  4. 新增模型/工具应保留 harness metadata:模型名、CLI、版本、隔离边界、验证器和审计报告比最终截图更重要。

失败模式与边界

  • 任务面窄:Sitegeist 只覆盖 constrained website-generation,不代表通用 coding、UX research 或产品策略能力。
  • exact duplicate 不等于语义重复:deterministic duplicate audits 只能抓完全相同 source/build,不能完整衡量风格相似。
  • poster 不是证据本身:README 明确 gallery posters 是 authored representations,真实网站需在 full-screen viewer / source 中检查。
  • 模型别名会漂移:provider behavior 和 agent tooling 会变,结论必须绑定 run 配置。

深度判断

晋升理由:它提供了可复用评测方法论,并把 agent coding 与产品设计/视觉质量连接起来。今天没有创建 comparison 页面,因为需要进一步读取 benchmark reports / gallery 才能比较不同模型;先以 source note 入库。

写入记录

  • 2026-07-27 09:07 CST:新增 source 页面,沉淀 Sitegeist 对视觉多样性 benchmark、隔离生成、artifact contract 和 duplication audit 的启发。