← 返回藏书阁

Context Engineering Kit

wiki/ai/sources/context-engineering-kit.md
分类:ai / sources · 更新:2026-07-02 09:08

Context Engineering Kit

一句话结论

NeoLabHQ 的 Context Engineering Kit(CEK)把“上下文工程”具体化成可安装、可选择、可组合的 agent skills/plugins:Reflexion、Spec-Driven Development、Subagent-Driven Development、DDD、Tech Stack 等。它的价值不在于技能数量,而在于展示了一种更成熟的 skill packaging 思路:最小 token footprint、插件粒度隔离、按需加载、质量导向、用 standards 承载 workflow

为什么对用户重要

用户的 Hermes / llm-wiki 已经依赖 skills、cron prompt、wiki schema 和写入记录维持长期行为。CEK 提醒我们:上下文工程不是“把更多规则塞进 prompt”,而是把不同场景的规则拆成可安装、可卸载、可组合、可验证的小插件。对 Hermes 来说,这比一个巨大的万能 skill 更可维护。

CEK 还明确支持 Hermes agents,并在 v3.0.0 中提到 Tech Stack plugin 会在 agent 读写 TypeScript 文件时自动注入 TypeScript best practices。这说明跨 agent 的 skills 生态正在从 Claude Code 专属配置,转向更通用的 agent behavior layer。

机制 / 一阶原理

CEK README 强调几个机制:

  1. Token-efficient:优先使用 command-oriented skills 与 sub-agents,而不是把大量通用信息常驻上下文。
  2. Granular:安装某个 plugin 只加载对应 agents、commands、skills,避免重叠和冗余。
  3. Quality-focused:每个 plugin 针对一个能显著提升结果质量的具体问题。
  4. Open standards:skills 基于 agentskills.io specification,SDD plugin 基于 Arc42 软件架构文档标准。
  5. Reflexion / memorize loop:实现后运行 /reflect 复盘,再用 /memorize 把可复用策略保存到项目记忆。

一阶原理是:agent 的上下文预算有限,长期质量来自“在正确时刻加载正确约束”,而不是全局堆叠规则。插件化上下文工程的目标是降低 context rot:每个技能只在相关任务中进入上下文,并尽量把大知识留在文档、命令或子代理里。

与既有 wiki 概念的关系

  • Context-Engineering:CEK 是“上下文资产工程化”的外部实例,强调按需加载和 token footprint。
  • External-Agent-Skills-Design-Patterns:补充 plugin granularity、open standards、context budget management 与 reflect/memorize loop。
  • Spec-driven-development:CEK 的 SDD plugin 把规格驱动开发包装成 agent workflow,并引入 Arc42、DDD/SOLID、code reviewer agent。
  • 子代理驱动开发:CEK 的 SADD plugin 用 meta-judge 和 judge sub-agents 并行生成规格,说明子代理不只是多开任务,也可以承担评审/判定角色。
  • Harness-Engineering:CEK 属于 harness 的上下文/规则层,不直接替代 runtime containment 或 verification membrane。

对 Hermes / llm-wiki 的可执行启发

  1. Hermes skills 应从“大而全说明书”转向“路由层 + references + scripts + 按需子技能”的结构,避免每次任务加载无关上下文。
  2. 新增技能前应明确粒度:它解决一个可复用 workflow,还是只是一组通用建议?后者不应自动加载。
  3. 对 llm-wiki 雷达,可把“是否提供 open standard / schema / package manager / lint / eval loop”作为 skills/tools 候选的加分项。
  4. 自我优化流程可以借鉴 /reflect/memorize:每次 deep ingest 后只把经过验证、可复用的流程经验提升为技能或 cron prompt 改动,其余只写入当天优化文章。

失败模式与边界

  • 营销式效果声明需保守看待:README 中“99% working code”等说法需要独立评测,不能直接当事实写入高置信页面。
  • 插件过多会产生选择成本:granular 设计降低上下文污染,但也要求安装前有 discovery、lint 和适配判断。
  • 跨 agent 兼容不等于语义一致:Claude Code、Hermes、Codex、Cursor 的 skill 加载和权限模型不同,复制插件前必须验证触发与安全边界。
  • 上下文层不能替代执行验证:CEK 改善 instruction following,但仍需 Agent-Benchmarks、测试、lint、sandbox 和 verification membrane 证明结果。

深度判断

值得晋升为 source 页面,因为它为“agent skills 应如何组织”提供了比单个技能仓库更系统的设计样本:按需加载、插件粒度、开放规范、反思记忆闭环。它能直接指导 Hermes skill 设计、llm-wiki cron prompt 收敛和外部 skills 生态筛选。

写入记录

  • 2026-07-02 09:00 CST:新增 source 页面,分析 CEK 对上下文工程插件化、Hermes skill 粒度和 reflect/memorize 自我优化闭环的启发。