halu-core — claim-grounded execution and reporting honesty benchmark engine
halu-core — claim-grounded execution and reporting honesty benchmark engine
为什么值得关注
halu-core 的核心问题非常贴近 agent 实践:AI agent 是否真的做了它在最终报告里声称做过的事?它把评测拆成 Execution Reliability(是否完成工作)和 Reporting Honesty(报告是否如实描述工作),并用 run/token lifecycle、scoped token、Agent API、event-sourced audit log 和 deterministic scoring engine 来核验 action 与 claim。这对 Agent-Benchmarks、Harness-Engineering 和 Hermes 最终报告规范都有直接价值。
深度判断:值得晋升,因为它不是泛泛的 leaderboard,而是把“执行证据”和“汇报诚实度”分离成可复用评测机制。用户的 llm-wiki cron 最容易退化成“说已入库但没验证”,halu-core 正好提供反模式纠偏。
机制 / 一阶原理
halu-core 的一阶原理是:最终报告中的 claim 必须能回溯到受控 action log。它用 challenge/context/items/actions/completion/events/result 组织一次 run;agent 先拿到 scoped single-run token,执行允许的 action,最后提交包含 structured claims 的 completion。评分器再基于 event log 判断:
- task completion 是否真实发生;
- action accuracy 是否符合任务;
- claim honesty 是否与事件一致;
- tool usage 是否越界或缺失;
- safety 是否违反规则。
关键点是 scoring 尽量 deterministic,隐藏挑战数据和答案留在私有 halu-web,公开的 halu-core 只提供可自托管评测引擎和示例挑战。这有助于减少 agent 对 hidden answer 的污染。
与现有 wiki 概念的关系
- 对 Agent-Benchmarks:补充“报告诚实度”维度,而不只看任务是否最终通过。
- 对 Harness-Engineering:完成门禁应要求 action log 支撑 final report。
- 对 Loop-Engineering:长期循环需要区分“上轮真的完成”与“上轮报告声称完成”,否则错误状态会滚入下一轮。
- 对 Knowledge-as-Code:wiki ingest 的 claim 也应可追溯到 raw/source/page diff,而不是只靠自然语言总结。
对 Hermes / llm-wiki 的可执行启发
- 日报中的“实际入库”必须绑定文件路径:每个 claim 对应 raw/source/concept/index/log/reindex 的真实结果。
- 把未验证内容显式降级:无法访问网页、API rate limit、只读到 README 前段时,confidence 只能 medium/low,不能写成已证实结论。
- 为 cron 增加 completion checklist:orientation、discovery、raw save、source page、concept update、index/log、vector reindex、QA,每项 PASS/HOLD/FAIL。
- 区分 did-work 与 said-work:最终报告应明确哪些是工具输出支持,哪些是 agent synthesis/inference。
失败模式 / 边界条件
- benchmark challenge 与真实工作差距:example challenges 不能代表复杂 repo / wiki 任务;需要把思想迁移到真实 workflow receipts。
- deterministic scoring 覆盖不足:很多知识综合质量无法完全确定性评分,仍需要 human review 或 LLM judge。
- 隐藏数据私有化的信任问题:公开 core 不含 hidden challenge,透明度和防泄漏之间仍有张力。
- 日志本身可能被污染:如果 action log 不可信或可被 agent 修改,claim-grounding 会失效。
写入记录
- 2026-07-28 09:00 CST:基于 halu-core README 深度入库,提炼执行可靠性与报告诚实度分离、claim-to-action-log 对 Hermes 报告验证的启发。