← 返回藏书阁

Agents' Last Exam

wiki/ai/sources/agents-last-exam.md
分类:ai / sources · 更新:2026-06-19 10:01

Agents' Last Exam

核心结论

Agents’ Last Exam 试图评估 agent 能否完成真实、长程、经济上有价值、结果可验证的专业任务。它的关键判断是:现有 benchmark 高分并没有充分转化为 GDP-relevant 的专业部署能力。

设计

  • 250+ 行业专家参与。
  • 参考 O\*NET / SOC 2018 职业分类。
  • 覆盖 13 个行业 cluster、55 个子领域、1000+ 个任务。
  • 任务池会持续增长,是 living benchmark。

最重要的数据

在最难 tier 上,主流 harness 和 backbone 配置的平均 full pass rate 低于 1%。

这说明 agent 革命还远没有完成:它们在短任务、代码题、工具 demo 上很强,但在真实专业工作流上仍有巨大缺口。