Agents' Last Exam
Agents' Last Exam
核心结论
Agents’ Last Exam 试图评估 agent 能否完成真实、长程、经济上有价值、结果可验证的专业任务。它的关键判断是:现有 benchmark 高分并没有充分转化为 GDP-relevant 的专业部署能力。
设计
- 250+ 行业专家参与。
- 参考 O\*NET / SOC 2018 职业分类。
- 覆盖 13 个行业 cluster、55 个子领域、1000+ 个任务。
- 任务池会持续增长,是 living benchmark。
最重要的数据
在最难 tier 上,主流 harness 和 backbone 配置的平均 full pass rate 低于 1%。
这说明 agent 革命还远没有完成:它们在短任务、代码题、工具 demo 上很强,但在真实专业工作流上仍有巨大缺口。