2026-06 Agentic AI 五篇材料精读综合
2026-06 Agentic AI 五篇材料精读综合
一句话结论
这五篇材料共同指向一个趋势:AI 正在从“会回答问题的模型”转向“能执行工作流的 agent”,但真正的瓶颈已经不只是模型智商,而是 任务定义、上下文定位、验证体系、领域 expertise 和经济价值评测。
1. 人和 agent 的分工正在稳定下来
Anthropic 的 Claude Code 研究给了一个很清晰的分工:人主要决定“做什么”,agent 主要决定“怎么做”。这不是一句营销话,而是来自约 40 万个 session 的统计:用户约承担 70% 的 planning decision,Claude 约承担 80% 的 execution decision。
这说明未来高杠杆的人不是把代码敲得最快的人,而是能把目标、约束、上下文、验收标准和风险讲清楚的人。领域知识没有贬值,反而变成调用 agent 的核心杠杆。
2. 模型厂商正在把“agentic workflow”作为主战场
Gemini 3.5 的页面非常典型:Google 不再只讲聊天、推理或多模态,而是把 Gemini 3.5 Flash 直接定位成 agents and coding。它同时连接 Google AI Studio、Gemini API、Gemini Enterprise Agent Platform 和 Antigravity。
这代表模型竞争正在平台化:模型本身只是底座,真正的产品形态是“模型 + 工具协议 + 开发环境 + 企业 agent runtime”。
3. 评测正在从题目分数走向真实经济任务
Agents’ Last Exam 的重要性在于它不满足于传统 benchmark。它问的是:agent 能不能完成真实职业中的长程工作流?这些工作是否有经济价值?结果是否可验证?
它覆盖 13 个行业 cluster、55 个子领域、1000+ 个任务,并且最难 tier 当前平均 full pass rate 低于 1%。这个数字很关键:它提醒我们,agent 的真实工作能力远没有被现有 demo 和排行榜完全证明。
4. Coding agent 的关键瓶颈是“读对代码”
SWE-Explore 把 coding agent 的仓库探索能力单独拆出来评测。它不让 agent 写 patch,而是要求 agent 在固定行数预算内返回最相关的代码区域。
这个设计抓住了 coding agent 的一个真实失败模式:很多时候 agent 不是不会写补丁,而是没找到关键文件、关键函数或关键代码行。文件级定位已经较强,但 line-level coverage 和 efficient ranking 仍是瓶颈。
这对我们的实践很重要:上下文工程不是“塞更多上下文”,而是给 agent 一个高信噪比证据包。
5. 研究雷达仍然有价值
Raschka 的 2026 LLM paper list 说明,在信息爆炸时代, curated list 依然很有用。它把论文按 reasoning、RLVR、efficient inference、agent harnesses、tool use、long context、diffusion LM、serving infrastructure、coding agents、benchmarks 等方向组织起来。
对我们的 llm-wiki 来说,这类文章不一定一次性全部 ingest,但非常适合扩展关注名单:先做 radar,再挑出值得深读的论文逐篇 ingest。
我们应该吸收的精华
- agent 的价值来自工作流,不只是模型输出。 未来要关注 agent runtime、tool protocol、sandbox、memory、eval、rollback。
- 领域 expertise 是放大器。 懂业务的人能更好地驱动 agent,而不是被简单替代。
- 上下文定位是 coding agent 的核心能力。 repo exploration、line-level retrieval、context efficiency 值得持续关注。
- benchmark 必须接近真实任务。 Agents’ Last Exam 这类经济价值评测比单纯刷题更接近长期判断。
- 关注名单要不断生长。 Raschka list、ALE、SWE-Explore、Gemini/Claude 的平台化动作都应进入后续 web search radar。
后续关注名单建议
- Agents’ Last Exam / ALE
- SWE-Explore
- repository exploration / line-level localization
- economically valuable agent tasks
- MCP Atlas / Toolathlon / OSWorld / GDPval-AA
- Gemini Enterprise Agent Platform / Antigravity
- Claude Code usage studies
- agent harnesses / tool use / long-context serving infrastructure
- Nemotron 3 Super / hybrid Mamba-Transformer for agentic reasoning
对 llm-wiki 的行动
本次 ingest 已沉淀为以下概念:Agentic-Coding、Agent-Benchmarks、Repository-Exploration、Economically-Valuable-Agent-Tasks、LLM-2026-Research-Radar,并新增来源页:Agentic coding and persistent returns to expertise、Gemini 3.5 — Frontier intelligence with action、Agents' Last Exam、SWE-Explore、LLM Research Papers 2026 Part 1。