覆盖窗口:2026-08-21 ~ 2026-08-23(约 48 小时) 原则:每条均来自可核查的公开来源,标注链接与日期;不确定的地方直说不确定。
一、今日头条
1. MCP 发布全新路线图,五大优先方向定调未来数个规范版本(8/22)
MCP 核心维护者 David Soria Parra 与 Den Delimarsky 于 8 月 22 日发布了新版路线图,把接下来的协议工作收敛为五个优先领域:Agentic messaging primitives(服务端主动事件 webhooks/channels、Tasks 扩展 SEP-2663 转正)、HTTP-native 传输统一与加固(让本地 server 也走 Streamable HTTP over stdio)、Agent 身份与企业级安全(DPoP、Workload Identity Federation、ID-JAG 与标准 token exchange)、改进原语(统一 tools/call 结果契约 + 启动「渐进式发现」工作,解决连一个百工具 server 就先付一大笔上下文税的问题)、SDK 开发者体验。
为什么重要:这份路线图直接决定了 SEP 的审阅优先级——落在这五个方向里的提案会走快速通道,不在里面的「不会自动拒绝,但维护者时间优先给路线图」。对做 MCP server 的人来说,这是未来半年该往哪投入的官方信号。其中「渐进式发现」是第一次被正式列入协议级议程(此前只是 Anthropic Tool Search、Amazon Prime Video 等各家自建的模式)。
来源:The New MCP Roadmap(2026-08-22) · 路线图页面
2. OpenAI 公开要求加州「加强」而非放松 AI 安全法案 SB 53(8/22)
OpenAI 就加州 SB 53 提交意见,主张扩大保障范围,包括「要求对训练中或评估中的前沿模型进行潜在严重事件监控」,以及「在模型开发全生命周期强化网络安全保护」。
为什么重要:大厂在州级 AI 立法上的公开表态,通常预示后续合规要求会怎么落到 API/产品层(参考 8 月初 Anthropic 为对齐 EU AI Act 而在全部输出中加水印)。做面向企业的 AI 产品,监管口径变化会直接变成客户的采购清单条目。
二、官方发布与新功能
- Claude Code v2.1.240 于 8 月 22 日发布,延续 8 月 v2.1.2xx 系列节奏(该系列此前已带来自托管环境
claude self-hosted-runner、跨会话消息@点名、从 HTTPS zip 安装插件并可 SHA-256 锁定、GitLab MR 支持、构建命令内存上限;同时移除了 Ultraplan 研究预览与/ultraplan)。v2.1.240 本身的逐条改动请以官方 changelog 为准。 — Claude Code changelog · What's new - OpenAI 更新 GPT-5.3 Instant:改进追问语气、减少「卖关子」式措辞;同时 o3 将于 8 月 26 日从 ChatGPT 下线(90 天日落期结束)。 — Model Release Notes
- ChatGPT 产品侧更新:新增 Site URL 控制、Computer History 扩展到更多地区、Apple Messages 支持、Codex 只读聊天快照,以及 Codex/ChatGPT Work 用户的置顶会话跨桌面与 iOS 同步。 — ChatGPT Release Notes
- Anthropic 近期官方条目:8/14《How Claude's text watermark works》(配合 8 月 2 日起全部 Claude 产品输出内嵌机器可读标记、对齐 EU AI Act);8/7 Fable 5 生物学安全防护改进。 — Anthropic Newsroom
三、Agent 技术精选
- MCP「渐进式发现」正式进入协议议程:路线图明确指出「连上一个有一百个工具的 server,意味着用户还没问第一句话,模型就已经为整个工具面付了费,而且工具选择准确率随列表变长而下降」,官方将启动 progressive discovery 工作,让 server 先给一个小入口、随对话收敛再逐步暴露目录。 — MCP Roadmap
- Tool Search Tool 官方数据:典型多 server 组合(GitHub / Slack / Sentry / Grafana / Splunk)光工具定义就吃掉约 55k tokens;开启 tool search 后通常减少 85% 以上,每次只加载 3–5 个真正需要的工具。官方同时给出经验阈值:超过 30–50 个工具后,模型选工具的准确率开始下降。 — Tool search tool(Claude Platform Docs)
- Agent SDK 侧 tool search 已默认开启,可用
ENABLE_TOOL_SEARCH=auto:N按「可延迟定义占上下文窗口百分比」自动决定何时启用;非一方ANTHROPIC_BASE_URL(代理)默认关闭,因为多数代理不转发tool_reference块。 — Scale to many tools with tool search - Anthropic 工程侧实践文章(本周):8/19《Turning conversation into knowledge: how Slack builds human-agent teams》、8/18《Claude on call: How Claude Tag serves as Anthropic's first responder for CI/CD failures》。 — Claude Blog · Agents
四、学术与课程
- Stanford Agentic AI Program 于 9 月 2 日开放报名,课程沿用 Stanford 研究生课纲、面向在职工程师,内容覆盖端到端 agent workflow、自我改进的工具使用、推理与规划。 — Stanford Agentic AI 2026
- Agent 工程方向论文:SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents(以失败轨迹驱动 RL 训练工具型 agent);Harness Engineering for Agentic AI Coding Tools: An Exploratory Study(把「agent 外壳」当成独立工程对象研究)。注:两篇均为预印本,尚未见同行评审结论,请按预印本对待。 — SENTINEL · Harness Engineering
五、行业动态
- 榜单:截至 8 月 21 日,SWE-bench Verified 上 Claude Opus 5 以 96% 居首,Claude Mythos 5(95.5%)、Claude Fable 5(95%)紧随,前三名差距在 1 个百分点内——该基准对前沿模型已接近饱和。LMArena 文本总榜方面,Claude Fable 5 约 1525 ELO 排第一(Arena 于 7 月 12 日重新基线化)。榜单数据来自第三方聚合站点,与官方口径可能有出入。 — BenchLM SWE-bench Verified · LMArena 汇总
- Binance 于 8 月 21 日发布 Agent OS:面向开发者的标准化接入层,让兼容的 AI 应用与 agent 通过可配置子账户与用户授权权限访问行情、钱包、支付并下单。 — AI Agents News · Week of Aug 22
- A2A 协议(Google Agent2Agent)将成为 Agentic AI Foundation 的托管项目,继续向中立基金会治理靠拢。 — Agentic AI Foundation
- 资金面:8 月上旬企业级 agent 创业公司融资密集——HappyRobot 1.5 亿美元 C 轮(投后 12 亿美元)、Zenity 1.25 亿美元,Cognition 据报道正在洽谈 10 亿美元以上、估值 400 亿美元以上的新一轮。融资数据来自行业媒体转述,未经当事方逐条确认。 — The Agent Report
六、今日精选主题
主题:工具规模化——Tool Search 与渐进式工具发现(Progressive Tool Discovery)
选择理由:今天的头条(MCP 新路线图)把「工具目录太大导致上下文膨胀 + 选工具准确率下降」第一次抬到了协议级议程;而 Anthropic 侧已经有可直接落地的实现(API 的 defer_loading + tool search tool、Agent SDK 的 ENABLE_TOOL_SEARCH=auto:N),官方还给出了 55k → 减少 85%、30–50 工具阈值这样的硬数字。这是一个「今天就能改配置省钱、且未来半年会变成协议标准」的交叉点,值得系统学一遍。
备选主题(如需换,回复即可):
- MCP Agentic Messaging Primitives:Tasks(SEP-2663)、
subscriptions/listen、progress notifications 与服务端主动事件(webhooks/channels)如何组合出长时程、可中途干预的 agent 工作流。 - Agent 身份与委托的标准化路径:DPoP(RFC 9449)、Workload Identity Federation、ID-JAG 与 token exchange 在 MCP 里怎么拼(注:与 8/20《Agent 身份与授权模型》有重叠,可作进阶篇)。
未回复则默认按主题 1(工具规模化)生成深度学习文档。
附:今日「Claude Code 小课」
本日小课为独立文档:Claude Code 小课 · 第 17 课:插件与 Marketplace
主页