覆盖时间窗:2026-08-26 ~ 2026-08-28(部分条目为本周内、此前未在本简报出现过的重要更新)。所有条目均来自公开搜索结果并附来源链接;未经交叉验证的数字已标注。
今日头条
1. MCP 发布新路线图:协议正式转向「事件驱动」 Model Context Protocol 于 2026-08-22 发布新版路线图,明确下一阶段的核心是服务端主动推送事件(webhooks / channels、subscriptions/listen、progress notifications、mid-flight steering),让客户端不必再靠昂贵的轮询等待长任务结果;同时 Tasks 扩展将逐步"转正"进入规范。治理侧也已落地 Contributor Ladder、Working Group 分领域 triage SEP,以及正式的特性生命周期与废弃策略。这是继 2026-07-28 规范(无状态内核、多轮往返、头部路由、可缓存 list 结果)之后,MCP 面向"规模化跑 Agent"的第二步。 来源:MCP Blog · The New MCP Roadmap、modelcontextprotocol.io/development/roadmap
2. 开源与闭源的差距被压缩到「单个 benchmark 分点」 第三方追踪显示,DeepSeek V4-Pro(1.6T 总参 / 49B 激活,MIT 许可,V4-Pro-0813 于 8 月 13 日 GA)在 SWE-bench Verified 上约 80.6%,与同期闭源旗舰的差距不到 1 个百分点,而价格差可达数倍。与此同时 2026 年几乎所有旗舰开源模型都是稀疏 MoE(Llama 4 Maverick 400B/17B、Qwen 3.5 397B/17B、Mistral Large 3 675B/41B)。⚠️ 这些榜单分数与参数来自第三方汇总站点,非官方原始发布页,建议以官方模型卡为准。 来源:llm-stats / 开源模型格局汇总、DeepSeek V4 Pro 规格汇总
官方发布与新功能
- OpenAI:扩大巴西业务布局(2026-08-27 公司公告)。openai.com/news
- ChatGPT:临时聊天(Temporary Chat)增加控制项 —— 可选择在临时聊天中启用记忆、插件与自定义指令,也可把临时聊天保存进历史。ChatGPT Release Notes
- Claude Code v2.1.245(8/25) 修复了新版 glibc 下 Linux 启动崩溃;v2.1.243 新增「循环内 token 消耗明细」视图,可看到哪些任务最烧 token;v2.1.235 加入可选拼写检查与后台任务处理改进。Claude Code Changelog
- Anthropic:输出内容机器可读水印 —— 自 2026-08-02 起发布的 Claude 产品在 AI 生成内容中加入机器可读标记,以符合欧盟 AI Act 第 50(2) 条。报道
- Google:Gemini 3.6 Flash / 3.5 Flash-Lite GA —— 3.6 Flash 主打 token 效率与代码/Agent 规划能力且价格更低;3.5 Flash-Lite 定位低延迟、高并发的「子 Agent」档位。另注意
gemini-robotics-er-1.6-preview将于 8/31 下线。Gemini API Changelog
Agent 技术精选
- MCP 路线图五大方向:server-initiated events、Tasks 转正、工具发现、Agent 身份、组合(composition)跨工作组评审。对自建 Agent 的直接影响是:长任务不必再自己写轮询循环。路线图解读
- 异步事件与 webhook 的工程实现参考:如何在 MCP server 里正确处理异步事件与 webhook 投递(重试、去重、乱序)。Hookdeck 技术文
- Context Engineering 四动作框架(write / select / compress / isolate)仍是本季度 Agent 工程共识写法,可作为自查清单。HappyCapy 综述
- MoE 服务成本的现实约束:MoE 模型显存占用可达同等能力稠密模型的 4~14 倍(需要装下全部专家权重,尽管每次只激活一小部分);vLLM / TensorRT-LLM 均已加入 MoE 专用内核与 expert parallelism。Spheron:MoE 推理优化
学术与课程
- Memory Reward Inflation in Self-Improving LLM Agents(arXiv:2608.00026):自我改进 Agent 在把「记忆」当作奖励信号时出现的奖励通胀现象。arXiv cs.AI 当期
- Adversarial Attacks in Multi-Agent LLM Pipelines(Bappy 等,已被 IEEE GLOBECOM 2026 接收):多 Agent 流水线的结构性脆弱点分析,对做 multi-agent 编排的人有直接参考价值。
- Continuous Improvement and Parallel Autonomous Exploration(arXiv:2608.24215,ACM KDD'26 Workshop):用 LLM-Agent 并行探索大解空间的框架。
- WiSP: A Working-Set View of Mixture-of-Experts Serving on Extremely Low-Resource Hardware(arXiv:2606.21868):把 MoE 专家调度看成「工作集」问题,低显存自托管的实用思路。
- 大学课程侧:本轮搜索未发现 Stanford CS329A / CS224G / Berkeley LLM Agents 等课程在过去 48 小时内的新公开材料。
行业动态
- Anthropic 自研芯片:8 月 5 日首次公开确认正在组建自研芯片团队并高薪招募资深芯片工程师。报道
- 人事:Mariano-Florentino (Tino) Cuéllar 于 8 月 4 日出任 Anthropic 首席全球事务官。
- 模型发布节奏:第三方统计称 8 月共有 7 家厂商发布 12 个新模型,最近一次为 Z.AI 的 GLM-5.2 Turbo(8/17);Qwen3.8 Max 于 8/2 发布。⚠️ 数据来自第三方聚合站,未逐条核对官方公告。LLM Gateway 时间线
今日精选主题
稀疏 MoE 开源模型的自托管选型(Sparse MoE Self-Hosting)
选择理由:今天的两条头条其实指向同一个决策——当开源旗舰在编码 benchmark 上只落后闭源不到一个百分点、且几乎全是稀疏 MoE 架构时,「要不要自托管、用什么规格自托管」第一次成为一个真实的工程与成本问题。而 MoE 的直觉陷阱很深:激活参数只有 49B,显存却要按 1.6T 总参准备。这个主题正好把架构原理、显存/吞吐账、服务栈(vLLM 的 expert parallelism)和选型判据串成一条完整链路。
备选主题: 1. MCP 服务端推送事件(webhooks / channels / subscriptions)——路线图刚发布,但与 8/26「MCP Tasks 异步长任务」主题相邻,留到规范落地后再讲更划算。 2. 多 Agent 流水线的对抗攻击面(Adversarial Attacks in Multi-Agent LLM Pipelines)。
(若无回复,默认按精选主题生成深度文档。)
主页