覆盖窗口:2026-09-03 ~ 2026-09-05(过去 24–48 小时为主,少量补充本周内的重要背景) 所有条目均来自公开搜索结果并附来源链接;未查到新内容的分区如实写「今日无重要更新」。 标注说明:〔事实〕= 来源明确陈述;〔报道〕= 媒体转述、未见一手确认。
🔥 今日头条
1. OpenAI 发布 GPT-6 Astra,官方口径直指「AGI 时代」〔事实 + 报道〕
OpenAI 于 9 月 3 日发布 GPT-6 Astra,称其为「世界上最智能、最对齐的模型」,并在数日内向包括 Plus 在内的全部 ChatGPT 套餐推送。基准上它几乎把几条主线打饱和了:FrontierMath Tier 4 拿到 97.6%,ARC-AGI-3 拿到 99.9%,ExploitBench 拿到 100%(前代 GPT-5.6 Sol 为 78.5%);计算机/浏览器操作方面 OSWorld 2.0 得 72.6%,且单任务耗时比前代少约 47%。训练侧,这是 OpenAI 迄今最大的一次训练,在德州 Stargate 站点动用 10 万张以上 GPU。Greg Brockman 对媒体表示,「觉得我们已经进入 AGI 时代并非不合理」。
为什么重要:一是评测层面——当 FrontierMath Tier 4 / ARC-AGI-3 这类「为难前沿模型」的基准同时接近满分,行业将被迫重建一套新的区分度评测,旧榜单的信息量正在归零;二是安全层面——ExploitBench 100%、ExploitGym 42.4%(前代 30.3%)意味着攻击性网络能力跨过一个台阶,这直接抬高了所有 agent 部署的风险基线。
- OpenAI 官方发布页
- Al Jazeera:OpenAI unveils GPT-6 Astra amid rising scrutiny(2026-09-04)
- The New Stack:基准解读
- Artificial Analysis 独立评测
2. OpenAI 同步推出 Daybreak for Frontline Defenders,承诺 10 亿美元补贴防守方〔事实〕
伴随 GPT-6 Astra 发布,OpenAI 宣布 Daybreak for Frontline Defenders 计划:向美国及全球「一线防守者」(关键基础设施与公共服务的安全团队)开放前沿网络安全能力,并投入 10 亿美元用于补贴访问、培训、技术支持与合作。
为什么重要:这是「攻防能力同时释放」时厂商的标准动作——把同一套能力优先、低价地交到防守方手里,试图让防御曲线跑在攻击曲线前面。它也侧面确认了官方对 Astra 网络能力量级的判断。
- 见上方 Al Jazeera 与 OpenAI 发布页
3. Claude Code 连发两版:/diff 面板、/skill-doctor、缓存未命中归因〔事实〕
9 月 3 日 v2.1.260 与 9 月 4 日 v2.1.261 两个版本,给开发者体验补了几块关键拼图:全屏模式下新增可用 /diff 开关的 diff 面板(边改边看未提交变更);/cost 与状态栏 prompt_cache 字段新增缓存未命中的可能原因(如工具定义或 system prompt 变了、闲置超过 TTL);新增 /skill-doctor,列出「加载了但没被用到的 skill 以及它们占了多少上下文」;新增 bashOutputMaxChars / taskOutputMaxChars(最高 128K 字符)与 --append-subagent-system-prompt-file。
为什么重要:这三件事(diff 可视化、缓存归因、skill 体检)合起来是同一个方向——把此前只能靠感觉的上下文与成本问题变成可读的仪表盘。详见今日《Claude Code 小课 · 第 25 课》。
🏢 官方发布与新功能
- OpenAI GPT-6 Astra(9/3):多项基准饱和,SRE-Bench pass@1 88% / pass@4 99.2%,BenchCAD 几何重合度 95.9%,AutomationBench 41.4%。—— OpenAI
- Google Gemini 3.8 Flash + Gemini 3.8 Flash Cyber(9/4)〔报道〕:六周内第三款 Flash 模型;Cyber 版面向受信任的政府与企业客户,主打「以前沿级性能检测并修补软件漏洞」,但跑得更快更便宜。—— CNBC
- Demis Hassabis 在 G20 创新会议发言(9/4)〔报道〕:提出 Gemini 可以越来越多地扮演「通用协调层」,去调度更便宜的专用模型与 agent。这是他从 DeepMind CEO 转任该部门 chairman 后的首次公开发言。—— 同上
- Anthropic Claude Fable 5.1 / Mythos 5.1(9/1,本周背景):面向编码与知识工作的最新模型;缓存读取价格从 $1.00/M tokens 降到 $0.25/M tokens(降 75%)。Mythos 5.1 限定在美国 CVP / LSVP 两个验证项目内使用。—— Anthropic
- Anthropic Enterprise Frontier Safeguards(9/1):把零数据留存(ZDR)与滥用检测放在同一套方案里,数据存放在客户自己控制的云基础设施而非 Anthropic。—— Anthropic
🤖 Agent 技术精选
/skill-doctor(Claude Code 2.1.261):官方第一次给「skill 的上下文开销」提供了可量化视图——哪些 skill 加载了却从没被触发、各自吃掉多少 token。这把「skill 装越多越好」的直觉纠正成了一笔要算的账。—— changelogmanagedMcpServers组织级托管设置(2026-09 上旬):组织可以给所有用户统一下发 HTTP/SSE 的 MCP server;同时新增--permission-prompts none供无人值守的 headless 主机使用。—— changelog- MCP 2026-07-28 规范 + 8/22 新路线图:协议层已彻底无状态化(六个 SEP 合力),支持 header 路由、可缓存的
tools/list;Dynamic Client Registration 正式弃用,转向 CIMD(向后兼容,未来版本移除);Roots / Sampling / Logging 弃用但至少保留 12 个月。—— MCP Blog:2026-07-28 规范 · 新路线图 - Anthropic 工程文《How we contain Claude across products》:三种遏制形态(claude.ai 的临时容器 / Claude Code 的 HITL 沙箱 / Cowork 的本地 VM)与三次「漏过去」的真实事故。文中有两个数字很扎眼:用户对权限弹窗的批准率约 93%;上了 OS 级沙箱后权限弹窗减少 84%。—— Anthropic Engineering
🎓 学术与课程
- ContainmentBench: Trace-Based Evaluation of Post-Injection Containment in Tool-Using LLM Agents:不只看「攻击最终有没有得手」,而是用沙箱内的完整轨迹评估「注入发生之后遏制得怎么样」。—— arXiv 2607.23999
- Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents:系统梳理「把安全放到模型之外用确定性策略执行」这一路线,覆盖 CaMeL、FIDES、Progent、RTBAS、FORGE 等,用能力(capability)、信息流标签与引用监视器三类机制实现。—— arXiv 2606.26479
- Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response:综述 agent 与沙箱边界处的五类脆弱性——多步攻击链、与沙箱边界冲突的目标、供应链与凭据暴露、持久化 C2、自动化行动的速度。—— arXiv 2607.25379
- Quantifying Frontier LLM Capabilities for Container Sandbox Escape:用 Inspect AI 的 CTF 形式、嵌套沙箱架构(外层放 flag 且无已知漏洞)量化前沿模型的容器逃逸能力。—— arXiv 2603.02277
- Stanford CS329A《Self-Improving AI Agents》:研究生研讨课,先修 CS224N 或 CS229S;评分 50% 作业 + 50% 项目,项目可做新评测集/基准、agent 系统可靠性研究或在已有基准上爬坡,提供 API credits。—— 课程主页
📈 行业动态
- Crusoe 新一轮融资超 30 亿美元,估值约 300 亿美元〔报道〕。—— Tech Startups(2026-09-04)
- Figure 与 Nscale 签算力合作〔报道〕:起步 35 亿美元算力承诺,最终可能部署至多 10 万张 Nvidia GPU。—— 同上
- Nvidia 宣布 60 亿美元开源 AI 投入〔报道〕,对冲中国实验室的低价开源模型攻势。—— 同上
- OpenAI 将于 11 月 12 日切断 Cursor 的模型访问〔报道〕:理由是 Musk 旗下公司过往的合同违约;背景是 Cursor 被 SpaceX 收购。—— 同上
- Anthropic 据报将在劳动节后公开 IPO 招股书〔报道,未证实〕:目标 10 月上市、估值约 2 万亿美元;此前 2026 年 5 月 Series H-1 的私募估值约 9650 亿美元。此为媒体报道口径,以官方文件为准。—— Venture Atlas · Yahoo Finance
🎯 今日精选主题
选定:Agent 容器化遏制与爆炸半径(Blast Radius)工程
选择理由:今天三条主线指向同一件事。GPT-6 Astra 在 ExploitBench 拿到 100%、ExploitGym 从 30.3% 跳到 42.4%;Google 专门为政府和企业出了一款网络安全模型;OpenAI 掏 10 亿美元补贴防守方。当模型的攻防能力整体上一个台阶,「怎么劝 agent 别做坏事」的边际收益在下降,「怎么从环境上限制它能做到什么」的边际收益在上升。Anthropic 的工程文给出了业界最完整的一手数据(93% 的权限弹窗被无脑批准、沙箱让弹窗减少 84%、内部钓鱼演练 25 次里 24 次成功外传凭据),学术界又刚好在同一时期给出了 ContainmentBench 等一批「遏制导向」的评测。对独立开发者而言这也是直接可用的:你给 Claude Code / Cowork 配的那几行 permission 和 egress 规则,决定的正是你自己项目的爆炸半径。
备选主题(如需可回复切换): 1. 基准饱和之后:前沿模型评测的重构 —— FrontierMath Tier 4 97.6%、ARC-AGI-3 99.9% 之后,区分度从哪里来。 2. 「通用协调层 + 专用小模型」的分层架构 —— Hassabis 的 G20 说法 + Gemini 3.8 Flash Cyber 这类专用模型,落到工程上怎么路由。
📚 今日 Claude Code 小课
第 25 课:新功能速用 —— v2.1.260 / v2.1.261(/diff、缓存归因、/skill-doctor、输出上限)
独立文档见同目录 Claude Code小课-2026-09-05.md,累积技巧库见 ../claude-code-tips.html。
本简报由自动化流程生成。所有链接为搜索所得的公开来源;标注〔报道〕的条目未见一手确认,引用前请自行核实。
主页