覆盖区间:2026-09-09 ~ 2026-09-11(过去约 48 小时) 所有条目均来自公开搜索结果并标注来源链接与日期;标「据报道」的为二手聚合来源,未经一手核实。
一、今日头条
1. OpenAI 发布 Agents API 公测,把 Codex 的 harness 变成托管服务(9/10)
OpenAI 正式开放 Agents API 公测,把驱动 Codex 和 ChatGPT for Work 的那套 agent harness 直接以 API 形式交给开发者:一次 API 调用即可创建一个生产级 agent,指定任务、模型、工具和运行环境。OpenAI 托管 harness 与会话(durable session),开发者只负责工具、知识和工作流。
为什么重要:过去两年,「自己写 agent loop」是每个团队的必经之路——上下文压缩、工具检索、子 agent 编排、断线恢复,每家重复造一遍。Agents API 把这一层整体外包出去,并且随模型升级同步演进(versioned harness),这意味着 agent 工程的竞争焦点正从「harness 写得好不好」转向「工具、数据与工作流设计得好不好」。公测期不额外收费,只按 token 和工具用量计费。
来源:Introducing the Agents API — OpenAI, 2026-09-10
2. OpenAI 发布 GPT-Live-1 API,全双工语音进入开发者手中(9/10)
GPT-Live-1 以 $0.05/分钟 的前端语音层价格进入 API。模型可以边听边说,支持停顿、打断、实时调用工具,并把深层推理与执行委托给配对的模型和工具(官方以 Codex 与 ChatGPT Work 为例)。
为什么重要:它把 ChatGPT 语音背后的对话系统开放给第三方应用,同时明确了「语音层 + 推理层分离」的架构范式——语音模型不负责思考,只负责自然对话与委托。据报道其 Artificial Analysis Conversational Dynamics 均分 97.3%,高于 GPT-Realtime-2.1 的 95.7%(该评测数据来自二手来源)。
来源:Build more natural voice experiences with GPT‑Live‑1 in the API — OpenAI, 2026-09-10 · unite.ai 报道
3. Anthropic 发布 2026 年 9 月威胁情报报告(9/10)
Anthropic 威胁情报团队公布过去八个月识别并中断的滥用 Claude 的行动案例,并说明恶意使用方式相较 2025 年的历次报告发生了哪些演变。
为什么重要:这是理解「agent 能力提升后攻击面如何变化」的一手材料,对做 agent 产品的人来说,它同时是威胁模型清单和防御设计参考。
来源:Detecting and countering misuse of AI: September 2026 — Anthropic, 2026-09-10
二、官方发布与新功能
- OpenAI Agents API 公测(9/10):durable sessions、OpenAI 托管沙箱 / 自托管沙箱 / 无环境三种模式,内建 compaction、tool search、programmatic tool calling、subagents;支持 MCP、自定义函数与内建工具。来源
- OpenAI hosted sandbox(9/10):与 Codex / ChatGPT 同一套沙箱基础设施,可配置文件、包、skills 与 plugins。同时公布沙箱生态合作方:Blaxel、Cloudflare、Daytona、DigitalOcean、E2B、Modal、Oracle、Runloop、Vercel。来源
- OpenAI GPT-Live-1 进入 API(9/10)。来源
- ChatGPT for Financial Services(9/10)与 "Now everyone can put data to work"(9/10):OpenAI 同日的两条行业化产品公告。来源1 · 来源2
- Claude Code v2.1.268(9/10):Claude apps gateway 支持在
gateway.yaml里设pricing:,让签入客户端的/cost与遥测同口径;新增gatewayInternalNetworks托管设置与access_control.allow_cidrs空值启动告警;claude self-hosted-runner --remove-session-state;claude plugin install/uninstall/update/enable/disable支持--json;修复第三方 Anthropic 兼容端点自 2.1.265 起每轮 HTTP 400 的回归。来源 - Claude Code v2.1.267(9/9):新增
maxEffortLevel设置(可顶层或按模型),在所有 provider(含 Bedrock / Vertex / Foundry)上封顶 effort 档位;新增--system-prompt-snapshot off。来源 - OpenAI × GSA 新 OneGov 协议(9/10):27 个月期限,按 token 计费 5 折,自 10/1 起生效,无平台接入费、无最低订单与消费承诺;据报道可覆盖约 2300 万人。来源
三、Agent 技术精选
- Agents API 的三件套架构:官方架构文档把系统拆成 harness(OpenAI 托管的 Codex 实例,跑模型与工具循环、维护会话)、environment(远程沙箱 / 笔记本 / Docker / Lambda,agent 跑命令与改文件的地方)、application server(你的代码,提交任务、接收事件、处理 function tools)。三者可按需组合,
environment.type可设none/openai_hosted/self_hosted。来源 - 长会话上下文管理:Agents API 在会话逼近上下文上限时自动 compaction,保留后续所需信息,开发者无需自己实现压缩逻辑,可写跨多个上下文窗口的工作流。来源
- 工具规模化两件套:tool search 按需加载相关工具定义以降低 token 成本并保住缓存前缀;programmatic tool calling 让 agent 在代码里并行调用、串联操作、过滤合并结果,只把相关结果带回上下文。tool search · programmatic tool calling
- 多 agent 并行:
multi_agent.enabled+max_concurrent_subagents即可开启;每个 subagent 保有独立上下文,主 agent 负责协调与汇总。来源 - 开源底座:Agents API 由开源的 Codex harness 驱动,开发者可查阅其公开代码库了解协调模型调用、工具与上下文的核心逻辑。github.com/openai/codex
- 可靠性信号(来自客户证言,非独立验证):SafetyKit 称迁移后每案例成本下降 60%;Hypha 称「把 harness 与 sandbox 分离」后失败响应减少 86%;Ciridae 称 subagent 支持带来 4 倍延迟下降。这些为厂商页面上的客户自述,建议按营销材料对待。来源
- MCP 生态背景(非今日新闻,供对照):2026-07-28 版 MCP 规范把协议核心改为无状态,引入多轮往返请求、基于 header 的路由、可缓存的 list 结果与授权加固;Tasks 移出实验核心进入
io.modelcontextprotocol/tasks扩展;Dynamic Client Registration 正式弃用转向 CIMD。来源
四、学术与课程
- arXiv 2609.10132(2026-09-09 提交):《Context operations to architecture modelling output from large language models and evaluation criteria for their use in systems engineering design》,研究对 LLM 架构建模输出做上下文操作,并给出系统工程设计场景的评价标准。arXiv
- Stanford CS329A · Self-Improving AI Agents:研究生 seminar,主题是能通过与自身和环境交互持续自我改进的 AI agent;先修为 CS224N 或 CS229S,外加 Python 与 LLM API 实操经验。课程页面公开可查。cs329a.stanford.edu · Stanford Online
- 相关论文合集:VoltAgent/awesome-ai-agent-papers 汇总 2026 年的 agent 工程、记忆、评测、工作流与自治系统论文,适合做周期性扫描。GitHub
说明:过去 48 小时未检索到 agent 方向的重量级新论文或新开课公告,以上为可核实的最近条目,不做凑数。
五、行业动态
- SWE-bench 榜单分化:据榜单聚合站,SWE-bench Verified 已接近饱和——前沿模型普遍聚集在 90 分中段(Claude Opus 5 约 96%、Mythos 5 约 95.5%、Fable 5 约 95%),区分度下降;更难的 SWE-bench Pro 成为更有效的对比口径(Fable 5 约 0.800 居首)。这些数字来自第三方榜单站,建议以官方 leaderboard 复核。SWE-bench Verified · SWE-bench Pro
- AI 基建融资继续集中(据报道,9 月):Baseten 约 15 亿美元 F 轮(多模型推理基础设施)、Nexthop AI 约 5 亿美元(AI 负载带来的网络瓶颈)、General Intuition 约 3.2 亿美元(用游戏视频数据训练 agent)。资金明显偏向 agent 基础设施与有真实收入的垂直 agent,而非模型薄封装。来源
- 模型定价与发布节奏(9 月上旬汇总,据第三方追踪):GPT-6 Astra(9/3)、Claude Fable 5.1(9/1,cache read 降至 $0.25/M)、Gemini 3.8 Flash(9/2)、Meta Muse Spark 1.3(9/2)。来源
六、今日精选主题
选定:托管 Agent 运行时 —— OpenAI Agents API 深度解析
选择理由:今天唯一一条会改变工程决策的新闻。它直接回答一个所有做 agent 的人都在算的账——「自己维护 harness 到底值不值」。而且它有完整的一手文档(架构、会话、沙箱、工具、多 agent、可观测性),能讲清楚「是什么 / 怎么用 / 什么场景用」,也能对照 Claude Agent SDK 与自建方案做选型。与 9/7 的《Harness Engineering》一课形成互补:那篇讲「harness 该长什么样」,这篇讲「不自己造 harness 的那条路怎么走、代价是什么」。
备选主题(如需替换,回复主题编号即可):
- GPT-Live-1 与全双工语音 agent 架构 —— 语音层与推理层分离的设计范式、延迟与成本模型、与 Realtime API 的迁移路径。
- Claude apps gateway 与企业自托管接入 —— gateway.yaml 定价对齐、CIDR 访问控制、self-hosted runner 会话状态清理,一条从个人使用到组织治理的完整链路。
附:今日 Claude Code 小课
第 29 课(新功能速用 v2.1.267 / v2.1.268)为独立文档,见同目录 Claude Code小课-2026-09-11.md,并已同步进 claude-code-tips.html 累积技巧库。
本简报由每日定时任务自动生成。事实与数字均标注来源;来自第三方聚合站的数据已单独标注,建议关键决策前以一手来源复核。
主页