说明:本期距上一期(09-25)间隔较久,内容覆盖 09-28 至 10-05 的主要动态。所有条目均来自真实检索结果,标注来源与日期。
今日头条
1. OpenAI DevDay 2026(09-29):常驻智能体 "Dots" + GPT-6.1 Sol OpenAI 发布 Dots——每个 dot 运行在自己的云端电脑上、无需用户逐条提示即可持续工作的 ChatGPT 智能体(由 GPT-6 Astra 驱动,连接 4000+ 应用及 Slack/Teams),用户通过"自主 / 需审批 / 禁止"三级规则控制其权限;同时发布 GPT-6.1 Sol(100 万级上下文,$2/$10 每百万 token)、Decisions API、Agents API(含 computer use)、Ultrafast 速度档与 Codex Cloud。这标志着产品形态从"对话式助手"转向"长期在线、可委托的数字员工",权限分级与自动复核成为核心工程问题。 来源:OpenAI DevDay 2026 Recap · Latent Space AINews · MediaNama(2026-09-29)
2. Google 发布 Gemini 4 Argon,首批仅向网络安全防御方开放(09-30) Google 称 Argon 在 DeepSWE v1.1 达 77.9%,CWE-bench v1 并列第一(68%),输出上限提升至 100 万 token;首发通过 Fairwind 计划面向可信的网络防御者,并计划为经审核的防御方提供不设网络安全护栏的版本。"能力越强越先给防守方"的分阶段发布策略值得关注。 来源:Google 官方博客 · SecurityWeek(2026-09-30)
3. Claude Code 推出 Mods(10-01,v2.1.287)
Mods 是一类能"改写 Claude Code 自身行为"的插件:用 JS/TS 事件处理函数在进程内运行,可画面板/横幅、拦截或改写工具调用、注册无需经过模型回合的 /command。与 shell 脚本式的 settings hooks 不同,它运行在 Claude Code 内部,因此需要明确的信任模型。今日小课专讲。
来源:Mods overview(官方文档) · Classmethod 版本解读(2026-10-01)
官方发布与新功能
- Anthropic · Claude Sonnet 5.5(09-28):更快、更低成本的模型,与 Opus 5.5 一同在 API 和各大云平台提供;同日公告 Claude Sonnet 4.5 将于 2026-11-30 退役。来源:Releasebot · Anthropic
- Anthropic · Claude for Government 正式可用(09-30):面向联邦与州政府机构,具备 FedRAMP High 授权、治理控制与审计日志。来源:Releasebot · Anthropic
- Anthropic · Claude Frontier Academy(10-02):投入 1 亿美元,通过住院医师式的驻场项目培养 10,000 名前线部署工程师,首批合作方含 Accenture、McKinsey、Deloitte。来源:Releasebot · Anthropic
- OpenAI · GPT-6.1 Sol(09-29):DeepSWE v1.1 75.2%(与 GPT-6 Astra 持平,据 Vellum 约便宜 80%),OSWorld 2.0 71.4%,上下文 1,050,000 token。来源:Vellum 解读
- xAI · Grok 4.7(09-21)、Xiaomi · MiMo-V2.6(09-22)等模型发布见模型清单。来源:LLM Stats
Agent 技术精选
- Dots 的权限设计:三级自定义规则(自主 / 需审批 / 禁止)、密码修改始终由用户完成、内置自动复核与可暂停的安全监控——值得对照自己的 agent 权限模型。来源:MediaNama(2026-09)
- Decisions API:基于 GPT-6 Luna 的近即时多选分类与路由接口,用于把"路由/分流"从重推理中剥离。来源:Latent Space
- Claude Code v2.1.287 安全收紧:危险
rm即便带重定向也始终需确认;经符号链接写敏感文件需确认;MCP URL 登录提示需bareElicitationCapability。来源:Classmethod(2026-10-01) - MCP 2026-07-28 规范(无状态架构、多轮往返请求)仍是协议主线;官方博客最近一篇为 08-22 的路线图。来源:MCP Blog
学术与课程
- Securing Computer-Use Agents Against Branch Steering Attacks(arXiv 2610.03089):识别并防御针对 GUI 智能体工作流的提示注入式"分支引导"攻击。来源:agents-radar 2026-10-05 周报
- Ask, Relax, or Act?(arXiv 2610.03102):形式化 agent 在"直接行动 / 询问澄清 / 放宽约束"之间的决策。同上来源
- D2K-Bench(2610.03226)与 MintEval(2610.03080):分别评测 agent 把专家设计变成高效 GPU kernel、把自然语言交易策略写成等价代码的能力。同上来源
- 课程:2026 秋季免费可看的 agent 课程对比:CMU 11-768(边讲边放 YouTube)、Stanford CS146S(重实战,涉及 Claude Code/Cursor)、CS329A(Self-Improving AI Agents,9 讲回放)、MIT MAS.S60。来源:heyuan110 对比文
行业动态
- 融资:Instinct 完成 10 亿美元融资(Sequoia/Benchmark/Coatue,个人 AI 助手);Armadin 2.555 亿美元 B 轮、估值 25 亿(agent swarm 安全);ElevenLabs 3 亿美元员工要约收购,估值 220 亿。来源:GTSTU 周报 10-04
- OpenAI 套餐调整:新增 Pro 500 档(Plus 的 25 倍用量),据 Latent Space 称该调整使原 Pro 200 的价值约减半、引发用户不满;ChatGPT 周活 12 亿。来源:Latent Space · MediaNama
- 榜单:Gemini 4 Argon 77.9% vs GPT-6.1 Sol 75.2% vs Sonnet 5.5 71.0%(DeepSWE v1.1,来自各自厂商/第三方报告,口径未必一致)。来源:Google 博客 · Vellum
今日精选主题
OpenAI Dots:常驻智能体(Always-On Agents)的架构与权限设计 选择理由:这是本期最大的产品范式变化——agent 从"被调用"变成"持续在线",对权限分级、自动复核、成本计量和安全监控提出了新的工程要求,与你关注的 Agent 工程实践直接相关。深度文档已生成(中英双语)。
备选主题: 1. Gemini 4 Argon 的"防守方优先"分阶段发布与 Fairwind 计划 2. Computer-use agent 的分支引导(Branch Steering)攻击与防御
不回复则默认使用上述精选主题。
主页