覆盖窗口:2026-09-22 ~ 2026-09-24(核心事件集中在 09-22/09-23;个别背景素材标注了具体日期) 每条均来自真实搜索结果并标注来源链接与日期。未经二次核实的说法以「据报道」标明。
🔥 今日头条
1. Claude Code v2.1.281 发布,集中修复一批"每天都会撞见"的老毛病(09-23)
Anthropic 发布 Claude Code v2.1.281,重点不是新功能而是稳定性:修复了 API 重试时偶发的"unrecoverable interface error"崩溃、--max-turns 被忽略导致的无限重试循环、恢复会话时重复发送早前轮次(且内容会变形)、以及 MCP 服务器中途断连导致 prompt cache 失效等问题。同时新增了 MCP 2026-07-28 协议的 URL-mode elicitation 支持,以及网关模式下 Bedrock 上游的 assume_role(STS 角色假设)与 guardrail 支持。
为什么重要:这些都是长会话、CI 无头模式、企业网关部署里最容易"看起来卡住了但说不清哪里错"的坑,对每天在用 Claude Code 的人是直接可感的稳定性提升。 来源:Claude Code Changelog
2. Google Cloud AI Research 发布 RRSI:给"Agent Harness 自我进化"加正则化,防止过拟合基准测试(09-21)
Google Cloud AI Research(联合 Stanford、UNC-Chapel Hill、WashU)提出 RRSI(Regularized Recursive Self-Improvement):此前让 Agent Harness(提示词、控制流、工具、记忆管理等)递归自我进化的方法,普遍存在"在 evolve 集上刷分、换到新任务就崩"的适应性过拟合问题。RRSI 在提案侧(退火编辑预算、证据感知的假设记录)和选择侧(噪声地板、复杂度惩罚、结构化剪枝)都加了正则约束,在编码、办公、工程设计三大类共 8 个基准上,分布外(OOD)平均提升 3.9 分(对比同类方法多为负收益),且策略 token 用量减少 30%。 来源:arXiv:2609.24972
3. SWE-bench Pro 榜单更新:Claude Opus 5.5 以 89.9% 大幅领跑(09-22)
在 Anthropic 09-22 发布 Claude Opus 5.5(定价 \$4/\$20 每 Mtok,比 Opus 5 便宜约 40%)之后,SWE-bench Pro 榜单同日更新,Opus 5.5 以 89.9% 登顶,领先第二名 Claude Fable 5.1(81.2%)达 8.7 个百分点。
为什么重要:这是模型发布后benchmark 侧最快的独立印证之一,但 BenchLM 也提醒,据 OpenAI 07 月审计,SWE-bench Pro 公开任务中约 30% 存在缺陷,榜单数字仅供参考、不宜作为唯一采购依据。 来源:BenchLM SWE-bench Pro 榜单
📦 官方发布与新功能
- Claude Code v2.1.281(09-23):修复无限重试、崩溃、prompt cache 丢失等问题;新增 MCP URL-mode elicitation、Bedrock
assume_role/guardrail。Changelog - Claude 发现新型 CRISPR-like 酶系统(09-23):Anthropic 披露 Claude 在扫描 20 万个酶序列后,发现噬菌体中一种此前未被描述、带 CRISPR 式重复序列的新型酶系统,是 AI 辅助基础生物学发现的又一实例。Anthropic 官方
- OpenAI 发布 MentalHealthBench(09-23):面向心理健康对话场景的新评测基准,用于衡量模型在敏感对话中的回应质量;据报道 GPT-6 Astra 在该基准上得分 57.3。OpenAI 官方
- Claude Opus 5.5(09-22,背景延续):1M 上下文,思考能力常驻开启(不可关闭,以
effort参数替代),computer_20251124工具已废弃。官方迁移指南
🤖 Agent 技术精选
- MCP 生态落地 URL-mode elicitation:Claude Code v2.1.281 支持 MCP 2026-07-28 协议里的 URL-mode elicitation(工具可引导用户跳转到外部链接完成授权类交互),是该协议规范持续被各家客户端实现的最新一例。Changelog
- RRSI 提出目前最细粒度的公开 Harness 可编辑维度分类:prompt / control_flow / config / context_mgmt / client_tool / skill / memory / subagent 八类,并证明"允许编辑的范围"和"约束搜索轨迹"可以分开处理——对自己在写自动化 prompt/harness 优化流水线的人是很直接的设计参考。arXiv:2609.24972
- DUMA-Bench:Agent 安全是"涌现"出来的,不只是模型属性:新基准把"用户和 Agent 都能操作环境"的双控场景纳入评测,发现攻击成功率从单控的 26.9% 升到双控的 41.1%——对做 Agent 安全评测/红队的人,提示了传统仅测模型的评测方法可能低估真实风险。arXiv:2609.24662
🎓 学术与课程
- 《RRSI: Regularized Recursive Self-Improvement of Agent Harnesses》(arXiv:2609.24972,09-21 提交,Google Cloud AI Research / Stanford / UNC-Chapel Hill / WashU):在编码(Terminal-Bench 2.1 → SWE-bench Verified)、办公(Harvey LAB → JobBench/GDPval/APEX-Agents)、工程设计(EngDesign → Frontier-Eng)三类共 8 个基准上验证,分布外平均提升 3.9 分,是同类方法里唯一 OOD 收益为正且稳定跨模型迁移(Gemini 3.5 Flash 进化的 harness 迁移到 Gemini 3.1 Flash Lite 仍 +3.4 分)的工作。论文
- 《DUMA-Bench: A Dual-Control Multi-Agent Benchmark for Evaluating LLM Agent Security》(arXiv:2609.24662,09-21 提交):覆盖五大厂商共 14 个模型,证明双控交互场景下攻击成功率显著高于单控场景,把"Agent 安全"重新定义为模型-用户-环境三者交互的涌现属性。论文
📈 行业动态
- SWE-bench Pro 榜单更新(09-22):Claude Opus 5.5 以 89.9% 登顶,第二名 Fable 5.1(81.2%)、第三名 Mythos 5(80.3%);榜单方提醒约 30% 公开任务存在已知缺陷,数字仅供参考。BenchLM
- Verda(原 DataCrunch)融资 \$1.89 亿 Series B(09-22):这家总部在赫尔辛基的欧洲"neocloud"厂商,由 Emergence Capital 领投,MUFG、Supermicro 等跟投,计划 2027 年前在欧美亚部署 250+ 兆瓦算力、上线 Nvidia VR200 NVL72,累计融资(股权+债权)超 \$4.5 亿。SiliconANGLE
- Airbnb 扩大 GPT-6 Astra 接入范围(09-23):据 OpenAI 官方博客,Airbnb 宣布扩大在其平台上使用 GPT-6 Astra 的范围,是 GPT-6 Astra 09-03 发布后又一企业侧落地案例。OpenAI 官方
🎯 今日精选主题
主选:Agent Harness 的自我进化怎么才不"刷分即崩"?—— 从 RRSI 论文拆解正则化递归自我改进
选择理由:①技术深度足够、可拆解性强——RRSI 不是一篇泛泛的"Agent 又变强了"新闻稿,而是有完整的提案/选择双侧正则化机制(退火编辑预算、噪声地板、复杂度惩罚、结构化剪枝)、8 个基准的定量结果和消融实验,非常适合画图拆解;②和已讲主题错位互补——此前讲过的「Agent Harness Engineering」(09-07)、「编码 Agent 自主验证闭环」(08-06)关注的是"人怎么手动设计好 harness",而 RRSI 关注的是"怎么让 harness 自动进化、还不为了刷分把自己搞崩",是全新的自动化优化视角;③当天素材质量高——论文本身、GitHub 代码、项目主页三者齐全,便于引用可验证的细节而非道听途说。
备选主题(若你更想看别的,回复即可,不回复则按主选执行):
- 备选 A:Claude Opus 5.5 与 SWE-bench Pro 89.9%——"思考常驻开启"这类破坏性模型变更该怎么迁移 —— 以官方迁移指南为核心,讲清楚 effort 替代 thinking:disabled、tool_choice 强制单工具模式被砍之后,已有自动化脚本该怎么改
- 备选 B:"Neocloud"融资潮里的资本逻辑 —— 以 Verda \$1.89 亿 B 轮为切入点,对照上周 Temporal 的 \$5.5 亿融资,讲清楚"长时程 Agent 基础设施"和"AI 推理专用云"两类资本叙事的本质区别
本简报由每日自动任务生成 · 2026-09-24 · Claude Code 小课为独立文档,见同目录 Claude Code小课-2026-09-24.md
主页