Mingyu's Library主页
2026年9月24日

AI 每日简报 · 2026-09-24(周四)

覆盖窗口:2026-09-22 ~ 2026-09-24(核心事件集中在 09-22/09-23;个别背景素材标注了具体日期) 每条均来自真实搜索结果并标注来源链接与日期。未经二次核实的说法以「据报道」标明。


🔥 今日头条

1. Claude Code v2.1.281 发布,集中修复一批"每天都会撞见"的老毛病(09-23)

Anthropic 发布 Claude Code v2.1.281,重点不是新功能而是稳定性:修复了 API 重试时偶发的"unrecoverable interface error"崩溃、--max-turns 被忽略导致的无限重试循环、恢复会话时重复发送早前轮次(且内容会变形)、以及 MCP 服务器中途断连导致 prompt cache 失效等问题。同时新增了 MCP 2026-07-28 协议的 URL-mode elicitation 支持,以及网关模式下 Bedrock 上游的 assume_role(STS 角色假设)与 guardrail 支持。

为什么重要:这些都是长会话、CI 无头模式、企业网关部署里最容易"看起来卡住了但说不清哪里错"的坑,对每天在用 Claude Code 的人是直接可感的稳定性提升。 来源:Claude Code Changelog

2. Google Cloud AI Research 发布 RRSI:给"Agent Harness 自我进化"加正则化,防止过拟合基准测试(09-21)

Google Cloud AI Research(联合 Stanford、UNC-Chapel Hill、WashU)提出 RRSI(Regularized Recursive Self-Improvement):此前让 Agent Harness(提示词、控制流、工具、记忆管理等)递归自我进化的方法,普遍存在"在 evolve 集上刷分、换到新任务就崩"的适应性过拟合问题。RRSI 在提案侧(退火编辑预算、证据感知的假设记录)和选择侧(噪声地板、复杂度惩罚、结构化剪枝)都加了正则约束,在编码、办公、工程设计三大类共 8 个基准上,分布外(OOD)平均提升 3.9 分(对比同类方法多为负收益),且策略 token 用量减少 30%。 来源:arXiv:2609.24972

3. SWE-bench Pro 榜单更新:Claude Opus 5.5 以 89.9% 大幅领跑(09-22)

在 Anthropic 09-22 发布 Claude Opus 5.5(定价 \$4/\$20 每 Mtok,比 Opus 5 便宜约 40%)之后,SWE-bench Pro 榜单同日更新,Opus 5.5 以 89.9% 登顶,领先第二名 Claude Fable 5.1(81.2%)达 8.7 个百分点。

为什么重要:这是模型发布后benchmark 侧最快的独立印证之一,但 BenchLM 也提醒,据 OpenAI 07 月审计,SWE-bench Pro 公开任务中约 30% 存在缺陷,榜单数字仅供参考、不宜作为唯一采购依据。 来源:BenchLM SWE-bench Pro 榜单


📦 官方发布与新功能


🤖 Agent 技术精选


🎓 学术与课程


📈 行业动态


🎯 今日精选主题

主选:Agent Harness 的自我进化怎么才不"刷分即崩"?—— 从 RRSI 论文拆解正则化递归自我改进

选择理由:①技术深度足够、可拆解性强——RRSI 不是一篇泛泛的"Agent 又变强了"新闻稿,而是有完整的提案/选择双侧正则化机制(退火编辑预算、噪声地板、复杂度惩罚、结构化剪枝)、8 个基准的定量结果和消融实验,非常适合画图拆解;②和已讲主题错位互补——此前讲过的「Agent Harness Engineering」(09-07)、「编码 Agent 自主验证闭环」(08-06)关注的是"人怎么手动设计好 harness",而 RRSI 关注的是"怎么让 harness 自动进化、还不为了刷分把自己搞崩",是全新的自动化优化视角;③当天素材质量高——论文本身、GitHub 代码、项目主页三者齐全,便于引用可验证的细节而非道听途说。

备选主题(若你更想看别的,回复即可,不回复则按主选执行): - 备选 A:Claude Opus 5.5 与 SWE-bench Pro 89.9%——"思考常驻开启"这类破坏性模型变更该怎么迁移 —— 以官方迁移指南为核心,讲清楚 effort 替代 thinking:disabledtool_choice 强制单工具模式被砍之后,已有自动化脚本该怎么改 - 备选 B:"Neocloud"融资潮里的资本逻辑 —— 以 Verda \$1.89 亿 B 轮为切入点,对照上周 Temporal 的 \$5.5 亿融资,讲清楚"长时程 Agent 基础设施"和"AI 推理专用云"两类资本叙事的本质区别


本简报由每日自动任务生成 · 2026-09-24 · Claude Code 小课为独立文档,见同目录 Claude Code小课-2026-09-24.md