Mingyu's Library主页
2026年9月9日

AI 每日简报 · 2026-09-09(周三)

覆盖窗口:2026-09-07 ~ 2026-09-09(以过去 24–48 小时为主) 所有条目均来自公开搜索结果并附来源链接;未查到新内容的分区如实写「今日无重要更新」。 标注说明:〔事实〕= 一手来源明确陈述;〔报道〕= 媒体/聚合站转述,未见一手确认。 已在 09-03 / 09-05 / 09-06 / 09-07 详述过的 GPT-6 Astra、Gemini 3.8 Flash、Claude Fable 5.1、Harness Engineering 论文,今日不再重复。


🔥 今日头条

1. OpenAI 宣称用内部模型 + 约一万个并发 agent 解决了 Navier–Stokes 千禧年问题〔事实〕

9 月 8 日,OpenAI 发布《On the Navier–Stokes Millennium Prize Problem》,公开一份由内部系统产出的证明:三维不可压缩 Navier–Stokes 方程在光滑外力、有限能量条件下可以在有限时间内产生奇点(velocity 无界增长)。这对应官方千禧年问题表述中的 "C"(及 "D")分支,即否定性解答。同时公开了论文 PDF 与 Lean 形式化证明(GitHub: openai/NavierStokesAndEuler)。

工程细节比数学结论更值得工程师注意(以下均为 OpenAI 自述):

为什么重要:这是目前公开可查的最大规模的一次「agent 群体搜索」工程记录,而且带有可机器验证的 ground truth(Lean)。它同时提供了一个反直觉的对照——今天 arXiv 上另有论文显示「等推理成本下多 agent 打不过单 agent」(见下条)。两者不矛盾:Navier–Stokes 这类任务的特点是验证便宜、搜索昂贵、解空间极大,此时堆并发+强制多样性+跨组授粉才有回报。今日《深度学习》文档即拆解这条工程线。

2. 同一周,Anthropic 研究员与 NYU 教授独立公布 Euler 有限时间爆破证明,优先权出现争议〔事实/报道〕

Anthropic 研究员 Levent Alpöge 与 NYU 数学教授 Tristan Buckmaster 于 9 月 7–8 日公开三份预印本,证明带光滑外力下不可压缩多孔介质方程、二维 Boussinesq 系统与三维不可压缩 Euler 方程的有限时间爆破,并附 Lean 形式化。该工作建立在 Diego Córdoba 与 Luis Martínez-Zoroa 多年研究纲领之上;作者披露大量使用 LLM——用 Claude 提炼并复现前人证明的关键构件,用 Claude 与 Codex 撰写正文。Terence Tao 于 9 月 7 日在其博客发文讨论这组结果。〔事实〕

争议点:Buckmaster 在声明中叙述了与 OpenAI 的接触,称对方告知其内部模型产出了约 100 页的受迫 Navier–Stokes 有限时间爆破证明,但截至 9 月 8 日他本人未见到该证明。〔报道〕OpenAI 在其发布中的表述是:双方结果不同——Alpöge–Buckmaster 解决的是受迫 Euler,OpenAI 解决的是 Navier–Stokes,且其 Euler 结果是无外力版本;OpenAI 承认对方在受迫 Euler 上的优先权,并称在 9 月 6 日完成验证后才主动联系对方。〔事实,OpenAI 自述〕

为什么重要:两件事同周落地,信号是"AI 参与的数学"已经从辅助进入产出主结果的阶段,而学术界的优先权、署名与验证规范还没跟上。Lean 形式化在这里承担了唯一的客观仲裁角色——这对所有做 agent 的人是个通用启发:能被机器验证的领域,agent 的上限会先被打开

3. Google DeepMind 发布 AlphaGenome Atlas:预计算人类基因组全部 90 亿个单碱基变异的分子效应〔事实〕

9 月 8 日,DeepMind 上线 AlphaGenome Atlas——把 AlphaGenome 模型的预测离线全量预计算,覆盖人类基因组中所有 90 亿种可能的单核苷酸变异,数据集约 1 PB(是 AlphaFold 数据库的 30 多倍)。同时发布 AVI(AlphaGenome Variant Impact)分数,把 AlphaGenome 与 AlphaMissense 的预测压缩成单个数字,可直接对变异排序;并提供 AVI 特征归因(染色质可及性、剪接、保守性等)与 2500+ 个 de novo motif 集合。学术用途免费,通过网页门户、AlphaGenome API 及 Google Antigravity 中的一个 skill 三种方式访问;商业用途将上 Google Cloud。

已验证的应用:Broad Institute 团队用 AVI 定位到此前被漏掉的 DNM1 剪接变异(与癫痫性脑病强相关),实验验证成立;Exeter 大学 Gareth Hawkes 在 UK Biobank 5.4 万人全基因组数据上,按预测分子效应分组罕见变异后,多发现 22% 的非编码关联信号

为什么重要:这是「把模型推理离线全量预计算成静态资产」这一模式的又一次大规模验证——和 AlphaFold DB 一个路数。对做 AI 产品的人是可迁移的架构启发:当推理成本远低于用户查询量、且输入空间可枚举时,预计算 + 静态检索往往比在线推理更划算。


🏢 官方发布与新功能

🤖 Agent 技术精选

🎓 学术与课程

📈 行业动态


🎯 今日精选主题

选定主题:Agent Swarm —— 大规模并行智能体的编排、失效与工程边界

选择理由:今天出现了一个罕见的「同题双向证据」窗口——

这三组证据放一起,才能回答独立开发者真正关心的问题:什么时候该堆 agent 数量,什么时候堆了纯属烧钱。今日深度文档即围绕这条线展开:swarm 的判据(验证成本 vs 搜索成本)、多样性的制造与度量、跨组授粉的机制、以及群体规模上升时必然出现的四类失效模式。

备选主题(如需替换请直接回复):

  1. Harness 演化导致的能力遗忘(EvoHarnessBench) —— 你每加一个 MCP server / skill,可能正在让此前跑通的任务悄悄退化。
  2. 可机器验证领域的 agent 上限(Lean 形式化作为 ground truth) —— 为什么数学、编译、类型检查这类领域会先被 agent 攻破。

📌 今日 Claude Code 小课(独立文档)

第 28 课:Checkpointing 与 /rewind —— 把「改坏了」变成一个可回退的动作

详见同目录 Claude Code小课-2026-09-09.md,并已同步进 ../claude-code-tips.html 累积技巧库。