← 主页
2026年7月13日

AI 每日简报 · 2026-07-13(周一)

面向 mingyu 的每日 AI 技术情报。所有条目来自真实搜索结果,标注来源与日期;不夸大、不编造。近 24–48 小时无新内容的分区标注「今日无重要更新」。


🔥 今日头条

  1. OpenAI 正式全量发布 GPT-5.6(Sol / Luna / Terra 三档) OpenAI 于 7 月 9 日面向公众全量放开 GPT-5.6,分三个版本:Sol(最强)、Luna(主打速度)、Terra(日常均衡)。Altman 称 Sol 在 agentic 编码任务上 token 效率提升 54%——在「企业都在算 AI 花的钱值不值」的当下,这个「每一分钱的性价比」指标格外关键。此前该系列因美国政府 AI 网络安全令(发布前 30 天送审)而分阶段放行。 来源:https://www.axios.com/2026/07/09/ai-openai-gpt-release

  2. Google Gemini 3.5 Pro 推迟到 7 月 17 日,推倒重来 + DeepMind 人才流失 Google 放弃 Gemini 2.5 Pro 架构、从零重建 3.5 Pro,发布延到 7 月 17 日,主打 200 万 token 上下文、Deep Think 推理层、自主工作流。同期一周内 4 位资深研究员离职(Noam Shazeer 去 OpenAI,诺奖得主 John Jumper 等加入 Anthropic),Alphabet 市值一度蒸发约 2250 亿美元。 来源:https://finance.biggo.com/news/6f0c6bb2-795f-4c57-9d09-6db691d7638a

  3. SWE-bench Verified 榜单刷新:Claude 系霸榜 截至 7 月 11 日,SWE-bench Verified 榜由 Claude Mythos 5(95.5%)领跑,Fable 5(95%)、Opus 4.8(88.6%)紧随;开源侧 Zhipu GLM-5.2 成 SWE-Bench Pro 最强开源模型(0.621)。编码 Agent 的评测正成为各家角力的主战场。 来源:https://benchlm.ai/benchmarks/sweVerified


🏢 官方发布与新功能


🤖 Agent 技术精选


🎓 学术与课程


📈 行业动态


🎯 今日精选主题

主题:AI Agent 评测与 Benchmark(如何科学评估一个 Agent 好不好)

选择理由:今天多条头条都指向同一件事——评测正成为 Agent 竞争的胜负手(SWE-bench 榜单刷新、GPT-5.6 主打 agentic 编码效率、CUBE/UTBoost 学术推进、DeepEval/LangSmith 等工具矩阵成熟)。而「怎么评一个 Agent」恰恰是工程实践里最容易被忽略、又最影响上线成败的一环:从只看最终答案,到评「轨迹」、评「计划质量」、评「工具调用准确率」,方法论正在快速定型。这个主题此前的深度文档(MCP、沙箱、上下文工程、多智能体、AgenticRL、Agent Skills、记忆系统)都还没覆盖,正好补齐 Agent 工程闭环的「验收」一环。

备选主题(如不回复则默认用上面精选): 1. Agent Harness Engineering(Agent「外壳工程」:工具/权限/可观测性/编排的整体设计) 2. Agent 的无限循环与失败模式(为什么 Agent 会停不下来,如何设护栏)