面向 mingyu 的每日 AI 技术情报 · 覆盖官方发布 / Agent 工程 / 学术课程 / 行业动态 保真原则:所有条目均来自当日/近 48 小时真实搜索结果,标注来源;部分未获官方确认的信息已明确标注「待确认」。
🔥 今日头条
-
OpenAI GPT-5.6 三兄弟(Sol / Terra / Luna)正式公开发布,并推出低成本 GPT-5 Turbo 继 6 月 26 日预览、此前仅对约 20 家政府背景合作方开放后,GPT-5.6 家族本周正式面向公众开放:旗舰 Sol、均衡的 Terra、快速廉价的 Luna。同时发布 GPT-5 Turbo——面向高并发企业场景的成本优化版,早期基准显示多数任务上表现落后完整版 GPT-5 约 6–8%,但每百万 token 成本约低 40%。为什么重要:这是 OpenAI 把「按能力/成本分层」的产品策略进一步铺开,企业可以按预算精细选型。来源:Nextgov/FCW、LLM-Stats 更新
-
Anthropic「Claude Managed Agents」三个研究预览功能集体转公测:Memory、Multi-agent coordination、Outcomes 截至 7 月 9 日,Managed Agents 产品线在上线三个月内大幅迭代,研究预览货架「几乎清空」——记忆(Memory)、多智能体协同(Multi-agent coordination)、结果度量(Outcomes)均已进入公测。为什么重要:这三项恰好对应做生产级 Agent 最难的三块——长期记忆、多 Agent 协作、可度量的产出闭环。来源:Claude Managed Agents 更新
-
Google Gemini 3.5 Pro 传延期至 7 月 17 日、推倒重构(待确认) 多家媒体报道 Google 放弃原 Gemini 2.5 Pro 架构、从零重构 3.5 Pro,发布推迟到 7 月 17 日,主打数学推理、SVG 场景生成、图像质量,对标 GPT-5.6 与 Fable 5,并传闻带 200 万 token 上下文。为什么重要:三大厂旗舰节奏胶着,但截至 7 月 7 日 Google 尚未发布 model card / API 文档,「7·17 发布、2M 上下文、定价」等均属未确认传闻,需等官方发布物为准。来源:BigGo Finance、Geeky Gadgets
🏢 官方发布与新功能
- OpenAI 计划让 Sol 跑在 Cerebras 晶圆级硬件上,最高约 750 tokens/秒,约为当前 GPU 推理吞吐的 15 倍——推理算力路线出现非 GPU 选项。来源:LLM-Stats
- Anthropic 重新全球部署 Claude Fable 5,并新增更深的 cyber 安全防护:草拟「AI 越狱严重度框架」、上线 HackerOne 项目供安全研究者上报潜在 cyber 越狱。来源:Anthropic Newsroom、Releasebot
- Claude 新增「月度回顾与专注设置」(Web/桌面):休息提醒、免打扰时段、工作洞察;Settings > Reflect 展示用户投入的主题、最活跃日与高峰时段(Free/Pro/Max 灰度)。来源:Releasebot
- Google 已于 5 月 19 日发布 Gemini 3.5 Flash,是 3.5 家族首个公开版本(Pro 仍未 GA)。来源:Coursiv
- Anthropic 将 Claude Code 与 Cowork 带入政府场景(7 月 7 日),并展示营销运营团队用 Cowork 自动化报表与投放搭建(7 月 8 日)。来源:Anthropic 官方
🤖 Agent 技术精选
- Anthropic 工程博客谈 Agent「爆炸半径(blast radius)」封控:随着 Agent 能力增强,工程核心问题是如何为其影响面「封顶」;文章总结了为 claude.ai、Claude Code、Cowork 构建 containment(隔离/围栏)的经验。来源:Anthropic Engineering
- 上下文工程(Context Engineering)持续成为核心学科:多篇实践指南把技巧归为四类——写入(write)、选择(select)、压缩(compress)、隔离(isolate),关注跨多步任务对指令/工具/记忆/历史的整体信息环境管理。来源:Mem0、Sourcegraph
- MCP 2026-07-28 规范定于 7 月 28 日正式发布(RC 已出):自 launch 以来最大改版——无状态核心可跑在普通 HTTP 负载均衡后、MCP Apps(沙箱 iframe 内的服务端渲染 UI)、Tasks 长任务扩展、对齐 OAuth/OIDC 的授权、正式弃用策略。来源:MCP 官方博客、InfoQ
- 多智能体(multi-agent)热度盖过单 Agent 工具:在「脏活/杂活」任务上,专业化分工的多 Agent 常优于单一通用 Agent。来源:AI Agents News 7 月号
🎓 学术与课程
- SENTINEL:失败驱动的强化学习训练「会用工具」的 Agent(arXiv 2606.12908)。核心思路:用模型自己失败的 rollout 反哺下一轮 RL 任务构造——Controller 分析失败轨迹→Proposer 造针对性任务→Solver 用 RL 优化,持续把训练分布推向当前策略的薄弱处。来源:arXiv 2606.12908
- 「多步工具使用 RL 为何会崩溃、以及监督信号如何修复」(arXiv 2606.26027):揭示多步 tool-use 的 RL 训练不稳定成因并给出改进。来源:arXiv 2606.26027
- VerlTool:面向整体式 Agentic RL + 工具使用的框架(arXiv 2509.01055);另有 Agent-R1 端到端 RL 训练开源项目。来源:arXiv 2509.01055、Agent-R1
- General AgentBench / AgentEscapeBench 等新评测:系统研究 Agent 的 test-time scaling(顺序 vs 并行)与「域外工具接地推理」——最优模型在依赖深度增大时成功率从 90% 跌到 60%。来源:arXiv 2602.18998、AgentEscapeBench
📈 行业动态
- SWE-bench 榜单(截至 7 月 8 日)由 Claude 系霸榜:Verified 上 Claude Mythos 5 以 95.5% 居首,Fable 5(95%)、Opus 4.8(88.6%)紧随;SWE-Bench Pro 上 Fable 5 以 0.800 领先(35 个模型)。来源:BenchLM、SWE-Bench Pro
- LMArena(用户偏好):Claude Fable 5、Opus 4.6/4.7(thinking)位居文本生成榜前列。来源:DataLearner 榜单
- RL for Agent 从研究走向生产:veRL(字节)、OpenRLHF 已证明 GRPO/PPO 可规模化训练推理模型,下一步是把同套技术用到与真实软件交互的 Agent 上。来源:DEV Community
⭐ 今日精选主题
主题:Agentic RL —— 用强化学习训练「会用工具」的 Agent
选择理由:今天的学术与行业信号高度一致地指向同一件事——把「Agent 会不会用工具」从靠提示词/few-shot,转向用强化学习真正训练出来。SENTINEL(失败驱动 RL)、「多步 tool-use RL 为何崩溃」、VerlTool、Agent-R1,加上「RL 从研究走向生产」的产业判断,构成了一个完整且当下最活跃的技术脉络。它直接落在你关注的「Agent 工程 + 学术研究」交叉点,且此前的深度文档(MCP 新规范、Agent 沙箱、上下文工程、多智能体编排)都未覆盖「如何训练 Agent 本身」这一层,互补性强。
备选主题(如需切换请回复): - 备选 A:LLM Agent 的工具使用评测与故障恢复(General AgentBench / AgentEscapeBench / When Tools Fail)——偏「怎么衡量与压测 Agent」。 - 备选 B:MCP Apps 与 Tasks 扩展(7·28 新规范里的服务端渲染 UI + 长任务)——偏「协议与前端交互」。
若今日不回复,默认按精选主题「Agentic RL」生成深度学习文档。
备注:GPT-5.6/Gemini 3.5 Pro 等条目中的部分细节(定价、上下文长度、具体发布日)属媒体报道/传闻,已按保真原则标注「待确认」;以各厂官方 model card / API 文档为准。