面向 mingyu 的每日 AI 技术情报。所有条目来自真实搜索结果,标注来源与日期;不夸大、不编造。近 24–48 小时无新内容的分区标注「今日无重要更新」。
🔥 今日头条
-
OpenAI 正式全量发布 GPT-5.6(Sol / Luna / Terra 三档) OpenAI 于 7 月 9 日面向公众全量放开 GPT-5.6,分三个版本:Sol(最强)、Luna(主打速度)、Terra(日常均衡)。Altman 称 Sol 在 agentic 编码任务上 token 效率提升 54%——在「企业都在算 AI 花的钱值不值」的当下,这个「每一分钱的性价比」指标格外关键。此前该系列因美国政府 AI 网络安全令(发布前 30 天送审)而分阶段放行。 来源:https://www.axios.com/2026/07/09/ai-openai-gpt-release
-
Google Gemini 3.5 Pro 推迟到 7 月 17 日,推倒重来 + DeepMind 人才流失 Google 放弃 Gemini 2.5 Pro 架构、从零重建 3.5 Pro,发布延到 7 月 17 日,主打 200 万 token 上下文、Deep Think 推理层、自主工作流。同期一周内 4 位资深研究员离职(Noam Shazeer 去 OpenAI,诺奖得主 John Jumper 等加入 Anthropic),Alphabet 市值一度蒸发约 2250 亿美元。 来源:https://finance.biggo.com/news/6f0c6bb2-795f-4c57-9d09-6db691d7638a
-
SWE-bench Verified 榜单刷新:Claude 系霸榜 截至 7 月 11 日,SWE-bench Verified 榜由 Claude Mythos 5(95.5%)领跑,Fable 5(95%)、Opus 4.8(88.6%)紧随;开源侧 Zhipu GLM-5.2 成 SWE-Bench Pro 最强开源模型(0.621)。编码 Agent 的评测正成为各家角力的主战场。 来源:https://benchlm.ai/benchmarks/sweVerified
🏢 官方发布与新功能
- OpenAI GPT-5.6 三档模型 + 语音:同步把 GPT-5.6 接入 Microsoft 365 Copilot(Word/Excel/PPT/Chat/Cowork 默认模型),并推出 GPT-Live-1 / mini 全双工语音模型。来源:https://www.axios.com/2026/07/09/ai-openai-gpt-release
- Anthropic Claude Sonnet 5:Sonnet 档最强模型,接近 Opus 智能、原生 1M token 上下文,已成 Claude Code 默认模型,促销价延续到 8/31。来源:https://releasebot.io/updates/anthropic
- Anthropic Claude Fable 5 全球重新部署:6/30 出口管制放开后,7/1 起带更新的网络安全防护重新上线;Pro/Max/Team 等计划 7/7 前按最高 50% 周用量额度包含 Fable 5。来源:https://www.anthropic.com/news/redeploying-fable-5
- Anthropic Claude Science:面向科研人员的 AI 工作台,集成常用工具/包、产出可审计的 artifact、灵活调用算力。来源:https://www.anthropic.com/news/claude-science-ai-workbench
- Cowork 扩展到 Web 与移动端:会话与文件跨设备同步,Chat 与 Cowork 统一入口;新增 Microsoft 365 写入工具(邮件/日历/OneDrive/SharePoint)。来源:https://releasebot.io/updates/anthropic
🤖 Agent 技术精选
- MCP 成为主流框架默认工具协议:LangChain、CrewAI、LangGraph、LlamaIndex 已从「实验支持」转为把 MCP 作为工具调用默认协议;MCP 是标准化集成层,不取代 Agent 编排框架。来源:https://guptadeepak.com/tools/top-10-mcp-frameworks-2026/
- Agent 评测转向「轨迹评估(trajectory eval)」:2026 年主流做法是评分整条调用轨迹(工具选择、参数、步数、循环、恢复),而非只看最终答案——一个 Agent 可能答对但路径低效/不安全。前提是必须做 trace 埋点。来源:https://www.confident-ai.com/blog/llm-agent-evaluation-complete-guide
- Harness Engineering 兴起:社区整理 awesome-harness-engineering,把工具、评测、记忆、MCP、权限、可观测性、编排作为「Agent 外壳工程」统一话题。来源:https://github.com/ai-boost/awesome-harness-engineering
- 论文:Agent 会「停不下来」:《When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents》(arXiv 2607.01641,7/2)系统研究了 LLM Agent 的无限循环失败模式。来源:https://arxiv.org/abs/2607.01641v1
🎓 学术与课程
- Stanford CS329A《Self-Improving AI Agents》:课程覆盖 constitutional AI、verifier、测试时计算扩展、搜索+LLM、工具/代码/记忆增强、多步推理规划,以及「构建稳健评测框架的挑战」。先修 CS224N/CS229S。来源:https://cs329a.stanford.edu/
- CUBE:统一 Agent 基准的标准(arXiv 2603.15798):试图统一杂乱的 Agent benchmark 口径。来源:https://arxiv.org/pdf/2603.15798
- UTBoost:更严格地评测编码 Agent(基于 SWE-Bench,arXiv 2506.09289):针对 SWE-bench 测试用例不足的问题做加强。来源:https://arxiv.org/pdf/2506.09289
- MemTool(arXiv 2507.21428):优化 LLM Agent 多轮对话中动态工具调用的短期记忆管理。来源:https://arxiv.org/pdf/2507.21428
📈 行业动态
- 开源编码模型逼近大模型:Qwen3-Coder-Next 仅 3B 激活参数,在 SWE-bench 上媲美 20 倍大的模型;GLM-5.2 领跑 SWE-Bench Pro 开源榜。来源:https://localaimaster.com/models/swe-bench-explained-ai-benchmarks
- DeepMind 人才外流引发市场震荡:一周 4 位核心研究员离职,Alphabet 市值一度蒸发约 2250 亿美元,反映顶级 AI 人才争夺白热化。来源:https://the-agent-report.com/2026/07/google-gemini-3-5-pro-delayed-july-2026/
- 评测框架生态成熟:DeepEval(pytest 式 CI 评测)、Braintrust、Arize Phoenix(OTel 原生轨迹评测)、LangSmith、Galileo 等形成 Agent 评测工具矩阵。来源:https://www.morphllm.com/ai-agent-evaluation-frameworks
🎯 今日精选主题
主题:AI Agent 评测与 Benchmark(如何科学评估一个 Agent 好不好)
选择理由:今天多条头条都指向同一件事——评测正成为 Agent 竞争的胜负手(SWE-bench 榜单刷新、GPT-5.6 主打 agentic 编码效率、CUBE/UTBoost 学术推进、DeepEval/LangSmith 等工具矩阵成熟)。而「怎么评一个 Agent」恰恰是工程实践里最容易被忽略、又最影响上线成败的一环:从只看最终答案,到评「轨迹」、评「计划质量」、评「工具调用准确率」,方法论正在快速定型。这个主题此前的深度文档(MCP、沙箱、上下文工程、多智能体、AgenticRL、Agent Skills、记忆系统)都还没覆盖,正好补齐 Agent 工程闭环的「验收」一环。
备选主题(如不回复则默认用上面精选): 1. Agent Harness Engineering(Agent「外壳工程」:工具/权限/可观测性/编排的整体设计) 2. Agent 的无限循环与失败模式(为什么 Agent 会停不下来,如何设护栏)