覆盖过去约 24–48 小时的官方发布、Agent 工程、学术课程与行业动态。所有条目均来自当日 WebSearch 结果并标注来源;搜索结果之间有分歧或未能一手核实处已注明。
🔥 今日头条
-
OpenAI GPT-5.6 家族(Sol / Terra / Luna)7 月 9 日全面开放(GA) 继 6 月 26 日预览后,GPT-5.6 三档模型正式对所有用户开放:旗舰 Sol、均衡档 Terra、快速廉价档 Luna。此前该家族仅限约 20 家政府审核过的合作机构试用,如今转为普遍可用,意味着新一代旗舰能力进入公开竞争。来源:Axios、llm-stats
-
xAI Grok 4.5 于 7 月 8 日公开发布,主打编码 Grok 4.5 是一款「用 Cursor 训练」的编码模型,API 定价约 $2/$6(输入/输出,每百万 token),SuperGrok 订阅 $30/月,具备 Opus 级推理与原生 X 平台实时检索。这是 xAI 自 7 月 8 日起的公开旗舰。来源:llmgateway 时间线、felloai
-
Meta 首个「付费」模型 Muse Spark 1.1 上线(7 月 9 日) 这是 Meta 首款收费模型,定价约 $1.25/$4.25,定位 agentic coder(自主编码智能体),在工具调用基准 MCP Atlas 上拿到 88.1、居榜首。标志着 Meta 从纯开源策略转向部分商业化。来源:aireleasetracker
🏢 官方发布与新功能
- Anthropic Claude Fable 5 全球恢复访问并加固网络安全防护:该模型 6 月 9 日发布后因出口管制被短暂暂停,6 月 30 日管制解除,7 月 1 日起全球恢复;同时新增更深的网络安全防护、AI 越狱严重度分级草案框架,并对安全研究者开放 HackerOne 项目。来源:Releasebot
- Claude Sonnet 5 主打「最强 agentic」:可自主使用浏览器、终端等工具,性能接近 Opus 4.8 但成本显著更低。来源:llm-stats
- Google DeepMind Gemini 3.5 Pro 目标 7 月 17 日 GA:官方称此版本「从头重建」,与 DeepSeek V4 从预览转正式稳定版为同一天。来源:TechTimes
- DeepSeek 旧别名 7 月 24 日停用(开发者需注意):
deepseek-chat与deepseek-reasoner两个 legacy 别名将于 7 月 24 日停止响应,暂无延期,生产系统需及时迁移。来源:TechTimes
🤖 Agent 技术精选
- MCP 下一版规范进入 Release Candidate(2026-07-28):核心改为无状态协议(stateless core,可跑在普通 HTTP 基础设施上)、新增 Extensions 框架、Tasks(长任务)、MCP Apps(服务端渲染 UI),并强化 OAuth/OIDC 授权与正式弃用策略。来源:MCP 官方博客
- 主流框架把 MCP 设为默认工具协议:LangChain、CrewAI、LangGraph、LlamaIndex 已从实验支持转为默认;LangChain 用
langchain-mcp-adapters,LlamaIndex 用llama-index-tools-mcp。来源:LangChain 文档 - 上下文工程的四大手法被反复强调:write(把上下文写到窗口外持久化)、select(只取当下相关)、compress(压缩摘要)、isolate(给子任务干净上下文),用以对抗「context rot(上下文腐烂)」。来源:Sourcegraph、Anthropic 工程博客
- Agent Skills 成为「能力单元」的主流范式:技能是带 SKILL.md 的文件夹,靠「渐进式披露」按需加载;官方与社区把它与 MCP(连接性)、Subagents(委派)清晰分工。来源:Anthropic 工程博客、Claude 平台文档
🎓 学术与课程
- arXiv:Agentic RL(智能体强化学习)综述与新方法持续高产:近期出现《The Landscape of Agentic Reinforcement Learning for LLMs: A Survey》(arXiv:2509.02547),以及围绕隐式步骤奖励、层次化信用分配(HIPER)、技能复用压缩等方向的新论文。来源:arXiv Survey
- 短期记忆与动态工具调用:《MemTool: Optimizing Short-Term Memory Management for Dynamic Tool Calling in LLM Agent Multi-Turn Conversations》(arXiv:2507.21428)聚焦多轮对话中工具调用的短期记忆管理。来源:arXiv MemTool
- Stanford CS329A《Self-Improving AI Agents》:研究生 seminar,覆盖自我改进(Constitutional AI、验证器、test-time compute、搜索+LLM、train-time RL)、工具/代码/记忆增强、多步推理与评测框架。来源:cs329a.stanford.edu
- Berkeley CS294/194-196《Agentic AI》(Fall 2025):讲 LLM 基础、推理规划、Agent 框架与基础设施,并覆盖代码生成、机器人、Web 自动化、科学发现等应用。来源:Berkeley RDI
📈 行业动态
- SWE-bench 基准信任度转移:OpenAI 标记 SWE-bench Verified 存在训练数据污染疑虑,SWE-bench Pro 正成为更可靠的接班基准;Claude Fable 5 以 80.3% 领跑 Pro 榜(截至 7 月 7 日)。来源:SWE-bench Pro 榜单、llm-stats
- 开源与闭源在编码上的差距基本抹平:MiniMax M2.5(80.2% SWE-bench)已接近 Claude Opus 4.6(80.8%);GLM-5 在开源模型的 Arena Elo 中领先(1451)。来源:Vellum 开源榜、DataLearner
- LMArena 用户偏好榜:Claude Fable 5、Opus 4.6/4.7(thinking)位居文本生成前列(匿名 A/B 投票)。来源:Swfte 榜单
📌 今日精选主题:Agent Skills(智能体技能 · SKILL.md 与渐进式披露)
选择理由:今天多条线索(Anthropic 工程博客、Claude 平台文档、大量社区对比文)都指向同一个正在成型的工程范式——用一个带 SKILL.md 的文件夹给 Agent「装能力」,靠「渐进式披露(progressive disclosure)」按需加载,把 token 成本压下来又提升准确率。它恰好补齐了本周已覆盖的 MCP、上下文工程、多智能体、Agentic RL 之间的一块拼图:能力如何被组织、发现、加载。而且它可落地、可动手,是最值得系统学一遍的主题。
备选主题(如需可回复选择): 1. Agent 评测基准之争:SWE-bench Verified 污染疑虑 vs SWE-bench Pro / MCP Atlas 2. LLM Agent 的记忆管理:短期记忆(MemTool)与 write/select/compress/isolate 的落地
说明:本次为自动运行,已默认采用精选主题「Agent Skills」生成深度学习文档。GitHub 连接器未授权,本次未发布到网站仓库(详见文末)。