覆盖过去约 24–48 小时的主流厂商发布、Agent 工程、学术课程与行业动态。每条均标注来源链接,内容以真实搜索结果为准,不夸大、不编造。
🔥 今日头条
-
OpenAI 发布 GPT-5.6 三档模型(Sol / Terra / Luna)+ ChatGPT Work OpenAI 推出新一代 GPT-5.6 模型家族,分为主力档 Sol、中间档 Terra、经济档 Luna,主打「每个 token 产出更多有用工作」。同时上线由 GPT-5.6 驱动的 ChatGPT Work,能汇聚团队工具里的上下文,把零散笔记/草稿变成成品。Altman 称 Sol 在编码任务上 token 效率提升 54%。这是继 Claude Sonnet 5 之后,前沿厂商在「性价比 + Agent 能力」上的又一次正面交锋。 来源:TechCrunch、Axios
-
MCP 2026-07-28 规范进入 Release Candidate Model Context Protocol 公布 2026-07-28 版本的候选发布,称其为「自诞生以来最大的一次修订」:无状态核心(移除 session,可跑在普通 HTTP 负载均衡后)、MCP Apps(服务端渲染 UI)、Tasks 扩展(支持长时运行任务)、更贴近 OAuth/OIDC 的授权,以及正式的弃用策略。7 月 28 日发布正式版。 来源:MCP Blog
-
OpenAI 上线全双工语音模型 GPT-Live-1 / mini 新的对话模型 GPT-Live-1 与 GPT-Live-1 mini 支持「边说边听」(full-duplex),可自然打断、实时翻译,turn-taking 更流畅。语音 Agent 从「录音—识别—回复」的回合制,正式迈向真正的实时双工。 来源:TechCrunch
📢 官方发布与新功能
- OpenAI GPT-5.6(Sol/Terra/Luna):三档分层,已加入 SWE-bench Pro 排行(64.6% / 63.4% / 62.7%),并成为 Microsoft 365 Copilot 在 Word/Excel/PPT/Chat 的首选模型。 来源:TechCrunch
- Anthropic Claude Cowork 上云:Cowork Agent 迁移到云端,可跨设备访问、设备离线也能继续跑任务。 来源:NBC News
- Claude 接入 Microsoft 365 写操作:可起草并发送邮件、管理日历、创建/更新 OneDrive 与 SharePoint 文件。 来源:Anthropic Newsroom
- Claude 月度回顾(Monthly Recap):Settings > Reflect 新增月度回顾与专注设置(休息提醒、免打扰、工作洞察),Beta 覆盖 Free/Pro/Max,需开启 Memory。 来源:Anthropic Newsroom
- Anthropic Claude Science:面向科研的 AI 工作台,集成常用科研工具与包、产出可审计的 artifact、灵活调度算力。 来源:Anthropic
- Google Gemini 3.5 Pro 延期至 7 月 17 日:放弃 2.5 Pro 架构做从头重建,主打数学推理、SVG 场景生成、图像质量,2M token 上下文 + Deep Think 推理层;3.5 Flash 已先行发布。 来源:BigGo Finance
🤖 Agent 技术精选
- MCP Tasks 扩展 + 无状态核心:候选规范把「长时运行任务」正式纳入协议,并移除协议级 session,tools/list 可按
ttlMs/cacheScope缓存——远程 MCP 服务从此可跑在普通轮询负载均衡后。 来源:Stacktree 解读 - Agent 记忆成为「生产工程学科」:2026 年共识是记忆系统正从纯向量相似度,走向「向量 + 图 + 分层(短期便签 / 中期任务记忆 / 长期显式提升)」的组合;AWS Bedrock AgentCore Memory、Google Vertex AI Memory Bank 已 GA/预览,Cloudflare Agent Memory 私测中。 来源:mem0 State of Agent Memory 2026、Fountain City
- 模型路由成标配实践:简单任务走小模型(Haiku/Mini)、难任务走旗舰,成本可降 5–10×;GPT-5.6 的 Sol/Terra/Luna 分层正是把这一实践产品化。 来源:MLflow
- 主流 Agent 框架格局(2026):LangGraph、Claude Agent SDK、CrewAI、AutoGen/AG2、Semantic Kernel、LlamaIndex、Pydantic AI 并存。 来源:Alice Labs
🎓 学术与课程
- arXiv《Decoupling Search from Reasoning》(2606.18947):提出 DSG(Decoupled Search Grounding),用 MCP 兼容网关把「检索接地」移出推理模型,做成厂商无关的边界层。 来源:arXiv
- Agent 记忆研究扎堆:MemRL(运行时 RL on 情景记忆)、Agentic Memory(统一长短期记忆管理)、MAGMA(多图 Agentic 记忆架构)、EverMemOS(自组织记忆 OS)等新论文密集出现。 来源:Agent-Memory-Paper-List
- Stanford CS329A《Self-Improving AI Agents》:覆盖自我改进(constitutional AI、verifier)、工具/代码/记忆增强、多步推理与规划,配原创研究项目。 来源:cs329a.stanford.edu
- Berkeley CS294/194-196《Agentic AI》:LLM 基础、推理规划、Agent 框架与基础设施,代表性应用含代码生成、机器人、Web 自动化、科学发现。 来源:Berkeley RDI
- DeepLearning.AI 短课《LLMs as Operating Systems: Agent Memory》:与 Letta 合作,由 MemGPT 作者 Charles Packer、Sarah Wooders 讲授。 来源:DeepLearning.AI
📈 行业动态
- LMArena 融资 1.5 亿美元、估值 17 亿美元(A 轮):Felicis、UC Investments 领投,a16z、Kleiner Perkins、Lightspeed 参投——标志「AI 评测」本身正成为基础设施。 来源:The Next Web
- 编码榜单变化:Claude Fable 5 以 80.3% 居 SWE-bench Pro 之首,Opus 4.8 紧随;OpenAI 提示 SWE-bench Verified 存在训练数据污染,SWE-bench Pro 正成为更可靠的接棒基准。 来源:CodingFleet
- 开源格局:Qwen 3 235B-A22B 居开源综合榜首,DeepSeek R1 深度数学第二;DeepSeek V4(4/24,MIT 许可)编码 SWE-bench Verified 83.7%;坊间传更大的 V4 旗舰或于 7 月中旬登场。 来源:llm-stats、particula.tech
🎯 今日精选主题
主题:Agent 记忆系统(Agent Memory)——让智能体「记住并持续变强」
选择理由:今天的多条线索都指向同一个底层能力——记忆。Claude 月度回顾功能明确「需开启 Memory」;ChatGPT Work 的核心是「汇聚并沉淀团队上下文」;arXiv 上 MemRL、Agentic Memory、EverMemOS 等论文密集出现;各大云厂商(AWS/Google/Cloudflare)相继推出托管记忆服务。记忆正从「加个向量库」升级为一门有基准、有权衡、有生产范式的工程学科,是理解 2026 年 Agent 的关键拼图,且此前的深度文档尚未覆盖,值得系统学一遍。
备选主题(如你想换,回复序号即可,不回复则默认用上面这个): 1. MCP Tasks 扩展与无状态核心:2026-07-28 新规范里,长时运行任务与去 session 化如何改变远程 MCP 部署 2. 全双工语音 Agent(full-duplex):GPT-Live 背后的「边说边听」实时对话技术怎么做
本简报由每日 AI 情报助手自动生成。分区若无重要更新会注明「今日无重要更新」,不凑数。