面向 mingyu 的每日 AI 技术情报。所有条目来自真实搜索结果,标注来源与日期;不夸大、不编造。近 24–48 小时无新内容的分区标注「今日无重要更新」。
🔥 今日头条
-
「七月大发布潮」延续:四大前沿模型同期开打 短短一周内,xAI Grok 4.5(7/8)、OpenAI GPT-5.6 三档(7/9)、Meta Muse Spark 1.1(7/9)、Anthropic Claude Fable 5(7/1 回归)集中登场,被业界戏称「七月的圣诞节」。竞争格局分化为「峰值质量 vs 效率成本」两条路线——xAI/Meta 主打又快又便宜,OpenAI/Anthropic 争最强。 来源:https://medium.com/@richardhightower/christmas-in-july-the-great-frontier-model-unwrapping-of-2026-grok-4-5-9a705f82d4bd
-
OpenAI 推出「超级应用」ChatGPT Work,正面硬刚 Claude Cowork 7/9 上线的 ChatGPT Work(基于 GPT-5.6 Sol)是一个能跨应用收集上下文、把目标拆成多步、连续数小时自主执行、直接交付表格/幻灯片/文档/网页的 Agent,还带原生计算机操作(点击、打字、跑多步工作流)。这是 OpenAI 对 Anthropic 今年 1 月推出的 Claude Cowork 的直接回应。 来源:https://www.digitalapplied.com/blog/chatgpt-work-openai-agent-launch-2026
-
Meta 首款「付费闭源」模型 Muse Spark 1.1,告别开源基因 Meta 花 143 亿美元请来 Alexandr Wang 重建 AI 栈、推倒重来九个月后,推出首个自研付费模型 Muse Spark 1.1(多模态推理、1M 上下文、原生主/子 Agent 编排、支持 MCP 与自定义技能),定价 $1.25/$4.25 每百万 token——标志 Meta 从开源转向商业化。 来源:https://www.artificialintelligence-news.com/news/meta-muse-spark-ai-model-open-source/
🏢 官方发布与新功能
- OpenAI ChatGPT Work:统一插件目录 +
@唤起各应用上下文,可自主跑数小时长任务、原生控制桌面。来源:https://dataconomy.com/2026/07/10/chatgpt-work-productivity-agent-openai/ - Anthropic 再次延长 Fable 访问:OpenAI Sol 发布后,Anthropic 让用户可购买用量额度(按用量付费)继续使用 Fable 5。来源:https://www.forbes.com/sites/tylerroush/2026/07/13/ai-model-wars-anthropic-extends-fable-access-again-after-openais-sol-release/
- Meta Muse Spark 1.1:首款付费闭源模型,通过 Meta Model API 提供,新账号送 $20 额度。来源:https://explainx.ai/blog/muse-spark-1-1-meta-model-api-july-2026
- xAI Grok 4.5(7/8):走效率/成本路线,质量接近前沿而价格低、速度快。来源:https://www.digitalapplied.com/blog/muse-spark-1-1-vs-grok-4-5-agentic-model-comparison-2026
🤖 Agent 技术精选
- Harness Engineering(Agent 外壳工程)持续升温:社区整理 awesome-harness-engineering,Red Hat 发企业视角文章强调「先设计 Agent 的工作环境,它才能写出更好的代码」;核心是结构化上下文、MCP 扩工具箱、preventive/corrective 双层控制。来源:https://github.com/ai-boost/awesome-harness-engineering
- 关键量化:一个生产级 Agent ≈ 98.4% 是 harness 基础设施:MBZUAI 5 月一项分析 Claude Code 源码的研究指出,权限/上下文管理/沙箱/工具路由/恢复占 98.4%,真正的 AI 决策逻辑只占 1.6%——差异化已转移到「包裹模型的那一层」。来源:https://medium.com/@tort_mario/ai-agent-best-practices-production-ready-harness-engineering-2026-guide-c1236d713fac
- MCP 采用曲线陡峭:据 Zuplo《State of MCP》,MCP 月 SDK 下载量已达 9700 万,「提供更好的上下文」是使用 MCP 最常被提到的首要价值。来源:https://www.infoworld.com/article/4175336/the-role-of-mcp-in-context-engineering.html
- O'Reilly 发布《The AI Agents Stack(2026 版)》:梳理当前 Agent 技术栈全貌。来源:https://www.oreilly.com/radar/the-ai-agents-stack-2026-edition/
🎓 学术与课程
- HAS-Bench(arXiv 2607.04329):评测「人机协作系统」在可配置的人类参与度下的表现,把「人到底该介入多少」变成可量化维度。来源:https://arxiv.org/pdf/2607.04329
- Harness Engineering for Agentic AI Coding Tools: An Exploratory Study(arXiv 2602.14690):对 Agent 编码工具的外壳工程做探索性研究。来源:https://arxiv.org/pdf/2602.14690
- AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents(arXiv 2605.13357):把 harness 定义为围绕模型 Agent 的「运行时基座」。来源:https://arxiv.org/pdf/2605.13357
- From Signals to Structure(arXiv 2607.00233):研究记忆架构如何驱动 LLM Agent 的「语言涌现」。来源:https://arxiv.org/list/cs.AI/current
📈 行业动态
- SWE-Bench Pro 榜:Fable 5 约 80% 领先,Grok 4.5(64.7%)与 GPT-5.6 Sol(64.6%)近乎并列落后约 15 分,Muse 61.5%。来源:https://kenhuangus.substack.com/p/the-july-2026-frontier-muse-spark
- 工具调用榜(MCP Atlas):Muse 88.1 居前(Opus 4.8 为 82.2);法律 Agent 榜 Muse 20.00 领先 Grok 4.5(12.92)。来源:https://kenhuangus.substack.com/p/the-july-2026-frontier-muse-spark
- 开源侧融资:Ollama 完成 8800 万美元 open-models 轮,与 7/9 一众前沿模型 GA 同日。来源:https://kenhuangus.substack.com/p/the-july-2026-frontier-muse-spark
- Meta 入局 AI 编码市场,追赶 Anthropic 与 OpenAI。来源:https://www.cnbc.com/2026/07/09/meta-jumps-into-ai-coding-market-to-chase-anthropic-and-openai.html
🎯 今日精选主题
主题:Agent Harness Engineering(Agent 外壳 / 运行环境工程)
选择理由:今天最反直觉、也最有工程价值的一条,是那个 98.4% 的数字——一个生产级 Agent 里,真正的「AI 决策」只占 1.6%,其余全是包裹模型的「外壳(harness)」:权限、上下文管理、沙箱、工具路由、失败恢复、可观测性。这解释了为什么「换更强的模型」常常不如「把外壳做好」,也把今天多条新闻(ChatGPT Work 的自主执行、Muse 的主/子 Agent 编排、Red Hat 的环境设计、MCP 工具接入)串成了同一件事。这个主题昨天的「Agent 评测」正好是它的一个子模块,顺势往上一层讲清整个「控制面」,补齐 Agent 工程闭环。此前深度文档(MCP、沙箱、上下文工程、多智能体、AgenticRL、Agent Skills、记忆系统、评测)都是它的零件,而 harness 是把这些零件装成一台可靠机器的「底盘」。
备选主题(如不回复则默认用上面精选): 1. Computer-Use Agent(计算机操作智能体:ChatGPT Work / Cowork 背后的桌面自动化怎么做、边界在哪) 2. 人机协作系统与「人该介入多少」(HAS-Bench 引出的 human-in-the-loop 设计)