覆盖过去 24–48 小时(8月3日–8月5日)的 AI 技术动态。所有条目均来自真实搜索结果并附来源链接。
今日头条
1. OpenAI 大幅下调 GPT-5.6 系列价格,Auto-review 成本降约 10 倍 8月4日,OpenAI 下调 GPT-5.6 Luna 与 Terra 价格,为 GPT-5.6 Sol API 推出 Fast 模式提速,并把 ChatGPT 应用与 Codex CLI 的 Auto-review 从 GPT-5.4 升级到 GPT-5.6 Luna——叠加新定价后,Auto-review 预计便宜约 10 倍。这是「模型能力竞赛」转向「价格与分发竞赛」的又一信号,代码审查类 Agent 的使用成本门槛显著降低。同日 OpenAI 还发布了面向教学场景的 ChatGPT Work 与 Codex 新玩法及一次安全更新。 来源:https://openai.com/news/ 、https://releasebot.io/updates/openai (2026-08-04)
2. Claude Code v2.1.221 发布:VSCode Focus 视图 + 沙箱凭据 mask 模式 8月3日发布的 v2.1.221 新增 VSCode Focus 视图(把工具活动折叠为每轮可展开的摘要,Ctrl+Alt+F 切换)、Linux/WSL 沙箱凭据「mask」模式(沙箱内命令只读到哨兵副本,真实值在出口代理处替换)、/fork 后台会话、更智能的 /resume 与 /background 流程,并收紧了 WebSearch、subagent 派生与 Bash 执行的安全策略。今日「Claude Code 小课」独立文档将专讲这批新功能的用法。 来源:https://code.claude.com/docs/en/whats-new 、https://www.havoptic.com/tools/claude-code (2026-08-03)
3. 阿里发布 Qwen3.8 Max 8月2日,阿里发布 Qwen3.8 Max,为 Qwen 系列当前最新旗舰。结合 7月31日的 DeepSeek-V4-Flash-0731 与 7月27日 Moonshot Kimi K3 开源(2.8T 参数、104B 激活、1M 上下文),中国厂商在开源/旗舰两条线上的发布密度仍在持续。 来源:https://llm-stats.com/llm-updates 、https://llmgateway.io/timeline (2026-08-02)
官方发布与新功能
- OpenAI 将于 8月30日退役官方 DALL·E GPT,引导用户改用 ChatGPT Images 进行图像创建与编辑。来源:https://help.openai.com/en/articles/6825453-chatgpt-release-notes (2026-08)
- Anthropic 把 Claude Code 订阅用户的临时 50% 周用量加成延长至 8月19日;Claude Sonnet 5 促销价($2/$10 每百万 token)8月31日截止,9月1日起恢复 $3/$15。来源:https://releasebot.io/updates/anthropic (2026-08)
- Google 方面,Gemini 3.6 Flash 与 3.5 Flash-Lite 转为稳定生产版本(3.6 Flash 主打 token 效率与代码/agentic 规划);gemini-robotics-er-1.6-preview 将于 8月31日关停,多个图像生成旧模型 8月17日下线。来源:https://ai.google.dev/gemini-api/docs/changelog (2026-08)
- 回顾:Anthropic 于 7月24日发布 Claude Opus 5($5/$25 每百万 token,价格与 Opus 4.8 持平,能力接近 Fable 的一半价格),现已是 Max 计划默认模型。来源:https://www.anthropic.com/news/claude-opus-5 (2026-07-24)
Agent 技术精选
- MCP 2026-07-28 新规范持续引发解读热潮:无状态核心、Multi Round-Trip Requests、基于 header 的路由、可缓存列表、授权加固与正式扩展框架(MCP Apps、EMA);Tier 1 SDK 月下载量已近 5 亿,TS/Python SDK 累计均破 10 亿。来源:https://blog.modelcontextprotocol.io/posts/2026-07-28/ 、https://www.scworld.com/brief/model-context-protocol-releases-major-update-to-ai-interaction-technology
- Mem0 发布上下文工程实践指南,强调「把无状态 demo 变成会学习、会记忆的生产系统」的记忆分层方法。来源:https://mem0.ai/blog/context-engineering-ai-agents-guide (约 2026-07-31)
- Crux Digits 总结 2026 Agent 工程图景:LangGraph 因内建状态与 checkpoint 成为受监管/高风险场景默认选择;「Agentic Context Engineering」(Agent 自我反思更新自己的上下文 playbook)成为新研究模式。来源:https://cruxdigits.nl/blog/context-engineering-ai-agents-2026/ (约 2026-07-31)
学术与课程
- arXiv 近期 Agent 方向值得关注的论文:《When Prompts Control Robots: Prompt Injection Attacks in Multi-Agent Robotic Systems》(多智能体机器人系统中的提示注入攻击)、《CommCP: LLM 通信 + 保形预测的高效多智能体协调》、《AgenticPay: 买卖双方 LLM 协商交易系统》、《RuleSmith: 多智能体 LLM 自动游戏平衡》。来源:https://github.com/VoltAgent/awesome-ai-agent-papers 、https://arxiv.org/list/cs.MA/recent
- Berkeley Agentic AI MOOC(12 讲,OpenAI/NVIDIA/Meta/DeepMind 等讲者)与 Stanford CS224G 仍是系统学习 Agent 的首选公开课;暂无本周新讲座发布。来源:https://agenticai-learning.org/f25 、https://web.stanford.edu/class/cs224g/index.html
行业动态
- SWE-bench Pro 8月更新:Claude Mythos 5 以 80.3% 居首,Claude Fable 5(80%)、Claude Opus 5(79.2%)紧随;SWE-Bench Verified 上 Claude Fable 5 以 95.0% 领先(104 个模型)。来源:https://benchlm.ai/benchmarks/swe-bench-pro 、https://llm-stats.com/benchmarks/swe-bench-verified (2026-08)
- Moonshot AI 估值达 200 亿美元,其开放权重押注(Kimi K3,史上最大开源模型)被认为已见成效;Together AI(开源模型基础设施)进入本周最大融资行列。来源:https://entrepreneurloop.com/moonshot-ai-funding-20-billion-valuation-kimi-2026/ 、https://news.crunchbase.com/venture/biggest-funding-rounds-ai-energy-biotech-joulent/
今日精选主题
低精度推理与 MXFP4 量化
选择理由:Kimi K3 以 MXFP4 权重 + MXFP8 激活的「量化感知」形态开源,是首个原生低精度发布的超大 MoE 旗舰;OpenAI 的大幅降价背后同样是低精度推理基础设施的成本红利。理解 MXFP4/MXFP8 微缩放格式、量化感知训练与 FP8/FP4 推理,是看懂「为什么模型越来越便宜、自托管越来越可行」的关键,且与已有深度文档(万亿级开源MoE自托管、混合线性注意力KDA)互补不重复。
备选主题(回复选择,默认用上面这个): 1. 代码审查 Agent(Auto-review)工程实践——OpenAI Auto-review 降价 10 倍背后的 PR 审查自动化 2. LLM 推理服务与 vLLM 部署——从 Kimi K3 的 vLLM day-0 支持看推理框架选型
生成时间:2026-08-05 · 来源均为公开网络搜索结果,未经二次核实的单源信息请以原文为准
主页