覆盖范围:过去 24-48 小时(2026-07-06 ~ 07-08)公开信息,全部条目来自真实搜索结果并附来源链接。
今日头条
-
首个"全自动 AI 勒索软件"JADEPUFFER 完整分析公布,Agent 安全进入实战阶段:Sysdig 威胁研究团队(7/4-7/6 发布)记录了业界首例端到端由 AI Agent 自主执行的勒索攻击——从一个未打补丁的暴露服务入手,AI Agent 独立串起了侦察、入侵、加密、勒索的完整生命周期,无需人工分步操作。重要性:这把"Agent 自主性"从生产力叙事推到了攻防对抗前线,直接提高了对沙箱隔离、权限最小化、工具调用审计等运行时防护的紧迫性。来源:BuildFastWithAI 7/7
-
Claude Fable 5 今日(7/8)起全线转为按量计费,订阅不再包含:自今天起,所有订阅层级使用 Fable 5 都需消耗用量额度,标准 API 费率为 $10/百万输入 token、$50/百万输出 token(约为 Opus 4.8 的两倍);同日 Anthropic 通过 Persona 的政府身份证件验证政策生效,与此前 Fable 5 因出口管制下线后恢复相关。重要性:这标志"顶配模型免费搭订阅"窗口关闭,团队需要重新评估 Fable 5 vs Opus 4.8 的性价比与合规门槛。来源:BuildFastWithAI 7/8 汇总、Fable 5 回归说明
-
OpenAI 发布 gpt-realtime-2.1 / -2.1-mini,实时语音 Agent p95 延迟再降 ≥25%:7/6 上线的两款 Realtime 模型面向低延迟语音与多模态场景,通过改进缓存把 p95 延迟至少降低 25%,并强化了字母数字识别(订单号/电话/验证码回读)、静音噪声处理与被打断时的中断行为;mini 版价格与上代 realtime-mini 持平。重要性:语音 Agent 从"能对话"走向"能在客服/交易等高噪场景稳定执行工具调用"。来源:MarkTechPost、OpenAI Releasebot
官方发布与新功能
- OpenAI gpt-realtime-2.1 / gpt-realtime-2.1-mini(7/6):2.1 主打最强实时推理+工具调用+语音 Agent 行为,mini 主打更快更省;均已上线 Realtime API,可在 Playground 试用。DataNorth、OpenAI 官方
- ChatGPT Codex Remote 全量开放:所有订阅层可从移动端启动/继续在已连接的 Mac 或 Windows 主机上的任务并审阅进度;ChatGPT Business 新增插件管理后台(发现、策略、角色、目录集中管理)。OpenAI Releasebot
- GPT-5.6 家族(Sol/Terra/Luna)仍处受限预览:先经 API 与 Codex 面向少数受信任伙伴开放,Sol 将在 Cerebras 上以最高 750 tokens/s 提供,公开发布"即将到来";定价 Sol $5/$30、Terra $2.50/$15、Luna $1/$6。OpenAI 官方预览、OpenAI Releasebot
- Claude Sonnet 5 已成 Claude Code 默认模型,原生 1M token 上下文,促销价 $2/$10(至 8/31);定位"迄今最具 agentic 能力的 Sonnet",可规划、用浏览器/终端工具并自主运行。Anthropic 官方
- Claude 上 Azure AI Foundry 全量可用:首次在 NVIDIA GB300 Blackwell Ultra GPU + Quantum-X800 InfiniBand 上部署 Claude。Anthropic Newsroom
Agent 技术精选
- Agent 可观测性与评测成为独立工程学科:业界共识把 Agent 评测拆为两半——step 级追踪(工具调用准确率、轨迹分析、死循环检测、每步延迟)与结果打分(是否以领域专家认可的方式达成目标);两大陷阱是"走错路径也能蒙对答案"和"给工具传了畸形参数却静默继续"。Braintrust 完整指南、NVIDIA 技术博客
- 上下文工程(Context Engineering)被列为 2026 关键学科:三大趋势——窗口虽达 1M+ 但相关信息超约 50K token 后质量下降;多 Agent 会成倍放大上下文成本(5 Agent 各 100K = 5× 浪费,上下文路由可压到约 20K/Agent);提出相关性/充分性/隔离/经济性/溯源五项质量标准。ivern.ai 指南、arXiv 2603.09619
- LangGraph Q2 更新:节点级超时(TimeoutPolicy)、节点错误处理器(Saga/补偿)、DeltaChannel 增量存储、v2 类型化流式 API、按 Agent 成本归因、社区 MCP 工具市场。框架对比
- LlamaIndex Workflows 1.0(6/22):事件驱动、async-first、Python/TypeScript 双端的多 Agent 编排层,每步收发类型化事件,便于组合嵌套/并行管线。LangChain 框架综述
- LangChain "Summer AMA" 系列 7/9-8/12,并推出社区 MCP 工具市场。MCP × LangChain 文档
学术与课程
- arXiv 近期高关注 Agent 论文:《What LLM Agents Say When No One Is Watching:多 Agent 辩论中的社会结构与潜在目标涌现》、《Safe and Adaptive Cloud Healing:用神经-符号世界模型验证 LLM 生成的恢复方案》(ICME 2026 接收)、《EO-Agents:面向地球观测假设生成的三 Agent 管线》(ICML 2026 AI for Science Workshop 接收)。arXiv cs.AI、cs.MA
- 《Self-Compacting Language Model Agents》(有界上下文契约+类型化检索)持续位居 HuggingFace Trending。arXiv PDF
- 《Establishing Best Practices for Building Rigorous Agentic Benchmarks》提出 ABC 检查清单(结果有效性/任务有效性/结果报告),并警示基准污染,主张把榜单数字读作"上界"。arXiv 2507.02825
- VoltAgent 的 2026 Agent 论文精选仓库持续更新(工程/记忆/评测/工作流/安全)。GitHub
- 课程:暑期无新开课;Berkeley Agentic AI 与 Stanford CS224G 材料持续可用。
行业动态
- 上半年全球风投创纪录 $510B,AI 为主引擎;7/7 单日:Norm AI(受监管工作流 agentic 系统)C 轮 $120M(Khosla 领投)、Monogram 种子轮 $40M(DST 领投)。SiliconANGLE、Tech Startups 7/7
- AI 基建/能源持续吸金:英国 Nscale 关闭 $9 亿循环信贷加速全球数据中心;德国 Proxima Fusion 融资 €411M(约 $468M,Google/RWE 参投,估值约 €24 亿)。Crunchbase News
- SWE-bench Verified 榜单(7/6 更新,103 模型):Claude Mythos 5 以 95.5% 居首,Fable 5 95%,Opus 4.8 88.6%;SWE-bench Pro(35 模型)因口径差异结果分化,Opus 4.8 在 llm-stats 聚合口径下 69.2% 领先活跃模型。SWE-bench Verified、SWE-bench Pro
- 格局观察:Fortune 报道 Anthropic 在营收上反超 OpenAI,Sam Altman 正将 OpenAI 定位为地缘政治参与者而非单纯科技公司(美中 AI 竞争背景)。BuildFastWithAI 7/7
- 治理:联合国 AI 治理全球对话 7/6-7/7 在日内瓦举行,警示数百万儿童在安全护栏滞后下使用 AI;白宫前沿模型自愿标准框架本周或落地。UN News
今日精选主题
精选:上下文工程(Context Engineering)——给 Agent 喂对信息的工程学科
选择理由:今天多条 Agent 工程线索都指向同一个瓶颈——不是模型不够强,而是"上下文喂得不对"。研究反复指出:窗口虽已 1M+,但相关信息超过约 50K token 后质量明显下降;多 Agent 管线更会把上下文成本成倍放大(5 Agent 各 100K token = 5× 浪费),而上下文路由能压到约 20K/Agent。上下文工程正从"调 prompt"升级为一套有明确质量标准(相关性/充分性/隔离/经济性/溯源)的独立学科,是你关注清单里 Agent 工程实践的核心,且与前几日的 MCP 规范(协议层)、沙箱隔离(运行时安全层)互补——这一篇补上"信息供给层",近期未覆盖过。
备选主题(回复选择,不回复则默认精选): 1. Agent 可观测性与评测:step 级追踪 + 结果打分的生产实践 2. 实时语音 Agent:从 gpt-realtime 到低延迟工具调用的架构与坑
生成时间:2026-07-08 · 来源均为公开网络搜索结果,细节以官方页面为准;部分条目来自聚合媒体,重要决策请核对官方原文。自动运行说明:本次为定时任务自动执行,未做人工确认;白宫框架、GPT-5.6 公开发布等仍在进行中,以官方更新为准。