覆盖范围:过去 24-48 小时(2026-07-05 ~ 07-07)公开信息,全部条目来自真实搜索结果并附来源链接。
今日头条
-
Meta 开源多轮编码评测 SWE-Together,Claude Opus 4.8 以 63% pass@1 领先:该基准包含 109 个从真实工程会话回放的多轮任务,核心指标是"人类纠偏负担"(corrective steering)——衡量模型在多轮工作流中无需人工干预即可完成任务的比例,Claude Opus 4.8 所需纠偏最少。重要性:评测范式正从单轮 SWE-bench 转向"多轮 + 干预成本",这更贴近生产环境中编码 Agent 的真实价值。来源:AI Weekly 报道、BuildFastWithAI 7/6 汇总
-
白宫前沿模型自愿标准框架预计本周(7/7-7/11)公布:FT/Reuters 报道谈判进入最后阶段,框架含"覆盖模型"认定的保密基准、30 天发布前政府评估窗口及外国实体访问规则;该框架也被视为 GPT-5.6 从约 20 家政府审核伙伴走向公开发布的触发条件。来源:Reuters via Yahoo Finance、BuildFastWithAI 7/6
-
中国「AI 拟人化交互服务管理暂行办法」7月15日生效,豆包/千问将下线智能体功能:豆包(3.45 亿 MAU)7/15 下线 agent 功能、数据 10/15 后永久不可访问;千问未提供任何迁移工具。两家均判断防沉迷、强制提醒、即时退出等合规要求与持久记忆 Agent 架构结构性不兼容,选择整体下线而非改造。来源:TechTimes
官方发布与新功能
- Anthropic 扩展 Claude Science Workbench:Opus 4.8 通过专用工具包接入 60+ 科学数据库(NCBI、UniProt、PDB、AlphaFold DB、PubChem、ClinicalTrials.gov 等),单会话完成跨库检索-分析-综合;AI for Science 资助计划(50 个项目、$30K 额度)7/15 截止申请。AI Weekly、Anthropic 官方
- OpenAI 发布 GeneBench-Pro 计算生物学基准(129 题):GPT-5.6 Sol Pro 仅 31.5%、Claude Opus 4.8 16%,揭示前沿模型在专家级科学问题上的真实差距。AI Weekly
- GPT-5.6 定价确认:Sol $5/$30、Terra $2.50/$15、Luna $1/$6(每百万 token);Sol 将在 Cerebras 上以最高 750 tokens/s 提供;目前仍限约 20 家政府审核伙伴,公开发布预计 7 月内。OpenAI 官方预览、Releasebot
- Gemini 3.5 Pro 再度推迟 GA:仍处 Vertex 企业预览,原因是长程 Agent 任务 token 消耗过高、编码与长任务推理未达 Pro 层目标。The AI Rankings、Tech-Insider
- 计费提醒:今天(7/7)是 Claude Fable 5 含在 Pro/Max/Team 订阅内的最后一天,7/8 起按用量计费($10/$50 每百万 token)。BuildFastWithAI 7/6
Agent 技术精选
- LlamaIndex Workflows 1.0(6/22 发布,近期讨论升温):事件驱动、async-first、基于 step 的 Agent 编排框架,Python/TypeScript 双端;LlamaCloud 同期更名 LlamaParse,转向 agentic 文档处理。框架对比、JetBrains 博客
- LangGraph Q2 更新:节点级超时(TimeoutPolicy)、节点错误处理器(支持 Saga/补偿模式)、优雅停机、DeltaChannel 增量存储、v2 类型化流式 API。对比分析
- MCP 2026-07-28 正式规范发布进入倒计时(7/28):无状态核心、MCP Apps、Tasks 扩展、OAuth/OIDC 对齐;SecurityWeek 提醒新规范带来新的企业安全挑战(前日深度文档已覆盖协议细节)。MCP 官方博客、SecurityWeek
- 中国模型已占 OpenRouter 流量约 45%(一年前不足 2%):小米 MiMo-V2-Pro 成平台最常用模型(21.1% 份额 vs OpenAI 7.5%);工程注意点:政治敏感内容硬拒答、数据管辖权、tool-call JSON 偶发不合规范。Digital Applied Q2 报告
学术与课程
- arXiv 近期高关注 Agent 论文:《Self-Compacting Language Model Agents》(有界上下文契约+类型化检索,长程 Agent 记忆)持续位居 HF Trending;新增《CommCP:基于共形预测的多智能体高效通信》《AgenticPay:买卖双方多智能体谈判》《PerceptUI:LLM Agent 作为 UI/UX 合成用户》等。arXiv cs.AI、HF Trending、Self-Compacting
- 《EO-Agents:面向地球观测假设生成的三智能体管线》被 ICML 2026 AI for Science Workshop 接收。arXiv cs.AI
- VoltAgent 的 2026 Agent 论文精选仓库持续更新(工程/记忆/评测/工作流四类)。GitHub
- 课程:暑期无新开课;Berkeley Agentic AI(CS294/194-196)与 Stanford CS224G 材料持续可用。Berkeley RDI、CS224G Schedule
行业动态
- 阿里将 AI 业务整合为「Alibaba Token Hub」:通义实验室、Qwen、企业 AI 部门"悟空"等五个单元并入,CEO 吴泳铭直管,使命"create/deliver/apply tokens";中国全国日 token 处理量已达 140 万亿(2024 年初为 1000 亿)。Fortune、BuildFastWithAI 7/6
- Tesla Robotaxi 进入迈阿密(第五城),首次默认无安全员运营,目标年底覆盖 12 个州。The Information via llm-stats
- 加拿大数据中心冷却初创 Wafr Technologies 融资 $1 亿(水高效冷却系统,再寻求 $2 亿)。Crunchbase News
- OpenAI 已向 SEC 保密递交 S-1 草案(IPO 路演目标 9 月;Anthropic 目标 10 月)。OpenAI 官方、BuildFastWithAI 7/6
- FT 观点(Josh Zoffer):美国数据中心建设(微软 $1900 亿、Alphabet $1800-1900 亿 capex)应作为"需求锚"牵引本土 AI 供应链,而非仅靠补贴与关税。via llm-stats
今日精选主题
精选:AI 编码 Agent 的多轮评测——从 SWE-bench 到"纠偏负担"(SWE-Together 与 Agent Evals 实践)
选择理由:Meta 昨日开源 SWE-Together 标志评测范式转折——单轮"能不能修好这个 issue"(SWE-bench)正让位于多轮"人类需要纠偏几次"(steering burden),这直接对应生产环境里编码 Agent 的真实成本;同时 token 效率已成采购指标(微软开始在 release card 上公布每任务平均 token 用量,Gemini 3.5 Pro 正因此推迟)。评测(evals)是你关注清单里的 Agent 工程实践核心项,且与前两天的 MCP 规范、沙箱隔离主题互补(协议层 → 运行时安全层 → 质量度量层),近期未覆盖过。
备选主题(回复选择,不回复则默认精选): 1. LlamaIndex Workflows 1.0:事件驱动 Agent 编排框架的设计与用法 2. Claude Science Workbench:接入 60+ 科学数据库的科研 Agent 架构
生成时间:2026-07-07 · 来源均为公开网络搜索结果,细节以官方页面为准;部分条目来自聚合媒体,重要决策请核对官方原文。