信息来源:过去 24-48 小时全网搜索,所有条目附来源链接。
今日头条
1. 阿里发布 Qwen3.8-Max:2.4 万亿参数 MoE,多项榜单超 GPT-5.6 Sol 与 Claude Fable 5 8 月 3 日阿里正式发布 Qwen 家族迄今最强模型 Qwen3.8-Max:2.4T 总参数、每次请求仅激活 95B 的 MoE 架构,官方称可连续 10 天以上自主执行软件工程任务。Terminal-Bench 2.1 得 86.6(超 Claude Fable 5 的 84.6,略逊 GPT-5.6 Sol max 的 88.8),IFBench 82.8 大幅领先。定价 $2/$6 每百万 token,权重下周开源到 Hugging Face / ModelScope——开源阵营再次逼近闭源第一梯队。 来源:MarkTechPost · Neowin · Dataconomy(2026-08-03)
2. Anthropic 多项使用政策与价格节点:Claude Code 50% 用量加成延至 8/19,Sonnet 5 促销价 8/31 截止 Claude Code 订阅用户的周用量临时 50% 加成延长到 8 月 19 日;Claude Sonnet 5 的促销价 $2/$10(每百万 token)8 月 31 日结束,9 月 1 日起恢复 $3/$15。同时 Cowork 已扩展到移动端与 Web,支持后台任务、定时任务与移动端审批。对重度用户来说,8 月中下旬是调整用量与预算的时间窗口。 来源:Releasebot/Anthropic · explainx 时间线 · Anthropic Newsroom(2026-08 上旬)
3. Palantir Q2 营收同比 +93% 达 $1.94B,AI 商业化落地的风向标财报 Palantir 二季度营收 $1.94B(预期 $1.8B),美国商业收入同比 +149%,并上调全年指引,盘后大涨 9%+。企业侧 AI 平台的收入兑现速度仍在加速,是本轮「AI 落地」叙事的直接证据。 来源:Techmeme/CNBC(2026-08-03)
官方发布与新功能
- OpenAI 于 8 月 3 日发布工程类公告「Building abundant intelligence」,搜索结果暂未见详细内容,可关注官网原文。OpenAI News(2026-08-03)
- Claude Code 近期更新:subagents 默认可嵌套派生至 3 层(原 1 层)、/code-review 改为后台 subagent 运行不再占用会话上下文、/mcp 连接失败时显示 HTTP 状态与错误文本。Claude Code What's new(2026-07 底)
- Google:Gemini 3.6 Flash 转 GA,token 效率与代码/agentic 规划能力提升且价格低于 3.5 Flash;Gemini Omni 视频生成 8 月 5 日起进入 Google Vids。Gemini API changelog · Releasebot/Google(2026-07/08)
- DeepSeek 于 7 月 31 日发布 DeepSeek-V4-Flash-0731。LLM Stats(2026-07-31)
Agent 技术精选
- 《How to Secure AI Agents, MCP Servers, and LLM Apps in Production》:提出五层 agentic AI 安全框架(see-fix-protect),指出 Agent 应用打破了「应用行为由代码决定」的传统 AppSec 假设。LLM Stats AI News(2026-08-03)
- F1 与 AWS 用 Bedrock AgentCore 构建 Data Accelerator,数据源接入从最长 8 周缩短到分钟级——大型企业 agentic 数据运维的完整案例。LLM Stats AI News(2026-08-03)
- Sourcegraph 更新《Context Engineering: A Practical Guide for AI Agents (2026)》:上下文工程 = 用最小的高信号 token 集合最大化目标达成概率。Sourcegraph Blog(2026)
- InfoWorld 分析 MCP 在上下文工程中的角色;Zuplo《State of MCP》报告称「为 AI 提供更好上下文」是 MCP 最常被引用的核心价值。InfoWorld(2026)
学术与课程
- arXiv 新论文《Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges》:用跨模型审计链缓解 LLM 裁判的认知偏见,与今日精选主题直接相关。arXiv:2607.28636(2026-08-03 上线)
- arXiv《Learning Stateful Predictive Knowledge From Experience》:指出 Agent 仅靠轨迹级反思学经验有局限,提出有状态预测知识的学习框架。arXiv:2607.28638(2026-08-03 上线)
- arXiv《Topology-Aware Data Movement for Disaggregated GPU Inference》:Prefill/Decode 分离推理下的数据中心网络拓扑感知数据搬运,称现有系统均未正确解决。arXiv:2607.28633(2026-08-03 上线)
- Stanford CS329A《Self-Improving AI Agents》课程页持续更新:自我改进技术、工具使用与多步规划。cs329a.stanford.edu
行业动态
- Design Arena(设计品味人类评测竞技场,全球 530 万用户,为前沿实验室提供人类偏好评测)融资 $790 万。TechCrunch(2026-08-03)
- 榜单动态:Qwen3.8-Max 在 DeepSWE 1.1(21.6→56.6)、FrontierSWE(40.7→73.5)等 agentic 编码基准上较上代大幅跃升;Datacurve 的 DeepSWE 以「防污染的全新长时程任务」设计成为 Artificial Analysis 采用的基准。OfficeChai · BenchLM(2026-08)
今日精选主题
LLM-as-Judge:用模型当裁判的可靠性、偏见与工程实践
选择理由:今天 arXiv 上线的 Chain-of-Models 论文把「LLM 裁判的偏见治理」再次推到台前;而 LLM-as-Judge 是 Agent 评测、RLAIF、自动回归测试的基础设施,位置偏见/冗长偏见/自我偏爱等系统性缺陷直接影响所有依赖它的评测结论。已有 30 期深度文档均未覆盖该主题,且工程可操作性强(校准、rubric、DAG 拆分、漂移监控)。
备选主题(可回复选择,默认用上面这个): 1. Prefill/Decode 分离推理架构(disaggregated inference)——今日拓扑感知数据搬运论文 + vLLM 生态热点 2. Agent 经验学习与有状态预测知识——今日 arXiv 2607.28638 方向
生成时间:2026-08-04 · 来源均为当日搜索结果,未经交叉验证的单源信息请以原文为准。
主页