Mingyu's Library主页
2026年8月4日

AI 每日简报 · 2026-08-04

信息来源:过去 24-48 小时全网搜索,所有条目附来源链接。

今日头条

1. 阿里发布 Qwen3.8-Max:2.4 万亿参数 MoE,多项榜单超 GPT-5.6 Sol 与 Claude Fable 5 8 月 3 日阿里正式发布 Qwen 家族迄今最强模型 Qwen3.8-Max:2.4T 总参数、每次请求仅激活 95B 的 MoE 架构,官方称可连续 10 天以上自主执行软件工程任务。Terminal-Bench 2.1 得 86.6(超 Claude Fable 5 的 84.6,略逊 GPT-5.6 Sol max 的 88.8),IFBench 82.8 大幅领先。定价 $2/$6 每百万 token,权重下周开源到 Hugging Face / ModelScope——开源阵营再次逼近闭源第一梯队。 来源:MarkTechPost · Neowin · Dataconomy(2026-08-03)

2. Anthropic 多项使用政策与价格节点:Claude Code 50% 用量加成延至 8/19,Sonnet 5 促销价 8/31 截止 Claude Code 订阅用户的周用量临时 50% 加成延长到 8 月 19 日;Claude Sonnet 5 的促销价 $2/$10(每百万 token)8 月 31 日结束,9 月 1 日起恢复 $3/$15。同时 Cowork 已扩展到移动端与 Web,支持后台任务、定时任务与移动端审批。对重度用户来说,8 月中下旬是调整用量与预算的时间窗口。 来源:Releasebot/Anthropic · explainx 时间线 · Anthropic Newsroom(2026-08 上旬)

3. Palantir Q2 营收同比 +93% 达 $1.94B,AI 商业化落地的风向标财报 Palantir 二季度营收 $1.94B(预期 $1.8B),美国商业收入同比 +149%,并上调全年指引,盘后大涨 9%+。企业侧 AI 平台的收入兑现速度仍在加速,是本轮「AI 落地」叙事的直接证据。 来源:Techmeme/CNBC(2026-08-03)

官方发布与新功能

Agent 技术精选

学术与课程

行业动态

今日精选主题

LLM-as-Judge:用模型当裁判的可靠性、偏见与工程实践

选择理由:今天 arXiv 上线的 Chain-of-Models 论文把「LLM 裁判的偏见治理」再次推到台前;而 LLM-as-Judge 是 Agent 评测、RLAIF、自动回归测试的基础设施,位置偏见/冗长偏见/自我偏爱等系统性缺陷直接影响所有依赖它的评测结论。已有 30 期深度文档均未覆盖该主题,且工程可操作性强(校准、rubric、DAG 拆分、漂移监控)。

备选主题(可回复选择,默认用上面这个): 1. Prefill/Decode 分离推理架构(disaggregated inference)——今日拓扑感知数据搬运论文 + vLLM 生态热点 2. Agent 经验学习与有状态预测知识——今日 arXiv 2607.28638 方向


生成时间:2026-08-04 · 来源均为当日搜索结果,未经交叉验证的单源信息请以原文为准。