Mingyu's Library主页
2026年7月25日

AI 每日简报 · 2026-07-25(周六)

覆盖范围:2026-07-24 ~ 07-25。补录版。所有条目均来自实际搜索结果,标注来源链接。

今日头条

1. Claude Opus 5 昨日(7/24)发布,以一半价格接近 Fable 5,部分基准反超 Anthropic 上线 Claude Opus 5:1M 上下文、128k 最大输出、默认开启 thinking,定价 $5/$25 每百万 token(约为 Fable 5 一半)。多家评测称它在若干基准上不只是逼近、而是反超 Fable 5——例如 FrontierBench v0.1 上 Opus 5 约 43.3%、GPT-5.6 Sol 约 37.5%。这标志着「以更低价格拿到近前沿智能」成为现实。 来源:promptailearning 7/25 · Anthropic Newsroom · Releasebot

2. Nvidia 黄仁勋 X 首帖:开放模型是安全、创新与主权的必需品 黄仁勋以一封公开信作为 X 平台首帖,论证开放 AI 模型与闭源前沿模型应当并存——开放模型对安全、创新和「AI 主权」不可或缺。这一表态与本周 Kimi K3 等开放权重浪潮形成呼应,也把「开放 vs 闭源」之争推到台前。 来源:promptailearning 7/25

3. ChatGPT Health 全美铺开 OpenAI 的 ChatGPT Health 功能开始全美推广:连接用户健康档案与 Apple Health 等服务的数据,为健康类问题给出「有依据」的回答。医疗是幻觉与合规风险最高的领域之一,这一功能的落地方式值得关注。 来源:promptailearning 7/25

官方发布与新功能

Agent 技术精选

学术与课程

行业动态

今日精选主题

主选:LLM 幻觉评测怎么做——Vectara HHEM 与 AA-Omniscience 两把尺子,以及工程上如何压低幻觉 理由:Opus 5 与 Fable 5 的对比、ChatGPT Health 的落地都把「模型说的话可不可信」推到核心;而幻觉评测恰恰是最容易被误读的一块(「准确率高」不等于「幻觉低」,「会推理」反而幻觉更多)。这与已有深度文档不重复。

备选(回复数字可切换,默认用主选): 1. Claude Opus 5 vs Fable 5:同门模型的定位与取舍 2. 前沿模型资本开支与推理经济学