覆盖范围:2026-07-24 ~ 07-25。补录版。所有条目均来自实际搜索结果,标注来源链接。
今日头条
1. Claude Opus 5 昨日(7/24)发布,以一半价格接近 Fable 5,部分基准反超 Anthropic 上线 Claude Opus 5:1M 上下文、128k 最大输出、默认开启 thinking,定价 $5/$25 每百万 token(约为 Fable 5 一半)。多家评测称它在若干基准上不只是逼近、而是反超 Fable 5——例如 FrontierBench v0.1 上 Opus 5 约 43.3%、GPT-5.6 Sol 约 37.5%。这标志着「以更低价格拿到近前沿智能」成为现实。 来源:promptailearning 7/25 · Anthropic Newsroom · Releasebot
2. Nvidia 黄仁勋 X 首帖:开放模型是安全、创新与主权的必需品 黄仁勋以一封公开信作为 X 平台首帖,论证开放 AI 模型与闭源前沿模型应当并存——开放模型对安全、创新和「AI 主权」不可或缺。这一表态与本周 Kimi K3 等开放权重浪潮形成呼应,也把「开放 vs 闭源」之争推到台前。 来源:promptailearning 7/25
3. ChatGPT Health 全美铺开 OpenAI 的 ChatGPT Health 功能开始全美推广:连接用户健康档案与 Apple Health 等服务的数据,为健康类问题给出「有依据」的回答。医疗是幻觉与合规风险最高的领域之一,这一功能的落地方式值得关注。 来源:promptailearning 7/25
官方发布与新功能
- Claude Opus 5 细节:与 Opus 4.8 同价,官方定位「更快、更省的编码/知识工作/科研模型」;CodingFleet 对比称其在 12 项基准中 7 项胜过 Fable 5(如 Frontier-Bench +9.6、OSWorld 2.0),Fable 5 仅在 SWE-bench Pro 微弱领先 0.8 分。CodingFleet 对比
- SutiSoft 在其企业应用中全线引入 Agentic AI,主打「用自然对话管理业务流程」替代复杂界面与手工工作流。promptailearning
Agent 技术精选
- FrontierBench / FrontierCode 榜单更新(7/24):FrontierCode v1.1 主榜以「生产代码 PR 质量」排名——Fable 5 53.5%、Opus 5 53.4% 几乎并列。用「真实 PR 质量」而非单点通过率评测 Agent 编码,是评测方法的一个方向。CodingFleet 榜单
- Claude 5 技术栈讨论:社区总结 7/25 前后的上下文工程实践(system prompt 大幅精简、context「体检」等),配合 Opus 5 落地。(社区博客,观点性内容)
学术与课程
- AA-Omniscience 基准论文(arXiv:2511.13029):Artificial Analysis 的知识可靠性与幻觉基准,6000 题跨 6 大领域,提出 -100~100 的「Omniscience Index」——奖励正确、惩罚幻觉、对「拒答」不罚。是理解「模型知不知道自己不知道」的重要工具。arXiv · 榜单
- 课程方面今日无重要更新。
行业动态
- 四大云/平台公司 2026 资本开支合计逼近 $7250 亿,其中微软全年约 $1900 亿——AI 基础设施军备竞赛的量级。promptailearning
- 幻觉率新格局:Fable 5 以 AA-Omniscience Index 40、准确率 61% 登顶,但其高分「由准确率而非低幻觉驱动」——首个把「准确」置于「谨慎拒答」之上的 Claude 旗舰,幻觉率高于 Opus 4.8。CodingFleet 幻觉排名
今日精选主题
主选:LLM 幻觉评测怎么做——Vectara HHEM 与 AA-Omniscience 两把尺子,以及工程上如何压低幻觉 理由:Opus 5 与 Fable 5 的对比、ChatGPT Health 的落地都把「模型说的话可不可信」推到核心;而幻觉评测恰恰是最容易被误读的一块(「准确率高」不等于「幻觉低」,「会推理」反而幻觉更多)。这与已有深度文档不重复。
备选(回复数字可切换,默认用主选): 1. Claude Opus 5 vs Fable 5:同门模型的定位与取舍 2. 前沿模型资本开支与推理经济学
主页