#01模型与开放生态
Anthropic发布Claude Opus 5:多项基准反超Fable 5,价格仅为一半
Anthropic 于 7 月 24 日发布 Claude Opus 5 并当天全平台上线,官方数据中多项基准反超自家旗舰 Fable 5,定价却与 Opus 4.8 完全相同(每百万输入 token 5 美元、输出 token 25 美元),仅为 Fable 5(10/50 美元)的一半。 在 Frontier-Bench v0.1 上,Opus 5 超过所有其他模型,成绩是 Opus 4.8 的两倍以上;ARC-AGI 3 的得分达到次优模型的三倍;OSWorld 2.0 上以约三分之一成本超过 Fable 5 的最佳成绩;CursorBench 3.2 max effort 设置下距 Fable 5 峰值仅 0.5%,但单任务成本减半。官方将其定位为日常编程与知识工作的高效模型,以上均为发布方评测数据。 API 模型 ID 为 claude-opus-5,思考模式默认开启,支持含 max 档在内的完整 Effort 档位;Fast mode 约为默认速度的 2.5 倍,按基础价格两倍计费。本次还加入两项 beta 功能:对话中途更换工具不再使 prompt cache 失效,以及被安全分类器拦截的请求可按配置自动转给其他模型。官方同时称 Opus 5 是对齐程度最高的模型,安全分类器拦截频率比 Fable 5 低约 85%。 官方评测:Opus 5 与 Fable 5、Opus 4.8、GPT-5.6 Sol 在多项基准上的对比(发布方数据) 第三方评价同日出现。Lenny's Newsletter 的实测评测《Claude Opus 5 review: this model is brilliant (but annoying)》记录了模型在真实编程中"神经质"的一面——曾拒绝处理一个 merge conflict,以及输出冗长的问题;评测包含 7 个模型的盲测对比。分析师 Gavin Baker 在 X 上评论称,Grok 4.5、SWE-1.7 与 Opus 5 构成新的帕累托前沿,"单位成本智能"(intelligence per $)将成为关键指标。 补充报道:https://www.lennysnewsletter.com/p/claude-opus-5-review-this-model-is 参考资料:https://x.com/i/web/status/2080742505088250014
#02模型与开放生态
30余家机构联署公开信支持开放权重,Anthropic与Google未签
微软、Meta、NVIDIA、OpenAI、Mistral、Hugging Face、IBM、GitHub、Cisco、Dell、Cohere、Palantir、Perplexity、Replit、Mozilla、Linux Foundation、a16z、Y Combinator 等 30 余家公司与机构 7 月 24 日联署公开信,呼吁美国政策制定者避免过早限制开放权重模型。 公开信托管于微软官网并列出完整联署名单,Google 与 Anthropic 不在其中;Google 未签署一事也在 Reddit 社区引发集中讨论。 信中认为,开放权重能扩大 AI 经济参与、增强竞争与客户控制,也便于研究人员检查模型行为、发现漏洞和开发防护措施。信中承认权重发布后难以撤回、修改版本不易追踪,但主张围绕已经证明的风险制定规则;蒸馏则被区分为常见的模型改进与评估技术,以及应通过针对性法律和商业框架处理的非法提取行为。 公开信《Open Weights and American AI Leadership》首页,日期为 2026 年 7 月 24 日 同日,黄仁勋开通 X 账号,NVIDIA 官方账号发文欢迎并引述其观点:"未来 AI 领导力既需要前沿闭源模型,也需要前沿开放模型。"开源社区多人转发,感谢其公开支持开放模型。 参考资料:https://x.com/JensenHuang/status/2080643682408321103 ### 作者锐评 OpenAI 签了倒不意外:自己叫 OpenAI,总不能不 open。没签的两家各有心思——Google 正忙着追自己的闭源旗舰;Anthropic 大概还在琢磨信里"蒸馏是常见的模型改进与评估技术"这句该怎么咽,毕竟两天前,美方刚有人指控 Kimi K3 蒸馏自它家模型。
#03模型与开放生态
华尔街日报:Stripe洽谈收购OpenRouter,估值约100亿美元
《华尔街日报》援引知情人士报道,Stripe 正洽谈收购 AI 模型聚合平台 OpenRouter,交易估值可能约 100 亿美元,协议可能较快宣布,但谈判仍可能破裂。 OpenRouter 今年 5 月完成 1.13 亿美元 B 轮融资时估值 13 亿美元,投资方包括 a16z、Menlo Ventures 和 Alphabet 旗下 CapitalG。The Information 此前报道 OpenRouter 收到收购意向,并曾与大模型公司 Databricks 早期接触。 OpenRouter 通过单一 API 聚合 400 多款模型,覆盖 OpenAI、Anthropic 及开源模型,4 月年化收入约 5000 万美元。Stripe 目前已是 OpenRouter 的支付、税务与反欺诈服务商。交易双方均未公开确认谈判。 补充报道:https://www.pymnts.com/news/artificial-intelligence/2026/stripe-eyes-10-billion-deal-for-ai-model-marketplace-openrouter/
#04模型与工具
NVIDIA发布SANA-Video 2.0:单卡H100生成5秒720p视频需13.06秒
NVIDIA Research 发布 SANA-Video 2.0,提供 5B 与 14B 两种规模;5B 版本配合 Sol-Engine,在单张 H100 上生成 5 秒 720p 视频需 13.06 秒。 模型采用混合视频扩散 Transformer,以 3:1 比例组合线性注意力与 softmax 锚点,再通过 Block Attention Residuals 将锚点表示传给后续层。 官方报告 VBench 总分为 84.30,并称上述 5B 推理设置比 Wan 2.2-A14B 快 120 倍。速度与质量数字均来自发布方测试;项目页已提供论文,代码入口指向 NVlabs/Sana。 SANA-Video 2.0 官方示例视频首帧
#05模型与工具
Kimi Code新增k3-256k模型ID,日常开发消耗约为1M版一半
Kimi Code 新增 k3-256k 模型 ID,与 k3 同属 Kimi K3,但上下文上限固定为 256K,官方称消耗约为 1M 版的一半。 新入口面向日常问答、代码补全、常规功能开发和少量文件修改,Moderato 及以上会员可用;它只支持图片输入,不支持视频。 从 k3 切换到 k3-256k 时,如果会话已超过 256K 或含视频文件,需要先执行 compact。从 k3-256k 切回 k3 不影响缓存。官方模型表把 K3 标注为 2.8T 参数规模,这一数字对应模型版本,不是 256K 上下文长度。
#06模型与工具
Sakana AI升级Fugu-Ultra v1.1,并接入Claude Code兼容接口
Sakana AI 发布 Fugu-Ultra v1.1,继续动态编排多款前沿模型,并保持与 v1.0 相同的价格。 发布方称,新版在所跟踪基准上均有提升,最高增加 7.9 分,其中 ProgramBench 与 Terminal Bench 2.1 的增幅较明显;Fable 5 不在当前 agent pool 中。 新版同时开放 Claude Code 兼容 endpoint。开发者可以在终端内调用 Fugu 的多模型协作能力,把编写、调试和执行任务分配给不同模型。全部跑分为 Sakana AI 发布数据。
#07模型与工具
Midjourney上线V8.2,重点改善审美、稳定性与个性化
Midjourney 上线 V8.2 图像模型,更新集中在审美、整体质量和个性化。 官方称,新版生成结果会更大胆、成熟和新鲜,随机出现低质量图像的情况将明显减少。 V8.2 也会更多利用用户既有的评分记录来理解个人偏好,评分数据积累较多的用户受益更明显。创建 V8.2 个性化配置文件时,可供选择的图片池也比此前更大。
#08Agent 与开发生态
Grok进入Google Workspace,一次安装覆盖Sheets、Slides与Docs
SpaceXAI 发布免费的 Grok for Google Workspace 插件,一次安装即可覆盖 Sheets、Slides 与 Docs。 在 Sheets 中,Grok 能读取表格并引用使用过的单元格,填写公式、插入图表和重跑情景;这些操作都是可检查、可撤销的普通编辑。 Slides 可根据大纲生成可编辑演示文稿,沿用现有主题,并从网页或 X 补充研究和配图。Docs 可把笔记整理成结构化草稿、原地修正语法;启用 connectors 后还能读取近期邮件或 Google Drive 文件。SpaceXAI 也为 Word、Excel、PowerPoint 和 Outlook 提供对应版本。同日官方 X 账号还宣布 Grok STT 上线 OpenRouter,以及 Grok Build 可安装 Exa 插件获得 agentic 网络搜索;两条消息未附更多参数。 参考资料:https://x.com/i/web/status/2080749255183245691
#09Agent 与开发生态
OpenRouter发布Classifiers测试版,异步标记Agent任务与成本归属
OpenRouter 发布 Classifiers 测试版,可在每次生成完成后异步添加结构化标签,不增加推理路径延迟。 用户可配置最多 8 个分类维度、分类提示、所用模型和采样率,用于标记任务类型、所属部门、Agent 复杂度、合规类别或成本中心。 平台提供 6 个预设模板,分类结果写入日志,并可在 Activity Explorer 中按维度汇总模型使用与支出。该功能在关闭输入、输出日志记录时仍可工作;高吞吐团队也能用采样率控制额外分类成本。
#10Agent 与开发生态
Anthropic删减Claude Code八成系统提示词,重新整理上下文工程规则
Anthropic 称,针对 Claude Opus 5 和 Fable 5 等新模型,Claude Code 删除超过 80% 的系统提示词后,编码评测没有出现可测损失。 团队发现,系统提示词、Skills、CLAUDE.md 与用户要求常会给出相互冲突的规则;新做法是减少兜底约束,让模型匹配周边代码的注释密度、命名和惯例。 文章还主张从堆示例转向设计清晰接口,从一次性塞入全部信息转向渐进披露。CLAUDE.md 应保持轻量,把验证等专门流程拆到按需加载的 Skills;Claude Code 的 /doctor 命令可检查并调整 Skills 与 CLAUDE.md 的体量。
#11研究与基础设施
Google发布ATLAS报告:工作场景中完全自动化交互不足一成
Google 发布 ATLAS v1.0 报告,基于 1500 万次聚合、去标识化的人机交互,统计 Gemini App、AI Mode 与 Gemini API 的实际使用。 数据覆盖 150 多个国家、140 种语言、800 个职业和 4000 项任务。工作场景的使用涉及 68% 的职业,这些职业占美国就业约 90%;但在典型工作中,AI 只用于约 21% 的任务。 报告显示,工作交互仍以协作、信息检索、学习和构思为主,完全自动化不足 10%。全部交互中,86% 以上发生在非工作场景。ATLAS 只统计 Google 所列产品,不能代表全部 AI 使用。 Google ATLAS 报告基于 150 多个国家的 1500 万次去标识化交互
#12研究与基础设施
NVIDIA ModelExpress让新副本从GPU直接取权重,冷启动降至1分44秒
NVIDIA 发布 ModelExpress,在加载模型前查找已有兼容权重副本,并优先通过 NIXL 与 P2P RDMA 从一块 GPU 直接传到另一块 GPU。 这条路径避开对象存储、本地盘和主机内存的重复搬运。没有可用同伴时,系统再从对象存储流式加载,或选择本地存储与 GPUDirect Storage。 官方演示把 DeepSeek-V4 Pro 权重与 JIT kernel cache 传给新副本的时间压到 10 秒以内,总启动时间从 8 分钟降至 1 分 44 秒。集群缓存服务还会用原子协调避免多个副本重复下载同一个 806GiB 模型。上述时间和容量均来自 NVIDIA 给定环境下的测试。