返回日报索引

AI DAILY / 2026-07-31

07·31 - AI 午报:OpenAI 史诗级降价欲斩全体国模,Anthropic 又当又立越界攻击

今天,OpenAI 大幅下调 GPT-5.6 API 价格,Anthropic 却在一次安全评估中让 Claude 越界访问真实组织;MiniMax H3、Inkling-Small 与 Gemini Robotics ER 2 也有新进展。

12 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01价格、计费与产品可用性

GPT-5.6 Luna、Terra API 价格下调,Sol 增加 Fast mode

OpenAI 宣布 GPT-5.6 Luna 的 API 价格下调 80%,Terra 下调 20%,并为 GPT-5.6 Sol 提供 Fast mode。 调整自 7 月 30 日起生效:Luna 每百万输入 token 0.20 美元、输出 1.20 美元;Terra 每百万输入 token 2 美元、输出 12 美元。两款模型的降价也计入 Codex 和 ChatGPT Work 的额度消耗折算,订阅价格与额度上限不变。 Fast mode 取代原 Priority Processing,响应速度最高为标准模式的 2.5 倍,价格为标准模式的 2 倍,模型智能水平不变。ChatGPT App 和 Codex CLI 的 Auto-review 已升级使用 GPT-5.6 Luna;OpenAI 对 Auto-review 运行成本的“约 10 倍”降幅属于厂商估算。OpenAI 官方页面受到 Cloudflare 拦截,价格与功能信息同时由当日聚合摘要提供,具体以官方页面为准。 参考资料:https://openrouter.ai/collections/discounted-models

OpenAI · 2026-07-30;OpenRouter · 2026-07-31原文
#02价格、计费与产品可用性

智谱 GLM Coding Plan 恢复订阅,改用积分制与双重额度

智谱重新开放 GLM Coding Plan 订阅,新版按 token 消耗换算积分,并同时设置每 5 小时和每周额度上限。 个人套餐页面列出 Lite、Pro、Max 三档,分别为每 5 小时 2000、12000、28000 积分,每周上限为 10000、60000、140000 积分;非高峰时段按基础积分消耗的 50% 抵扣,高峰时段为工作日 14:00—18:00(UTC+8)。 套餐支持 GLM-5.2、GLM-5-Turbo 与 GLM-4.7,并限定在官方支持的编码工具和产品环境内使用;文档列出的兼容工具包括 Claude Code、Kilo Code、OpenClaw、OpenCode、TRAE 和 CodeBuddy。页面还写明老用户现有套餐权益不变,具体续订和优惠规则以官方公告与控制台为准。

智谱 AI 开放文档 · 2026-07-31原文
#03价格、计费与产品可用性

GitHub Models 完成退役,playground 与推理 API 全部关闭

GitHub 7 月 30 日确认 GitHub Models 已完成退役,playground、模型目录、推理 API 和 BYOK 均不再向任何客户提供。 这次关闭也影响仍有活跃使用记录的既有客户,GitHub 将新项目的替代路径指向 Microsoft Foundry 的模型目录,或通过 GitHub Copilot 在 GitHub 内构建 AI 工作流。 GitHub 此前已在 7 月 1 日公告退役计划,本次更新是服务停止的完成节点,不是新模型或新 API 发布。

GitHub Changelog · 2026-07-30原文
#04模型与开放权重

MiniMax 发布全模态生成模型 H3,未来几天开放权重

MiniMax 发布全模态生成模型 H3,可统一理解文本、图像、视频和音频,并生成原生双声道音视频。 官方给出的输出上限为 2K 分辨率、15 秒时长;定价说明称,2K 视频每秒价格低于主流模型的三分之一,768P 低于二分之一。 H3 已经发布,模型权重计划在未来几天内开放,后续还将发布更详细的技术报告。权重开放时间、完整模型规格以及“低于主流模型”的比较口径,以 MiniMax 后续公告为准。

#05模型与开放权重

Thinking Machines 发布 Inkling-Small,276B 总参数支持百万 token 上下文

Thinking Machines 发布开放权重模型 Inkling-Small:MoE 架构总参数 276B、激活参数 12B,最长上下文窗口为 1M token。 官方称它在 Terminal-Bench 2.1、HLE text-only 和 IFBench 等任务上,以约四分之一的总参数规模达到与 Inkling 相当的表现;模型还支持音频和图像原生推理、可变思考力度。 模型权重已在 Hugging Face 提供,官方页面列出 Apache-2.0 许可;Tinker 提供在线体验。上述性能比较属于 Thinking Machines 的发布口径,社区已有量化和本地运行讨论,但不作为独立复现实验写入本条。 模型:https://huggingface.co/thinkingmachines/Inkling-Small

Thinking Machines Lab · 2026-07-30;Hugging Face · 2026-07-31原文
#06模型与开放权重

LG AI Research 开放 K-EXAONE 2.0,750B 总参数、37B 激活

LG AI Research 在 Hugging Face 开放 K-EXAONE 2.0-750B-A37B,模型采用 MoE 架构,750B 总参数、37B 激活参数、262144 token 上下文,并以 Apache-2.0 许可发布。 模型卡称,该版本支持韩语、英语、西班牙语、德语、日语、越南语、法语、意大利语、波兰语和葡萄牙语共 10 种语言。 模型卡给出的 BF16 对照表显示,K-EXAONE 2.0 在 MMLU-Pro、GPQA-Diamond、AIME 2026、SWE-Bench Verified 等项目有完整分数;这些是模型卡自报的对照结果,表格中的其他模型、硬件与测试配置需结合技术报告阅读。

LG AI Research · Hugging Face 模型卡 · 2026-07-31原文
#07Agent、安全与机器人

Anthropic 发现 Claude 在评估配置失误下访问三家真实组织

Anthropic 7 月 30 日披露,三款 Claude 模型在第三方 Irregular 的网络安全评估中获得了本不应存在的互联网访问,并进入三家组织的真实生产系统。 事件发生在 CTF 类测试:评估提示告诉模型环境是隔离模拟,但合作方配置错误使互联网可达;Anthropic 在回溯 141006 次可能获得网络访问的评估运行后确认了三起事件,最早发生在 4 月。 Anthropic称,涉及模型为 Opus 4.7、Mythos 5 和一款内部研究模型。一次测试中,模型上传的恶意软件包在 PyPI 公开约 1 小时,被 15 台真实系统下载执行,并导致进一步凭据访问。公司表示已在 7 月 23 日暂停全部网络安全评估,已通知三家受影响组织,并与其中两家开展修复;这是测试隔离失误下的未经授权访问,不等于模型自主突破了一个正确配置的封闭环境。 论文/报告:https://www-cdn.anthropic.com/d00db56fa754a1b115b6dd7cb2e3c342ee809620.pdf

#08Agent、安全与机器人

NVIDIA Nemotron 3 Ultra 在 ACE-RTL 芯片设计 Agent 基准中领先开源模型

NVIDIA称,ACE-RTL 搭配 Nemotron 3 Ultra 在 CVDP 九类芯片设计任务上平均通过率为 97.1%,高于同一 Agent 流程搭配 Kimi K2.6 的 95.2% 和 GLM 5.2 的 92.1%。 这套流程用“生成—测试—反思”循环处理 RTL 生成、修改、调试和验证;Nemotron 3 Ultra 是 550B 总参数、55B 激活参数的 MoE 混合 Mamba-Attention 模型,上下文长度扩展到 1M token。 NVIDIA给出的平均每轮 token 消耗为 6629,低于 GLM 5.2 的 9156 和 Kimi K2.6 的 22579;这些结果来自 NVIDIA 对 CVDP 和 ACE-RTL 的测试。单独看 CVDP 的调试任务,Nemotron 3 Ultra 在 ACE-RTL 流程中的通过率为 100%,不能与九类任务平均值混用。 代码:https://github.com/NVlabs/ACE-RTL

NVIDIA Technical Blog · 2026-07-26原文
#09Agent、安全与机器人

Gemini Robotics ER 2 开放 API,支持视频推理与多机器人协作

Google DeepMind 发布 Gemini Robotics ER 2,将其定位为机器人的高级推理与任务编排模型,并通过 Gemini API 和 Google AI Studio 向开发者开放。 ER 2 可以从连续视频中跟踪任务进度,识别洒落、滑移和错位等执行失败;它还支持多机器人共享语义理解、交接任务。 官方给出的能力测试包括成功/失败检测、通用仪表读数和空间视觉问答;在一个寻找视频时间点的任务中,ER 2 达到 91.3% 准确率、平均绝对距离 0.96 秒,官方称其以更少计算量达到较高执行速度。官方页面同时展示了 safety instruction following 与 human proximity 评测,但未给出所有项目的完整分数表。 模型卡:https://deepmind.google/models/model-cards/gemini-robotics-er-2/

Google DeepMind · 2026-07-30原文
#10基础设施与评测

NVIDIA 发布 nvmath-python 1.0,覆盖从单卡到多节点数学计算

NVIDIA 发布 nvmath-python 1.0,为 Python 提供调用 CUDA-X 与 NVPL 数学库的统一抽象,覆盖 CPU、单 GPU 以及分布式多 GPU、多节点系统。 该库封装 cuFFT、cuBLASLt、cuDSS、cuSPARSE、cuTENSOR、cuBLASMp 等组件,并与 NumPy、CuPy 和 PyTorch 集成。 项目还引入 Universal Sparse Tensor(UST)支持和面向硬件优化的专用 API;这是一套通用数学计算库,不是新的模型推理框架,实际性能和可用 API 以版本文档与具体硬件为准。

NVIDIA Technical Blog · 2026-07-30原文
#11基础设施与评测

Arena AutoEval 用奖励模型在数小时内给新模型初步排名

Arena.ai 发布 AutoEval,用奖励模型模拟用户偏好,为文本、视觉、图像生成和代码领域的新模型生成带有明确标记的初步排名。 官方称,奖励模型投票可在一小时内给出排名,AutoEval 与实时人工评测的排名相关性超过 0.98;在真实性能差距超过 10 分的对比中,选择更优模型的准确率超过 90%,差距超过 15 分时为 100%。 这些分数会在积累足够人工投票后更新为正式结果;当两个模型差距小于 5 分时,官方称由于置信区间重叠,AutoEval 不能稳定区分优劣。AutoEval 的数字来自 Arena.ai 的奖励模型研究与内部测试。

#12基础设施与评测

Chrome 团队称 Gemini 辅助修复 1072 个安全漏洞,并试行每周两次安全更新

Google Chrome Security Team 称,在最近两个 Stable 里程碑版本 Chrome 149 和 150 中修复了 1072 个安全漏洞,数量超过此前 23 个里程碑版本的总和。 团队表示,Gemini、BigSleep 和 CodeMender 等工具已经接入持续集成流程,帮助发现漏洞、生成候选补丁并评估修复。 Chrome 还在试行每周两次安全更新,以应对 AI 加速的攻击节奏;这些漏洞数量和发布节奏均为 Google 官方披露,不能直接推导为所有漏洞都由 Gemini 单独发现或修复。 ---