返回日报索引

AI DAILY / 2026-08-10

08·10 - AI 午报:GLM 5.2 出现95%折扣,WeatherNext开放权重

今天的主线是 AI 从价格、开放权重到部署基础设施全面下沉:GLM 5.2 出现供应商级 95% 折扣,WeatherNext 开放代码与权重,Firebird 启动亚美尼亚 AI 工厂;Claude Code 防提示词注入、KPMG 成本数据和 OoO-Spec 工具调用加速,则补上 Agent 的安全、成本与效率。

11 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01模型、价格与开放权重

OpenRouter 显示 GLM 5.2 出现 95% 折扣,部分 API 价格降至每百万输入 token 0.07 美元

OpenRouter 的 GLM 5.2 页面当前显示,部分供应商提供约 95% 的折扣,最低列出的输入价格为每百万 token 0.07 美元、输出价格为 0.22 美元。 页面还标注 GLM 5.2 支持 1M token 上下文;折扣对应的是 OpenRouter 上的特定供应商与当前价格快照,不应理解为智谱官方统一下调了所有渠道的价格。 同一页面列出的不同供应商价格并不一致,折扣的生效原因和持续时间也没有在页面中说明。对开发者来说,这条消息更像是“路由平台上的即时成本变化”,使用前仍应检查供应商、稳定性、工具调用行为和实际结算价格。

OpenRouter GLM 5.2 模型页 · 2026-08-10原文
#02模型、价格与开放权重

Google DeepMind 开放 WeatherNext 2 与气旋模型代码和权重

Google DeepMind 开放 WeatherNext 2、WeatherNext Cyclones 的代码和预训练权重,并同步发布可在单个 TPU 上运行的 WeatherNext Cyclones Mini。 官方博客称,WeatherNext Cyclones 在 2023—2024 年历史气旋评测中,平均为路径、强度和风场预测带来超过一天的提前量;模型从近 20 TB 全球大气数据和约 5,000 个历史风暴样本中训练。 仓库同时给出了部署边界:完整模型更适合 TPU,非 Mini 版本需要 H100 才有足够显存,Mini 版本可在 P100 上尝试;预训练权重通过 Google Cloud Bucket 提供。也就是说,这次是代码和权重真实可取,但“开放”不等于普通电脑即可完成业务级预报。

Google DeepMind、WeatherNext GitHub · 2026-08-06/10原文
#03Agent 安全与企业落地

Claude Code 主创介绍模型、探测器和意图分类器叠加的提示词注入防线

Claude Code 主创 Boris Cherny 表示,Anthropic 将模型训练、输入探测器和意图分类器叠加用于防范提示词注入,并称未见攻击的成功率已接近零。 这是一则公开社交账号上的技术说明,帖文没有给出统一评测集、攻击样本量或独立复现实验,因此本文只把它写成作者对防御架构和实际使用情况的表述,不扩展为通用安全结论。 Cherny 还提到,让无法读取 SSH 密码等凭证的子代理处理不受信任内容,是降低暴露面的做法。对于会访问网页、仓库和第三方文档的 Agent,权限隔离与模型侧检测需要共同构成防线。

Boris Cherny(Claude Code)· 2026-08-10原文
#04Agent 安全与企业落地

KPMG 调查显示企业 Agent 部署保持在半数以上,但成本可见性仍不足

KPMG 的第二季度 AI Pulse 调查显示,53% 的受访组织正在部署 AI Agent,但只有 26% 表示已经具备对大规模 AI 运行成本的实时完整可见性。 调查还称,跨工作流编排多个 Agent 的组织比例从上一季度的 9% 增至 18%,而成本管理与经济核算仍是 35% 受访者认为的部署障碍。 这组数据来自 KPMG 对 204 名美国大型企业高管和业务负责人的调查,描述的是受访样本的组织状态,不是全行业普查。它和“近半数企业因成本撤回 Agent”的二手标题并不完全等价:KPMG 原始页面确认的是部署、成本可见性和治理数据,不能据此写成企业普遍停止使用 Agent。

#05Agent 安全与企业落地

Firebird 启动亚美尼亚 AI 工厂,计划部署超 7 万张 NVIDIA GPU

Firebird 宣布在亚美尼亚 Hrazdan 启动采用 NVIDIA DSX 参考设计的 AI 工厂,并计划到 2027 年底在亚美尼亚部署超过 7 万张 NVIDIA Rubin 与 Blackwell GPU、扩展至 300MW AI 基础设施容量。 公司还称,哈萨克斯坦已成为第二个市场,已落实 125MW 基础设施容量;其跨亚美尼亚、哈萨克斯坦及其他市场的全球规划目标为 2028 年底约 2GW。 这些数字来自 Firebird 新闻稿和 NVIDIA 对项目的介绍,属于项目方规划或发布方口径,不是已经全部上线的现有算力。更确定的节点是:亚美尼亚首座工厂已经举行开幕并进入运营,Perplexity 被列为首批客户之一,NVIDIA 计划投资 Firebird。

Firebird 新闻稿、NVIDIA Blog · 2026-08-08原文
#06本地推理与模型架构

WinterMix 发布 Qwen3.5-122B-A10B 的 3-bit MLX 版本

社区项目 WinterMix 发布了 Qwen3.5-122B-A10B 的原生 MLX 3-bit 构建,发布帖称文件体积约 59 GiB,并在 Hugging Face 提供权重。 作者称,新版本在 20K 以上上下文的困惑度测试中优于其比较的部分量化版本,并报告在 M5 Max 上 MLX 相比 llama.cpp 具有更高预填充速度和约 20% 的 token 生成速度优势。 这是社区量化与单机体验报告,性能来自发布者自己的设备和测试方法,不能当作统一硬件下的独立结论。对本地部署者而言,MLX 与 GGUF 的取舍仍取决于设备、上下文长度、量化版本和推理框架。

Reddit r/LocalLLaMA · 2026-08-10原文
#07本地推理与模型架构

BigBang-v1 发布 35B-A3B Agent 模型与八项基准结果

Endless Frontier 发布 BigBang-v1:这是一个基于 Qwen3.6-35B-A3B 的 Agent 模型,总参数 35B、推理时激活约 3B,并同时公开通用 Agent harness 与评测结果。 GitHub README 列出 BrowseComp、xbench、SWE-Bench Pro、SciCode-V、FrontierScience、HLE、BioMystery 和 PaperBench 等八项评测;其中 BigBang-v1 在发布方表格中列为八项 35B 模型比较的最高报告分数,但部分基准只列了发布方自行测试或可得的比较值。 这不是“35B 全面超过所有前沿模型”的证据:README 明确说明不同评测使用不同 harness,部分闭源模型或指标缺少公开分数,论文仍标注为 coming soon。更稳妥的读法是,它把一个相对小的 Agent 模型、工具 harness 和可下载评测流程放在同一仓库,方便后续复查其基准口径。

Endless Frontier GitHub · 2026-08-10原文
#08本地推理与模型架构

KLQ 用测量到的几何敏感性分配量化比特,代码以 Apache 2.0 开放

开源项目 KLQ 提出一种免训练的几何感知量化方法:先用校准数据分解激活协方差,再沿各方向注入扰动并测量输出分布的 KL 散度,最后按方向分配比特。 项目 README 称,方法研究的是“按模型对方向的敏感性分配比特”,而不是简单把空间整体旋转得更均匀;仓库提供 RTN 与向量量化后端,并以 Apache 2.0 许可证发布。 项目作者明确说明目前没有生产级 kernel,部分展示属于理论框架和量化 demo。README 中的困惑度表是项目自测与引用结果,不能等同于已经完成的通用推理实现;但它提供了一个清晰的研究假设:低比特量化的预算不一定要平均撒在每个方向上。

BalSob107/KLQ GitHub、Reddit r/LocalLLaMA · 2026-08-09/10原文
#09工具调用与量化研究

OoO-Spec 将函数选择和参数槽位预测并行化

论文 OoO-Spec 把工具调用中的函数选择和 schema 定义参数槽位放到请求级并行预测中,报告在 7 个目标模型、3 个基准的贪心 batch-one 条件下,相对自回归解码获得 2.46 倍至 5.34 倍加速,平均值为 3.89 倍。 它让一个 Qwen3-0.6B sidecar 预测语义信息,同时由目标模型继续 ToolSpec 解码;目标模型仍是最终校验与提交方。 结果限于论文设定的模型、基准和解码条件,不能直接等同于生产 Agent 的端到端时延。它针对的是工具调用中函数名和多个参数往往可以提前推断、却被统一按 token 串行生成的瓶颈。

#10工具调用与量化研究

CKA-QAD 用内部表示对齐改进 NVFP4 低比特蒸馏

论文 CKA-QAD 指出,仅让低比特学生模型匹配高精度教师输出,可能掩盖中间层表示退化;作者提出以 CKA 引导的表示对齐作为额外正则项。 摘要称,该方法在 Nemotron 3 Nano 与 Qwen3-4B-Thinking-2507 的 NVFP4 量化蒸馏实验中改善了推理与代码任务的准确性,并增加的训练开销较小。 这项工作仍属于研究验证。真实部署还需要针对模型、硬件、推理 kernel 和任务重新评估蒸馏开销与收益;论文的核心提醒是,输出分布对齐并不必然保证内部计算几何没有漂移。

#11工具调用与量化研究

Ling-3.0-Flash INT4 社区实测在单台 DGX Spark 上提速

社区发布者报告,在单台 DGX Spark 上运行官方 Ling-3.0-Flash INT4 权重时,关闭 --enforce-eager 并开启 MTP 推测解码后,速度从 20.8 tok/s 提升到 38.7 tok/s。 该报告还称,测试通过支持该模型注意力路径的 vLLM 分支运行,并在同一设备上提供 256K 上下文。 数字来自单个社区复现,且转发者明确说明并非本人测得;不同 vLLM 版本、驱动、上下文长度和请求负载都可能改变结果。可复用的信息是:模型能载入不等于已经走在正确的注意力路径上,推理栈版本需要随模型结构一起核对。 ---