返回日报索引

AI DAILY / 2026-06-17

06·17 - AI 午报:GLM-5.2 开源即登顶,Blackwell MLPerf 全胜

今天是开源模型和工程基础设施一起抬头:智谱 GLM-5.2 以 MIT 许可开源,Terminal-Bench 突破 80%;NVIDIA Blackwell 在 MLPerf Training 6.0 全胜,并继续把 AI Agent、金融基础模型和端侧游戏角色工具铺到应用层。产品侧,Android 17 扩展 Gemini 能力,Grok Imagine Video 1.5 降低视频生成等待时间,DeepMind 与英国政府合作尝试用 AI 缩短住房规划审批。产业消息里,Cursor 收购传闻和 OpenAI Q1 成本讨论仍值得关注,但都需要继续等待更权威确认。

13 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01模型与开源

GLM-5.2 正式开源:MIT 许可,Terminal-Bench 首破 80%

智谱 AI 于 6 月 16 日正式开源 GLM-5.2 模型权重,采用 MIT 许可。该模型在编码和代理任务上取得显著改进,支持 1M 上下文窗口,提供 Max 和 High 两种推理努力级别,API 定价与 GLM-5.1 相同(输入 $1.4/百万 token,输出 $4.4/百万 token)。 GLM-5.2 是首个在 Terminal-Bench 上突破 80% 准确率的开源权重模型(得分 81.0),超越所有其他开源模型。其他基准:SWE-bench Pro 62.1,FrontierSWE 74.4,WebDev Arena 排名第 2,Design Arena 排名第 1。在 Code Arena: Frontend 排名第 2,在更广泛的 Arena 排名中位列前沿。 发布当天,vLLM v0.23.0、Ollama、HuggingFace、DeepInfra、Fireworks、Together Compute、Baseten、Nebius、Novita、Notion、Vercel AI Gateway、ModelScope 等超过 15 个平台宣布 Day 0 支持。Trae CN 和 Friendli 也已完成集成。

#02模型与开源

Grok Imagine Video 1.5 发布:720p 渲染降至 25 秒

xAI 发布 Grok Imagine Video 1.5,新的图像转视频模型在真实感、物理模拟和生成速度上均有提升。720p 视频渲染时间从上一代的 40 秒以上降至约 25 秒。面向消费者的 Video 1.5 Fast 版本同步推出,API 已全面可用。 官方 X 账号展示了从静态图像生成的动态视频示例。此次更新延续 xAI 在生成式 AI 领域的迭代节奏,但具体技术细节和基准测试尚未公开。

#03模型与开源

社区发现 DeepSeek V4.1 灰度测试迹象

Linux Do 社区用户观察到 DeepSeek 模型出现多项变化:知识库截止时间更新至 2026 年 5 月,思维链风格转向结构化 Markdown,服务状态在 6 月 16 日略有下降。这些迹象暗示 DeepSeek V4.1 可能已进入灰度测试阶段,或于 6 月正式发布。目前仅来自用户观察,无官方确认。

#04模型与开源

Mistral 预告 7 月发布新开源模型家族

Mistral AI 联合创始人 Arthur Mensch 在 X 平台宣布,公司计划于 2026 年 7 月发布新一代开源权重模型系列。这延续了 Mistral 在开源大模型领域的布局。当前未公布具体参数、架构或性能数据。 ---

Reddit r/LocalLLaMA · 2026-06-16原文
#05产品与应用

Android 17 正式发布:Gemini、多任务和跨生态分享能力扩展

Google 于 6 月 16 日正式发布 Android 17 和 Wear OS 7,率先推送至 Pixel 设备。新系统引入“气泡栏”多任务界面、同框录制、折叠游戏模式等功能,并继续把 Gemini 能力前置到系统体验中。 AI 功能方面,素材显示 Android 17 集成了音乐生成模型 Lyria 3、多模态 Gemini Omni 和 AudioLM 语音翻译等能力。Quick Share 与苹果 AirDrop 的兼容也被列为本次更新重点。Wear OS 7 则加入紧急检测、个性化表盘生成,并宣称续航提升约 10%。当前来源为社区转载信息,具体功能范围仍应以 Google 官方发布说明为准。

#06产品与应用

DeepMind 与英国政府合作,用 AI 加速住房规划审批

Google DeepMind 与英国政府合作开发 AI 原型系统,目标是加速住房规划审批流程。该系统计划分析规划申请、自动生成摘要和初步评估,把过去可能持续数月的审批周期压缩到数周量级。 这类应用不是直接面向消费者的模型发布,而是把 AI 放进政府和城市治理的流程环节。当前公开信息仍以合作方向和原型目标为主,具体部署时间表、地方政府覆盖范围和人工复核机制尚未完全披露。

Google DeepMind Blog · 2026-06-16原文
#07产品与应用

SpaceX 收购 AI 编程工具 Cursor

据 Linux Do 论坛消息,AI 编程工具 Cursor 确认被 SpaceX 以 600 亿美元价格收购。消息仅来自单一论坛帖,缺乏官方公告或权威媒体报道。 若属实,这将是 SpaceX 首次涉足 AI 开发工具领域。Cursor 是当前增长最快的 AI 编程 IDE 之一,拥有数百万开发者用户。目前 Cursor 和 SpaceX 均未发布官方声明。

#08产品与应用

OpenAI 2026 Q1 烧掉 37 亿美元

据 Linux Do 社区讨论,OpenAI 在 2026 年第一季度消耗 37 亿美元,该数字接近部分国产大模型公司的估值。此信息来自论坛帖,OpenAI 未发布 Q1 2026 正式财报,但此前 OpenAI 在 2025 年已披露年化运营成本超 50 亿美元,2026 年随着 GPT-5 系列部署和算力扩展,成本持续攀升符合预期。

#09产品与应用

智谱股价因 Anthropic 出口管制涨 33%

受 Anthropic 对中国出口限制消息影响,华尔街提高对中国 AI 公司的押注,智谱 AI 股价飙升 33%。Reddit 社区讨论认为,美国 AI 公司对华限制正加速中国本土开源模型的替代需求,GLM-5.2 同日开源进一步放大了这一叙事。 ---

Reddit r/LocalLLaMA · 2026-06-16原文
#10工程与基础设施

NVIDIA Blackwell MLPerf Training 6.0 全胜

NVIDIA 在 MLPerf Training v6.0 中实现全胜,在所有基准测试中取得最快训练时间和最高每加速器性能,是唯一提交所有测试的平台。 新引入的 DeepSeek-V3 671B MoE 基准测试中,NVIDIA GB300 NVL72 系统在 8192 块 Blackwell Ultra GPU 上以 2.02 分钟完成训练;GPT-OSS-20B 基准以 7.43 分钟完成。软件创新包括首次为无 token 丢弃 MoE 实现全迭代 CUDA 图、CuTe DSL 内核融合、MXFP8 注意力模块、路由器优化和近 100% 全到全通信重叠。 三个月内 DeepSeek-V3 训练吞吐量从 1298 TFLOPS/GPU 提升至 1648 TFLOPS/GPU(1.3 倍),无需硬件改动。Blackwell Ultra GB300 相比 GB200 性能提升 1.3–1.6 倍。

NVIDIA Developer Blog · 2026-06-16原文
#11工程与基础设施

NVIDIA 推出多项 AI 应用基础设施:交易基础模型、XR AI Agent 与 ACE Game Agent SDK

NVIDIA 同日发布多篇面向应用开发者的技术内容,重点从训练性能延伸到行业和端侧场景。 金融方向,NVIDIA 提出企业可基于交易序列构建 Transaction Foundation Model,用 Transformer 捕捉账户、支付和交易行为模式,服务欺诈检测、客户画像和金融智能分析。XR 方向,NVIDIA XR AI 面向 AR 眼镜和 XR 设备,把摄像头、麦克风、多模态模型、企业数据和工具调用接入同一 Agent 开发框架。游戏方向,ACE Game Agent SDK 与 Unreal Engine 5 插件支持在设备端构建 AI 游戏角色,把推理更多放到本地 GPU,以降低延迟并保护用户交互数据。 这些更新不是单一爆款产品,而是 NVIDIA 把 Blackwell、RTX 和软件栈继续包装成行业 AI 基础设施的信号。

NVIDIA Developer Blog · 2026-06-16原文
#12工程与基础设施

Anthropic 发布 Claude Code 职业与任务价值分析

Anthropic 发布了两项 Claude Code 使用数据分析。 职业成功率对比研究显示,在"可验证证据证明目标完成"的严格标准下,所有职业领域的成功率与软件工程领域的差距均在 7 个百分点以内。非软件工程职业(数据科学、产品管理、运维等)使用 Claude Code 完成任务的成功率与专业软件工程师相当。 任务价值增长数据显示,2025 年 10 月至 2026 年 4 月期间,Claude Code 每会话任务的平均货币价值增长 27%。该价值通过与自由职业市场上同类任务的成本对比得出。

X @Anthropic · 2026-06-16
#13工程与基础设施

OpenAI 讨论部署模拟与评估方法,Codex 在欧洲扩展功能

OpenAI 同日围绕评估方法和产品可用范围发布多条动态。评估侧,OpenAI 提到 Deployment Simulation 可用代表性生产数据模拟真实部署中的行为分布,用来补充传统评估和红队测试,帮助估计不良行为在现实使用中的发生频率。OpenAI 也讨论了公开 WildChat 数据集在外部评估场景中的近似价值,并强调当前基准测试容易饱和或被博弈,需要更能预测模型进展的方法。 产品侧,OpenAI Developers 账号表示 Codex 本周在欧洲扩大可用范围,包括 Computer use、Codex Chrome 扩展和个性化体验。由于这些信息主要来自 X 官方账号,具体国家范围、套餐限制和功能灰度节奏仍需以后续文档为准。 ---