#01 华为 HDC 2026
华为开源盘古 2.0 华为在 HDC 2026(6 月 12-14 日,东莞)发布开源盘古 openPangu 2.0 大模型,包含两个版本: - openPangu 2.0 Pro:总参数量 5050 亿(505B),激活参数量 180 亿 - openPangu 2.0 Flash:总参数量 920 亿(920B),激活参数量 60 亿 华为常务董事余承东在发布会上解释了为什么盘古没有万亿级参数模型:华为把昇腾算力大量支持了国内企业需求,自己留的卡数量有限;同时几百 B 参数的模型在推理吞吐率和时延上更高效,成本更低。他透露,如果算力充足,华为也会训练更大模型再做蒸馏。 openPangu 计划 6 月 30 日将七大组件陆续开源——比业界通行的四项(模型结构、权重、技术报告、推理代码)多出三项:预训练代码、后训练代码和训推算子。模型针对昇腾算力做了专门优化,单卡吞吐率领先业界主流模型。 余承东去年 9 月被任命为华为 IRB(产品投资评审委员会)主任,核心任务是带领华为在 AI 领域取得全球领先地位。他曾在 2021 年 4 月代表华为云发布了国内第一个大模型。此次重新负责盘古团队,他表态"字典里没有第二,只有第一",并预告今年秋天 30B 参数的端侧盘古大模型将在麒麟芯片上运行,端侧吞吐率有 5 倍以上提升。 ---
#02 管制与封禁
Fable 5/Mythos 5 遭出口管制紧急叫停 美国政府引用国家安全授权,发布出口管制指令,暂停所有外国国民对 Fable 5 和 Mythos 5 模型的访问权限——无论是在美国境内还是境外。指令涵盖 Anthropic 的外籍员工,实际上冻结了公司的全球研发协作。 Anthropic 于 6 月 12 日发布官方声明确认此事。Fable 5 于 6 月 9 日发布,是 Mythos 的公开版本。发布时 Anthropic 在网络安全和生物学话题上设置了显式护栏,且悄悄削弱了 LLM 创建能力。后者在公众抗议后于 6 月 11 日被撤回。 Ben Thompson 在 Stratechery 分析指出,Anthropic 的信念与商业融合策略使其在与美国政府的对峙中陷入困境,但 Fable 5 本身的能力仍令人印象深刻。 出口管制指令的具体范围和持续时间尚未公布。目前 Fable 5 和 Mythos 5 的 API 访问已在全球范围内暂停。
Anthropic 官方声明、Stratechery、X/Twitter 原文 #03 管制与封禁
社区呼吁本地模型不可替代 Reddit r/LocalLLaMA 社区反应强烈。一条热帖标题直言:"API 是租的,本地权重才是永久的。"评论指出,集中式 API 可以被单一政府法令在瞬间全球关闭——仅仅因为有人发现可以让模型修复代码漏洞。 社区将此事件与更广泛的 AI 主权讨论联系起来:当云端模型访问权受制于企业合规和政府决策时,用户数据和算力访问随时可能被切断。多条帖子呼吁转向本地部署和开源权重模型。 同时有社区成员指出,本地大模型的硬件门槛也在升高——"本地 LLM 已经不够民主了"的讨论同样引发共鸣。
#04 管制与封禁
Siri AI 在 WWDC 2026 低调亮相 苹果在 WWDC 2026 上展示了可用的 Siri AI。演示速度很慢,慢到不可能是假的——这和两年前仅展示概念的风格截然不同。Siri AI 不惊艳,但功能扎实,由工程主管 Mike Rockwell(现同时负责 Siri)主讲。 Ben Thompson 评论称,Tim Cook 作为 CEO 的最后一次 WWDC,很大程度上是在清理苹果两年前制造的混乱。可用的 AI 功能叠加 iPhone 的全部优势,足以让苹果在新一代计算中保持中心地位。 ---
#05 开源模型发布
MiniMax M3 开源权重上线 MiniMax 于 6 月 12 日正式开放 M3 模型权重,可通过 Hugging Face 获取。M3 于 6 月 1 日首次发布时仅提供 API 访问,此次开源兑现了"10 天内开源权重"的承诺。模型采用 MoE 架构,总参数量 428B,激活参数约 23B,原生支持文本、图像、视频输入,上下文窗口 1M token。 开源当日,MiniMax 首席技术官闫俊杰在 X 平台表示团队正在讨论什么参数规模最适合社区——M3 系列还有"更大的版本即将到来"。同日 M3 上线 Modular、Fireworks AI、Together Compute、Baseten、GMI、Parasail、Novita 等多个推理平台。
#06 开源模型发布
M3 推理生态 Day-0 就绪 M3 开源权重上线当日,推理生态同步就绪。核心进展: - vLLM 项目推出专用 MSA 预填充/解码内核,支持 1M 上下文长度,含前缀缓存和分块预填充 - BF16 和 MXFP8 精度在 Hopper 和 Blackwell 架构上均可运行,经 NVIDIA 和 AMD GPU 验证 - MiniMax Sparse Attention 通过预过滤机制将 KV 缓存访问速度提升 4 倍以上。在 1M 上下文下,每 token 计算成本降至上一代 M2 的 1/20,预填充速度提升 9 倍,解码速度提升 15 倍 - NVIDIA Dynamo 分离式推理在 32k 输入长度下将交互性提升 4 倍 - 模型支持 TensorRT LLM、SGLang、vLLM 等主流开源推理框架 MiniMax 还提供了免费 GPU 加速推理端点供开发者体验。
#07 开源模型发布
MiMo-V2.5-Pro-UltraSpeed 速度突破 1000 tok/s MIMO 推出万亿参数旗舰模型 MiMo-V2.5-Pro-UltraSpeed,宣称最高推理速度突破 1000 tokens/s。用户在 linux.do 上实测:生成一张复杂天气卡片,UltraSpeed 版本仅用 24.8 秒,而普通版需要 543 秒——速度提升约 22 倍。 三倍价差换来数量级的速度提升,测试者形容"由奢入俭难"。该测试基于单一提示词,普通版可能受负载影响掉速,更多基准验证仍需等待。 ---
#08 评测与基准
NVIDIA 在首个 Agentic 编码基准中领先 Artificial Analysis 推出业界首个多厂商开放基准测试 AA-AgentPerf,专门测量推理系统在真实智能体编码轨迹下的并发支持能力。 NVIDIA 公布的结果:GB300 NVL72 在每兆瓦并发智能体数上达到 H200 的 20 倍。关键优化包括 WideEP/DeepEP、DeepGEMM、融合 MoE 和 NVLink 扩展。即将推出的 Vera Rubin 平台将借助 50 PFLOPs NVFP4 算力和 Vera CPU 加速工具调用。 智能体编码的工作负载与传统推理负载截然不同——不再是简单的单次请求-响应,而是包含工具调用、多轮推理和上下文累积的复杂轨迹。AA-AgentPerf 基准填补了这一评测空白。
#09 评测与基准
DiffusionGemma 快 4 倍但错误多 6 倍 社区开发者在单张 H100(FP8)上对 Google 的 DiffusionGemma 26B A4B 和自回归版 Gemma4 进行对比测试。三个任务:Steve Jobs 传记、Tetris 历史、BeOS 故事——主题热门程度依次递减。 结果: - DiffusionGemma:763 tok/s,正确 33 条事实,错误 28 条 - Gemma4:218 tok/s,正确 45 条事实,错误 5 条 错误率与主题冷门程度高度相关:Jobs 传记错 4 条,Tetris 错 12 条,BeOS 错 12 条。具体错误包括:将 Steve Jobs 的母亲杜撰为 "Clara Clley"、为 Pajitnov 虚构同事 "Geri Gulovik"、将 BeBox 价格虚标为 $9,999(实际 $1,600)。 原因在于扩散模型一次性生成 256 个 token 后多轮润色,优先追求文本流畅性而非事实正确性。Google 在发布帖中也承认质量较低,推荐在事实敏感场景使用常规 Gemma4。
#10 评测与基准
Kimi K2.7 Code 社区横向评测 linux.do 开发者使用 Unity C# 皮肤系统代码生成任务对四款模型进行横向评测: | 模型 | 耗时 | Token 消耗 | 结果 | |------|------|-----------|------| | Composer 2.5 | 3 分钟 | 未披露 | Tier 1,代码可编译,完成度极高 | | Kimi K2.7 Code | 39 分钟 | 26.1M(约 ¥40) | Tier 1,两次上下文压缩 | | Grok 4.3 | — | — | Tier 3,无法编译 | | Grok Build 0.1 | — | — | Tier 3,无法编译 | Composer 2.5 表现超越 Kimi K2.6,被评为本次评测最优。Kimi K2.7 Code 虽然同样达到 Tier 1 完成度,但成本高昂且因上下文压缩影响了效率。 评测基于单一 Unity 项目,结果不代表通用编程能力。 ---
#11 前沿研究
全球首批工作核钟问世 清华大学黄北辰团队与维也纳量子科学与技术中心 Luca Toscani De Col 团队独立研制出全球首批工作核钟,利用钍-229 原子核能级跃迁计时。 传统原子钟基于原子外层电子跃迁计时,而核钟利用原子核内部的能级跃迁。钍-229 拥有激光可及的低能核跃迁(约 8.4 eV),是核钟的理想候选同位素。两个团队的方案不同但有互补性:清华团队建立了基于核跃迁的反馈环路,维也纳团队实现了光学核钟的连续运行。 精度有望超越当前最佳光学原子钟,为超精密测量、基础物理常数检验和深空导航带来变革。相关成果已发表于 arXiv。 ---