返回日报索引

AI DAILY / 2026-06-11

06·11 - AI 午报:DiffusionGemma 开源,Dario 呼吁安全测试

今天的主线是“模型速度”和“监管压力”同时抬头:DeepMind 发布 DiffusionGemma,用扩散式文本生成替代逐 token 自回归;Anthropic CEO Dario Amodei 呼吁对前沿模型做强制第三方安全测试,并配套劳动力市场基金和全国奖学金。商业侧,WSJ 报道 OpenAI 考虑降价,Oracle 云承诺也开始接入 OpenAI 产品;工具侧,FlashMemory-DeepSeek-V4、MiMo Code、River API 和 Pyrecall 分别落在长上下文、编程助手、后训练工具和微调监测上。

11 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01模型与技术

DeepMind 开源 DiffusionGemma:26B MoE 文本扩散模型,H100 上 1000+ t/s

Google DeepMind 发布 DiffusionGemma,首个采用扩散式文本生成的开源大模型,Apache 2.0 许可,在单张 H100 上达到 1000+ tokens/s 推理速度。 DiffusionGemma 的核心创新是用扩散去噪取代逐 token 自回归。传统 LLM 必须从左到右逐个生成 token,而 DiffusionGemma 一次性在 256 token 的「画布」上生成随机噪声,再通过 Uniform State Diffusion 迭代去噪、并行精炼整个文本块。由于所有 token 可同时互相 attend,模型在生成过程中如果置信度下降,会主动注入噪声进行实时自我纠错(Error Correction via Re-Noising)。 模型架构为 Gemma 4 26B MoE,总参数 25.2B,每次推理仅激活 3.8B 参数。量化后可在 18GB VRAM 内运行。官方数据显示:H100 上超过 1000 tokens/s,RTX 5090 上约 700 tokens/s,NVIDIA DGX Spark 上约 150 tokens/s。支持 256K 上下文窗口、原生函数调用、35+ 语言,以及文本/图像/视频多模态输入。 NVIDIA 同步发布了 NVFP4 量化版本 nvidia/diffusiongemma-26B-A4B-it-NVFP4,在 H100 (FP8) 上达到 1100+ tokens/s。模型已集成 Hugging Face Transformers、vLLM 和 Unsloth,开发者可通过 NVIDIA NIM 和 NeMo AutoModel 完成从原型到生产的全流程部署。 Demis Hassabis 在 X 上表示,DiffusionGemma 的推理速度是同类 Gemma 4 模型的 4 倍。

Google DeepMind Blog · 2026-06-10原文
#02模型与技术

FlashMemory-DeepSeek-V4:Lookahead Sparse Attention 将 KV Cache 压缩至 13.5%

FlashMemory-DeepSeek-V4 提出 Lookahead Sparse Attention (LSA) 推理范式,通过可训练的 Neural Memory Indexer 将物理 KV Cache 压缩至全上下文的 13.5%,在 500K 超长上下文下开销降低超 90%。 LSA 的核心思路是在推理时主动预测未来需要的上下文,只保留关键 KV 块而非缓存全部。Neural Memory Indexer 作为轻量级独立模块训练,无需加载大模型即可完成优化。在 LongBench-v2 等评测中,压缩后的平均准确率反而提升 0.6%。该方案采用解耦训练策略,索引器可独立部署和更新。 ---

Reddit r/LocalLLaMA · 2026-06-10原文
#03政策与产业

Anthropic CEO Dario Amodei 呼吁对前沿模型实施强制性第三方测试

Anthropic CEO Dario Amodei 发布新文章《Policy on the AI Exponential》,指出 AI 进展远超政策制定速度,呼吁从「仅要求透明度」转向「强制性第三方测试」,并赋予监管机构阻止或撤销不安全模型部署的权力。 文章主张对前沿模型进行网络、生物和自主性风险测试,认为仅靠公司自愿披露已不足以应对风险。Dario 写道:「长期以来我们主张对前沿 AI 仅要求透明度,因为风险尚不明确到足以精确监管。但现在,这一立场已不再足够。」文章同时探讨了 AI 对就业、经济、科学进步、公民自由和地缘政治的广泛影响。

X @DarioAmodei · 2026-06-10原文
#04政策与产业

Anthropic 发布 2 亿美元劳动力市场基金 + 1.5 亿美元全国奖学金计划

与 Dario 的政策文章同步,Anthropic 宣布三项配套举措:2 亿美元基金用于评估 AI 劳动力市场冲击应对方案,1.5 亿美元全国奖学金计划帮助早期职业人士将 AI 推广至美国各地社区,以及一份面向政府的《先进 AI 框架》。 《先进 AI 框架》提出政府应获得阻止或撤销不安全模型发布的权力,并投资社会韧性以防范灾难性风险。经济政策框架聚焦于如何通过政策管理 AI 对就业的冲击。Dario 承认:「这些项目本身不足以应对高级 AI 的挑战,但它们是未来数月和数年大幅扩展工作的意图信号。」

X @AnthropicAI · 2026-06-10原文
#05政策与产业

WSJ 报道 OpenAI IPO 前考虑大幅降价,与 Anthropic 争夺市场

据《华尔街日报》报道,OpenAI 正考虑对 API 和订阅服务进行大幅降价,以在 IPO 前与 Anthropic 等竞争对手争夺市场份额。 具体降价幅度和生效时间尚未披露,降价可能涉及 GPT-4o 等旗舰模型的调用成本。消息通过 Reddit 和 Linux Do 社区二次传播。若实施,可能引发新一轮 AI 模型服务价格竞争。

华尔街日报 · 2026-06-11原文
#06政策与产业

微软内部禁用 Claude Fable 5,等待安全审查

微软暂停员工对 Anthropic Claude Fable 5 的访问,特别是在 GitHub Copilot 中的集成,等待内部安全审查。 禁用的直接原因是 Anthropic 更新了 Mythos 级模型政策,要求用户提示和生成输出保留 30 天用于安全目的。这是微软限制外部 AI 助手的最新动作,此前已取消大部分 Claude Code 内部许可证。 ---

Reddit r/singularity · 2026-06-10原文
#07产品与生态

Claude Fable 5 上线 Arena Agent Mode;社区演示一键生成多人 3D 游戏

Anthropic 的 Claude Fable 5 模型上线 Arena.ai 的 Agent Mode,用户可免费测试其智能体能力。同时,社区开发者使用 Fable 一次性生成了完整的在线多人 3D 曲棍球游戏,全程在浏览器中运行,消耗 30 万 token,耗时 22 分钟。 此外,Fable 5 在 ZeroBench(高难度视觉基准测试)上 pass@5 指标已追平 GPT 系列模型,但在 pass^5 指标上仍有差距。Anthropic 官方同时澄清:Fable 5 并非永久仅限 API,待容量充足后将恢复为订阅计划的标准内容。

#08产品与生态

小米 MiMo Code V0.1 开源终端编程助手

小米 MiMo 团队发布并开源 MiMo Code V0.1,一款终端原生 AI 编程助手,内置 MiMo Auto 限时免费通道,同时支持接入多家主流 LLM API。 MiMo Code 具备代码读写、命令执行、Git 管理及持久化记忆功能。同步推出的 MiMo V2.5 多模态模型限时免费,支持百万 token 上下文窗口。项目已在 GitHub 开源。

#09产品与生态

OpenAI 支持通过 Oracle 云承诺访问模型和 Codex

OpenAI 宣布企业客户可通过 Oracle Cloud Infrastructure 的既有云承诺访问 OpenAI 模型和 Codex。 OpenAI 官方博客称,这一合作面向已有 OCI 云承诺的企业客户,目的是减少额外采购流程,让企业在现有 Oracle 云预算内使用 OpenAI 产品。访问该页面时可能遇到 Cloudflare 拦截;Greg Brockman 也在 X 上转发了同一入口。

#10产品与生态

Codex token 消耗量 48 小时内异常激增

社区开发者 Tibo 注意到,OpenAI Codex 在过去 48 小时内 token 消耗量出现异常激增,而 OpenAI 在此期间未发布任何新产品或更新。 这条更适合作为产品线索处理。OpenAI 官方尚未回应,异常消耗可能来自内部测试、产品集成或服务侧变化,目前没有足够材料判断具体原因。

#11产品与生态

GPT 土耳其区低价订阅结束

OpenAI 停止土耳其区的 ChatGPT Plus 低价订阅服务。此前土区 Plus 月费约 10 美元,远低于美区 20 美元。多个用户确认订阅失败。 ---