返回日报索引

AI DAILY / 2026-06-29

06·29 - AI 午报:Gemini 3.5 Pro 泄露,Wan-Streamer 端到端音视频模型发布

今天的信号集中在模型发布节奏和基础设施博弈两条线上。模型侧,Google Gemini 3.5 Pro 的泄露视频在 YouTube 出现,社区认为极大概率真实;Musk 确认 Grok 4.5 已入内测,声称接近或超越 Opus;阿里发布 Wan-Streamer v0.1,在单个 Transformer 内实现 200ms 级端到端实时音视频交互。企业侧,HP 与 OpenAI 建立 Frontier 战略合作,Google 因算力短缺限制 Meta 使用 Gemini,奥地利则正式呼吁欧盟托管 Anthropic,地缘博弈从模型能力延伸到基础设施主权。

12 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01模型与新发布

YouTube 出现 Gemini 3.5 Pro 泄露视频

YouTube 上出现一段疑似 Google Gemini 3.5 Pro 的演示视频,社区判断极大概率为真实。 视频内容展示了模型的对话和推理能力。Google 有向 LMSYS 竞技场匿名提交模型的惯例,这与泄露特征吻合。 该模型上月曾因性能不足被推迟发布。社区中较为理性的评价指出:目前唯一确定的事实是 3.5 Pro 上月因不够好而被推迟,最终表现仍需等正式发布后验证。 参考资料:https://linux.do/t/topic/2491478

linux.do 论坛 · 2026-06-29
#02模型与新发布

Musk 确认 Grok 4.5 入内测,预告月更节奏

Musk 在 X 平台确认 Grok 4.5 已在 SpaceX 和 Tesla 开始内测,并预告今年每月发布一个全新从头训练的模型。 Grok 4.5 基于 1.5T 参数的 V9 foundation model 训练,补充训练阶段加入了 Cursor 数据。Musk 称早期评估显示性能接近甚至可能超过 Opus,强化学习仍在持续提升模型表现。 此外,Musk 还透露 Grok v9 基础模型将是一款"可靠的日常工作马",与 Opus 处于同一级别,xAI/SpaceXAI 的模型和训练框架改进节奏正在显著加快。 参考资料:https://x.com/elonmusk/status/2071184354756477041 参考资料:https://x.com/i/web/status/2071323738201837785

X @elonmusk · 2026-06-28
#03模型与新发布

阿里发布 Wan-Streamer v0.1,端到端实时音视频交互

阿里 Wan 团队发布 Wan-Streamer v0.1,在单个 Transformer 内实现原生流式、全双工的音视频交互。 模型将文本、音频与视频的输入输出统一交织建模,摒弃了外接 ASR、TTS 等拼接模块。模型端响应延迟约 200 毫秒,整体交互延迟约 550 毫秒,支持持续感知输入的全双工通信与同步视频输出。 当前 v0.1 版本视频分辨率为 192p,官方称其为开源领域内唯一能在一秒内端到端输出同步音视频的模型。论文发表于 arxiv,模型权重尚未公布。 论文:https://arxiv.org/abs/2606.25041

阿里 Wan 团队 · arxiv · 2026-06-29原文
#04模型与新发布

社区发现 GPT-5.6 灰度检测方法

Linux Do 社区用户发现一种通过 Codex CLI 检测 GPT-5.6 灰度状态的方法。 运行 /status 命令查看默认上下文长度,若为 353k 则可能已灰度到 GPT-5.6,灰度账号的 juice 值为 128。该方法基于土耳其区老 Plus 账号与新 Codex 账号的对照测试,作者承认结果可能受 Plus 账号自身上下文增大影响。 参考资料:https://linux.do/t/topic/2491689 ---

linux.do 论坛 · 2026-06-29
#05企业与合作

HP 与 OpenAI 建立 Frontier 战略合作

HP Inc. 宣布与 OpenAI 建立 Frontier 战略合作伙伴关系,计划将 OpenAI 的 AI 技术部署到客户体验、软件开发和企业运营中。 合作涉及利用 OpenAI 的前沿模型提升 HP 产品和服务智能化水平,但具体合作细节、部署规模和时间表尚未披露。此前 HP 已推出多款 AI PC 产品线,此次合作是其 AI 战略的进一步延伸。

#06企业与合作

Google 算力短缺限制 Meta 使用 Gemini

据路透社报道,Google 因算力短缺限制了 Meta 对 Gemini AI 模型的使用。 Google 约在三月告知 Meta 无法满足其全部 Gemini 算力采购需求,导致部分 Meta 内部 AI 项目中断和推迟。报道称其他几家 Google 客户也受到较小程度影响,Meta 因需求规模异常庞大受冲击最大。 目前报道源自知情人士,Google 和 Meta 均未公开回应。该事件反映了前沿模型 API 供应侧的算力瓶颈正在影响大型企业客户的 AI 部署计划。

#07企业与合作

奥地利正式呼吁欧盟境内托管 Anthropic

奥地利数字化国务秘书致信欧盟技术委员,提议在欧盟境内战略性地建立并参与托管 Anthropic。 公开信强调,确保欧洲不被排除在重大创新之外至关重要,欧盟具备相应的法律确定性、市场准入和资本。公开信直接回应了美国限制非美国人使用 Anthropic 最先进模型的举措。Anthropic 尚未回应奥地利的提议,具体实施路径和可行性仍有待观察。 ---

Reuters · Bloomberg · 2026-06-28原文
#08开源与社区

GLM-5.2 NVFP4 量化在 4x DGX Spark 上实现 128K 推理

开发者成功在 4 台 NVIDIA DGX Spark(GB10)上运行 GLM-5.2 NVFP4 量化模型,实现 128K 上下文推理。 通过 NVFP4 量化将模型从 1.5TB 压缩至 410GB(约 3.7 倍),GSM8K 精度损失约 2 个点。采用 DCP4(解码上下文并行)和 MTP1(多 token 预测)技术,短提示代码生成约 14.5-15.2 tok/s,长上下文(32K-112K)解码约 13 tok/s。 对比 M3 Ultra 512GB,DGX Spark 在长上下文场景下性能更优,而 M3 Ultra 因缺乏 MLA 内核支持,长上下文解码速度严重下降。该方案需大量系统优化,包括精简 Ray 配置和禁用无关服务,目前仍属实验性质。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1uidtb8/highqualityglm52quanton4xdgxsparkguide

Reddit r/LocalLLaMA · 2026-06-29
#09开源与社区

Ornith-1.0-35B 原生 MTP 推测解码提速 1.3 倍

开发者为 Ornith-1.0-35B 模型在 llama.cpp 中实现原生 MTP 推测解码,单流解码速度提升 1.3-1.35 倍。 将 IQ4XS 量化体与 Q6 draft head 结合,在单张 RTX PRO 6000 Blackwell GPU 上单流解码从 172.6 tok/s 提升至 233.8 tok/s。新量化 IQ4XS-MTP graft 在 KLD 指标上优于原版,后续将支持 MTP-2 draft。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1ui4yn6/ornith1035bggufupdatenativemtp

Reddit r/LocalLLaMA · 2026-06-29
#10开源与社区

Qwen 3.5 4B 通过专用 Agent 框架管理远程服务器

开发者构建了针对小模型的专用 Agent Harness,成功让 Qwen 3.5 4B 管理远程服务器。 该框架针对小模型常见失败模式(工具调用失败、环境变量验证差、生成中断、状态追踪弱等)进行了专项优化,项目代码已在 GitHub 公开。该实验展示了 4B 级别小模型在系统管理任务中的可行性。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1uicweb/ibuiltanagentharnessforsmallmodels ---

Reddit r/LocalLLaMA · GitHub · 2026-06-29
#11产品与安全

OpenAI Codex 彻查用量异常,已重置全员额度

OpenAI Codex 负责人 Tibo 宣布,已对所有用户的使用限制执行了一次硬性重置。 团队于周日进入"作战室"模式逐条排查日志,确认是否存在导致部分用户使用量加速消耗的原因。重置前几小时刚用过重置机会且未用完额度的用户,调查结束后将获得额外手动重置机会。 此前已有多位用户反馈 Codex 使用量异常消耗问题,此次团队采取全员重置措施以缓解用户影响。 参考资料:https://x.com/thsottiaux/status/2071383430634344902

X @thsottiaux · 2026-06-29
#12产品与安全

Claude 近期发生大规模封号

多个社区反馈 Claude 近期出现大规模封号,波及免费账户和付费订阅用户。 封号范围不限于中文用户——美国用户使用美国银行发行的 BOA 美卡订阅的账号同样被无预警封禁。被波及用户反映 Claude Code 出现 "API Error: 400 This organization has been disabled" 报错,但 Web 端仍能正常打开。 部分用户推测风控模型升级,可能通过时区、语言、聊天内容建立用户画像。Anthropic 官方尚未回应封号原因,社区反馈称受影响的用户可尝试改用英文交流或调整时区设定。 参考资料:https://linux.do/t/topic/2492592 参考资料:https://linux.do/t/topic/2491573 ---