返回日报索引

AI DAILY / 2026-06-09

06·09 - AI 午报:苹果Siri AI 亮相 WWDC · 小米 MiMo 推理破千 t/s · Chrome AI 漏洞修复创纪录

今天三条主线:苹果在 WWDC 2026 发布下一代 Siri AI 与 Apple Intelligence,但首日演示反响低于预期,社区普遍感到落差。小米与 TileRT 合作在 8 块商用 GPU 上实现万亿参数模型 1000+ t/s 推理,向专用芯片发起性价比挑战。Chrome 149 单版本修复 429 个安全漏洞,创历史纪录,AI 自动化漏洞发现正在改变安全攻防范式。NVIDIA 发布 NVFP4 精度格式与 Nemotron 3 Ultra Agent 模型,基础设施层持续演进。

15 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01模型与产品

苹果 WWDC 2026 发布 Siri AI 与新一代 Apple Intelligence

苹果在 WWDC 2026 上推出全新 Siri AI 和新一代 Apple Intelligence。新 Siri 基于大语言模型,支持更自然的对话、跨应用操作和个性化上下文理解。Apple Intelligence 深度集成到 iOS 27、macOS 和 visionOS 中,提供 AI 写作助手、图像生成和智能摘要等功能。 首日演示后,社区和投资者反馈普遍低于预期。论坛用户指出演示与宣传存在明显差距,国行 iPhone 升级 iOS 27 后 Apple Intelligence 仍无法使用。具体发布时间和硬件要求尚未公布。

Reddit r/singularity · 2026-06-08原文
#02模型与产品

Google NotebookLM 重大更新:切换 Gemini 3.5,输出格式扩展至 12 种

Google 为 NotebookLM 推出重大更新。底层模型全面切换至 Gemini 3.5 并引入 Antigravity 技术,内部五大评测维度平均胜率超 65%,其中高级网页研究胜率达 78.2%。新增推理步骤展示功能,输出格式扩展至 PNG、SVG、PDF、DOCX、Markdown、JSON、CSV、XLSX、PPTX 等 12 种,支持跨语言指令与结果生成,并可在项目初期主动发掘信息源。 更新面向 Google AI Ultra 订阅用户及 Workspace 企业客户开放,普通用户推广时间表未公布。

#03模型与产品

Chrome 149 单版本修复 429 个安全漏洞,AI 自动化筛查成主因

Chrome 149 修复了 429 个安全漏洞,创下单个版本修复数量纪录。其中仅约四分之一来自外部安全研究人员,其余大概率由 AI 模型(如 Mythos)自动化发现与修复。此前一个月 Chrome 已修复 110 个漏洞,为当时纪录。连续两月刷新纪录,表明具备高级推理能力的 AI 正在快速改变软件安全维护模式。

Reddit r/singularity · 2026-06-08原文
#04模型与产品

JetBrains 发布 Mellum 2:12B MoE 模型,本地推理 111 t/s

JetBrains 发布 Mellum 2,12B 总参数、2.5B 激活参数的 MoE 架构模型。在 AMD RX 7900 XT 上通过 Vulkan 后端实现 111.2 t/s 生成速度,130K 上下文下不低于 100 t/s。社区测试显示其在工具调用任务上超越 Gemma 4-12B 和 GPT-OSS-20B,生成速度约为 Qwen3.5-9B 的 3.7 倍。该模型在 llama.cpp 上运行,支持 131K 上下文,采用 bf16 KV 缓存。

Reddit r/LocalLLaMA · 2026-06-09原文
#05模型与产品

Claude Fable 5 现身 Azure 后端,疑为 Mythos 5 公开版

Reddit 用户发现 Azure 后端出现名为「Claude Fable 5」的模型,推测其为 Anthropic 即将发布的 Claude Mythos 5 的公开版本。此外也有用户报告 Mythos 5 已出现在 Web UI 中。目前仅来自社交媒体帖子,无官方确认或技术细节。 ---

Reddit r/singularity · 2026-06-09原文
#06推理与基础设施

小米 MiMo V2.5-Pro:8 块商用 GPU 实现万亿参数 1000+ t/s 推理

小米与 TileRT 团队合作,通过 FP4 量化、QAT、DFlash 投机解码和 TileRT 延迟优化内核,在 8 块普通 GPU 集群上实现万亿参数模型 MiMo V2.5-Pro 每秒 1000+ tokens 的推理速度。该方案不依赖 Groq 或 Cerebras 等专用芯片,仅用商用 GPU 即达到此前需专用硬件才能实现的性能。优化后的模型已通过 API 提供,价格为普通 API 的 3 倍,需申请访问权限。

Reddit r/singularity · 2026-06-08原文
#07推理与基础设施

NVIDIA 发布 NVFP4 精度格式:Blackwell GPU 训练加速约 20%

NVIDIA 发布 NVFP4 精度格式,结合 JAX 和 MaxText 在 Blackwell GPU 上实现大模型预训练加速。NVFP4 是一种 4 位浮点格式,专为低比特混合精度训练设计。初步测试显示使用 NVFP4 可将训练步时间缩短约 20%,对于千卡规模、万亿 token 的训练任务可节省数天时间和大量算力成本。该技术目前通过 NVIDIA 的 JAX 和 MaxText 框架提供支持,尚未开源。

NVIDIA Developer Blog · 2026-06-08原文
#08推理与基础设施

NVIDIA Nemotron 3 Ultra:专为长运行 Agent 设计的推理模型

NVIDIA 发布 Nemotron 3 Ultra,专为长运行代理设计的模型,支持多轮推理、工具调用和子代理协作,同时优化 token 效率。该模型针对多代理工作流中 token 数量快速增长的问题,提升复杂任务执行的速度和成本效益。可应用于自动化工作流、代码生成等场景。

NVIDIA Developer Blog · 2026-06-08原文
#09推理与基础设施

社区实测 DeepSeek v4 Flash on Hopper 达 193 tok/s

Reddit 用户通过使用 Canada-Quant 量化模型和修补 vLLM 的 MTP 代码,在 NVIDIA Hopper 系统上实现 DeepSeek v4 Flash 推理速度达 193 tok/s,4 并发线程下可达约 400 tok/s。但用户也指出电力成本高于 API 调用费用。优化方法来自博客文章,尚未经第三方验证。 ---

Reddit r/LocalLLaMA · 2026-06-08原文
#10评测与基准

Cognition 发布 FrontierCode 编程评测,顶级模型通过率不足 30%

Cognition AI 发布 FrontierCode,一个包含 1000 道高难度编程题的评估基准,覆盖算法、数据结构、系统设计等。要求模型生成可执行代码并通过隐藏测试。当前最强模型通过率不足 30%,揭示了大模型在复杂编程任务上的短板。

Reddit r/singularity · 2026-06-08原文
#11评测与基准

GPT-5.5 heavy 新高考数学 I 卷满分,最快 6 分 44 秒

社区评测显示 GPT-5.5 heavy 在一次性输入新高考数学 I 卷的测试中,4 次均获满分 150 分,最快仅用 6 分 44 秒。GPT-5.2 Pro extended、GPT-5.4 heavy 和 Gemini DeepThink 均取得 146–150 分。Qwen 3.7 Max 最高 146 分。测试采用一次性发送全部试题,考验长上下文推理能力,评分由双 GPT-5.5 Pro 完成。测试方法、样本量和评分一致性仍需验证。

#12评测与基准

Qwen3.6-35B-A3B 工具调用基准:ByteShape 与 Unsloth GGUF 对比

社区对 Qwen3.6-35B-A3B 进行大规模工具调用基准测试,在 V100 GPU 集群上完成 144 次运行。ByteShape GPU-5(18.0 GB)平均总分最高(146.8/168),长上下文场景表现突出。f16 与 q80 的 KV 缓存量化性能几乎无差异,q40 仅下降约 1 分。长上下文(122k tokens 填充)使所有配置得分下降约 10 分。ByteShape 与 Unsloth 量化间无明确胜者,模型大小与得分弱相关。 ---

Reddit r/LocalLLaMA · 2026-06-08原文
#13Agent 与开源

LEVI:基于 Qwen 30B 的 AlphaEvolve 搜索系统,成本降 35 倍

开发者发布开源系统 LEVI,以 AlphaEvolve 为蓝本,在代码优化和提示优化任务中成本降低最高 35 倍,评估次数减少最多 12 倍。LEVI 通过维护解多样性、智能路由大小模型、代理子集近似评分三大机制,在 ADRS 系统基准测试中超越现有框架。性能优势源于搜索架构而非更大模型,可运行于 Claude Code 或 Codex。项目已开源,支持本地部署或 API 调用。

Reddit r/LocalLLaMA / r/MachineLearning · 2026-06-08原文
#14Agent 与开源

Omi Health 开源医疗 ASR 模型:医学词错误率 2.37%

Omi Health 发布 Omi Med STT v1,基于 NVIDIA Parakeet TDT 0.6B v2 微调的医疗语音识别模型,权重开源(CC-BY-4.0)。在 1513 段医疗音频测试中,医学词错误率(M-WER)2.37%,整体 WER 8.30%,速度达 145 倍实时(A10)。性能优于 Whisper Large v3 Turbo、Qwen3 ASR 等开源模型,接近 ElevenLabs Scribe v2、AssemblyAI 等云端 API。支持 Mac(MLX)、CUDA(NeMo)、CPU(GGUF)本地运行,确保患者音频不离设备。药物名称准确率是主要短板(4.75%),计划 v2 改进。

Reddit r/LocalLLaMA · 2026-06-09原文
#15Agent 与开源

ai-collab-playbook:博士生开源 AI 协作方法论

一名 AI 博士生在社区发布《ai-collab-playbook》开源指南,系统分享日常与 AI 协作的方法论。提出「元提示词思维」「苏格拉底追问」「多模型协作」「经验沉淀」四大方法论,详细介绍科研文献调研、精读、绘图、写作的全流程 Agent 工作流。作者强调人应主导问题表述与验收标准,警惕「效率幻觉」,建议定期复盘 Skill/MCP 做减法。 ---