苹果在 WWDC 2026 上推出全新 Siri AI 和新一代 Apple Intelligence。新 Siri 基于大语言模型,支持更自然的对话、跨应用操作和个性化上下文理解。Apple Intelligence 深度集成到 iOS 27、macOS 和 visionOS 中,提供 AI 写作助手、图像生成和智能摘要等功能。 首日演示后,社区和投资者反馈普遍低于预期。论坛用户指出演示与宣传存在明显差距,国行 iPhone 升级 iOS 27 后 Apple Intelligence 仍无法使用。具体发布时间和硬件要求尚未公布。
#02模型与产品
Google NotebookLM 重大更新:切换 Gemini 3.5,输出格式扩展至 12 种
Google 为 NotebookLM 推出重大更新。底层模型全面切换至 Gemini 3.5 并引入 Antigravity 技术,内部五大评测维度平均胜率超 65%,其中高级网页研究胜率达 78.2%。新增推理步骤展示功能,输出格式扩展至 PNG、SVG、PDF、DOCX、Markdown、JSON、CSV、XLSX、PPTX 等 12 种,支持跨语言指令与结果生成,并可在项目初期主动发掘信息源。 更新面向 Google AI Ultra 订阅用户及 Workspace 企业客户开放,普通用户推广时间表未公布。
#03模型与产品
Chrome 149 单版本修复 429 个安全漏洞,AI 自动化筛查成主因
Chrome 149 修复了 429 个安全漏洞,创下单个版本修复数量纪录。其中仅约四分之一来自外部安全研究人员,其余大概率由 AI 模型(如 Mythos)自动化发现与修复。此前一个月 Chrome 已修复 110 个漏洞,为当时纪录。连续两月刷新纪录,表明具备高级推理能力的 AI 正在快速改变软件安全维护模式。
Cognition AI 发布 FrontierCode,一个包含 1000 道高难度编程题的评估基准,覆盖算法、数据结构、系统设计等。要求模型生成可执行代码并通过隐藏测试。当前最强模型通过率不足 30%,揭示了大模型在复杂编程任务上的短板。
#11评测与基准
GPT-5.5 heavy 新高考数学 I 卷满分,最快 6 分 44 秒
社区评测显示 GPT-5.5 heavy 在一次性输入新高考数学 I 卷的测试中,4 次均获满分 150 分,最快仅用 6 分 44 秒。GPT-5.2 Pro extended、GPT-5.4 heavy 和 Gemini DeepThink 均取得 146–150 分。Qwen 3.7 Max 最高 146 分。测试采用一次性发送全部试题,考验长上下文推理能力,评分由双 GPT-5.5 Pro 完成。测试方法、样本量和评分一致性仍需验证。
开发者发布开源系统 LEVI,以 AlphaEvolve 为蓝本,在代码优化和提示优化任务中成本降低最高 35 倍,评估次数减少最多 12 倍。LEVI 通过维护解多样性、智能路由大小模型、代理子集近似评分三大机制,在 ADRS 系统基准测试中超越现有框架。性能优势源于搜索架构而非更大模型,可运行于 Claude Code 或 Codex。项目已开源,支持本地部署或 API 调用。
#14Agent 与开源
Omi Health 开源医疗 ASR 模型:医学词错误率 2.37%
Omi Health 发布 Omi Med STT v1,基于 NVIDIA Parakeet TDT 0.6B v2 微调的医疗语音识别模型,权重开源(CC-BY-4.0)。在 1513 段医疗音频测试中,医学词错误率(M-WER)2.37%,整体 WER 8.30%,速度达 145 倍实时(A10)。性能优于 Whisper Large v3 Turbo、Qwen3 ASR 等开源模型,接近 ElevenLabs Scribe v2、AssemblyAI 等云端 API。支持 Mac(MLX)、CUDA(NeMo)、CPU(GGUF)本地运行,确保患者音频不离设备。药物名称准确率是主要短板(4.75%),计划 v2 改进。
#15Agent 与开源
ai-collab-playbook:博士生开源 AI 协作方法论
一名 AI 博士生在社区发布《ai-collab-playbook》开源指南,系统分享日常与 AI 协作的方法论。提出「元提示词思维」「苏格拉底追问」「多模型协作」「经验沉淀」四大方法论,详细介绍科研文献调研、精读、绘图、写作的全流程 Agent 工作流。作者强调人应主导问题表述与验收标准,警惕「效率幻觉」,建议定期复盘 Skill/MCP 做减法。 ---