返回日报索引

AI DAILY / 2026-05-27

05·27 - AI 午报:小米 MiMo 永久降价 99%,PrismML 发布 1-bit 图像模型

12 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01模型与应用

小米 MiMo-V2.5 系列 API 永久降价,最高降幅 99%,Token Plan 计费整体翻新

小米于 5 月 27 日正式下调 MiMo-V2.5 系列 API 价格,相比原定价最高降幅达 99%,且不再区分输入长度。 新的 Token Plan 计费体系从 Token 变为 Credits,输入侧区分缓存命中与否,通过 SGLang HiCache 完整支持 SWA,将 KV Cache 多级存储的数据搬运量降至优化前的近 1/7,可缓存 token 数提升近 5 倍。在 95% 缓存命中率下,Token Plan 实际可用额度提升至原来的 5-8 倍,所有现有订阅用户额度也在今日零点全量重置。 降价背后是推理系统的大幅优化:专家并行方案、输入长度分桶策略等改进进一步压低了单位 token 服务成本。值得注意的是,降价后 MiMo-V2.5 系列 API 定价与 DeepSeek V4 Pro 处于同一区间,国内模型 API 价格竞争进一步加剧。同步宣布 4 月 28 日启动的「百万亿 Token 创造者激励计划」因 100T Token 提前发完已于 5 月 26 日收官。

小米 MiMo 开放平台 · 2026-05-27 · [原文](https://platform.xiaomimimo.com/docs/zh-CN/news/v2.5-price-update)
#02模型与应用

PrismML 发布 Bonsai Image 4B:1-bit 与 Ternary 图像模型,iPhone 可直接运行

PrismML 发布 Bonsai Image 4B 开源图像模型家族,包含 1-bit 二值化和 Ternary 三值化两个版本,基于 FLUX.2 Klein 4B 架构,将 Diffusion Transformer 权重分别压缩至 0.93 GB 和 1.21 GB,最高压缩 8.3 倍。 模型在 iPhone 17 Pro Max 上生成 512×512 图像仅需 9.4 秒,Mac M4 Pro 上比全精度 MFLUX 管线快 5.6 倍。1-bit 版本保留原模型 88% 基准性能,Ternary 版本保留 95%。模型以 Apache 2.0 协议开源,同时推出 iOS 应用 Bonsai Studio。 这是首个可在手机上直接运行的 4B 参数级图像生成模型,代表量化图像模型从实验室向本地设备部署迈出了关键一步。1-bit 版本还可通过 WebGPU 在浏览器中完全本地运行。

PrismML 官方博客 · 2026-05-26 · [原文](https://prismml.com/news/bonsai-image-4b)
#03模型与应用

Kwai-Keye 开源 Keye-VL-2.0-30B-A3B:首个落地 DSA 的视觉语言模型

快手 Kwai-Keye 团队开源 300 亿参数多模态模型 Keye-VL-2.0-30B-A3B,这是首个在生产环境中落地 DeepSeek Sparse Attention(DSA)架构的视觉语言模型。 模型支持 256K 超长上下文,可对长达一小时的视频进行精准理解,在多项时序感知基准上媲美或超越 Gemini 3 Flash 等闭源模型。模型内置系统级编排机制,原生支持 Search、Tool 和 Code 场景,成为 Keye 系列首个 Agent-Ready 基础模型。模型和代码已在 Hugging Face 与 GitHub 以 Apache 2.0 协议完全开源。

Kwai-Keye / Hugging Face · 2026-05-27 · [原文](https://huggingface.co/Kwai-Keye/Keye-VL-2.0-30B-A3B)
#04模型与应用

MiniMax 预热 M3 模型,MSA 稀疏注意力架构实现长文本推理大幅加速

MiniMax 通过社交平台预告了新一代 M3 模型及其 MiniMax Sparse Attention(MSA)稀疏注意力架构。 官方数据显示,在 1M token 超长上下文下,M3 预填充速度较前代 M2 提升 9.7 倍,解码速度提升 15.6 倍。MSA 采用「索引分支 + 稀疏分支」两阶段设计:先由轻量索引筛选关键 KV 区块,再仅对选中区块执行注意力计算,大幅降低长文本下的推理延迟。官方称该架构基于 GQA 而非 MLA,与 DeepSeek V3.2 的 DSA 和 V4 的 CSA 设计路径不同。M3 目前处于预热阶段,正式发布时间和规格尚未公布。

X @MiniMax_AI · 2026-05-27 · [参考资料](https://x.com/MiniMax_AI/status/2059286515155599595)
#05模型与应用

Qwen3.7-Max 升至 Code Arena 第 4,与 Claude Opus 4.6 持平

阿里通义千问官方宣布 Qwen3.7-Max 在 Code Arena 编程竞技场排名升至第 4 位,与 Anthropic Claude Opus 4.6 性能持平,成为该榜单上排名最高的中国实验室模型。 目前尚无第三方独立评测或详细技术报告佐证,具体基准测试方法和模型参数量尚未公布。团队在发布中暗示后续还有其他更新。 ---

X @Qwen · 2026-05-27 · [参考资料](https://x.com/i/web/status/2059445345667747849)
#06产品与应用

支付宝推出全栈 AI 支付体系,发布首个 Token Pay 服务

蚂蚁集团旗下支付宝正式发布全栈 AI 支付体系,包括 AI 付、AI 收、Token Pay 和 AI 钱包四大产品,覆盖授权、支付、结算和管理全流程。 核心产品 AI 付已完成 3 亿笔智能体支付,支持 95% 主流智能体框架,覆盖手机、眼镜、车机等多终端。Token Pay 是市场上首个模型付款解决方案,采用订阅制,可将模型订阅成功率提升 70%。同时推出商家经营智能体「晓雨」及 AI 开发者激励计划,每月最高 5000 元 Token 算力补贴。

支付宝微信公众号 · 2026-05-27 · [原文](https://mp.weixin.qq.com/s/WwcAM0SzMbSt-vD25TiAgg)
#07产品与应用

腾讯 Hy-MT2 模型更换为 Apache 2.0 许可协议

腾讯混元官方宣布将 Hy-MT2 多模态模型的开源许可协议正式更改为 Apache License 2.0,允许无限制商业使用、微调和创建衍生品。 该模型的两个版本目前在 Hugging Face 趋势排行榜上分列第一和第四。此举大幅降低了企业部署门槛,为多模态模型在商业场景的广泛应用清除了许可障碍。

X @TencentHunyuan · 2026-05-27 · [参考资料](https://x.com/TencentHunyuan/status/2059249996256711150)
#08产品与应用

微软发布 MAI-Image-2.5 文生图模型,Arena 排名第三

微软发布文生图模型 MAI-Image-2.5,在 Arena 文生图排行榜上位列第三。 相比前代 MAI-Image-2,新模型在文本渲染、风格化插图和商业图像方面有显著提升,能够更可靠地渲染文字、遵循指令,并在对象、光照、比例和空间关系上展现增强的视觉推理能力。模型目前在 Arena 平台开放体验,预计两周内登陆 MAI Playground 和 Foundry。 ---

Microsoft AI Blog · 2026-05-26 · [原文](https://microsoft.ai/news/mai-image-2-5-launches-at-no-3-on-arena-ai)
#09行业动态

Anthropic 为 Claude Code 发布安全审查插件

Anthropic 发布 Claude Code 的 security-guidance 插件,在编码过程中自动审查代码变更并修复常见安全漏洞。 插件通过三个层级运作:文件编辑时的快速模式匹配(无模型调用)、每轮对话结束后的后台模型审查、以及 git commit/push 时的深度 Agent 审查,三个层级均不阻塞写入或提交操作。用户可通过 /plugin install security-guidance@claude-plugins-official 从官方插件市场安装。

Claude Code 官方文档 · 2026-05-27 · [原文](https://code.claude.com/docs/en/security-guidance)
#10行业动态

OpenRouter 完成 1.13 亿美元 B 轮融资

OpenRouter 宣布完成 1.13 亿美元 B 轮融资,由 Alphabet 旗下 CapitalG 领投,a16z、Menlo Ventures 及 NVIDIA 旗下 NVentures 等跟投。 平台每周处理的 token 量在六个月内从 5 万亿增长至 25 万亿,全球用户已超过 800 万。本轮融资将用于扩展基础设施和提升服务能力。OpenRouter 的增长数据从侧面反映了 AI 推理需求从实验阶段向规模化生产应用的迁移。 ---

X @OpenRouter · 2026-05-27 · [参考资料](https://x.com/OpenRouter/status/2059277623629664758)
#11研究与基础设施

NVIDIA 系列动态:PiD 像素扩散解码器开源,CompileIQ 自动调优工具发布

NVIDIA 研究团队开源像素扩散解码器 PiD,将潜空间解码与超分辨率统一为单一条件像素扩散模型。 PiD 直接在像素空间去噪,取代传统「先解码后超分」的级联流程,支持 4× 和 8× 上采样。在 RTX 5090 上,512×512 潜空间解码为 2048×2048 图像耗时不到 1 秒,GB200 上仅 210 毫秒,比 SeedVR2 快约 5.9 倍。兼容 Flux、SD3 等主流架构,但权重仅限非商业用途。 同期的 CompileIQ 自动调优工具针对 GPU 编译器选项选择难题,为特定工作负载自动搜索最佳编译配置,可在批处理、FP8 量化、Flash Attention 和内核融合等已有优化基础上进一步提取性能。

NVIDIA Research · NVIDIA Developer Blog · 2026-05-26 · [原文(PiD)](https://research.nvidia.com/labs/sil/projects/pid) · [原文(CompileIQ)](https://developer.nvidia.com/blog/extract-more-kernel-performance-with-nvidia-compileiq-auto-tuning)
#12研究与基础设施

Datacurve 发布 DeepSWE 长周期软件工程基准,GPT-5.5 以 70% 通过率居首

Datacurve 团队发布长周期软件工程基准 DeepSWE,包含 91 个开源仓库的 113 项原创任务,覆盖 TypeScript、Go、Python、JavaScript 和 Rust。 任务从零编写以避免数据污染,使用手写验证器测试软件行为而非实现细节。在统一使用 mini-swe-agent 的条件下,GPT-5.5 以 70% 通过率排第一,GPT-5.4 和 Claude Opus 4.7 分别为 56% 和 54%。基准代码与运行轨迹已在 GitHub 公开。 ---