返回日报索引

AI DAILY / 2026-07-20

07·20 - AI 午报:Qwen3.8-Max 预览上线,Kimi 暂停新订阅

今天的主线是模型供给与算力承载同时吃紧:阿里上线 2.4T 参数的 Qwen3.8-Max-Preview,并用 Token Plan 和分时折扣扩大入口;Kimi K3 上线后则暂停新用户订阅。开源侧,Fractale 用 8 个 fast-weight 向量保存跨段记忆,Matrix-Game 3.5 开放 5B 世界模型;工程侧,ATSInfer 与 BeeLlama.cpp 分别从张量调度和 KV 缓存压缩本地推理成本。

9 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01模型与产品

Qwen3.8-Max-Preview 上线,Token Plan 同步开售

Qwen3.8-Max-Preview 参数规模达到 2.4T,现已接入 Qoder 与千问 Token Plan。 Qoder 官方文档显示,该模型常规时段按 0.05 倍 Credits 计费,每日 22:00 至次日 08:00 降至 0.01 倍;活动从 7 月 19 日开始,结束时间尚未公布。模型仍处于预览阶段,正式版的上线与权重安排以官方后续公告为准。 千问 Token Plan 个人版提供 Lite、Standard、Pro 三档,限时月费分别为 39 元、139 元和 499 元。三档每 5 小时额度依次为 700、3000、12000 Credits,每 7 天额度为 2500、10000、40000 Credits,支持 Claude Code、Cursor、Qwen Code 和 OpenClaw 等交互式工具;套餐不得用于自动化脚本、应用后端或非交互式批量 API 调用。 产品文档:https://platform.qianwenai.com/docs/token-plan/personal/token-plan-personal-overview

Qoder · 千问 AI 平台 · 2026-07-19原文
#02模型与产品

Kimi K3 需求激增,新用户订阅暂停

Kimi 在 K3 上线后暂停个人用户新订阅,已订阅用户现有权益不受影响。 官方说明称,K3 发布后的请求量逼近集群承载上限,团队正在扩容,并计划分批恢复新订阅名额。 Kimi 会员页当前各付费套餐均显示售罄,同时预告 Kimi 主权益与 Kimi Code 权益将拆分。页面未给出新体系的开放时间;老用户仍可按现有说明管理订阅。 产品页:https://www.kimi.com/membership/pricing?from=upgradeplan

#03模型与产品

Fractale 用 8 个向量保存跨段记忆

独立研究者发布 Fractale-350M-base,用 8 个向量组成的 fast-weight memory 保存跨段信息,上下文窗口只有 512 token。 模型实际参数量为 386M,在约 10B token 的代码与英文网页数据上从头训练。每读完一个 512-token 片段,模型把内容压缩成一个 gist vector 写入记忆槽;槽位写满后按先进先出淘汰,读取时由超网络把向量展开成低秩 MLP 参与前向计算。 作者用“携带记忆”和“重置记忆”的交叉熵差衡量记忆作用,模型卡报告代码数据增益为 9.42 nats、网页数据为 7.27 nats。该模型只是未经指令微调和安全对齐的研究型 base model,记忆保存的是文档大意而非逐字副本;模型权重、使用工具和复现材料已开放。 代码:https://github.com/fractale-lm/fractale

Fractale 模型卡 · 2026-07-20原文
#04模型与产品

Matrix-Game 3.5 开放 5B 世界模型

昆仑万维旗下 RiemannDynamics 开放 Matrix-Game 3.5 的 5B 双向基础世界模型,提供第一人称和第三人称两个版本。 模型基于 Wan2.2-TI2V-5B,加入相机感知的 3D memory 与 PRoPE 相机条件控制,用于交互场景的生成和推演。 目前开放的是基础双向模型,蒸馏后的实时自回归版本尚未发布。模型卡未给出统一的生产部署门槛,使用前仍需按仓库说明核对硬件与推理环境。 模型:https://huggingface.co/RiemannDynamics/Matrix-Game-3.5-Base

RiemannDynamics · 2026-07-20原文
#05模型与产品

MiniCPM5-2B 预告 512K 上下文

面壁智能与 OpenBMB 发布 MiniCPM5-2B,发布方称模型原生支持混合思考和 512K 上下文。 官方公布的多项基准平均分为 54.26,并称模型在 4B 以下参数段排名靠前;这些性能数字尚待权重开放后的独立评测。 模型权重目前未开放,发布方表示后续会在 Hugging Face 等平台上线。FlagOS 同期宣布完成 9 款芯片的 Day0 适配。

面壁智能 · OpenBMB · 2026-07-20原文
#06安全与工程

Hugging Face 安全取证遭商业模型护栏拦截

Hugging Face 披露一起由自主 Agent 端到端驱动的基础设施入侵;团队在事后取证时,向商业模型 API 提交真实攻击命令、漏洞载荷和 C2 痕迹,被安全护栏拦截。 事件最初由使用 LLM 分流安全遥测的异常检测管线发现,防御方随后也用 AI 辅助日志分析。 披露材料称,团队最终在自有基础设施上运行开源权重模型 GLM 5.2 完成取证,相关攻击数据和凭证没有离开内部环境。目前可读的完整材料来自社区保存的事件说明,尚未找到单独的官方事故报告页面。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1v0ywoi/huggingfacesecurityincidentreporttheattacker

Reddit r/LocalLLaMA 保存的事件说明 · 2026-07-19
#07安全与工程

BeeLlama.cpp v0.4.0 加入 KV 缓存精度尾部

llama.cpp 分支 BeeLlama.cpp 发布 v0.4.0,新增 KVarN、KV cache precision tail 以及 q20 至 q31、q60、q61 等缓存量化类型。 precision tail 可把最近一段 token 的 KV 缓存保留为 BF16 或 F16,其余部分继续量化,减少任务细节在低比特缓存中的损失。 项目作者在 Qwen 3.6 27B Q5KS、64K 测试中报告:q20 的 KLD 中位数从无精度尾部时的 0.019374 降至保留最近 2048 token 时的 0.003696。数据来自作者测试;Gemma、GPT-OSS 等 SWA 架构与相关机制的兼容仍不完整。 代码:https://github.com/Anbeeld/beellama.cpp 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1v0xjw6/beellamacppv040kvarnkvprecisiontailq20q31

BeeLlama.cpp · Reddit r/LocalLLaMA · 2026-07-19
#08安全与工程

ATSInfer 用张量级调度加速消费设备推理

论文 ATSInfer 把消费设备上的 CPU-GPU offloading 从层或专家粒度下沉到张量粒度,论文报告 prefill 吞吐最高提升 1.94 倍、decode 吞吐最高提升 3.29 倍。 系统针对模型权重超过显存、需要借用 CPU 内存的本地推理场景,组合静态张量放置、负载感知动态传输与异步 CPU-GPU 协调。 作者在多种消费级平台上使用稠密模型和 MoE 模型评估,同时观察到 GPU 利用率和 PCIe 带宽利用率提高。论文已更新到 v2,当前未在论文入口列出公开代码仓库。 论文:https://arxiv.org/abs/2607.10183

arXiv · 2026-07-14
#09基础设施

日本与 NVIDIA 共建 2.75 万颗 Rubin GPU 基础设施

NVIDIA 与 Noetra 将在日本建设一座配备 13,750 颗 Vera CPU、27,500 颗 Rubin GPU、容量 140MW 的 AI factory。 项目采用 Vera Rubin NVL72、DSX 与 Spectrum-X,作为日本经济产业省 FRONTia 项目的计算底座。 该设施将训练面向制造、物流、医疗和通信等领域的开放多模态基础模型,并支持 Agent、数字孪生、机器人与物理 AI 应用。NVIDIA 称,Noetra 训练的预训练权重将向日本国内模型开发者和企业开放。 ---