返回日报索引

AI DAILY / 2026-08-03

08·03 - AI 午报:Qwen3.8正式发布,2.4万亿参数旗舰下周开放权重

今天最重要的是阿里发布 Qwen3.8:2.4 万亿参数旗舰 API 已上线,Max 与 27B 权重预计下周开放;Qwen-CUA 公开电脑操作方案,MiniMax H3 已提供开放权重。

6 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01模型与开放权重

Qwen3.8正式发布,2.4万亿参数旗舰 API 上线,Max 与 27B 开放权重预计下周发布

阿里巴巴 8 月 3 日正式发布 Qwen3.8 / Qwen3.8-Max:公开报道显示,旗舰模型总参数量为 2.4 万亿,API 已上线千问 AI 平台,并接入企业级 Agent 产品“千问办公”。 界面新闻与证券时报网转述的发布信息均称,Qwen3.8-Max 的模型权重预计下周开放,同时还将开放 Qwen3.8-27B。 这次发布要区分三个状态:Qwen3.8 的 API 现在已经可用;Qwen3.8-Max 和 Qwen3.8-27B 是已经宣布、但尚未到权重下载阶段的开放计划。核查到的官方 GitHub 仓库目前只有 README 和 Apache-2.0 LICENSE,没有模型 checkpoint 文件或 GitHub Release;Hugging Face 的 Qwen 官方组织搜索也尚未出现对应的 Qwen3.8 权重。因此,今天可以确认的是“正式发布 + API 上线 + 宣布下周开放权重”,不能提前写成“权重已经开源可下载”。 第三方报道还给出了 95B 激活参数、100 万上下文和 API 价格等细节,但这些信息在本期可直接读取的一手发布页面中没有完整呈现,暂不作为正文结论。模型实际能力、许可证和本地部署门槛,等权重与模型卡公开后再核对。

界面新闻、证券时报网、阿里巴巴 Qwen 官方 GitHub 仓库 · 2026-08-03原文
#02模型与开放权重

MiniMax H3 开放权重,支持多模态输入与最长 15 秒原生双声道视频生成

MiniMax H3 已在 Hugging Face 提供开放权重,定位为统一处理文本、图像、视频和音频的多模态生成系统。 模型卡称,它可生成最长 15 秒、带原生 32kHz 双声道音频的视频;默认短边为 768 像素,通过 H3-Regenerate-2K 可完成 2K 重生成。H3-Base 支持文生视频、首帧/尾帧视频等模式,参考模式可接收图像、视频和音频组合输入。 需要注意的是,官方完整工作流中的 H3-Context-IR 是托管预处理与编排服务,并未随此次开放权重发布提供;权重可得不等于整条官方生产管线可离线复现。模型卡标注的许可证为 MiniMax H3 Community License,使用前仍需核对具体条款。

MiniMaxAI · Hugging Face 模型卡 · 2026-08-03原文
#03Agent 与电脑操作

Qwen-CUA 发布截图驱动的原生 Computer Use agent,公开技术报告与参考 demo

Qwen 团队与 XLang Lab 发布 Qwen-CUA:它从截图读取界面状态,通过原生键盘和鼠标事件执行操作,不依赖 DOM、辅助功能元数据或任务专用 API。 项目仓库将其描述为基于 Qwen 的 Computer Use 模型与 agent,覆盖桌面控制、长程任务、网页交互和对抗鲁棒性等八类评测;仓库列出的 Qwen-CUA(397B-A17B)在 OSWorld-Verified 为 86.2。 项目还给出更大版本 Qwen-CUA-Max 的结果:其参数规模超过 1T,仓库称其在同一基准达到 87.6。当前公开内容是技术报告与参考 demo,模型权重不包含在该仓库内;这些分数属于项目方披露的评测结果,实际部署能力仍需等待可复现实现与后续发布。

Qwen Team 与 XLang Lab · GitHub · 2026-08-03原文
#04本地推理与开发工具

WASTE 用 NVMe 流式读取激活专家,在 64GB MacBook Pro 上运行 Kimi K3

开源 C 推理引擎 WASTE 尝试将 MoE 模型的主干保留在内存中,把被路由选中的专家从磁盘直接读入,并将剩余 RAM 作为有界专家缓存。 项目 README 给出的演示是在一台 64GB MacBook Pro 上运行完整的 2.78 万亿参数 Kimi K3,速度约为每秒 0.6 token;它同时列出约 1TB 内置 NVMe 存储作为该模型转换文件的需求。 README 解释,Kimi K3 每个 token 只激活约 4% 参数,WASTE 将共享部分留在 RAM,并以预读方式隐藏一部分专家磁盘读取等待。该项目仍是早期推理引擎,展示的是开发者在特定设备上的测量,不应外推为一般消费设备的吞吐量承诺。

sqliteai/waste · GitHub · 2026-08-03原文
#05本地推理与开发工具

llama.cpp 发布官方 Mac 应用,并以 llama serve 取代 llama-server

llama.cpp 的发布页已提供指向官方 llama.app 的入口以及 macOS Apple Silicon 和 Intel 构建产物;本期社区帖还提示项目新增 llama serve 命令。 输入材料称,新命令用于替代原有的 llama-server,并把本地服务启动路径收敛到统一命令;GitHub 发布页可确认项目正在持续提供 macOS 构建与 llama.app 链接。 关于菜单栏显示、自动加载模型等产品细节,本次未能从可访问的一手发布说明中完整核对,因此不在正文扩写。Mac 应用和新服务命令的具体行为以项目后续发布说明与实际版本文档为准。

llama.cpp · GitHub Releases;Reddit r/LocalLLaMA · 2026-08-03原文
#06本地推理与开发工具

EdgeRazor 提出混合精度量化感知蒸馏框架,开源低比特示例模型

南京大学团队在社区发布 EdgeRazor:该框架尝试通过熵引导蒸馏训练低比特混合精度学生模型,并提供 MobileLLM、Qwen3-0.6B 等示例模型。 输入材料将其描述为不要求改动 llama.cpp 等推理实现的量化感知蒸馏方案。 原始社区页面暂未能完整读取,本文不采用其中的性能比较与成本结论。具体方法、实验设置和复现状态仍以作者后续公开论文或仓库为准。 ---