返回日报索引

AI DAILY / 2026-08-01

08·01 - AI 午报:DeepSeek-V4-Flash API 公测,Seedance 2.5 延长视频生成

今天的重点是模型发布与可用性一起前移:DeepSeek-V4-Flash API 公测并接入 Codex,Seedance 2.5 把视频生成时长拉到 30 秒;LongCat、SenseNova 和 openPangu 接连开放,Hermes Desktop 与 NVIDIA 长上下文分析也有更新。

12 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01模型与开放权重

DeepSeek-V4-Flash-0731 API 公测并适配 Codex

DeepSeek-V4-Flash-0731 正式版 API 进入公测,模型卡与 Codex 接入文档同步开放。 官方模型卡称,正式版取代 Flash 预览版,模型结构保持一致但显著增强 Agent 能力;在其列出的官方测试中,Terminal-Bench 2.1 为 82.7、DeepSWE 为 54.4,均高于 V4-Pro 预览版的 72.1 和 12.8。DeepSeek API 文档已提供 Responses API 方式接入 Codex,当前只支持 V4 Flash,V4 Pro 的 Codex 接入仍标注为预计 8 月初。 这些基准使用 DeepSeek Harness 的 minimal mode 和 max 推理强度,属于发布方测试口径;API 公测是当前可用性变化,App 和网页端模型是否同步更新不在本条范围内。 模型:https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731 文档:https://api-docs.deepseek.com/zh-cn/quickstart/agentintegrations/codex

DeepSeek · X;DeepSeek 模型卡 · 2026-07-31;DeepSeek API 文档 · 2026-08-01原文
#02模型与开放权重

Seedance 2.5 将视频生成时长提升至 30 秒

字节跳动 Seed 正式发布 Seedance 2.5,单次视频生成时长从 15 秒提升到 30 秒。 新模型延续 Seedance 2.0 的多模态音视频联合生成架构,重点加强长叙事、多模态参考和编辑能力;用户最多可输入 30 张图片、10 段视频和 10 段音频作为参考素材,也可以用时间戳精确编辑音视频内容。Seedance 2.5 正在陆续上线即梦 AI 和豆包专业版,企业 API 计划近期接入火山方舟。

字节跳动 Seed 发布材料 · 2026-08-01原文
#03模型与开放权重

LongCat-Flash-Lite-Sparse:69B 总参数、3B 激活,原生支持 1M 上下文

美团在 Hugging Face 发布 LongCat-Flash-Lite-Sparse,采用 LongCat Sparse Attention,原生支持最高 1M token 上下文。 这是一个非思考型 MoE 模型,总参数 69B,每个 token 约激活 3B 参数;官方将其定位为 LongCat-Flash-Lite 的稀疏注意力版本,重点改善长上下文推理和 Agent 任务,同时保留通用推理能力。模型权重和代码以 MIT 许可证发布,模型卡还给出 SWE-Bench Verified 68.20 的官方测试结果,但这属于发布方评测口径。

美团 LongCat · Hugging Face 模型卡 · 2026-08-01原文
#04模型与开放权重

SenseNova-U1.5-8B-MoT 预览版开放,主打原生 4K 图像生成

商汤 SenseNova-U1.5-8B-MoT 预览版开放下载,重点升级原生 4K 图像生成与局部编辑。 官方仓库称,新版本采用 NEO-unify 架构,强化纹理、材质、光照和复杂版式生成,并支持通过蒙版、边界框和视觉标记做区域编辑;项目同时公开推理代码和模型权重。U1.5 仍是预览版,正式版本的发布时间和最终规格尚未公布。 代码:https://github.com/OpenSenseNova/SenseNova-U1

SenseNova · Hugging Face · 2026-07-31原文
#05音频与本地推理

audio.cpp 0.5 增加表达性 TTS、跨语言音色迁移和 ROCm 支持

audio.cpp 0.5 增加 DramaBox 表达性 TTS、Confucius4 跨语言音色迁移,并接入 RVC、BS-RoFormer、GLM-TTS、Fun-ASR-Nano 等模型。 发布说明还提到 AMD GPU 的 HIP/ROCm 早期支持、Apple Silicon Metal 性能改进,以及服务器和流式路径对实时 PCM 输入、增量转写的支持。原始 Reddit 页面被 403 拦截,因此本条只保留为社区发布线索;Fun-ASR-Nano 的官方平台关联和非 CUDA 后端支持仍需继续查看项目原始仓库。

Reddit r/LocalLLaMA · 2026-08-01原文
#06音频与本地推理

openPangu-2.0-Pro 开放,505B 总参数、18B 激活与 512K 上下文

华为开放基于昇腾 NPU 训练的 openPangu-2.0-Pro,模型约 505B 总参数、每 token 激活约 18B 参数,支持 512K 上下文。 模型采用 DSA+SWA 分层混合注意力、四支流 mHC 架构和三头 MTP 模块,并同时提供 Thinking 与 Non-Thinking 两种模式的测评数据。技术报告也明确写出:在复杂现实世界软件工程任务上,该模型与顶尖模型仍有差距。

openPangu · Hugging Face 模型卡 · 2026-07-31原文
#07开发工具与平台

GPT-5.4 与 GPT-5.4 mini 将于 8 月 31 日退出 Codex

OpenAI 宣布,GPT-5.4 和 GPT-5.4 mini 将于 8 月 31 日起不再向使用 ChatGPT 登录的 Codex 用户提供。 两个模型在 OpenAI API 和使用 API Key 鉴权的 Codex 会话中仍可用;官方建议将 gpt-5.4 替换为 gpt-5.6-terra、将 gpt-5.4-mini 替换为 gpt-5.6-luna。需要检查的范围包括工作区默认模型、保存的模型设置、自定义 Agent 和定时任务。

OpenAI ChatGPT & Codex Changelog · 2026-07-31原文
#08开发工具与平台

Hermes Desktop 首个官方插件 Kanban 上线,插件 SDK 同步开放

Nous Research 发布 Hermes Desktop 首个官方插件 Kanban,并开放 Desktop Plugin SDK。 SDK 允许开发者为原生桌面应用添加独立页面、侧边栏导航、快捷键、状态栏操作、主题和后端接口;插件是单个 ESM 文件,放入 desktop-plugins 目录后由应用监听并热加载,不需要克隆仓库或运行构建命令。SDK 文档还提供 React Query、插件存储、网关 JSON-RPC 和事件订阅等宿主能力。

Nous Research · Hermes Agent 文档 · 2026-08-01原文
#09开发工具与平台

Qwen-Audio-3.0-ASR-Flash 上线,覆盖 30 种语言和 5 分钟音频

Qwen-Audio-3.0-ASR-Flash 已在阿里云百炼开放,支持 Flash、Filetrans 和 Streaming 三种调用形态。 Flash 版本可转写最长 5 分钟音频,覆盖 30 种语言,并加强上下文一致性、行业词识别、热词定制、语音润色和多语种识别;官方页面还列出每秒 0.00022 元的音频计费。页面中的召回率、错误率和延迟属于平台公布的内部或理论指标,不能直接替代独立评测。

千问 AI 平台 · 2026-08-01原文
#10开发工具与平台

Google AI Studio 取消独立移动 App,转向 Gemini 应用整合

Google AI Studio 取消独立移动 App 发布计划,改为把相关体验整合进 Gemini 的移动端和桌面端。 官方称,AI Studio 将继续投入网页版,服务需要更深开发能力的用户;这一调整把面向日常使用的入口和面向开发者的网页工作台分开。原帖页面在本次直接抓取中不可访问,正文仅采用可见的官方公告摘要,未扩展“超过 80 万次预购”等未能通过独立页面核验的数字。

Google AI Studio 官方账号 · X · 2026-08-01原文
#11推理基础设施与评测

NVIDIA:长上下文推理的瓶颈,正在从实现转向注意力设计

NVIDIA 发布长上下文注意力协同设计分析,指出 DeepSeek-R1 在 4K 到 128K 预填充过程中,注意力计算占比可从 18% 上升到 85%。 文章把预填充和解码拆成两个不同的性能问题:前者受序列长度主导,后者更受查询头与 KV 头分组、访存和 GEMM 形状影响。给出的工程建议包括提高解码阶段的 group size、使用 128 或 256 的 head dimension,以及通过缓存压缩、稀疏或滑动窗口注意力减少有效 KV 状态;这是 NVIDIA 针对其 GPU 的分析与建议。

NVIDIA Technical Blog · 2026-07-31原文
#12推理基础设施与评测

同一 4B 模型在不同 Harness 下准确率相差 22 个百分点

一项预注册消融实验报告,同一个 4B 模型在 Kubernetes issue→SIG 分类任务上的准确率,因 Harness 设计不同而在 60% 到 82% 之间变化。 作者保持模型权重、250 条标注数据和评分器不变,只调整规则位置、证据顺序、轮次结构以及跨阶段保留的信息;显式规则带来 13 个百分点提升,任务说明前置带来 6.5 个百分点提升,而清空上下文改带摘要、以及跨阶段新会话分别带来 12 和 15 个百分点下降。原始 Reddit 页面被 403 拦截,本条保留为社区实验报告,不把结果写成独立基准结论。 ---