返回日报索引

AI DAILY / 2026-07-24

07·24 - AI 午报:FLUX 3统一生成音视频,ChatGPT语音调度多Agent

今天的主线是多模态与 Agent 进一步进入真实产品:Black Forest Labs 用 FLUX 3 统一生成图像、视频和音频,ChatGPT Voice 可在桌面端调度 Chat、Work 与 Codex 任务。模型侧,Ling-3.0-flash、LLaDA2.2-flash 和 KAT-Coder-V2.5-Dev 集中面向长上下文与 Agent;应用侧,ChatGPT Health 开始接入美国用户的医疗记录,Runway Media Router 自动匹配生成式媒体模型。

12 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01多模态与产品

FLUX 3统一学习图像、视频与音频,Video开放早期访问

Black Forest Labs 发布多模态基础模型 FLUX 3,在同一架构中联合学习图像、视频与音频。 模型可根据文本、图片或视频参考生成图像,以及最长 20 秒、带原生音频的视频;能力还包括视频续写、关键帧转视频、多语言对白和跨片段的 Agent 式串联。 FLUX 3 Video 已开放早期访问,Image 版本计划未来数周进入早期访问。开放权重的 FLUX 3 Dev 与机器人动作预测版本也在发布计划中。官方早期评测称,FLUX 3 对 Seedance 2.0 和 Gemini Omni Flash 的偏好率均为 52%;模型与评测系统仍在开发,数据属于发布方初步结果。

Black Forest Labs · 2026-07-23原文
#02多模态与产品

ChatGPT Voice登陆桌面端,可调度Chat、Work与Codex任务

OpenAI 将 GPT-Live 驱动的 ChatGPT Voice 接入 macOS 与 Windows 桌面应用。 用户可以在语音对话中启动独立线程、检查任务进度或追加指令,调度 Chat、Work 与 Codex 中的工作;iOS 设备配对桌面主机后,也能远程使用这套语音入口。 功能面向 Plus、Pro、Business、Edu 与 Enterprise 方案逐步开放,Enterprise 和 Edu 先进入两周早期访问。一次只能保持一个活跃语音聊天,语音额度按滚动五小时窗口计量;语音启动的 Codex 任务仍消耗 Codex 额度。

OpenAI ChatGPT Learn · 2026-07-23原文
#03多模态与产品

微软开放MAI图像与语音模型公测,已进入Bing、PowerPoint和Dynamics 365

微软将 MAI-Image-2.5-Pro 与 MAI-Voice-2-Flash 推入公开预览,并公布多项产品部署数据。 Image Pro 面向高保真生成、精细编辑与图中文字,价格为每百万文本输入、图像输入和图像输出 token 分别 5、8 与 106 美元;Voice Flash 比 MAI-Voice-2 快 2 倍、便宜 32%,每百万字符 15 美元。 MAI-Image-2.5 已成为 Bing Image Creator 默认模型,并用于 PowerPoint 和 OneDrive 图像编辑;微软称 OneDrive 上线后保存率提高 26%,P95 延迟下降约 25%。MAI-Voice-2-Flash 已进入 Dynamics 365 Contact Center 与 Azure Voice Live,MAI-Transcribe-1.5 则支持 58 种语言并用于 Dragon Copilot。

#04模型与开放权重

Ling-3.0-flash以5.1B激活参数面向生产级Agent

蚂蚁集团发布 Ling-3.0-flash,这是一款总参数 124B、每个 token 激活约 5.1B 的 MoE 模型。 模型支持思考与非思考模式,原生上下文为 256K,定位于高频 Agent、编码、文档处理和长上下文多轮交互。 Ling-3.0-flash 已进入 Vercel AI Gateway,免费使用期持续至 8 月 3 日。Vercel 提供的免费模型入口支持统一 API、用量与成本跟踪,以及重试、故障转移和路由规则。

Vercel · Ant Group · 2026-07-23原文
#05模型与开放权重

LLaDA2.2-flash用扩散解码支持128K上下文与序列编辑

inclusionAI 开放 Agent 导向的 MoE 扩散语言模型 LLaDA2.2-flash,总非嵌入参数量 100B,上下文长度 128K。 模型在扩散解码中加入 DELETE 与 INSERT 控制标记,可删除冗余内容、插入新位置,并以 Block Routing 将专家激活限制在扩散块级别。 模型卡显示,LLaDA2.2-flash 在 τ²-Bench、PinchBench 与 MCP-Atlas 上分别得到 80.33、81.66 和 46.21,结果均为发布方评测;SWE-bench 系列使用 Claude Code scaffold。权重采用 Apache 2.0 许可,SGLang 部署支持仍在开发。

inclusionAI · Hugging Face · 2026-07-23原文
#06模型与开放权重

KAT-Coder-V2.5-Dev开放35B代码模型权重

快手 KwaiKAT 团队开放 KAT-Coder-V2.5-Dev 权重,模型基于 Qwen3.6-35B-A3B 后训练,总参数 35B、激活参数 3B。 本次只包含文本语言模型权重,不含视觉组件;原生支持 262,144 token 上下文,可通过 vLLM、SGLang、Transformers 与 KTransformers 部署。 发布方在统一评测管线中报告 SWE-bench Verified、Multilingual 与 Pro 分数分别为 69.40、63.00 和 45.96,Terminal-Bench 2.1 两套 harness 平均为 41.02。模型采用 Apache 2.0 许可。

KwaiKAT · Hugging Face · 2026-07-23原文
#07模型与开放权重

HPD-Parsing以1B参数并行解析长文档

PaddlePaddle 开放 1B 参数文档解析模型 HPD-Parsing,用分层并行解码拆解整页自回归瓶颈。 主布局分支先协调全局结构,再把局部区域交给并发内容分支,配合渐进式多 token 预测与共享前缀 KV 缓存缩短解码路径。 官方数据显示,模型在 OmniDocBench v1.6 总分为 94.91%;在 A800 80GB、batch size 512 条件下,峰值吞吐为每秒 4,752.1 token,是自身自回归基线的 3.06 倍。生产吞吐路径依赖定制版 vLLM,权重采用 Apache 2.0 许可。

PaddlePaddle · Hugging Face · 2026-07-23原文
#08Agent 与开发生态

Runway Media Router按成本、质量与延迟自动选择媒体模型

Runway 在 Runway Dev 上线 Media Router,为每次视频、图像或音频请求自动匹配模型。 团队可设定单次生成价格上限、模型与供应商白名单或黑名单,再对成本、质量和延迟分配偏好;调用时只提交配置 ID,不必在代码中固定模型。 路由器先过滤不满足能力和硬约束的候选,再对剩余模型评分,并返回实际使用的模型与选择原因。如果约束导致没有可用模型,系统会指出冲突项而非自动降级。平台还提供不产生费用的 dry-run,用于提前查看路由结果。

#09Agent 与开发生态

北京发布智能体发展措施,明确支持Harness工程与Token经济

北京市四部门印发智能体发展措施,将 Harness Engineering、跨模型跨芯片中间层、智能体技能市场与安全沙箱列入支持范围。 文件提出围绕上下文工程、任务持久化、多智能体协作和系统扩展性建设共性底座,并推动工具调用、长上下文、记忆、互联协议和开发框架等技术攻关。 措施还提出发展 Token 即服务、智能体即服务和结果即服务,探索从 token 消耗量计费转向价值计费;支持一人公司社区、公共算力弹性供给、Token 券和智能体服务券。文件于 7 月 23 日发布,现行有效。

北京市人民政府 · 2026-07-23原文
#10Agent 与开发生态

NVIDIA披露Rubin GPU与Vera CPU的Agent基础设施设计

NVIDIA 公布 Rubin GPU 与 Vera CPU 的架构细节,面向长上下文、多步骤 Agent 带来的计算与串行处理压力。 Rubin GPU 配备 336B HBM4,内存带宽 22 TB/s;单 GPU 的 NVLink 带宽为 3.6 TB/s,官方称其 NVFP4 推理性能达到 50 PFLOPS。 Vera CPU 采用 88 个 Olympus 核心、176 线程和 1.5 TB LPDDR6X 内存,面向工具调用、代码执行、检索与编排等难以完全交给 GPU 的步骤。全部性能与比较数据来自 NVIDIA 发布材料,Rubin 平台尚待实际部署验证。 补充资料:https://developer.nvidia.com/blog/inside-nvidia-vera-cpu-olympus-cores-built-for-maximum-single-threaded-performance-in-agentic-ai

NVIDIA Developer Blog · 2026-07-23原文
#11应用与科研

ChatGPT Health向美国成年用户开放,可连接医疗记录与Apple Health

OpenAI 开始向美国 18 岁以上登录用户开放 ChatGPT Health,可由用户选择连接 Apple Health 与受支持的医疗记录。 功能覆盖 Web 和 iOS 的 Free、Go、Plus 与 Pro 方案,可比较历次检查、总结就诊后的变化,并在普通对话中按权限调用健康上下文;目前不支持 Codex。 OpenAI 称每周超过 3 亿人使用 ChatGPT 咨询健康问题,接入的医疗信息及相关对话不会用于训练基础模型或投放广告。数据默认按次询问授权,用户也可断开连接;官方同时强调产品不能替代专业医疗判断。

#12应用与科研

字节Seed启动百人STEM科学家计划,首期合作约六个月

字节跳动 Seed 团队启动 STEM 科学家计划,邀请 100 名学者围绕真实科研问题开展合作。 申请对象包括 STEM 领域学者、行业专家和在读博士,覆盖数学、物理、化学、生物、材料等方向;计划提供算力资源、AI 团队协作与薪酬支持。 首期合作约持续六个月,参与者需到办公现场协作,形式分为科学家顾问与博士实习生。申请截止时间为 2026 年 9 月 30 日,首批工作地点为北京海淀区。 ---