返回日报索引

AI DAILY / 2026-08-22

08·22 - AI 午报:NVIDIA AVO 前沿级智能体架构,DeepSeek 上线多模态视觉模型

国产模型与开源社区持续发力:Qwen3.8-27B 在 Agentic 编码场景的多项实测得到验证,GLM-5.3 拿下创意写作基准第二名,DeepSeek 上线多模态视觉实验模型;NVIDIA AVO 以 100% 成绩刷新 ARC-AGI-3 记录,Llama.cpp DSpark 推理加速再获提升。

9 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01模型与应用

NVIDIA AVO 在 ARC-AGI-3 达 100%,展示前沿级通用智能体架构

NVIDIA 宣布其 AVO 智能体架构在 ARC-AGI-3 基准测试中取得 100% 成绩,证明了"前端模型 + 智能体框架"协同设计是实现长时序自主智能的关键路径。 NVIDIA 官方博客指出,前沿语言模型只是智能体系统的组件之一,真正的挑战在于构建能够让前沿模型在扩展任务中可靠运行的智能体架构。AVO 在 ARC-AGI-3 这一通用人工智能基准上取得 100% 完成率,意味着在长时序决策、多步规划和工具使用等综合任务上,智能体框架本身成为与模型能力同等重要的变量。NVIDIA 强调,智能体架构决定了模型如何接收上下文、使用工具、维护状态、响应反馈、故障恢复和保持任务推进节奏。

NVIDIA Developer Blog · 2026-08-21原文
#02模型与应用

DeepSeek 上线多模态实验模型 DeepSeek-V4-Flash-Vision-Exp

DeepSeek 官方在 API 平台上线多模态视觉理解实验模型 DeepSeek-V4-Flash-Vision-Exp,纯文本能力与 V4-Flash 正式版持平,多模态 Agent 能力接近 Opus-4.8。 该模型支持 Chat Completions、Messages、Responses 三种 API 格式调用,上线即日起可用。上下文长度 1M,最大输出 384K,单张图片 token 消耗上限 384 个,单个请求最多含 600 张图片,图片按尺寸换算为 token 与文本一同计费,定价与 DeepSeek-V4-Flash 保持一致。官方同时上线不收费的 Files API,用户可先将图片上传后再在请求中引用,从而节省带宽。

DeepSeek 官方 · 2026-08-22原文
#03模型与应用

Qwen3-TTS 开源:34ms 首音频延迟,支持 10 RPS

通义千问团队开源 Qwen3-TTS 1.7B 实现,在单张 H100 上达到 10 请求/秒( RPS )和低于 50ms 的 p95 首音频延迟,同时在 RTX 4090 上实现约 50ms p95 TTFA。 该开源实现针对本地运行场景优化,声称相比 vLLM-Omni 和 SGLang-Omni 等流行推理引擎有显著加速。Reddit r/LocalLLaMA 社区帖子显示,项目方同步开源了实现代码和 benchmark 数据,方法论在官方博客中有详细说明。 ---

Reddit r/LocalLLaMA · 2026-08-21原文
#04模型与生态

GLM-5.3 (max) 拿下短篇创作基准第二名

智谱 GLM-5.3 (max) 在独立评审的短篇创意写作基准(Short Story Creative Writing Benchmark)中获评第二名,评判模型在每对匹配对比中持续偏好 GLM-5.3。 基准采用相同约束创作提示词,由独立 LLM 评判员对每对作品打分。定性分析报告指出,GLM-5.2 Max 倾向于列举故事内容,而 GLM-5.3 则实际构建故事结构;前者主角通常在和谐世界中独自行动,后者则在场景中引入第二人物制造冲突,使故事主题在碰撞中存活下来。

Reddit r/singularity · 2026-08-21原文
#05模型与生态

Qwen3.8-27B 推理档位与 preservethinking 参数验证

通义千问 Qwen3.8-27B 在 20 小时不间断 Agentic 编码实测和 Artificial Analysis 基准测试中得到验证,证实 Low/Medium 档位不依赖过度推理;社区同时发现 preservethinking 参数可控制思维链保留。 20 小时实测中,Qwen3.8-27B Q6 量化版在双 RTX 3090 + RTX 3060 配置下维持约 60-63 tokens/s 的速度完成全部工作流。Artificial Analysis 基准测试显示 Low/Medium 档位不依赖过度思考即可超越前代。社区发现,默认推理档位实际为 xhigh 而非 low,且 preservethinking 参数控制是否保留每次对话的思维链——关闭该参数可能导致模型每次重复推理相同内容。

Reddit r/LocalLLaMA · 2026-08-21
#06模型与生态

dots3-note 开源:280B MoE,16B 激活,512K 上下文

dots3-note preview 是 dots3 家族首款开源权重模型,采用 MoE 架构,总参数 280B,激活参数 16B,上下文长度最高支持 512K tokens,可处理文本、图片、视频、音频并输出文本。 首个 dots3 家族开源模型由 ggml-org/llama.cpp 社区贡献者 ngxson 通过 Pull Request 合入,支持多模态输入与长上下文,被社区视为对长上下文 Agent 场景有实用价值。

Reddit r/LocalLLaMA · 2026-08-21原文
#07模型与生态

Llama.cpp DSpark PC Tree fork:推理提速最高 29.5%

Llama.cpp 社区成员实现 DSpark PC Tree(Parent Conditioned Drafting Tree)优化,在 RTX 5090 + Qwen 3.0 配置下实现最高约 29.5% 的推理提速。 该优化基于 arXiv 论文 arXiv:2608.02123 实现,在 llama-bench 综合测试中相比原始 DSpark 提速 10.8%,相比朴素推理基线提速 39.43%。9 个测试类别中赢得 7 个,最高达到 159 tokens/s。该实现为首次尝试,开发者尚未收到用户反馈,实测数据来自 RTX 5090(SM120)平台。

Reddit r/LocalLLaMA · 2026-08-21原文
#08模型与生态

FireRedTeam 开源 FireRedAudio:统一音频理解与生成

FireRedTeam 发布 FireRedAudio 通用音频语言模型,采用共享 9B 参数 LLM,解耦连续表示分别处理音频理解与生成任务;同时发布 FireRedTTS3,支持 24 种语言和 21 种中文方言。 FireRedAudio 支持自动语音识别(ASR)、音频理解、零样本 TTS、指令 TTS、语义/声学语音编辑,以及长达一小时录音的精确时间定位。FireRedTTS3 提供语音克隆和语音编辑功能,支持 24 种语言和 21 种中文方言。项目在 HuggingFace、GitHub 和在线 Demo 上均有发布。 ---

Reddit r/LocalLLaMA · 2026-08-21原文
#09游戏与研究

Google DeepMind SIMA 2 发布:从 Atari 到 EVE Online

Google DeepMind 发布 SIMA 2 游戏智能体,延续 15 年游戏 AI 研究路线图,将覆盖范围从 Atari 经典游戏拓展至 EVE Online 等现代复杂游戏环境。 SIMA(Scalable Instructable Multi-Agent)是 DeepMind 面向可指导多智能体游戏 AI 的长期项目。SIMA 2 在此前的技术积累上进一步拓展游戏品类覆盖广度,旨在让智能体能够泛化理解不同游戏的指令与环境。官方博客详细描述了从 Atari 到 EVE Online 的研究演进路径。 ---