返回日报索引

AI DAILY / 2026-08-13

08·13 - AI 午报:三模同发!DeepSeek V4 Pro 正式版、Grok 4.6 发布,Qwen3.8 开放权重!

今天三条主线都是模型发布:DeepSeek V4 Pro 正式版评测出炉,Grok 4.6 进入 Cursor 与 API,Qwen3.8-2.4T-A95B 开放权重。其余新闻围绕端侧视觉模型、产品更新与协作工具展开。

11 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01三大模型发布

DeepSeek V4 Pro 正式版评测出炉,五轴综合分升至第 7

DeepSeek V4 Pro 正式版(DeepSeek-V4-Pro-0813)在 Hypo 体感评测 V3 拿到五轴综合分 82.39、排名第 7,较 preview 版的 76.22 提升 6 分多。 涨得最多的是诚实维度,从 21.11 分翻到 46.67 分;幻觉控制从 66.67 分打到 100 满分,世界知识、推理和写作也同步小幅提升,长上下文在三次采样中两次多报误报、略有回落。 模型调用名仍是 deepseek-v4-pro,定价为输入 $0.43、输出 $0.87 每百万 token。完整评测与分维度拆解见本期头条。

Hypo 体感评测 V3 · 2026-08-13;DeepSeek API 官方文档 · 2026-08-13原文
#02三大模型发布

Grok 4.6 正式发布,Agentic benchmark 与 API 入口同步开放

SpaceXAI 发布 Grok 4.6,重点放在长时间运行的 Agent、交互式应用和视觉工作;模型已经在 Cursor 与 Grok Build 上线,并同步提供 API 和合作伙伴入口。 官方称它在 Artificial Analysis Intelligence Index 上得到 61 分,与 GPT-5.6 Sol 持平;该指数是由九项基准组成的综合分数。发布页还列出 GDPVal-AA、CursorBench、DeepSWE、FrontierCode、APEX-Agents 等评测,但对比数字仍属于发布方汇总的公开 benchmark 口径。 API 价格从每百万输入 token 2 美元、输出 token 6 美元起,快速变体价格为两倍;Cursor 和 Grok Build 在首周提供 2 倍包含用量。官方把它描述为能在多步任务中持续研究、分析、改代码和迭代产品原型,实际体验仍取决于所用入口、任务类型和配额。

#03三大模型发布

Qwen3.8-2.4T-A95B 开放权重,2.4T 总参数与超长上下文面向数据中心部署

Qwen3.8-2.4T-A95B 的模型权重已经出现在 Hugging Face 和 ModelScope 仓库中,这是 Qwen 首次把 Max 级别模型以开放权重形式发布。 官方模型卡写明,它采用混合专家架构,总参数量为 2.4T,每个 token 激活 95B;原生上下文长度为 262,144,可扩展至约 1,010,000 tokens。模型定位是编码、专业工作、研究和长程 Agent 任务,权重兼容 vLLM、SGLang、TokenSpeed 等推理框架。 这个开放版本是纯文本模型,所有交互都强制启用思考模式,不能关闭思考,也不支持多模态输入。Qwen Cloud 上的 Qwen3.8-Max 是基于该模型的官方服务版本,额外提供视觉输入、非思考模式、内置工具和默认 1M 上下文。如此规模的权重并不适合普通个人电脑:NVIDIA 的部署说明把它放在 GB300 NVL72 等数据中心级平台上讨论,并提供 vLLM、SGLang、NVIDIA Dynamo 和 NIM 路径。

Qwen Hugging Face 模型仓库、ModelScope · 2026-08-12;NVIDIA Technical Blog · 2026-08-12原文
#04模型与端侧能力

Liquid AI 发布 LFM2.5-VL-3B,屏幕理解与函数调用继续下沉到端侧

Liquid AI 发布 LFM2.5-VL-3B,这是一个 3.1B 级视觉语言模型,重点补强屏幕与 UI 理解、目标定位、多图像输入和函数调用。 模型采用 SigLIP2 400M NaFlex 视觉编码器与 LFM2.5-2.6B 语言骨干,采用直接回答而不是先输出长链路推理,面向实时端侧应用。官方文章给出的评测覆盖视觉理解、文档、图表、GUI 和工具调用;例如 ScreenSpot-v2 Desktop、Mobile、Web 分别为 78.7、81.2、82.2,属于发布方在 vLLM 0.26.0 和各模型推荐参数下的测试结果。 模型首发即支持 llama.cpp、MLX、vLLM、SGLang 和 ONNX。Liquid AI 称它约占 3GB 内存,在 M5 Max 上可达到 228 tokens/s,在 Galaxy S26 Ultra 上也能达到 20 tokens/s;这些速度取决于硬件、运行时和测试设置,不等同于所有设备的固定表现。

Liquid AI / Hugging Face · 2026-08-12原文
#05模型与端侧能力

Cohere Labs 发布 North Micro Vision,2.4B 原生分辨率视觉模型采用 Apache 2.0

Cohere Labs 发布 North Micro Vision Instruct:2.4B 参数、原生分辨率、Apache 2.0 许可,模型权重已经公开。 模型由 2B 语言模型和 400M 视觉编码器组成,面向文档、表格、图表、截图、OCR、空间理解和多语言图像任务;模型卡写明语言骨干上下文窗口为 128K,但多模态输入经过验证的范围最高为 8K tokens。 原生分辨率设计保留了长文档和表格的比例与细节,适合做领域微调和专用视觉应用。发布文章将公共 vLLM 支持标为 coming soon,因此不能把它写成已经完成全套服务适配;当前可以直接追踪模型仓库和模型卡中的 Transformers 使用方式。

Cohere Labs / Hugging Face · 2026-08-12原文
#06产品与 Agent

Codex 突破 1500 万活跃用户,负责人宣布再次重置额度

Codex 负责人 Tibo 在公开帖中宣布,Codex 活跃用户已经超过 1500 万,并再次为用户安排一次额度重置。 这次动作延续了他此前“每新增 100 万活跃用户就重置一次额度”的社区承诺;他表示重置预计在约一小时内生效。 这条信息来自负责人个人账号,X 页面未提供稳定的可检索正文,因此这里只记录公开表态,不把它扩写成已经完成全量到账的官方产品公告。实际额度是否刷新,以各账户界面和 Codex 使用状态为准。 参考资料:https://x.com/thsottiaux/status/2087706104814023111

Tibo / Thibault Sottiaux(Codex)· 2026-08-13
#07产品与 Agent

Google DeepMind 发布 SL2T,Pixel 11 已支持手语转文本

Google DeepMind 发布手语转文本模型 SL2T,并首次把它带进消费产品:Pixel 11 的 Gboard 和 Live Transcribe 已支持美国手语(ASL)转英语。 用户可以用手语搜索网页、起草消息或文档,也可以让 Gemini 处理问题;Live Transcribe 则支持在对话中用手语回复。官方称模型训练覆盖 50 多种手语、超过 100,000 小时数据,Pixel 11 首发后还将扩展到更多设备和语言。 SL2T 不直接把原始相机视频传给翻译服务:设备端 MediaPipe Holistic 先提取人体姿态关键点,服务端接收几何坐标序列进行翻译。Google 给出的 FLEURS-ASL 零样本 BLEURT 分数为 70,同时承认少见手势、快速拼指、被动句和缺少上下文的时态仍会出错。

Google DeepMind · 2026-08-12原文
#08产品与 Agent

Manus 1.6 Lite 与 1.6 限时免费,图片和视频额度分开计算

Manus 官方宣布,Manus 1.6 Lite 和 Manus 1.6 即日起至 8 月 25 日 23:59(新加坡时间)对免费和付费用户免除标准模式费用,但仍受每日活动额度和排队控制。 付费用户拥有优先队列,Manus 1.6 Max 不在这次活动范围内。 活动里的图片和视频额度单独计算:免费用户每天最多 20 张图片和 1 个视频,付费用户每天最多 200 张图片和 10 个视频。官方还说明,异常使用可能触发临时限制,实际等待时间以产品界面为准。

Manus Help Center · 2026-08-13原文
#09产品与 Agent

Claude Cowork 进入 Chrome 侧边栏,会话可跨设备接续

Anthropic 把 Claude in Chrome 的侧边栏升级为完整的 Claude Cowork 会话:在浏览器里启动的任务,可以在 Claude 桌面端、网页端和移动端继续。 会话记录会保存到账号历史,skills 和 connectors 也能在浏览器中继续使用;功能目前向 Max 和 Team 开放,Pro 用户将在未来数周逐步获得。 企业方案默认关闭 Claude in Chrome,管理员可以开启并限制到批准域名;当前 Chrome 侧边栏还不支持其他 Chromium 浏览器或移动端浏览器。它更接近一个跨入口的长任务会话,而不是把浏览器窗口单独变成聊天框。

#10研究与工程协作

Zed 推出 Delta,DeltaDB 将 Agent 对话与代码工作区实时关联

Zed 推出 Delta,一款面向 Agent 协作编程与代码审查的多人环境,首批用户已经进入 private beta。 Delta 的核心不是再做一个聊天窗口,而是用 DeltaDB 将对话、代码编辑和 worktree 实时复制到同一个线程;参与者可以在代码行、计划和 Agent 输出上直接评论,后续接手者也能看到决策形成过程。 Delta 支持在浏览器中通过链接打开线程,把工作转移到云 runner,并从 Claude Code 等第三方 harness 接入。Zed 说明 DeltaDB 最终会进入 Zed 编辑器,但当前先以独立应用验证这套“代码与对话一起协作”的工作方式。 项目:https://delta.dev/

#11研究与工程协作

Gemini 将逐步接入更多第三方应用

Google 宣布 Gemini 将在未来数周逐步接入更多外部应用,把会议总结、网站编辑、本地预订、音乐播放和生活服务放进同一对话入口。 首批合作包括 Granola、Otter.ai、Wix、Fever、GetYourGuide、OpenTable(英国)、Ticketmaster、iHeartRadio、Pandora、Angi、Thumbtack 和 Zocdoc,覆盖生产力与创作、本地娱乐、音乐、家庭健康与生活方式四组场景。 这些连接能力仍是分阶段上线,不同地区、账号和应用的可用时间可能不同。公告描述的是 Gemini 与外部服务的连接范围,不等于每个用户今天就能在所有服务里完成同样的操作。 ---