返回日报索引

AI DAILY / 2026-07-19

07·19 - AI 午报:Anthropic滑跪!Claude Fable 5 加入Max与Team Premium订阅

Anthropic 调整 Claude Fable 5 的订阅策略:7 月 20 日起纳入 Max 与 Team Premium,此前依赖促销窗口的高端模型开始进入常规订阅。腾讯 WorkBuddy 同步登陆 iOS、Android 与鸿蒙,Agent 产品继续向移动端延伸;商汤 SenseNova U1 Pro、FastFlowLM 加入 AMD 等更新则覆盖模型创作与推理基础设施。

12 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01Agent 与产品

Claude Fable 5 将纳入 Max 与 Team Premium 方案

Anthropic 官方宣布自 7 月 20 日起,Claude Fable 5 纳入所有 Max 与 Team Premium 订阅方案,可用量按标准方案的 50% 计算。 Pro 和 Team Standard 用户则继续通过 usage credits 使用该模型,同时获得一次性 100 美元额度。 ClaudeDevs 同时确认,将 Claude Code 每周限额提升 50% 的活动延长至 8 月 19 日,覆盖 Pro、Max、Team 以及按席位计费的 Enterprise 用户。 补充公告:https://x.com/ClaudeDevs/status/2078511173759324328

#02Agent 与产品

腾讯 WorkBuddy 手机应用登陆三大系统

7 月 18 日,腾讯 WorkBuddy 同步上线 iOS、Android 与鸿蒙应用,官方称其为首个登陆鸿蒙操作系统的通用智能体应用。 WorkBuddy 手机端可远程向电脑端派发任务,也支持在云端独立运行,提供 Skills、专家与专家团、自动定时任务、产物下载分享及项目管理等功能。 在输入方式上,WorkBuddy 支持文字、语音、拍照和本地文件导入,同时可直接接入腾讯文档与 ima 的内容,便于用户在移动端快速发起和整理任务。

腾讯 WorkBuddy · 2026-07-18原文
#03Agent 与产品

Amp 推出 20 美元与 200 美元月度订阅

Amp 启动月度订阅 Beta,提供 Megawatt(20 美元/月)和 Gigawatt(200 美元/月)两档方案,分别匹配不同规格的 orb 时长、Agent 用量额度与可用模式。 Megawatt 包含每月 750 小时的 small orbs 使用时长、20 美元的 Agent 用量,并开放 low 与 medium 模式;Gigawatt 则提供每月 1000 小时的 large orbs 使用时长、200 美元的 Agent 用量,并解锁全部模式。 超出套餐内额度后,用户仍需链接自己的 ChatGPT 订阅或额外购买 credits 来继续使用。按量付费的消费方式也将继续保留。

#04模型与推理

商汤发布 SenseNova U1 Pro 图片创作模型

商汤在7月18日发布了图片创作模型 SenseNova U1 Pro,即日起开放邀请预览。 根据官方页面信息,该模型基于 NEO-Unify 架构,具备原生图文交错思考能力;IT之家引述官方新闻稿称,SenseNova U1 Pro 最高支持 8K 原生分辨率输出,并提供数十轮 Agentic Generation Loop 与可持续局部编辑功能。 商汤称该模型文字渲染出错率较低,生成效果可比肩海外模型;相关表现仍待公开测试。正式版本及相关 API 预计在 2026 年 8 月上线。 补充报道:https://www.ithome.com/0/978/562.htm

商汤日日新 · IT之家 · 2026-07-18原文
#05模型与推理

FastFlowLM 团队加入 AMD 推进 AI 推理

AMD 于 7 月 17 日通过官方博客宣布,FastFlowLM 团队加入 AMD,将归入 AMD AI Group,负责客户端与工作站 AI 软件的开发及模型的首日适配工作。 官方称该团队还将着力改进 AMD 平台上的 AI 推理性能与效率,重点围绕面向 AMD Ryzen AI NPU 的推理任务展开。官方未说明是否涉及收购,也未披露团队规模和具体组织安排。 FastFlowLM 团队此前专注于面向 AMD Ryzen AI NPU 的开放源代码推理方案。AMD 在公开说明中仅披露团队职能定位,未提供路线图或性能指标的更多细节。

#06模型与推理

字节精确 KV 缓存嫁接让冻结模型复用已验证知识

一项新研究提出字节精确的 KV 缓存嫁接技术,将已验证知识保存为键值缓存状态,恢复时可实现与重新计算完全一致的字节级输出。 该方法在冻结模型上复用缓存状态,不修改模型参数,也不重新训练。 作者基于同一路由系统搭配 Gemma 4 12B 模型进行实验,报告在 AIME 2025 基准上准确率从 76.7% 提升至 90.0%。该实验由论文作者完成,目前尚无独立第三方复测结果。 论文:https://arxiv.org/abs/2607.14431

arXiv · 2026-07-15
#07模型与推理

ikllama.cpp 合并 openPangu 2.0 Flash 支持

ikllama.cpp 已通过 PR #2065 合并对 openPangu-2.0-Flash 模型的推理支持。 该模型总参数量为 92B,每次激活参数量约 6B,训练上下文长度达到 512K。此次实现覆盖了 MLA latent cache、DSA/SWA、mHC 以及多头 MTP 等关键技术组件,使 ikllama.cpp 能够加载并运行这一架构的检查点。 社区已发布适配 ikllama.cpp 的 GGUF 格式文件。模型页面当前注明以 CPU 推理和单序列为主要运行方式,尚未出现独立的第三方性能复测结果。 代码:https://github.com/ikawrakow/ikllama.cpp/pull/2065 模型:https://huggingface.co/ji-farthing/openPangu-2.0-Flash-ik-llama-GGUF

ik_llama.cpp · Hugging Face · 2026-07-18
#08模型与推理

开发者在 Apple Silicon 微调 1.7-bit Bonsai 8B

一名社区开发者在 Apple Silicon 设备上对 PrismML 的 Bonsai 8B 三元模型执行量化感知训练,在约 1.7 bits/weight 的极低比特宽度下,将 SWE-rebench 的补丁率恢复至实验基线水平。 该模型基于 Qwen3-8B 架构,所有权重被量化为 -1、0 或 +1 三种取值,等效存储开销约 1.7 bits/权重。实验仅使用了 30 条经过验证的微调轨迹,当学习率设为 5e-4 时,模型在 SWE-rebench 上的补丁率(patch rate)回升至 50%,与该实验记录的基线持平,但所有生成补丁均未通过测试,通过率(pass rate)保持为 0%。 该结果来自单次社区实验,不同学习率下的行为差异显著:学习率降低至 3e-4 时,三元权重的码字几乎不发生翻转,微调几乎未生效;当学习率提高到 1e-3 时,训练过程会破坏模型的工具使用能力。实验全程在 Apple Silicon 硬件上完成,没有使用云端 GPU 资源。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1v0egoi/itriedfinetuningaternarymodelbonsai8bon

Reddit r/LocalLLaMA 社区实验 · 2026-07-19
#09基础设施与研究

阿里云发布灵骏真武 M890 超节点实例

阿里云在 7 月 18 日于世界人工智能大会(WAIC)上正式发布灵骏真武 M890 超节点实例,并在乌兰察布开放邀测。 该实例提供 64 卡算力单元,卡间互联带宽达 800GB/s。根据官方数据,其训练性能较上一代提升三倍,单台设备可承载十万亿参数级的混合专家(MoE)模型推理。 同步更新的还有一系列配套能力,包括 MicroVM 安全沙箱、AgenticFS、KVCacheStore 以及 PAI-EAS TokenWorks。上述性能指标与功能描述均为官方公布数据。

#10基础设施与研究

阶跃星辰与上海期智共建智能体前沿研究院

阶跃星辰与上海期智研究院于 7 月 18 日宣布共建智能体前沿研究院,研究方向涵盖智能体网络、经济原理与 AI Safety。 双方称研究将覆盖智能体时代的基础理论、核心技术、标准体系与产业范式。 在本次合作中,双方同步提出五项核心命题,分别是行动权利、责任秩序、安全范式、经济基础和人机共生。此外,阶跃星辰在当日推出StepStar全球人才计划,面向全球招募智能体领域人才。

#11开源与社区

社区驱动声称可解锁 CMP 170HX 的 64GB HBM2e

社区开发者基于 NVIDIA 610.43.03 开放内核模块发布了一组针对 CMP 170HX 的补丁,声称可将对用户可见的显存容量从 8GB 提升至 64GB HBM2e,并启用 173 TFLOPS 的 BF16 算力与 PCIe Gen2 x4 连接。 该补丁项目在说明中列出了对 Fedora、Ubuntu、Debian、Arch 和 openSUSE 等发行版的支持,并要求在打补丁后通过冷启动使改动生效。 目前所有结果仅来自作者发布的帖子和代码仓库,未经过 NVIDIA 官方验证,也没有独立第三方的复测报告。下载并安装此类第三方修改的驱动模块,可能引入安全风险和硬件损坏风险,相关说法仅代表社区开发者的声明。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1v088us/cmp170hx8gbperfmemorypciegen2unlocknvidia 代码:https://github.com/amoghmunikote/cmpunlocker

Reddit r/LocalLLaMA · GitHub · 2026-07-18
#12开源与社区

Trivium 用锁文件管理 Agent Skills 版本

开源 CLI 工具 Trivium 通过精确的 Git commit 哈希固定 Agent Skills 版本,并自动生成 skills.lock 文件,用于减少手动管理技能目录造成的版本漂移。 用户可以通过 Trivium 保存不同的技能组合并切换命名环境,每次锁定都会将依赖的具体提交记录写入 lock 文件,保证在不同机器或时间点复现一致的技能集。 该项目由开发者通过 Reddit 对外发布,代码仓库已公开。目前 Trivium 仍处于早期社区工具阶段,未见公开的大规模使用数据或来自第三方组织的正式评测报告。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1v04xlm/toolforreproduciblemanagementofagentskills 代码:https://github.com/AlapinEnjoyer/trivium ---