返回日报索引

AI DAILY / 2026-07-06

07·06 - AI 午报:Anthropic 扩张算力,SeFi-Image 开源

今天的主线是 AI 基础设施继续向两端扩张:Anthropic 被曝计划在欧洲和澳大利亚租赁大规模数据中心容量,SeFi-Image 以 1B 到 5B 参数规模开源文本生成图像模型,Qualcomm 则用 GenieX 把 Windows 笔记本上的本地 LLM 运行纳入 SDK。工程侧,llama-server 的 KV cache 持久化问题被社区定位并给出补丁,GLM 5.2 FP8 在 Terminal-Bench 2.1 的社区测试也显示,Agent 任务正在更多依赖推理栈、缓存和部署形态,而不只是模型名称。

8 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01算力与模型发布

Anthropic 被曝计划在欧洲和澳大利亚租赁大规模数据中心容量

据 Australian Financial Review 和 Data Center Dynamics 报道,Anthropic 正计划在欧洲和澳大利亚扩充数据中心容量。 AFR 获取的标书称,Anthropic 希望在澳大利亚购买至少 1.4 吉瓦数据中心容量,目标是在明年底前启用至少 1 吉瓦,预计建设成本最高可达 150 亿美元。 报道还提到,Anthropic 正在伦敦和悉尼招聘负责数据中心租赁与开发的岗位。此前 Anthropic 的算力计划主要集中在美国,并更多依赖云服务提供商;如果这些租赁计划落地,说明前沿模型公司的算力竞争正在从美国本土云资源,扩展到跨区域、长期租赁的数据中心布局。 参考资料:https://www.datacenterdynamics.com/en/news/anthropic-seeks-data-center-leasing-deals-in-europe-and-australia/

Australian Financial Review · 2026-07-05;Data Center Dynamics · 2026-07-05原文
#02算力与模型发布

SeFi-Image 开源 1B 到 5B 文生图模型,并提供 Turbo 加速版本

SeFi-Image 团队发布开源文本到图像基础模型,提供 1B、2B、5B 多种规模,并包含 Turbo 少步蒸馏加速版本。 项目采用“语义优先扩散”思路,把语义结构与纹理细节的生成过程拆开,让语义潜变量先于纹理降噪,为后续图像细节生成提供结构锚点。 官方页面称,5B 版本训练资源约为 125K A800 GPU 小时,并在 GenEval、LongTextBench、DPG-Bench 等测试中取得有竞争力的结果。项目同时发布 Base、RL 和 Turbo 三类变体,提供命令行与 Python API 推理代码。由于这是新开源模型,实际中文提示、长文本渲染和消费级硬件部署效果还需要社区复测。 参考资料:https://huggingface.co/SeFi-Image/SeFi-Image-5B-turbo ---

SeFi-Image Project · 2026-07-06原文
#03本地推理与基础设施

llama-server KV cache 恢复缺陷被定位,100K 上下文首次查询从 720 秒降至 1 秒

Reddit 用户 apollomg 报告称,llama-server 的 slot save/restore 功能在进程重启后会丢掉可复用的 KV cache,原因是 checkpoint 元数据只保存在内存中,没有随状态文件持久化。 这会导致恢复后首次查询重新处理大量上下文,长上下文场景下延迟非常明显。 该开发者提交了一个 117 行补丁,在保存状态时额外写入 state.ckpt 形式的 sidecar 文件,恢复后只需重处理少量尾部 token。帖子给出的实测数据是,100K 上下文场景中,恢复后的首次查询从约 720 秒降至约 1 秒。该问题据称仍存在于上游 llama.cpp master 分支,补丁是否进入主线还需要等待项目维护者确认。

Reddit r/LocalLLaMA · 2026-07-06原文
#04本地推理与基础设施

Qualcomm 发布 GenieX SDK,让 Windows 笔记本调度 CPU/GPU/NPU 运行 LLM

Qualcomm 发布 GenieX SDK,用于在 Windows 笔记本上通过 CPU、GPU 和 NPU 运行 LLM。 Reddit 社区转述的用户实测显示,Snapdragon X Elite 上运行 Gemma 4 26B A4B 模型可达到约 20 tok/s,首 token 延迟约 0.5 秒;Qwen 3.6 27B MTP 模型在 GPU 上约 10 tok/s。 GenieX 支持 llama.cpp 和 Q40 GGUF 模型,并尝试在异构硬件间自动调度。它的意义不在于单次跑分超过桌面 GPU,而是把本地模型运行纳入更标准的 PC SDK 路线:对普通 Windows AI PC 用户来说,模型、推理引擎和硬件调度之间的配置成本可能下降。不过,当前性能数据主要来自单一社区实测,功耗、散热和不同机型表现仍需更多样本。 ---

Reddit r/LocalLLaMA · 2026-07-05原文
#05Agent 与评测

GLM 5.2 FP8 社区测试 Terminal-Bench 2.1 达到 79.8% 通过率

Reddit 用户 Daemonix00 在 H200 上使用 SGLang 部署 GLM 5.2 FP8,并开启 FP8 KV cache,在 Terminal-Bench 2.1 中报告 79.8% 通过率。 该测试共 89 个任务,通过 71 个,帖子称缓存命中率达到 98.8%。Terminal-Bench 模拟终端操作任务,因此比纯问答基准更接近代码 Agent 和命令行 Agent 的实际工作方式。 这仍是一次非官方社区测试:存在 1 个超时未重跑,也没有看到独立复现。可以把它视为 GLM 5.2 在工程型 Agent 任务上的一条高信号样本,而不是最终排名。更值得注意的是部署形态本身:FP8 模型、FP8 KV、SGLang 和高缓存命中率共同决定了结果,评估 Agent 时很难再只比较模型名称。

Reddit r/LocalLLaMA · 2026-07-05原文
#06Agent 与评测

SupraLabs 发布 8 亿参数推理摘要模型与 51M 参数提示路由器

SupraLabs 连续发布两个小模型工具:8 亿参数的 reasoning-summarizer-800m-pre-gguf,以及 51M 参数的 Supra-Router-51M。 前者用于把编码 Agent 的推理轨迹和工具调用总结成结构化 JSON,包括标题、副标题、摘要和当前任务字段;团队同时开源了 6.1 万条 reasoning-summaries-61k 训练数据。 Supra-Router-51M 则用于按用户请求把任务路由给更小或更大的模型,配套开源 Prompt-Routing-Dataset。这两类模型都不追求直接替代大模型,而是服务于 Agent 系统的“外围能力”:压缩轨迹、展示进度、降低延迟、把不同复杂度任务分配给不同模型。它们反映了一个趋势:Agent 产品的体验问题,越来越多会由小模型、路由器和状态摘要器来补足。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1uo826q/releasesuprarouter51matinypromptrouting ---

Reddit r/LocalLLaMA · 2026-07-05原文
#07产品与行业

Grok 改用每周共享额度,替代按产品拆分的每日限额

xAI 的 Grok 文档更新显示,付费用户将使用每周共享额度,替代过去 Chat、Imagine、Voice、Build 等产品分别设置每日限额的方式。 不同操作按计算资源消耗扣减额度,普通聊天消耗较低,高质量视频生成或长编码任务消耗更高。 达到周限制后,付费功能会暂停,但免费层级聊天和语音仍可继续使用。用户可以购买额外额度、升级订阅或开启自动充值。这个调整把额度管理从“每个产品单独限量”改为“跨产品算力池”,更贴近多模态产品组合的实际成本结构,也让用户自己决定把额度花在聊天、图像、视频还是编码任务上。

#08产品与行业

Fedora 在社区反对后叫停 AI Developer Desktop 倡议

Fedora Council 发布声明,确认不再继续推进 AI Developer Desktop 社区倡议。 该倡议原本试图围绕 AI 开发体验整合 Fedora 桌面能力,但在社区讨论中遭到明显反对,争议集中在项目方向、维护成本、默认集成边界以及自由软件社区如何处理 AI 工具等问题。 这不是一个单纯的产品下线消息,而是开源社区对“AI 功能是否应该成为桌面发行版战略方向”的一次投票式反馈。它说明 AI 开发工具虽然快速进入主流工作流,但进入基础发行版、桌面环境和默认体验时,仍会触发更高强度的治理与价值边界讨论。 ---