返回日报索引

AI DAILY / 2026-07-26

07·26 - AI 午报:韩国加码AI基础设施,OpenAI宕机后重置用户额度

今天的主线是AI服务一边扩容、一边补稳定性:NVIDIA披露与SK Group规模超过5000亿美元的基础设施合作,NAVER数据中心将扩至约10万块GPU;OpenAI同日多次出现服务异常,恢复后重置Codex与ChatGPT Work额度。开发工具侧,llama.cpp合并MCP stdio支持,TensorSharp与WebGPU项目继续压低本地推理门槛。

8 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01算力与公司动态

韩国与NVIDIA扩大AI基础设施合作,SK项目规模超5000亿美元

NVIDIA称,SK Group与NVIDIA公布了一项规模超过5000亿美元的综合合作计划,用于建设AI基础设施,并采用SK hynix HBM4与NVIDIA Vera Rubin平台。 NAVER、Brookfield与NVIDIA还将NAVER位于GAK Sejong的数据中心扩建至200MW,规模约10万块GPU,是今年6月首期规划的三倍以上。 现代汽车同时公布与NVIDIA联合开发机器人参考平台。双方既有扩建计划包括5万块Blackwell GPU,以及把DRIVE Hyperion自动驾驶开发平台接入现代汽车的车辆平台。各项目的投资规模、硬件和时间表相互独立。

NVIDIA Blog · 2026-07-24;Hyundai Motor Group · 2026-07-25原文
#02算力与公司动态

OpenAI一天内多次出现服务异常,并重置Codex与ChatGPT Work额度

OpenAI服务在7月25日出现多次异常,官方状态页先后记录了三个不同时段的问题。 世界时09:17与11:35出现的两次“高错误率”事件均已恢复;世界时22:09起,部分用户又遇到无法加载或继续ChatGPT对话的间歇性错误,官方随后实施缓解措施并监测恢复情况。 OpenAI团队成员Tibo在X表示,前一晚约2点至4点发生接近全球性的宕机;服务恢复后,所有Codex与ChatGPT Work用户的使用额度已被重置。额度重置信息来自团队成员公开发文。 参考资料:https://x.com/thsottiaux/status/2081096447718723984

OpenAI Status · 2026-07-25;X @thsottiaux · 2026-07-25原文
#03算力与公司动态

彭博社:DeepSeek暂停第二轮融资,仍可能恢复并筹备IPO

彭博社援引知情人士报道,DeepSeek已口头通知部分潜在投资者,不会按照此前预期的时间表签署第二轮融资协议。 报道称,暂停部分源于创始人梁文锋对首轮融资期间内部发言外泄感到不满。DeepSeek未公开确认相关安排。 报道同时称,此次融资日后仍可能恢复,DeepSeek已开始筹备首次公开募股,最早可能在年内申报。融资状态、原因与IPO时间表均为媒体引述的未具名消息。 补充报道:https://www.bloomberg.com/news/articles/2026-07-25/deepseek-said-to-tell-backers-of-funding-pause-after-viral-posts

Bloomberg · 2026-07-25
#04Agent与开放工具

llama.cpp合并MCP stdio支持,本地模型可直接调用MCP工具

llama.cpp于7月25日合并MCP stdio传输支持,补齐本地工具调用链路。 GitHub PR #26062显示,服务器现在可以接受MCP JSON配置,启动和管理子进程,并把MCP工具暴露为server tools;相关实现分别处理JSON-RPC消息、底层字节流和子进程生命周期。 HTTP类MCP此前已有支持,本次新增的是基于标准输入输出的传输方式。开发者可把本地MCP server交给llama.cpp管理,再由本地模型通过统一工具接口调用。

ggml-org/llama.cpp · GitHub · 2026-07-25原文
#05Agent与开放工具

4GB显存运行本地Agent工作区,2B模型可承担工具调用与RAG

一名开发者在RTX 3050 Ti Laptop 4GB显存、Ubuntu 24.04环境中测试自托管Agent工作区,Qwen3.5 2B Q4KM达到约96 tok/s,并可完成原生工具调用、视觉和本地RAG。 同一测试中,Qwen3.5 0.8B约122 tok/s,4B版本约25 tok/s且约三分之一权重溢出到CPU,9B版本约8.6 tok/s。测试统一使用4096上下文、预热后取3次中位数。 RAG流程使用本地Ollama嵌入模型。由于2B聊天模型约占2.4GB、0.6B嵌入模型约占1.2GB,两者会轮流进出显存,损失主要来自模型重载而非逐token降速。作者也记录了小模型的边界:工具过多时容易选错,通用模型生成交互式HTML时可能留下未闭合标签,代码任务仍需切换到专用Coder模型。公开页面无法完整读取,以上均为项目作者测试。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1v6l726/localagentworkspaceona4gblaptopgpurtx

Reddit r/LocalLLaMA · 项目作者测试 · 2026-07-25
#06本地推理

Slipstream让Mac从SSD流式读取MoE专家,36GB内存运行百亿至千亿级模型

项目作者在Reddit发布Slipstream,这款macOS应用基于llama.cpp分叉,把常驻权重放在内存,并按路由从SSD加载MoE专家。 有界RAM缓存会拒绝可能触发系统交换的加载请求。作者称,Qwen3.6-35B-A3B Q4在10GiB缓存下约13 tok/s,缓存增至14GiB后约19 tok/s;Laguna 118B-A8B在36GB内存设备上约2.8 tok/s。 作者同时公开了失败测试:内置NVMe与慢速USB硬盘组成的双SSD条带化没有收益,预测式预取约下降8%,热专家预留下降1%至6%。上述速度和对比均为作者单机结果,公开页面未能通过直接访问或本机代理完整读取。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1v6eqvo/irun35b480bcodingmodelsonmy36gbmacbook

Reddit r/LocalLLaMA · 项目作者测试 · 2026-07-25
#07本地推理

TensorSharp开放.NET本地推理引擎,与llama.cpp对比CUDA和Vulkan性能

TensorSharp开放原生.NET本地大语言模型推理引擎,兼容GGUF,并提供OpenAI与Ollama风格接口。 项目方在相同GGUF文件和GPU条件下测试称,Gemma 4 E4B与2-bit Qwen3.6-35B-A3B的CUDA prefill最高约为llama.cpp的1.28倍,首token约1.27倍;Gemma 4 12B的Vulkan decode约为1.21倍。 这些数字来自项目仓库发布的benchmark,不是独立第三方测评。项目采用MIT许可证,并把逐场景测试与引擎对比报告一并公开。 测试报告:https://github.com/zhongkaifu/TensorSharp/blob/main/docs/enginecomparisonreport.md

TensorSharp · GitHub · 2026-07-25原文
#08本地推理

LFM 2.5 230M通过WebGPU在浏览器内达到每秒1400至1500 token

一名开发者公布自定义WebGPU后端,可在浏览器、Electron或Tauri中运行,并支持NVIDIA与Apple Silicon。 作者测试显示,RTX 3090运行LFM 2.5 230M约为1400至1500 tok/s,M4约为400至500 tok/s;Bonsai 1.7B在RTX 3090约为500至600 tok/s,在M4约为100至150 tok/s。 NVIDIA路径采用多阶段融合内核,Apple Silicon路径使用融合mega-kernel降低TBDR开销。项目仍在开发,速度均为作者给定环境下的测试;公开页面未能通过直接访问或本机代理完整读取。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1v6e0uq/lfm25230mrunningat1440toksinbrowser ---