返回日报索引

AI DAILY / 2026-07-03

07·03 AI 午报

微软宣布成立 Microsoft Frontier Company,投入 25 亿美元向企业派驻 6000 名专家,提供不绑定单一模型的 AI 部署服务。OpenAI 被曝向美国政府提议出让公司 5% 股份,估值约 426 亿美元。模型侧,社区开发者通过补丁 llama.cpp 成功在单张 RTX 5090 上跑通 DeepSeek V4 Flash 完整 1M token 上下文,峰值显存仅 31GB。葡萄牙发布首个面向欧洲葡语的开源大模型 AMALIA。国内,字节 Seed 发布 EdgeBench Agent 超长周期基准,阿里计划整合三大 Agent 产品,昆仑万维天工上线 Skywork Tags。

12 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01行业与资本

微软成立 Frontier Company:25 亿美元 + 6000 名专家

微软宣布成立新业务部门 Microsoft Frontier Company,首期投入 25 亿美元,将向全球企业客户派驻 6000 名行业和工程专家,协同设计并部署大规模 AI 系统。 微软商业业务 CEO Judson Althoff 表示该部门超越现有的前向部署工程模式,基于可衡量的业务成果交付 AI 解决方案。官方强调该平台支持模型多样化,客户可使用 OpenAI、Anthropic 等不同来源的模型而不被单一供应商锁定,同时承诺保护客户知识产权与数据。该部门将通过埃森哲、安永等合作伙伴全球扩展。

#02行业与资本

OpenAI 据悉向美国政府提议出让 5% 股份

据《金融时报》和 CNBC 报道,OpenAI 已向美国政府提议出让公司 5% 的股份,按其 852 亿美元投后估值计算约值 426 亿美元。CEO Sam Altman 认为这是与公众分享 AI 发展红利的方式。 该提议设想其他美国 AI 公司也通过主权财富基金向政府出让类似股份,Anthropic、Google 和 Meta 被列为潜在参与方。CNBC 确认相关谈判已持续超过一年,Altman 最早于 2025 年向政府提出这一概念。白宫及各家 AI 公司均未立即回应。

#03行业与资本

报道称 Anthropic 启动自研 AI 芯片并接触三星电子

据 The Information 报道,Anthropic 已启动自有 AI 芯片的早期研发,并与三星电子就潜在制造合作展开谈判。若成行,Anthropic 将加入 OpenAI、Google、Meta 等自研芯片的行列,进一步降低对 NVIDIA 的依赖。上述芯片研发进度及最终制造方案尚未获官方确认。 ---

The Information(via X/Twitter)原文
#04模型与开源

DeepSeek V4 Flash 单卡 1M 上下文:llama.cpp CUDA 补丁显存狂砍 8 倍

开发者 spencer-zaid 通过补丁 llama.cpp 的 DSA lightning indexer 并手写 CUDA 内核,在单张 RTX 5090(32GB)上成功运行 DeepSeek V4 Flash 模型,实现完整 1M token 上下文推理。此前该模型在 1M 上下文下需要约 256GB 显存。 具体数据:256K 上下文预填速度从 56 t/s 飙升至 263 t/s(提升 4.7 倍),1M 上下文预填 159 t/s、解码 13.7 t/s,峰值显存仅 31GB。通过 needle-in-haystack 测试验证了 100K、512K 和 1M 上下文下的检索正确性。该补丁基于上游 PR #24231(fairydreaming 提交),但上游尚未集成 CUDA 路径。

#05模型与开源

LeVLJEPA + SIGReg:视觉-语言 JEPA 预训练超越 CLIP

Yann LeCun 转发两项视觉-语言预训练突破:LeVLJEPA(Lukas Kuhn 等人提出)是首个完全非对比式的端到端视觉-语言预训练方法,性能与 CLIP 竞争;SIGReg 在大规模数据(CC12M → Datacomp-L)上的 JEPA 预训练超越了 CLIP 和 SigLIP 的目标检测性能。两项工作以非对比方式替代传统的负样本对比学习,延续了 LeCun 推动的 JEPA 路线。目前相关信息仅来自 X/Twitter 转发,未找到正式论文。

#06模型与开源

葡萄牙发布 AMALIA:首个欧洲葡语开源大模型

葡萄牙高校及研究机构联合体发布首个面向欧洲葡萄牙语的开源大模型 AMALIA,包含 9B 参数语言模型 AMALIA-9B 和视觉语言模型 AMALIA-VL。项目获政府支持及 550 万欧元欧盟复苏基金,模型、训练数据集和源代码均以开源许可发布。官方称其在欧洲葡语基准测试中具有竞争力,提供了从数据处理到评估的端到端开源生态。 ---

#07推理与基础设施

6×P40 跑 MiniMax M2.7:Flash Attention 必开,Q8 反而慢 12.8%

Reddit 用户 OldGrapefruit8774 发布 6 张 NVIDIA Tesla P40(共 144GB VRAM)在 llama.cpp 上运行 MiniMax-M2.7 Q3KXL 的详细基准测试。关键发现:Flash Attention 关闭后 65K 上下文预填速度从 66 t/s 暴跌至 19 t/s,131K 上下文直接创建失败;Q8 KV 缓存反而比 F16 慢 12.8%;GGMLCUDAP2P 和 launch queues 多路无性能增益。最佳配置 batch 2048/ubatch 256,layer split 模式,65K 上下文下预填 66 t/s、生成 6.38 t/s。

#08推理与基础设施

Gemma 4 WebGPU 内核 255 tok/s:浏览器端推理迫近云端

开发者 @xenovacom 发布针对 Gemma 4 模型的 WebGPU 内核优化,在浏览器端实现 255 tok/s 推理速度。社区认为当本地模型能承担大部分日常推理任务时,用户只需在复杂场景下调用云端服务,兼顾隐私与性能。该优化基于 WebGPU 标准,无需额外插件或后端。 ---

#09Agent与产品

Claude Code Artifacts 面向 Pro/Max 用户开放

Anthropic 宣布 Claude Code 的 Artifacts 交互页面功能从 Team/Enterprise 计划扩展至 Pro 和 Max 用户。用户可让 Claude 生成 PR walkthrough、项目仪表板或数据分析图表等网页,并实时发布在 claude.ai 的个人私密空间。Team 和 Enterprise 上还支持生成团队共享链接。

#10Agent与产品

字节 Seed 发布 EdgeBench:Agent 超长周期学习基准

ByteDance-Seed 团队发布 EdgeBench,一个用于研究 AI Agent 从真实世界环境中学习的超长周期基准测试,共 134 个任务覆盖科学、系统工程、优化、知识工作、数学、游戏六大类别,目前公开 51 个任务及完整评估框架。每个任务运行 12 小时以上,部分扩展超过 72 小时,基于约 38000 小时 Agent 交互数据。官方发现性能随交互时间呈对数 S 形缩放(R²=0.998),AI 从环境中学习的速度大约每三个月翻倍。

#11Agent与产品

阿里拟以 QoderWork 为基础整合悟空与 MuleRun

据 IT 之家报道,阿里巴巴计划以桌面 AI 工具 QoderWork 为基础,整合企业级 AI 工作平台"悟空"与面向多国的"MuleRun",打造面向企业生产力的新 AI 产品。该计划由钉钉 CEO 陈宇森负责,现有产品将无缝升级,用户权益不受影响。

#12Agent与产品

NVIDIA 推 AI 云收入分成:加速 AI 原生公司获取算力

NVIDIA 推出新商业模式,通过收入分成和信用支持机制与 AI 云伙伴(Sharon AI、Firmus 等)共同部署大规模多租户 AI 工厂。该模式使模型构建者、推理提供商和 AI 原生公司(Baseten、Fireworks AI、Together AI 等)无需经历选址、电力采购等环节即可快速获得全栈 NVIDIA 加速计算。