DeepSeek V4 正式版预告 7 月中旬上线,API 将启用峰谷定价
DeepSeek 向用户发送邮件,宣布 V4 正式版计划于 7 月中旬上线,届时 API 将引入峰谷定价机制。 正式版发布后,每日 9:00 至 12:00 和 14:00 至 18:00 为高峰时段,deepseek-v4-pro 与 deepseek-v4-flash 模型价格将翻倍,涵盖输入(含缓存命中与未命中)和输出费用。官方将提前 24 小时邮件通知用户,用户可选择退出并申请退款。
AI DAILY / 2026-06-30
DeepSeek 宣布 V4 正式版计划 7 月中旬上线,届时 API 将启用峰谷定价,高峰时段价格翻倍。美团正式发布 LongCat-2.0,1.6 万亿 MoE 架构,API 定价 9.9 元/5000 万 tokens。Anthropic 推出自托管 Claude apps gateway,支持企业 SSO 和 Bedrock/GCP 路由;同日 Amodei 在国会听证会警告开源模型风险,引发 Reddit 社区强烈反弹。微软 Azure 基于英伟达 GB300 全面推出 Claude 云服务。三星与 SK 集团分别公布超 4700 万亿韩元投资计划,覆盖半导体与 AI 数据中心。
DeepSeek 向用户发送邮件,宣布 V4 正式版计划于 7 月中旬上线,届时 API 将引入峰谷定价机制。 正式版发布后,每日 9:00 至 12:00 和 14:00 至 18:00 为高峰时段,deepseek-v4-pro 与 deepseek-v4-flash 模型价格将翻倍,涵盖输入(含缓存命中与未命中)和输出费用。官方将提前 24 小时邮件通知用户,用户可选择退出并申请退款。
美团正式发布 LongCat-2.0 大语言模型,总参数量 1.6 万亿,MoE 架构每个 token 激活约 480 亿参数,支持 100 万 token 上下文窗口。 该模型此前以 "owl-alpha" 为名在 OpenRouter 上秘密测试。 定价方案极具冲击力:新用户认证赠送 1000 万 tokens,月付 9.9 元可得 5000 万 tokens,399 元可得 10 亿 tokens。API 按量付费中,缓存命中时输入仅 ¥0.04/百万 tokens,未命中 ¥2.00,输出 ¥8(限时优惠),缓存命中不计入资源包。
DeepSeek V4 的 GGUF 量化模型支持已通过 PR #24162 合并到 llama.cpp 主分支。 用户可通过 git pull 和 cmake 编译后直接下载 GGUF 文件在消费级硬件上本地运行 DeepSeek V4,大幅降低部署门槛。
Krea-2-Turbo 图像模型被曝光可通过修改 SGLang diffusion 的 prompt adherence rebalancing 参数实现完全无审查,生成任意内容。 该模型约 3 秒可生成高质量图像,4bit GGUF 量化版约 8GB,可在本地运行。此外还支持参考图像风格迁移和掩码编辑。
开发者 Danmoreng 发布了基于 GGML 的 Qwen3-TTS 推理实现 qwen3-tts.cpp,在 RTX 5080 上达到约 5 倍实时速度,比 Python 参考实现快约 15 倍。 配套跨平台桌面 GUI 工具 Qwen-TTS-Studio 同步推出。该项目支持 0.6B 和 1.7B 模型、语音克隆、指令式语音设计、说话人嵌入混合与流式输出。 ---
Anthropic 推出 Claude apps gateway,一款自托管控制平面,可将 Claude Code 路由至 Amazon Bedrock 和 Google Cloud。 该网关以单个无状态容器部署,提供企业 SSO 登录、集中强制策略、基于角色的访问控制、每用户成本归因以及支出上限设置,并支持在云服务商之间进行故障转移。除非配置为使用 Claude API,否则不会将推理流量或使用数据发送给 Anthropic。
Anysphere 于 6 月 29 日发布了 AI 编程助手 Cursor 的 iOS Beta 版,仅支持 iOS 26.0 及以上系统。 用户可在移动设备上访问云端 Agent。另有社区用户发现,Cursor 从 3.7 版本起内置了 "local mode" 开关(默认关闭),可能支持自带 API Key(BYOK)的本地化推理。
Codex 团队宣布完全重置用量限制,并在未来 24 小时内额外提供一次手动重置额度。 此前有用户报告用量消耗过快,团队调查后确认原因为 Auto-review 过于主动、某项改动触发过多 subagent 工作以及后台建议在失败后重试频繁。目前相关改动已撤销,热修复已部署至 CLI、桌面应用和后端。 参考资料:https://x.com/thsottiaux/status/2071740419030053227
SpaceXAI 宣布其语音 API 已集成至 Vercel AI Gateway,开发者可通过该网关直接调用语音合成与识别能力。 Elon Musk 本人转发了相关推文。具体功能细节、定价及性能指标尚未披露。
微软 Azure 全面推出 Anthropic Claude 模型云服务,首批提供 Claude Opus 4.8 和 Claude Haiku 4.5,底层基于英伟达 GB300。 该服务支持从编程、代理式工作到复杂推理的各种用例,企业在 Azure 合规框架内即可使用 Claude 系列模型。
Logan Kilpatrick 发推预告 Nano Banana 2 Lite 和 Omni Flash 将于今晚(6 月 30 日)上线。 此前消息称该产品为 3.1 flash lite image,正式名称可能有变动。社区对 3.5p 模型迟迟未发布、厂商依赖多模态功能出货表示担忧。 ---
Anthropic CEO Dario Amodei 在 6 月 28 日国会听证会上警告,开源 AI 模型可能将行业引向"非常危险的地方"。 该言论在 Reddit r/LocalLLaMA 引发强烈反弹。用户系统性地列出反例:GLM 5.2、Nemotron3 Ultra 等开源模型公开了权重、数据和训练脚本;社区通过 HuggingFace 上的微调、合并和 LoRA 持续改进模型;Qwen 27B 等小型 MoE 和密集模型可在消费级硬件上运行。Amodei 此前曾以更激烈措辞称"开源模型将吞噬你的孩子"。
社区在 Anthropic iOS 端 Claude app 最新版本的字符串中发现,Fable 5 可能不在订阅计划内,需要 KYC 身份认证后才可额外购买额度。 相关字符串包括"Fable 5 消耗您订阅计划以外的使用额度""购买额度以使用 Fable 5""您购买的额度将在您的身份通过认证之后添加到您的账户内"。这暗示 Anthropic 可能将下一代模型作为独立计费产品,与现有订阅解耦。目前为未证实消息。 ---
三星宣布未来十年投资约 2655 万亿韩元,SK 集团宣布中长期投资 2100 万亿韩元,两项计划均覆盖半导体制造与 AI 数据中心建设。 韩国政府同步公布了涵盖半导体、AI 数据中心和 Physical AI 的国家投资框架,其中内存芯片部分涉及西南部四座新 Fab 的 5180 亿美元投入,以及中部地区 520 亿美元 HBM 封装中心。AI 数据中心由 SK、GS 和 Naver 等企业至 2035 年累计投入约 3560 亿美元。 ---
两个轻量级自主 AI Agent 项目在社区引起关注。 UmaDev 模拟总监 Agent 团队,可指挥 Claude/Codex 等底座从零构建商业化系统,流程包括联网调研、生成 PRD、架构文档、UI/UX 文档、拆解任务、驱动开发和交付。WorkBuddy 则以 180 行核心循环代码实现了 7 个工具的自主编程 Agent,支持通过 Hermes 自审机制防止 AI 虚假完成,并以 Docker 镜像发布。
NVIDIA 发布技术博客,详细介绍使用 FP8 混合精度优化 Transformer 模型训练的方法,包括调整层归一化和注意力机制。 该指南基于 NVIDIA 实践经验,面向 H100 及更新一代 GPU,目标是降低显存占用并提升训练吞吐。 ---