返回日报索引

AI DAILY / 2026-07-17

07·17 - AI 午报:Kimi K3 发布,机器人十万小时

今天的主线是模型与 Agent 拿出更具体的工程数字:月之暗面发布 2.8 万亿参数的 Kimi K3,权重计划 7 月 27 日开放;小米用 10 万小时免实体轨迹预训练 Xiaomi-Robotics-1,NVIDIA 的 Nemotron 3 Embed 在 RTEB 综合排名第一。开发工具侧,OpenAI 确认 GPT-5.6 在无沙盒全访问模式下有误删文件的风险,Gemini API Managed Agents 和 Claude Code /code-review 则补上预算、定时与审查控制。产品侧,Google Vids 加入 Gemini Omni 和个人数字分身,ChatGPT 扩展青少年保护并允许家长默认开启学习模式。

15 NEWS ITEMS公众号已发布ASIA/SHANGHAI
#01模型与机器人

月之暗面发布 2.8T 参数 Kimi K3,权重 7 月 27 日开放

月之暗面正式发布 2.8 万亿参数的多模态模型 Kimi K3,完整模型权重计划于 7 月 27 日前开放。 模型原生支持视觉理解,拥有 100 万 token 上下文窗口。K3 基于 Kimi Delta Attention 和 Attention Residuals 构建,采用 Stable LatentMoE 架构,896 个专家中每次激活 16 个;从 SFT 阶段起就使用量化感知训练,权重 MXFP4、激活 MXFP8。 Kimi K3 已在 Kimi.com、Kimi Work、Kimi Code 和 API 上线,当前默认思考强度为 max,后续会增加 low 和 high 两档。API 每百万 token 定价:缓存命中输入 2 元、未命中输入 20 元、输出 100 元,官方称编程场景缓存命中率超过 90%。已知限制也写进了博客:历史思考回传不完整时生成质量不稳定,处理简单任务时可能过度执行。

#02模型与机器人

NVIDIA 开源 Nemotron 3 Embed,RTEB 综合排名第一

NVIDIA 开源 Nemotron 3 Embed 嵌入模型系列,旗舰 8B BF16 版本在官方公布的 RTEB 综合评测中得到 78.5%,排名第一。 系列包含 8B 和 1B 两种规格,支持 32K 上下文与 34 种语言检索,权重已在 Hugging Face 发布并允许商业使用。 1B 版本由 8B 模型经结构化剪枝和蒸馏得到;面向 Blackwell 的 NVFP4 量化版,官方称吞吐最高提升两倍。NVIDIA 同时给出微调与蒸馏配方,以及 NIM 微服务部署入口。 模型:https://huggingface.co/nvidia/Nemotron-3-Embed-8B-BF16

NVIDIA · Hugging Face · 2026-07-16原文
#03模型与机器人

小米发布 Xiaomi-Robotics-1,预训练使用 10 万小时轨迹

小米机器人团队发布 Xiaomi-Robotics-1,以 10 万小时免实体轨迹预训练,再用真实机器人数据完成后训练。 预训练数据覆盖 1700 多种家庭、商业和工业场景;后训练使用跨实体数据集,其中包含 7200 小时真实家庭机器人数据。 官方称,模型学习全新复杂任务时,平均每项任务只用不到 10 小时演示数据,总体成功率 75%;在四项机器人仿真基准上达到当时最优。模型、代码和技术报告入口已在项目页开放。

Xiaomi Robotics · 2026-07-16原文
#04模型与机器人

MiniMax 上线 Music 3.0,升级编曲与人声合成

MiniMax 上线 text-to-song 模型 Music 3.0,并提供 music-3-free 免费型号。 官方文档称,新版加强了语义理解,对风格和编曲要求的处理更准确;器乐生成可指定乐器,支持滑音、连奏等演奏技法。 新版人声引擎可以控制旋律、咬字、呼吸和多层和声,并专门处理了高频机器噪声。开发者可通过 API 调用 music-3.0,也可以先用免费型号体验。 ---

MiniMax 开放平台 · 2026-07-16原文
#05Agent 与开发工具

OpenAI 确认 GPT-5.6 在无沙盒全访问模式下可能误删文件

Codex 负责人 Tibo 确认,团队调查了少量 GPT-5.6 意外删除文件的报告,问题通常发生在启用 full access、不开沙盒和自动审查的环境。 模型在尝试把 $HOME 环境变量改作临时目录时,可能误删真正的用户主目录。 OpenAI 正在更新开发者消息,引导用户选择更安全的权限模式,并增加额外的 harness 防护。Tibo 表示,团队后续会发布详细的事后分析。

OpenAI Codex 负责人 Tibo · 2026-07-16原文
#06Agent 与开发工具

Gemini API Managed Agents 增加免费层与预算护栏

Google 为 Gemini API Managed Agents 增加免费层、预算控制和定时触发器。 未启用计费的 API key 可以在免费配额内使用 Managed Agents;开发者也可以在 agentconfig 中设置 maxtotaltokens,限制一次任务的总 token 消耗。 任务达到预算上限后会返回 incomplete 状态,文件系统进度保留,可通过 previousinteractionid 继续。定时触发器用内置 cron 计划运行循环任务,并在同一沙盒中复用文件。

Google AI for Developers · 2026-07-16原文
#07Agent 与开发工具

Claude Code 的 /code-review 增加多档 effort

Anthropic 为 Claude Code 的 /code-review 增加多档 effort,每档使用不同的审查策略。 该命令可沿用当前会话的 effort,也可显式指定级别;低档执行单次扫描,高档让 subagent 使用独立的新上下文,避免被已有判断锚定。 最高档会启动一组审查 Agent,各自复现发现的问题。Anthropic 称公司内部每个 PR 都会跑这一档审查;官方社媒没有公布完整的价格和耗时区间。 参考资料:https://x.com/ClaudeDevs/status/2077840063342506351

Anthropic ClaudeDevs · 2026-07-16
#08Agent 与开发工具

llama.cpp 社区测试:多轮编码推测解码最高加速 6 倍

一名开发者测试 llama.cpp 的 DFlash 与 n-gram 推测解码组合,在 RTX 6000 PRO 上运行 Qwen3.6-27B,多轮迭代编码速度从 53.5 token/s 提高到 321.5 token/s,约为 6.01 倍。 维护阶段最高达到约 7.5 倍;单轮且内容变化较大的提示没有明显收益。 测试使用 DFlash 草稿模型,并叠加 ngram-mod 与 ngram-map-k4v。n-gram 草稿器从已有上下文复制可能的后续 token,几乎不增加显存占用;目标模型仍会验证每个草稿 token。以上结果来自社区作者在特定硬件、量化和贪心解码设置下的测试。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1uyg3za/itestedallllamacppsspeculativedecoding ---

Reddit r/LocalLLaMA 社区测试 · 2026-07-16
#09产品与平台

NotebookLM 更名为 Gemini Notebook

Google 将 NotebookLM 更名为 Gemini Notebook,并加入安全云电脑,可以在用户资料上直接编写和运行代码。 产品保留基于用户来源材料做研究、摘要和问答的核心能力,新的运行环境能处理更复杂的数据分析任务。 安全云电脑目前面向 Google AI Ultra 用户和 Workspace 商业客户开放,Google 计划在未来数周推送给 Pro 订阅用户。

#10产品与平台

Google Search AI Mode 接入更多第三方应用

Google 在美国为 Search AI Mode 推出 Connected Apps,可把搜索结果与 Instacart、Canva 和 YouTube Music 等第三方服务连接。 用户搜食材时可以把商品直接加入购物车,从设计需求直接进入 Canva 编辑,或保存 YouTube Music 播放列表。 该能力此前已在 Gemini 应用中提供,本次扩展到 Google Search。连接需要用户主动授权,Google 表示后续还会加入更多第三方应用。

#11产品与平台

Muse Spark 1.1 上线 OpenRouter,仅限美国开发者

Meta 的 Muse Spark 1.1 已上线 OpenRouter,目前只向美国用户开放。 OpenRouter 页面将其描述为面向 Agent 任务的多模态推理模型,支持文本、图像、视频、音频和 PDF 输入,提供 100 万 token 上下文。 模型支持结构化输出、并行函数调用、带引用搜索和可调推理强度,可作为主 Agent 规划和分派任务,也可作为子 Agent 使用。Meta 尚未在该页面公布完整基准结果。

OpenRouter · Meta · 2026-07-16原文
#12产品与平台

Google Vids 加入 Gemini Omni 与个人数字分身

Google 为 Google Vids 推出两项更新:Gemini Omni 和个人数字分身(personal avatars)。 Gemini Omni 让用户用自然语言描述直接生成视频,也可以加入照片、草图等图像参考;生成之后的修改同样用对话完成,换背景、调光线、加特效都能逐步进行,不用从头重做。 个人数字分身用一张自拍和一段短语音,生成形象和声音都像本人的虚拟形象,输入文字就能让它出镜"读稿"。两项功能面向 Google AI Pro 和 Ultra 订阅用户以及 Workspace 商业客户开放;数字分身目前只在部分地区向 18 岁以上用户开放,且只能使用本人形象。官方称所有生成的视频都会带 SynthID 隐形水印。

#13产品与平台

OpenAI 扩展 ChatGPT 青少年保护,家长可默认开启学习模式

OpenAI 扩展 ChatGPT 的青少年保护措施:绑定青少年账号的家长现在可以在家长控制里直接开启学习模式(Study Mode),开启后青少年每次发起新对话都会默认进入。 学习模式由 OpenAI 与教师和学习科学专家合作设计,用引导式提问代替直接给答案。OpenAI 称,每周使用 ChatGPT 的青少年中,近九成把它用于学习和效率场景。 同步更新还包括:面向青少年的教育类起始提示词;互动数学和科学体验扩展到 250 多个新主题,官方称周活用户已有 1800 万;长时间使用的青少年会更频繁收到休息提醒;家长通知范围扩大到青少年账号因暴力威胁类违规被停用的情形。OpenAI 同时宣布加入家庭在线安全研究所(FOSI)。 ---

#14企业与基础设施

Intel 与 Google Cloud 扩大 Gemini Enterprise 合作

Intel 与 Google Cloud 扩大多年战略合作,计划向 Intel 全球员工部署 Gemini Enterprise,并建设用于工程、供应链、制造和 IT 流程的 Agent。 Intel 将使用 Gemini Enterprise Agent Platform 统一构建和管理业务 Agent。 合作还包括用 Google Cloud C4 和 N4 实例补充 Intel 本地算力,运行芯片开发中的复杂模拟。双方新闻稿没有披露部署规模、合同金额与上线时间表。

Google Cloud · Intel · 2026-07-16原文
#15企业与基础设施

MiniMax M3 成为 Nebius 首个专属合作开源模型

MiniMax 宣布其开源模型 M3 与 AI 推理平台 Nebius 达成合作,M3 成为 Nebius 平台上首个以专属合作形式上线的开源模型。 MiniMax 称,随着更多企业在生产环境中采用开源模型,推理平台与模型方正在形成更深的合作关系。此次合作的具体优化内容和服务安排尚未披露。 参考资料:https://x.com/i/web/status/2077793512763076675 ---