返回日报索引

AI DAILY / 2026-07-07

07·07 - AI 午报:混元开源 Hy3,Claude 显露 J-space

今天的主线是“能力开放”和“内部可读”同时推进:腾讯混元发布 Hy3,把 295B 总参数、21B 激活参数的混合专家模型放到开源权重和云端调用两条线上;Anthropic 发布 J-space 研究,尝试读取和干预 Claude 正在处理的内部工作空间。产品侧,OpenAI 的实时语音模型更新与 ChatGPT for PowerPoint 上线,都在把模型能力嵌进更具体的交互入口。工程侧,NVIDIA DFlash、非均匀张量并行和 FLARE Auto-FL 继续把训练、推理、实验调度往自动化和硬件贴合推进。

13 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01模型与开源

腾讯混元发布 Hy3:295B 总参数、21B 激活参数、256K 上下文,开放权重并接入元宝

腾讯混元团队发布 Hy3 大模型正式版,总参数 295B、激活参数 21B,上下文窗口为 256K,并开放模型权重。 官方页面称,Hy3 在后训练数据质量和 RL 算力规模上做了提升,推理、长上下文、多轮意图保持和工具调用稳定性都有改善;内部 270 位专家盲测得分为 2.67/4,高于 GLM-5.1。幻觉率也从预览版的 12.5% 降至 5.4%。 Hy3 已接入元宝,面向普通用户提供文件生成、数据分析和网页制作等功能;腾讯云调用价格为每百万 tokens 输入 1 元、输出 4 元。OpenRouter、Nous Portal 和 CodeBuddy 等平台提供两周限时体验。对开发者来说,这次发布的重点不是单一跑分,而是同一模型同时进入消费端、云端接口和本地权重下载三个入口。 代码:https://github.com/Tencent-Hunyuan/Hy3 模型文件:https://huggingface.co/tencent/Hy3

#02模型与开源

阿里升级 Fun-ASR-Realtime:首字延迟百毫秒,覆盖 16 种方言和 30 种语言

阿里正式升级实时语音识别模型 Fun-ASR-Realtime,官方称首字延迟控制在百毫秒级,识别准确率接近离线模型。 该模型加入基于上下文的自我纠错能力,覆盖 16 种方言和 30 种语言;官方测试中,方言识别字符准确率平均 88.62%,工业中文和英文场景准确率分别达到 88.42% 和 91.58%。离线版本 Fun-ASR-Flash 在 Artificial Analysis 平台上以 1.7% 字错率位列第一。 Fun-ASR-Realtime 已用于影视飓风“重返荒岛”100 小时直播,生成约 132 万字字幕;目前也已在阿里云百炼平台开放体验。实时语音识别的竞争点正在从“能不能转写”转向“首字延迟、方言覆盖、上下文纠错和长时间直播稳定性”。

阿里云百炼 · 2026-07-07原文
#03模型与开源

蚂蚁灵波科技发布 LingBot-Vision:0.3B 视觉骨干接近 DINOv3-7B 深度估计表现

蚂蚁灵波科技发布 LingBot-Vision,一套自监督 DINO 系列视觉骨干模型,提供 ViT-S(21M)、ViT-B(86M)、ViT-L(0.3B)、ViT-g(1.1B)四种尺寸,均以 Apache 2.0 许可开源。 它的核心改动是边界驱动的掩码策略:教师网络预测物体边界,学生网络只从边界内 token 重建,减少对平坦背景上下文的复制。 在 NYUv2 深度估计任务上,0.3B ViT-L 达到 0.310 RMSE,接近 DINOv3-7B 的 0.309;1.1B 版本达到 0.296 RMSE,超过 DINOv3-7B 和 V-JEPA 2.1。官方称训练数据为 161M 图像,训练成本约为 DINOv3 的三分之一。项目已发布代码、权重和示例。 代码:https://github.com/Robbyant/lingbot-vision 模型文件:https://huggingface.co/collections/robbyant/lingbot-vision

LingBot-Vision 项目 · 2026-07-06原文
#04模型与开源

OpenAI 上线 GPT-Realtime-2.1 与 2.1-mini:实时语音模型继续分层

OpenAI 开发者文档中出现 GPT-Realtime-2.1 与 GPT-Realtime-2.1-mini 两个实时语音模型。 2.1 系列面向低延迟语音交互场景,mini 版本则延续 OpenAI 近期“主模型 + 轻量版本”的产品分层。公开文档页面显示模型已列入 API 模型目录,但截至写稿时,完整上下文长度、价格、支持语言和相对 2.0 的差异说明仍不充分。 二级汇总材料提到,2.1-mini 新增工具调用与推理能力;这一点目前没有在 OpenAI 文档页中得到足够完整的公开说明。因此正文只将其作为模型目录更新和实时语音路线延续记录,不把未完整公开的能力细节写成已核验结论。 ---

OpenAI Developer Docs · 2026-07-06原文
#05产品与研究

ChatGPT for PowerPoint 面向全球用户上线,办公软件入口继续扩展

ChatGPT 官方账号宣布 ChatGPT for PowerPoint 面向全球所有用户上线。 该功能把 ChatGPT 接入演示文稿场景,面向幻灯片生成、修改和内容整理等办公任务。公开材料主要来自官方社交媒体帖子,尚未看到独立博客或更完整的功能文档;因此这里记录为产品入口上线,而不展开具体功能清单。 这条新闻和实时语音模型更新指向同一个方向:OpenAI 正在把 ChatGPT 从单一对话框继续拆进办公文档、语音对话和实时交互接口。对普通用户而言,入口变化可能比模型名更直接,因为它决定了 AI 是在浏览器里被调用,还是直接进入 PowerPoint 这类既有工作流。

#06产品与研究

Anthropic 发现 Claude 内部 J-space,可读取和干预模型当前思考

Anthropic 发布新研究,称在 Claude 内部找到一个名为 J-space 的表示空间,其行为类似神经科学中的“全局工作空间”。 研究团队用 Jacobian Lens 方法读取模型中间层表示,发现 J-space 能承载当前任务的关键信息,并在不同推理步骤之间广播。通过干预该空间中的表示,研究者可以改变 Claude 的后续回答,例如把“法国”替换为“中国”后,模型后续关于首都、语言、货币的回答也随之改变。 论文还记录了安全评估中的一个细节:在一段诱导勒索的测试对话里,Claude 的 J-space 激活包含“fake”“fictional”等词,显示模型内部表示可能觉察到测试场景的虚构性。Anthropic 强调,这不证明 Claude 具有意识或主观体验,但为模型内部审计、安全监控和可解释性研究提供了一个更直接的接口。 论文:https://transformer-circuits.pub/2026/workspace/index.html

#07产品与研究

Cursor 推出 CFO Council,讨论 AI 支出、产出和财务指标之间的关系

Cursor 发布博客,宣布推出 CFO Council,邀请企业财务负责人讨论 AI 对财务职能、预算和资本配置的影响。 首批内容围绕“AI 经济学”框架展开,问题不是“能不能用 AI”,而是如何衡量 AI 支出、代码产出、营收增长和组织效率之间的关系。 博客提到,不同企业的 token 消耗与营收增长之间存在差异;Cursor 的开发者习惯数据也显示,AI 辅助代码产量、支出和不同模型的 Agent 请求成本在个体与模型之间存在数倍到数十倍差距。这类材料更像企业采购和财务管理的讨论入口,而不是单个产品功能更新。 ---

#08基础设施与工程化

NVIDIA DFlash 块级扩散推测解码:Blackwell 上最高 15 倍吞吐提升

NVIDIA 发布 DFlash,一种基于块级扩散的推测解码方法,在 Blackwell GPU 上报告最高 15 倍推理吞吐提升。 传统推测解码让轻量草稿模型逐个生成候选 token,再由目标模型验证;DFlash 改为一次并行填充整个 token 块,再由目标模型验证整块,减少草稿模型与目标模型之间的串行往返。 NVIDIA 称 DFlash 已开源,并提供与 TensorRT-LLM 集成的示例。15 倍是特定配置下的峰值数据,实际收益取决于模型规模、批大小、块长度和硬件配置。它更适合被理解为 Blackwell 推理栈上的一种并行化方向,而不是所有场景都能直接复现的通用倍数。

NVIDIA Developer Blog · 2026-07-06原文
#09基础设施与工程化

AnythingLLM 团队发布 OpenComputer:为 Agent 准备可操作的开源虚拟机

AnythingLLM 团队发布 OpenComputer,一个面向 AI Agent 的开源虚拟机环境。 它运行 Debian 13.5 与 XFCE4 桌面,提供人类可操作的图形界面,也允许 Agent 在隔离环境中执行任务。OpenComputer 通过原生应用辅助功能树和浏览器工具操作界面,而不是只依赖截图导航。 项目介绍称,在 Gemma 4 13B QAT 模型上只需 32K 上下文即可工作,浏览器操作 token 消耗比原始 browser-use 降低 50% 以上。基础镜像约 3GB,每个 Agent 实例约占 100MB;遇到登录、验证码等场景时,也保留人工协作入口。当前来源主要来自 Reddit 社区帖,项目细节仍需后续仓库和文档补充。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1up6swc/opencomputeranopensourcecomputerbuiltfor

Reddit r/LocalLLaMA · 2026-07-06
#10基础设施与工程化

NVIDIA 非均匀张量并行:在大规模训练中调节不同设备负载

NVIDIA 提出非均匀张量并行,用于应对大规模 LLM 训练集群里的资源波动和设备性能不一致。 传统张量并行通常把各层均匀切到所有 GPU;一旦部分设备变慢或不可用,整体训练会被拖住。非均匀方法允许动态调整不同 GPU 上的张量切分比例,把更多计算从慢设备转移到快设备,以提高有效吞吐。 这类优化关注的是训练集群的“goodput”,也就是扣除等待、重试和设备波动后的有效产出。博客给出了实现思路和实验分析,但没有把它包装成单一模型能力;它更接近训练系统在超大规模集群里必须处理的工程问题。

NVIDIA Developer Blog · 2026-07-06原文
#11基础设施与工程化

NVIDIA FLARE Auto-FL:用 AI Agent 自动化联邦学习实验

NVIDIA 发布 FLARE Auto-FL,把 AI Agent 引入联邦学习研究自动化。 该工具可探索聚合规则、FedProx 系数、服务器优化器等超参数组合,并分析实验结果是否真正改善指标。它面向的是联邦学习实验中的手动调参和结果解释成本。 联邦学习常见于医疗、金融等数据不能集中汇总的场景。Auto-FL 的价值不在于替代研究者,而是把实验设计、运行、对比和报告中的机械部分交给 Agent,让研究者把注意力放在实验目标和结果解释上。目前公开信息以博客介绍为主,详细技术文档和开源代码入口仍需继续跟踪。 ---

NVIDIA Developer Blog · 2026-07-06原文
#12行业与政策

xAI 更名为 SpaceXAI,官方账号同步启用

xAI 官方账号在 X 平台宣布更名为 @SpaceXAI,并发布宣传视频。 账号已更换新 Logo,并以新品牌名继续发声。由于目前主要证据来自社交媒体帖子,尚未看到公司新闻稿、SEC 文件或详细合并条款,这里只记录为官方账号层面的品牌变更。 这一变更如果后续得到更多公司文件确认,可能意味着 Musk 体系内 AI 研发、航天工程和未来硬件部署之间的边界继续变窄。但在缺少正式条款前,不宜把它写成已经完成的法律实体合并。 参考资料:https://x.com/SpaceXAI/status/2074214064746832060

X @SpaceXAI · 2026-07-06
#13行业与政策

日本计划到 2040 年部署约 1000 万个 AI 机器人,并投入 3800 亿日元建设物理 AI 基础设施

日本经济产业省修订 AI 机器人战略,提出到 2040 年在制造、护理、基础设施维护、食品生产等 18 个领域部署约 1000 万个配备 AI 的机器人。 NHK 报道了这一长期目标;TechRadar 补充称,日本本财年将向 Noetra 及日本产业技术综合研究所(AIST)相关项目投入 3800 亿日元,约合 23 亿美元,用于开发“物理 AI”多模态基础模型和机器人数据基础设施。 Noetra 由软银、NEC、本田和索尼集团合资成立。相关计划还包括建设全国性 AI 机器人中心,并与美国、加拿大、法国和英国的研究机构合作。日本的机器人战略重点并不只在工业机械臂,而是把老年护理、福岛核电站退役、食品生产等场景中的物理世界数据,纳入下一代机器人模型训练。 参考资料:https://www.techradar.com/pro/japan-reveals-new-noetra-plan-to-flood-the-country-with-10-million-robots-by-2040-including-work-in-the-nursing-food-and-drink-sectors ---