Vera Rubin NVL72:为 Agentic AI 推理设计的硬件平台
NVIDIA Vera Rubin NVL72 平台专为 Agentic AI 的非确定性推理轨迹设计。Agent 系统每次会话可能执行数百次推理请求,端到端延迟累积是核心瓶颈。Vera Rubin 通过高吞吐、低延迟架构处理这一挑战,将整个机架作为调度单元,避免跨域通信。
AI DAILY / 2026-06-12
今天是 NVIDIA GTC 内容爆发日:Vera Rubin NVL72 专攻 Agentic AI 推理扩展,Vera CPU 为 AI 工厂 Agent 负载设计,CUDA 13.3 引入 Tile 编程模型。模型侧,Nemotron 3 Nano Omni 统一多模态 Agent 推理,Nemotron 3 Ultra 降低长时 Agent token 消耗,Cosmos 3 融合物理推理与世界建模。此外,Bezos 新公司 Prometheus 曝光,融资 410 亿美元目标"人工通用工程师";DeepSeek 连续发布 Agent Harness 岗位,称正向 Agent 产品转型。
NVIDIA Vera Rubin NVL72 平台专为 Agentic AI 的非确定性推理轨迹设计。Agent 系统每次会话可能执行数百次推理请求,端到端延迟累积是核心瓶颈。Vera Rubin 通过高吞吐、低延迟架构处理这一挑战,将整个机架作为调度单元,避免跨域通信。
NVIDIA 发布 Vera CPU,专为 AI 工厂中的智能体工作负载优化。新架构针对 Agent 推理、规划和工具调用进行设计,支持大规模并行处理与低延迟响应,与 NVIDIA GPU 协同工作。
NVIDIA 发布 NVFP4,一种 4 位浮点精度格式,用于 Blackwell GPU 上的 JAX 和 MaxText 框架。官方数据显示,在千卡集群上训练万亿 token 级模型时,步时间缩短 15-20%,同时保持模型质量。NVFP4 解决了低比特混合精度预训练的稳定性难题。
NVIDIA 发布 CUDA 13.3,引入 C++ Tile 编程模型,允许开发者以高层 tile 方式编写 GPU 内核,自动管理底层细节。同时新增编译器自动调优功能(CompileIQ)和 Python 支持更新。Tile 编程现支持 Compute Capability 9.0 及更高架构。 ---
NVIDIA 发布 Nemotron 3 Nano Omni,一个开源多模态模型,统一处理屏幕、文档、音频、视频和文本。模型将视觉、音频和文本推理整合到单一感知-行动循环中,减少推理跳数和编排复杂度。
NVIDIA 发布 Nemotron 3 Ultra,专为长时间运行的多智能体工作流优化。模型在保持推理能力的同时显著降低 token 消耗,使 Agent 能在多轮交互中高效规划、调用工具和子智能体。
NVIDIA 发布 Cosmos 3,面向物理 AI 的前沿基础模型。模型融合物理推理、世界建模与动作生成能力,目标让机器人、自动驾驶车辆和智能空间理解实时环境、预测未来状态并生成具体动作。官方博客披露了概念框架,具体架构和性能基准尚未公开。 ---
NVIDIA 宣布其 Blackwell GPU 和加速端点已针对 DeepSeek V4(V4-Pro 1.6T 参数 / V4-Flash 284B 参数)完成优化,提供高效部署方案。DeepSeek V4 此前已上线,本次是 NVIDIA 侧的硬件适配与性能调优,非模型新版本发布。
OpenAI 研究员 Noam Brown 在 X 上透露,GPT-5.5 在某未公开评估中取得最高分,且在按 token 数、成本和实际时间衡量的效率指标上同样领先。目前未公布评估名称、具体分数或对比模型。
Google DeepMind 的 Logan Kilpatrick 宣布,Gemini Omni Flash 在图像生成视频、文本生成视频和视频编辑三项任务上达到 SOTA 水平,即将通过 API 向开发者开放。 ---
Jeff Bezos 新创公司 Prometheus 首次公开,目标是构建「人工通用工程师」(Artificial General Engineer),利用 AI 加速喷气发动机、航天器、计算机和汽车等复杂物理产品的设计与制造。公司已累计融资 410 亿美元(最新一轮 120 亿美元),据称正在探索设立 1000 亿美元投资基金。 ---
DeepSeek 近日连续发布 Agent Harness 产品经理和研发工程师两个岗位,内部称正在将前沿模型能力转化为 Agent 产品。岗位要求求职者深度使用过 Claude Code、Cursor、GitHub Copilot 等主流编程工具。 ---