#01 基础设施与推理
NVIDIA 与 SchedMD 推出 GB200 NVL72 拓扑感知调度方案 NVIDIA 与 SchedMD 合作,在 Slurm 23.11 中推出 topology/block 插件,让 GB200 NVL72 机架级系统按 NVLink 域边界调度作业。 GB200 NVL72 单机架搭载 72 颗 Blackwell GPU,NVLink 聚合带宽 130 TB/s,调度器如果把作业切到域外,会带来显著的通信损耗。 该插件支持最大 18 节点的段大小,远高于此前 HGX H100 的 1 节点限制。NVIDIA 在 5000 节点模拟集群中测试后称,小作业集中在 NVLink 域末端节点时,GPU 总体占用率仅比理论最优低约 1%。部署建议:64 个以上 GPU 的大作业配置 16 节点段,小作业使用 2 到 8 节点段,并持续监控碎片化。 NVIDIA 另一篇同步博文聚焦块调度:GB200 NVL72 的一致性内存域覆盖整个机架,Slurm 通过 topology/block 插件和 --segment 参数将单个 NVLink 域作为刚性调度块。官方称该方案已在 NVIDIA 内部集群验证,目标是减少跨机架通信、简化大模型训练集群运维。
NVIDIA Blog · 2026-05-21 · [原文](https://developer.nvidia.com/blog/unlock-exascale-performance-on-nvidia-gb200-nvl72-with-slurm-topology-aware-job-scheduling) · NVIDIA Blog · 2026-05-21 · [原文](https://developer.nvidia.com/blog/achieving-peak-system-and-workload-efficiency-on-nvidia-gb200-nvl72-with-slurm-block-scheduling) #02 基础设施与推理
NVIDIA 用 NeMo Agent Toolkit 自动挖掘金融信号 NVIDIA 发布基于 NeMo Agent Toolkit 的多智能体金融信号发现案例,将信号生成、代码实现和回测评估串成闭环。 系统包含信号生成器、代码生成器和评估器三个智能体,信号生成器使用 Nemotron-3-Nano-30B-A3B,由 YAML 配置驱动,并接入 Arize Phoenix 做运行可观测。 在动量信号演示中,系统经过 3 次迭代生成两个有效信号。其中"Rank-Adjusted Return Momentum"在标普 500 成分股上回测 3504 个交易日,平均信息系数 -0.0134,p 值小于 10⁻⁷。NVIDIA 将该案例定位为辅助量化研究员提出和筛选假设,而非直接替代交易决策。
NVIDIA Blog · 2026-05-21 · [原文](https://developer.nvidia.com/blog/automating-and-optimizing-financial-signal-discovery-with-multi-agent-systems) #03 基础设施与推理
NVIDIA 介绍 Kubernetes GPU 使用可见性方案 NVIDIA 在技术博客中介绍了一套面向 Kubernetes AI 负载的 GPU 使用监控方案。 博文指出,平台团队的常见痛点是无法实时了解 GPU 的占用情况——哪些 Pod 挂起、哪些任务空闲,导致昂贵的 GPU 集群长期处于低利用率。 该方案构建在 NVIDIA DCGM Exporter 之上,面向集群运营团队提供实时指标和可视化入口。文章展示了 GPU 使用率和内存占用视图,重点落在识别空闲 GPU、挂起 Pod 和资源分配瓶颈。
NVIDIA Blog · 2026-05-21 · [原文](https://developer.nvidia.com/blog/get-real-time-visibility-into-gpu-usage-across-kubernetes-clusters) #04 基础设施与推理
量化 Prefill 论文主张预填充低精度、解码高精度 一篇新论文提出混合精度推理策略:预填充阶段使用 W4A4 量化,解码阶段保留高精度。 核心逻辑在于预填充和解码是两类不同计算——预填充并行处理固定输入,量化误差不会递归传递到后续 token;解码逐步生成,对误差更敏感,因此继续使用高精度。理论上有望获得四倍预填充加速。 社区讨论将这一思路与 NVFP4、Mix-Quant 等推理优化方向放在一起对比。方案的关键不是全流程低精度,而是把预填充这个单独环节压低精度、同时保持解码的精度稳定性。
Reddit · 2026-05-21 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tjvl4h/interesting_paper_advocates_for_quantized) #05 基础设施与推理
llama.cpp b9274 修复 MTP 显存泄漏 llama.cpp b9274 版本修复了 MTP 模型的 VRAM 泄漏问题。 此前 servercontextimpl 的 destroy() 只清理主模型和上下文,未释放推测解码器、草稿上下文和草稿模型,导致每次睡眠/恢复循环后显存持续增加。 补丁已合并到主分支,通过显式重置 spec、ctxdft 和 modeldft 完成清理,并调整释放顺序避免 use-after-free。对走长时间 server 模式或反复休眠恢复的本地推理用户来说,这类修复直接改善稳定性。
Reddit · 2026-05-21 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tk0grd/latest_b9274_addresses_mtp_vram_leak) #06 开发者工具与模型产品
OpenAI 发布 Codex 多项更新 OpenAI 发布 Codex 多项更新,包括 Appshots、/goal 指令、锁屏远程控制和 Business 插件共享。 Sam Altman 同日在 X 宣布新版 Codex 发布,Greg Brockman 补充了 token analytics 与 plugin sharing 两项企业功能。 Appshots 支持在 Mac 上双击 Command 键截取当前应用窗口画面和文本上下文;/goal 指令结束实验阶段,面向数小时甚至数天的长任务;Computer Use 新增锁定模式,可通过手机远程操控已锁屏的 Mac;Business 版开放团队内共享自定义插件。
OpenAI 官方文档 · 2026-05-22 · [原文](https://developers.openai.com/codex/remote-connections) · X 社媒参考 · 2026-05-21 · [参考资料](https://x.com/i/web/status/2057559714788258003) · X 社媒参考 · 2026-05-21 · [参考资料](https://x.com/i/web/status/2057549563494650223) #07 开发者工具与模型产品
ChatGPT for PowerPoint 与 Daybreak 网络安全消息 Greg Brockman 在 X 上发布两条简短消息,分别提到 ChatGPT for PowerPoint 和 Daybreak 服务大型银行网络安全。 ChatGPT for PowerPoint 将 ChatGPT 的生成能力接入演示文稿制作流程。 Daybreak 则面向金融机构的安全运营需求。两条消息虽然简短,但方向明确——OpenAI 正在同时向办公和生产场景推进,一个进演示文稿,一个进金融机构安全运营。
X 社媒参考 · 2026-05-21 · [参考资料](https://x.com/i/web/status/2057556336003416553) · X 社媒参考 · 2026-05-21 · [参考资料](https://x.com/i/web/status/2057561615868813631) #08 开发者工具与模型产品
Qwen 3.7 与 Qwen3 测评讨论升温 Qwen 3.7 开放权重讨论继续在 r/LocalLLaMA 发酵,社区标题直接写出「The new King has arrived」。 Qwen3.7-Max 已上线 API 和 Qwen Studio,官方在 SWE-Bench Pro 上取得 60.6% 分数,将编程 Agent、通用 Agent 和高难度推理列为重点场景。 ### 作者锐评 知乎大佬 toyama nao 对 Qwen3 的判断相对克制:推理能力已进入国模头部、编程表现体现出较高的硬智力,但知识面一般。这个评价和社区对开放权重的期待放在一起看,Qwen 这一轮更像是把「能跑复杂任务」的能力牌打出来,而不是单纯堆聊天榜。
Reddit · 2026-05-21 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tjvz6l/waiting_for_qwen_37_open_weight_the_new_king_has) · Qwen 官方博客 · 2026-05-22 · [原文](https://qwenlm.github.io/zh/blog/qwen3.7) #09 开发者工具与模型产品
DeepSeek V4 Flash 被论坛用户测到 100+ tps linux.do 用户发帖称 DeepSeek V4 Flash 官方 API 输出速度达到每秒 100 多个 token。 原帖将提速与高端算力资源、折扣周期等因素联系在一起,回帖则把速度变化和并发限制调整联系起来。 DeepSeek 官方 API 文档更新显示:deepseek-v4-pro 账号粒度并发上限为 500,deepseek-v4-flash 为 2500,超限返回 HTTP 429,用户可提交工单申请免费扩容。文档还新增 userid 隔离,用于内容安全、KVCache 和调度隔离,扩容账号按 userid 维度独立限速,请求等待期间增加 keep-alive 机制。
linux.do 论坛转述 · 2026-05-21 · [参考资料](https://linux.do/t/topic/2222603) · DeepSeek 官方文档 · 2026-05-22 · [原文](https://api-docs.deepseek.com/zh-cn/quick_start/rate_limit) #10 开发者工具与模型产品
Google AI Studio 移动端消息流出 Google AI Studio 移动端已覆盖 Android 和 iOS。 Android 端已在 Google Play 出现,iOS 端通过 App Store 审核,预计 2026 年 7 月 1 日上线。应用由 Google 官方开发,定位 AI 模型测试与开发。 移动端可通过自然语言即时生成并运行小型 App,复杂需求可导出到 Antigravity 继续开发。从浏览器里的模型调试台延伸到移动端入口,Google 的方向是「随手描述,随手生成一个小工具」。
linux.do 论坛转述 · 2026-05-21 · [参考资料](https://linux.do/t/topic/2222287) · linux.do 论坛转述 · 2026-05-21 · [参考资料](https://linux.do/t/topic/2222375) #11 开发者工具与模型产品
Grok / X Premium 接入 OpenCode xAI 宣布 Grok 和 X Premium 订阅可用于 OpenCode。 该接入使用驱动 Grok Build 的模型,主打高速代码库智能,面向代码理解、补全和重构等开发场景。 这意味着 X Premium 订阅从内容消费延伸到开发工具调用。OpenCode 本身走轻量开源路线,和 Grok Build 模型结合后,自然落在代码库理解和快速迭代上。
X 社媒参考 · 2026-05-21 · [参考资料](https://x.com/i/web/status/2057522050923929948) #12 政策、公司与研究讨论
Google DeepMind 在亚太启动环境风险加速器 Google DeepMind 宣布在亚太地区启动 Accelerator 计划,面向环境风险相关 AI 项目提供支持。 官方博文称该计划聚焦气候变化、生物多样性丧失和污染监测等问题,面向亚太地区的初创企业和研究机构。 DeepMind 将为入选团队提供深度学习指导、计算资源和工程支持。这个项目把 DeepMind 的技术资源落到具体的区域议题中,目标是寻找能真正用于环境风险治理的 AI 应用。
Google DeepMind Blog · 2026-05-21 · [原文](https://deepmind.google/blog/were-launching-the-google-deepmind-accelerator-program-in-asia-pacific-to-tackle-environmental-risks) #13 政策、公司与研究讨论
美国 AI 行政令推迟消息在 Reddit 传播 Reddit 消息称特朗普总统推迟了一项 AI 行政命令,原因是白宫内部存在分歧。 帖子指向「White House infighting」,社区讨论将可能波及范围延伸到模型安全审计、算力出口和联邦采购等方向。 这类消息折射出美国 AI 政策的内部协调难度——产业竞争、国家安全、开源模型、出口管制和政府采购常常被打包进同一套政策议程,任何一项拉扯都可能拖慢签署节奏。
Reddit · 2026-05-21 · [参考资料](https://www.reddit.com/r/singularity/comments/1tjxvhp/donald_trump_abruptly_postpones_ai_order_after) #14 政策、公司与研究讨论
Meta AI 转型录音与 Heretic 法律通知传闻 Reddit 上出现两条 Meta 相关帖子。 一条称扎克伯格在泄露的内部录音中谈到因 AI 转型推进大规模裁员;另一条称 LLM 去限制工具 Heretic 收到了来自 Facebook/Meta 的法律通知。 两个消息放在一起看,一个是大公司在内部用 AI 重组组织,一个是对外部模型绕限制工具施压,都指向 AI 平台在「效率和「控制权」上的同步收紧。
Reddit · 2026-05-21 · [参考资料](https://www.reddit.com/r/singularity/comments/1tjwa05/leaked_recording_mark_zuckerberg_addresses_staff) · Reddit · 2026-05-21 · [参考资料](https://www.reddit.com/r/singularity/comments/1tjvry0/llm_decensorer_heretic_has_been_served_a_legal) #15 政策、公司与研究讨论
模型一致性与活体检测泛化讨论 Grok 4.3 在 LLM Sycophancy Benchmark 的一致性排行榜中位列第一。 该基准不是直接测「奉承话术」,而是测模型是否会因用户立场变化而改变自身判断。社区帖还列出了 Mistral、GPT-4.1、ByteDance Seed 2.0 Pro、Gemini 3.1 Pro 等模型的不同表现。 另一条讨论聚焦活体检测模型能否泛化到未见过的合成媒体技术——商用系统常基于静态图像或重放攻击训练,而新一代合成媒体质量已超出旧数据集覆盖范围。相关厂商答复偏自信,社区关注点在于独立评测能否跟进。
Reddit · 2026-05-21 · [参考资料](https://www.reddit.com/r/singularity/comments/1tjr3g5/grok_43_tops_the_consistency_leaderboard_in_the) · Reddit · 2026-05-21 · [参考资料](https://www.reddit.com/r/MachineLearning/comments/1tjv27t/can_liveness_detection_models_generalise_to) #16 政策、公司与研究讨论
本地 Agent 工作流与仓库偏好蒸馏实验 Reddit 用户 remyxai 提出 Implicit Preference Distillation,尝试从代码仓库合并历史中抽取团队偏好,用于对齐 AI Agent 的修改风格。 该思路把「被接受的改动」视为偏好信号,从版本化工件中学习团队口味,目标是降低组织内部 Agent 适配成本。 另一帖分享了 Qwen3.6 35B 本地模型与 pi 工具结合的个人工作流:从 WhatsApp 语音输入开始,经 AnythingLLM 转录并生成内容结构,再用 pi 的技能机制和并行子任务完成网站迭代,最终部署到 VPS。两条帖子的共同主题是:本地模型正在被塞进真实工作流里试错,而不只是「能聊天」。
Reddit · 2026-05-21 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tjww2d/your_repo_is_a_preference_dataset_extracting) · Reddit · 2026-05-21 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tjwrp7/qwen36_35ba3_has_changed_my_workflows_and_even) #17 政策、公司与研究讨论
AI 外挂技术讨论与 Optimus 活动现场消息 linux.do 用户围绕 OBS 录屏和 YOLO 模型讨论 AI 自瞄外挂。 原帖重点关注双机采集卡、摄像头加外部移动装置、模拟鼠标轨迹等规避检测方式,讨论的焦点是游戏反作弊系统如何应对视觉模型、外部硬件和人类轨迹仿真组合带来的检测难度。 同日 Reddit 帖子称,特斯拉 Optimus 在 S/X 活动现场被拍到自然行走,部分产线正在为机器人生产做改造。一个讲游戏反作弊,一个讲机器人产线,表面上不在同一个赛道,底层却都在触碰「AI 从屏幕走进物理世界」的边界。 由 AI 辅助生成,可能存在幻觉。
linux.do 论坛转述 · 2026-05-21 · [参考资料](https://linux.do/t/topic/2222355) · Reddit · 2026-05-21 · [参考资料](https://www.reddit.com/r/singularity/comments/1tjvne8/optimus_spotted_walking_naturally_at_tesla_sx)