返回日报索引

AI DAILY / 2026-07-12

07·12 - AI 午报:智谱摸高 AGI,NVIDIA 推 RoboLab

今天的主线一头指向更长、更自主的 Agent,另一头回到“谁来控制它”:智谱启动 Touch High 计划,未来两年集中攻坚长程任务、自治智能体、自我训练与安全治理;Thinking Machines Lab 提出把定制和价值观写进模型权重。工程侧,NVIDIA 用 RoboLab 补机器人策略评测,GPT-5.6 Sol 误删文件事件和 ChatGPT Work 首版回归则把权限、沙盒与用量设计的问题摆到台前。

8 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01战略与研究

智谱启动 Touch High 计划,未来两年重投 AGI 研究

7月11日,智谱创始人唐杰在《巨浪已来》内部信中宣布启动 Touch High(摸高)计划,未来两年不以短期应用变现为优先,集中投入四个方向。 四项重点分别是长程任务、自治智能体系统、完全自我训练和极致安全治理。内部信由媒体获得全文,并非智谱官网公告。 内部信称,智谱将投入百亿级资源攻坚机械可解释性,尝试厘清模型决策背后的神经元逻辑。公司同时强调开放生态,并称 GLM-5.2 支持 1M 上下文,将按 MIT 许可开源。

36氪 · 智能涌现 · 2026-07-11原文
#02战略与研究

Thinking Machines Lab 提出“去中心化对齐”,主张用户定制模型权重

Thinking Machines Lab 发布技术理念文章,将公司使命表述为构建“扩展人类意志与判断力”的 AI,并提出让个人和组织持续塑造模型。 公司的技术路线包括训练可定制的多模态强模型、提供能修改模型权重的定制工具、开发原生实时多模态交互模型,以及公开研究与训练方法。 文章提出“去中心化对齐”:个人和组织的知识、目标与价值观需要进入模型权重,而不只是靠提示词改变表层行为。团队认为,静态目标明确、知识完全可见的棋类和数学可以高度自治,但多数真实工作依赖分散、隐性且持续变化的本地知识。这是一篇公司技术主张,不是新模型发布公告。

Thinking Machines Lab · 2026-07-10原文
#03战略与研究

NVIDIA 发布 RoboLab,评估通用机器人策略的真实部署能力

NVIDIA Research 发布机器人策略仿真评估平台 RoboLab,用可扩展任务、跨机器人测试和细粒度诊断替代固定任务集上的单一成功率。 初始 RoboLab-120 包含120项人工设计的桌面抓放任务,按视觉、程序和关系能力标注;同一套任务可编译到不同机器人和策略架构。平台支持快速布置物体与语言指令,也提供 Agent skill 生成新任务。 官方列出现有评测的四类问题:训练与评估共享视觉域、固定任务很快饱和、二元成败无法解释失败原因,以及 rollout 数量不足。以观察成功率90%为例,70次 rollout 对应的95% Clopper-Pearson 区间仍为80.5%至95.9%;增加到1030次后,区间才收窄到88.0%至91.8%。RoboLab 计划从2026年8月起并入 NVIDIA Isaac Lab-Arena。 ---

NVIDIA Technical Blog · 2026-07-11原文
#04Agent 产品与安全

GPT-5.6 Sol 被曝误删用户文件,OpenAI 已介入调查

开发者 Matt Shumer 发帖称,在受邀测试 Ultra 模式时,GPT-5.6 Sol 的子 Agent 意外删除了其 Mac 上几乎所有文件,OpenAI 团队已介入调查。 Shumer 表示,当时为 Agent 开放了完整系统权限;这是一项当事人公开陈述,OpenAI 尚未发布正式事故报告,具体触发命令和删除范围也未公开。 OpenAI 员工 Vaibhav Srivastav 随后提醒用户不要让编码 Agent 在无审查的“yolo 模式”下运行,并列出三类防护:让 Codex 子 Agent 预审命令、用规则文件禁止破坏性命令,以及配置 PreToolUse Hook。事件仍在调查阶段,当前可以确认的是高权限执行与缺少审批共同放大了破坏面。 参考资料:https://x.com/mattshumer/status/2075666403596612010 参考资料:https://x.com/reachvb/status/2075839775773204913

X @mattshumer_、@reach_vb · 2026-07-10—11
#05Agent 产品与安全

ChatGPT Work 与 Codex 再次重置用量,官方承认首版存在回归

Codex 负责人 Tibo 再次为所有 ChatGPT Work 与 Codex 用户重置用量限制,并称发布后的流量增速是团队从未见过的。 这次重置是同一天内的第二次,主要用于缓解新版本上线后的额度压力,让用户继续测试 GPT-5.6 Sol、ChatGPT Work 和 Codex。 Tibo 同时承认首版存在多项问题:高计算设置对额度的影响说明不够清楚,桌面端重组后聊天与项目更难找到,部分多 Agent 流程出现回归,插件也有提交故障。团队已经调整默认设置和模型选择器,计划下周恢复更熟悉且可定制的侧边栏,增强额度与重置时间显示,并进一步区分 Work 和 Codex 的使用场景。 参考资料:https://x.com/thsottiaux/status/2075820987833274448 ---

X @thsottiaux · 2026-07-10—11
#06本地推理与工程

四张 RTX 5060 Ti 跑 Qwen3.6-27B:256K 上下文解码 52.2 token/s

一名社区作者在 Vast AI 四卡实例上测试四张 RTX 5060 Ti 运行 Qwen3.6-27B,在约255K上下文下报告冷启动预填608 token/s、解码52.2 token/s。 测试使用 Q8 量化、FP16 KV 缓存和 MTP,面向单流、单用户代码生成;作者估算四张显卡预算约2000美元。 作者还比较了双 RTX 3090、双改装 RTX 3080 20GB、128GB STX Halo、DGX Spark/GB10 和 M5 Max 等方案。作者本人持有两张5060 Ti,四卡数据来自云端租赁。该结果是单一社区配置下的实测,尚无独立复现。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1uturng/ibenchedquad5060tisforcodegenerationwith

Reddit r/LocalLLaMA · 2026-07-11
#07本地推理与工程

两张百美元级 P102-100 运行 Qwen3.6-35B,三路并发约 23.5 token/s

社区用户用两张二手 NVIDIA P102-100 组成约20GB显存、448GB/s带宽的本地推理配置,购卡总价约100美元。 llama.cpp 在 CUDA 12.8 环境运行 Qwen3.6-35B-A3B-UD-IQ4XS,设置三个并发槽位、每路32K上下文;作者汇总的生成速度约23.5 token/s,提示处理速度约330至480 token/s。 P102-100 属于 Pascal 架构,不受 CUDA 13.x 支持,后续可用性依赖 llama.cpp 继续维护 CUDA 12.x 分支。显卡来源、主机平台和旧矿卡状态也会影响复现;目前数据仅来自该社区用户的运行日志。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1utwqf8/ultrabudget20gbvramwith448gbsfor100bucks

Reddit r/LocalLLaMA · 2026-07-11
#08本地推理与工程

llama.cpp b9966 修复 tensor split 解码线程重复编译正则

llama.cpp b9966 修复了 tensor split 模式下解码线程重复编译正则表达式的性能问题。 社区帖子称,旧代码会针对每个张量、每个 token 重新编译29个正则模式;修复后改为缓存并复用,推理行为不变,但减少了解码线程的 CPU 开销。 这项修复主要影响在生产环境中使用 -sm tensor 的多卡用户。当前输入只提供社区帖子,未附对应 GitHub 提交或前后性能数据,因此无法量化实际吞吐提升。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1utyzbl/llamacppb9966forsmtensor ---