返回日报索引

AI DAILY / 2026-06-05

06·05 - AI 午报:Anthropic 公布递归自我改进数据,OpenAI 模型找到 80 年 Erdős 猜想反例

Anthropic 连续发布多组内部基准数据:Mythos Preview 在训练代码优化任务上实现 52 倍加速,Claude 在开放式编程问题上成功率达 76%,工程师人均代码交付量较两年前提升 8 倍。OpenAI 研究团队宣布其模型找到了 Erdős 猜想的反例,该猜想已悬而未决 80 年。平台侧,NVIDIA 发布 Nemotron 3 Ultra(550B 参数、100 万上下文),OpenAI 向美国付费用户推送 ChatGPT 新记忆系统,容量翻倍。

10 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01Agent 与自我改进

Anthropic 公布递归自我改进内部数据:Mythos Preview 代码优化加速 52 倍

Anthropic 在 X 平台公布了一项内部基准测试:每次发布新模型时,要求模型优化一段训练小 AI 模型的代码使其运行更快。 熟练人类工程师需要 4-8 小时实现 4 倍加速;2025 年 5 月,Claude Opus 4 平均约 3 倍加速;2026 年 4 月发布的 Mythos Preview 平均达到约 52 倍。Anthropic 同时发布更正说明,澄清 Opus 4 的 3 倍加速基线来自 2025 年 5 月,而非 2024 年——该评估基准自 2024 年 9 月才建立,回测显示 2024 年 5 月的模型没有任何加速。 Anthropic 表示,虽然 Claude 目前尚不具备研究判断能力(即选择正确研究问题的能力),递归自我改进尚未到来,但如果当前趋势持续,AI 系统自行设计和构建继任者将变得合理。

Anthropic 官方 X · 2026-06-04原文
#02Agent 与自我改进

Claude 开式编程成功率升至 76%,Anthropic 工程师人均代码交付量提升 8 倍

Anthropic 宣布 Claude 在开放式编程问题上的成功率达 76%,较 6 个月前提升 50 个百分点。 许多工程师反馈 Claude 的代码质量已与人类程序员相当,Anthropic 预计年内将超越人类水平。同期,Anthropic 工程师人均每季度代码交付量较 2021-2025 年期间提升 8 倍,公司预测两年后可达 16 倍。 这些数据来自 Anthropic 官方 X 账号的系列推文,未披露具体度量标准和代码库规模。

Anthropic 官方 X · 2026-06-04原文
#03Agent 与自我改进

Mythos Preview 在科研决策回溯测试中 64% 优于人类

Anthropic 公布了一项回溯测试结果:在 AI 研究 session 中,当人类研究者走错路时,Mythos Preview 给出的下一步建议 64% 的情况优于人类,较 2024 年的 22% 大幅提升。 测试方法是截取真实研究 session 至出错节点,让模型判断下一步。 ---

Anthropic 官方 X · 2026-06-04原文
#04AI for Science

OpenAI 模型找到 80 年 Erdős 猜想反例

OpenAI 研究人员 Alex Wei、Hongxun Wu 和吴军在 OpenAI Podcast 中宣布,他们的大模型找到了一个存在 80 年之久的 Erdős 猜想的反例。 该猜想由数学家 Paul Erdős 提出,长期未被证明或证伪。研究团队在播客中讨论了数学家与模型协作的新范式。目前尚未发布论文或详细证明。 ---

OpenAI 官方 X · 2026-06-04原文
#05模型与平台

NVIDIA 发布 Nemotron 3 Ultra:550B 参数 MoE,100 万上下文

NVIDIA 正式发布 Nemotron 3 Ultra 大语言模型,总参数 5500 亿,采用 MoE 架构仅激活 550 亿参数,支持 100 万 token 上下文窗口。 该模型专为长运行 Agent 设计,优化了多轮推理、工具调用和子代理协作场景下的 token 效率。NVIDIA 官方博客称,Nemotron 3 Ultra 针对多代理工作流中 token 数量快速增长的问题进行了优化。 模型已在 NVIDIA 官方渠道公布,社区关注其本地部署可行性和开源计划。

NVIDIA Developer Blog · 2026-06-04原文
#06模型与平台

ChatGPT 新记忆系统上线,容量翻倍并支持跨对话上下文

OpenAI 向美国 Plus 和 Pro 用户推送 ChatGPT 新记忆系统,记忆容量翻倍。 新系统可自动追踪重要细节,支持跨对话携带上下文,并理解时间维度(如"七月旅行"的即将到来、进行中和已结束状态)。用户可通过记忆摘要查看和引导 AI 记住的内容,也可在设置中切换回旧版。 Sam Altman、Greg Brockman 和 OpenAI 官方账号分别发帖宣布此事。

OpenAI 官方 X · 2026-06-04原文
#07模型与平台

ChatGPT 支持构建和发布 Web 应用

Sam Altman 在 X 平台发帖称,ChatGPT 现已支持通过自然语言对话构建和发布 Web 应用。 该功能降低了编程门槛,用户无需传统开发环境即可创建和部署 Web 应用。Altman 同时提到 OpenAI 即将发布新动态,配文"是时候起飞了",引发社区对 GPT-5 或新产品的猜测。 目前仅来自社交媒体,OpenAI 尚未发布详细功能公告。 ---

#08基础设施与工具

BeeLlama v0.3.1 发布:DFlash 加速,单卡 3090 推理提速 4.93 倍

BeeLlama v0.3.1 基于最新 llama.cpp,集成 DFlash、MTP、q60 KV Cache 和 TurboQuant,在单张 RTX 3090 上运行 Qwen 3.6 27B 和 Gemma 4 31B 推理速度最高达 177.8 tok/s,相比基线加速 4.93 倍。 DFlash 现支持多槽位、多 GPU 配置和自适应草稿深度优化,新增 TQ31S/TQ41S 量化格式。该版本已被 club-3090 社区推荐为默认引擎。

Reddit r/LocalLLaMA · 2026-06-04原文
#09基础设施与工具

NVIDIA JetPack 7.2 发布:边缘平台统一 Orin 与 Thor 软件栈

NVIDIA 发布 JetPack 7.2,为 Jetson 边缘平台带来一键部署 NemoClaw 代理框架、Jetson 代理技能、Thor 的 MIG 分区支持、官方 Yocto Project 支持等更新。 Jetson AGX Orin 32 GB 启用 Super Mode 后,AI 性能从 200 TOPS 提升至 241 TOPS,模块成本降低 45%。JetPack 7.2 统一了 Orin 与 Thor 的软件栈(Ubuntu 24.04、内核 6.8、CUDA 13.0)。

NVIDIA Developer Blog · 2026-06-04原文
#10基础设施与工具

NVIDIA 推出 Verified Agent Skills 治理框架

NVIDIA 推出 Verified Agent Skills 计划,为 AI Agent 的技能提供能力治理框架。 该计划通过验证和认证 Agent 使用的指令,确保其符合安全与性能标准,目标是在企业规模化部署 Agent 时建立信任。同期,NVIDIA 还发布了 cuOpt Agent Skills,将供应链优化决策从传统运筹学团队数周的手动建模转变为 Agent 自动化流程。 ---