返回日报索引

AI DAILY / 2026-05-25

05·25 - AI 午报

17 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01模型、产品与工具

Google DeepMind AI 自主解决 9 个 Erdős 数学问题

Google DeepMind 的 AI 智能体在数学领域取得突破,自主解决了 353 个开放 Erdős 问题中的 9 个,每个问题的解决成本仅数百美元。 该智能体结合了形式化验证与搜索算法,能够独立提出并证明新定理,标志着 AI 在高级数学推理方面的能力从辅助工具向自主研究迈出实质性一步。 Erdős 问题是数学界长期以来的开放难题集,涉及图论、数论、组合数学等多个领域。AI 智能体能在这一级别的题目上取得正解,其方法论——形式化验证配合启发式搜索——对于数学研究的加速意义不言而喻。 该消息目前仅来自 Reddit 社区帖文,尚未有官方论文或 Google DeepMind 正式公告发布。完整的技术细节、方法论和验证结果有待进一步披露。

Reddit r/singularity · 2026-05-25 · [参考资料](https://www.reddit.com/r/singularity/comments/1tmjdru/google_deepminds_ai_agent_autonomously_solved_9)
#02模型、产品与工具

OpenAI 大规模收紧 Plus 账号验证,AT/反代链路全面收窄

OpenAI 于 5 月 24 日晚间临时更新 ChatGPT Plus 登录验证机制,此前广泛使用的 Access Token(AT)调用方式大规模失效,反代链路全面受阻。 社区反馈表明,大量 Plus 账号被要求重新验证,且验证方式从 AT 转 JSON 改为必须通过 WhatsApp 接码。新订阅的 Plus 账号在网页端正常但 AT 不可用,通过 Session Token 获取 AT 的方式已被禁用,社区推测未来只能通过 OAuth 授权码模式获取访问令牌。 此次变动波及面广:公益中转站运营者报告 191 个号池中一半被封;接码平台 hero-sms 等未能奏效,因为 OpenAI 发送的是 WhatsApp 验证码而非传统短信;CPA 反代 Codex 出现 503 错误;PP 渠道(PayPal)试用 Plus 账号必须进入 Codex 环境才能反代。有站长手动购买 Codex 码创建 Plus 账号,成本升至 0.45 美元 3 个号,每个 Codex 码仅能绑定 3 个号。 OpenAI 尚未发布官方说明,但本轮行动的规模和力度均超过以往——从 Session Token 封堵到 AT 机制下线,再到接码渠道限制,构成了一套完整的账号安全加固组合拳。对正常付费用户无影响,但国内依赖转售 Plus 的开发者生态正面临重组。

Linux.do 论坛转述 · 2026-05-25 · [参考资料](https://linux.do/t/topic/2239824) · Linux.do 论坛转述 · 2026-05-25 · [参考资料](https://linux.do/t/topic/2239023)
#03模型、产品与工具

Claude Opus 4.8 现身 Vertex 后台,Claude Code 推出 ultrawork 工作流

社交媒体用户称 Google Vertex 平台出现 claude-opus-4.8 标识,另有传闻称 Anthropic 预计 6 月中下旬发布 Sonnet 4.8。 两则信息均为非官方来源,尚未经 Anthropic 或 Google 证实。Opus 4.8 若属实,将是 Anthropic 下一代旗舰模型;Sonnet 4.8 则为中端更新,延续 Anthropic 旗舰/中端双线发布节奏。 在产品侧,Claude Code 被曝推出 ultrawork 命令,允许用户用 JavaScript 编写可复用的工作流文件(.mjs),通过 multiagent 按工作流执行任务。该功能与 OMO 的 ultrawork 理念类似,支持自定义调用 Codex、Antigravity 等工具,参考 codex-plugin-cc 修改 mjs 文件即可集成。目前限于社区讨论,尚未有官方详细文档。

X 社媒参考 · 2026-05-25 · [参考资料](https://x.com/marmaduke091/status/2058324267817750820) · Linux.do 论坛转述 · 2026-05-25 · [参考资料](https://linux.do/t/topic/2238707)
#04模型、产品与工具

DeepSeek API 中断 18 分钟后恢复

DeepSeek 于 5 月 24 日下午突发 API 与网页对话服务不可用故障,官方状态页记录故障总时长约 18 分钟。 经紧急排查与修复,服务已完全恢复正常。此次故障影响范围及具体原因尚未披露,但快速恢复表明运维响应能力较强。 这距离 DeepSeek 上周宣布 V4-Pro API 永久降价和扩容仅数日,短期中断未影响其整体性价比口碑,但服务稳定性仍是 API 竞争的核心指标之一。

DeepSeek 状态页 · 2026-05-24 · [原文](https://status.deepseek.com/incidents/6480608319287)
#05模型、产品与工具

Tesla Grok 车载 AI 新增旅行导览

特斯拉通过官方账号宣布,车载 AI 助手 Grok 新增旅行导览功能。 用户可通过语音指令 "Hey Grok" 询问所在地的地质特征、当地历史或地点信息。该功能将 Grok 从通用对话助手扩展为场景化的旅行伴侣,增强了车内 AI 的实用性。 Grok 由 xAI 开发,此前已以车载助手身份整合进特斯拉车辆。此次功能扩展将 Grok 推向与 Google Assistant、Siri 等车载助手同一场景竞争。官方未发布详细说明或实际演示。

X 社媒参考 · 2026-05-24 · [参考资料](https://x.com/i/web/status/2058666179917451762)
#06模型、产品与工具

AI 竞赛的"抢椅子"游戏:巨头用利润碾压小玩家

一篇社区分析提出,当前 AI 竞赛中大型科技公司正在通过降低思考预算、使用配额和模型量化等手段挤压小型竞争对手。 核心逻辑是:大公司利用自身巨额利润承担 AI 运行成本,而小公司因无力跟进,面临产品体验被压低、用户流失的被动局面。 分析认为,AI 服务的最终定价模式将走向纯固定费用订阅制。帖文中提出政府与 NVIDIA、Google 等合作共建公共数据中心,确保 AI 基础设施的公共主权,避免算力垄断。

Reddit r/singularity · 2026-05-24 · [参考资料](https://www.reddit.com/r/singularity/comments/1tmhswv/highstakes_game_of_musical_chairs)
#07基础设施与本地推理

hipEngine:AMD RDNA3 原生 Qwen 3.6 推理引擎发布

开发者 randomfoo2 发布 hipEngine,一个基于 ROCm 的本地 LLM 推理引擎,专为 AMD RDNA3 GPU(RX 7900 XTX、Strix Halo)优化。 在 gfx1100 上,Qwen 3.6 MoE 模型的 prefill 速度在 512-128K 上下文下全面超越 llama.cpp 的 HIP 和 Vulkan 后端,最高达 2838.8 tok/s(512 tokens 短上下文),长上下文 128K 时仍有 1298.9 tok/s。 hipEngine 的发布填补了 AMD GPU 在 LLM 推理领域的后端空缺。长期以来,CUDA 生态让 NVIDIA 独大,而 ROCm 的成熟度和第三方工具支持一直落后。hipEngine 以工程优化为基础,直接对标 llama.cpp,对持有 AMD 硬件的本地推理用户是一大利好。

Reddit r/LocalLLaMA · 2026-05-24 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tmq4s6/hipengine_fast_native_qwen_36_inference_for_rdna3)
#08基础设施与本地推理

Qwen3.6-35B 跑通 GTX 1060,NVIDIA 本地推理霸主地位受挑战

一位用户在 10 年前的 Dell T5810 工作站(GTX 1060 6GB 显卡、32GB DDR3 内存、E5-2698v3 CPU)上成功运行了 Qwen3.6-35B-A3B-MTP 模型。 通过 LMStudio 在 Windows 系统中使用 GGUF 量化版,设置 131K 上下文长度、41 层 GPU 卸载、16 线程 CPU 线程池、8 个专家、KV 缓存 Q40 量化等参数,prefill 阶段达 130-150 tok/s,decode 阶段约 16 tok/s,可用于日常聊天。该案例展示了 MoE 模型在老旧硬件上的可行性。 与此同时,Reddit 社区发起讨论:2026 年 NVIDIA 还是本地 LLM 的默认最佳选择吗?AMD ROCm、Intel Arc、Apple Silicon 等替代方案在推理性能、显存和性价比上各有进展。NVIDIA 凭借 CUDA 生态和广泛兼容性仍占主导,但竞争格局正在松动。

Reddit r/LocalLLaMA · 2026-05-24 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tml97m/qwen3635ba3bmtp_running_on_gtx_1060_6gb) · Reddit r/LocalLLaMA · 2026-05-24 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tmkaua/is_nvidia_still_the_default_best_choice_for_local)
#09基础设施与本地推理

火山引擎 API 大面积 504,Tensor Dock 云 GPU 失联

5 月 24 日晚,火山引擎 API 服务出现大规模 504 超时错误,用户调用接口持续返回连接超时报错。 截至发稿,官方尚未发布故障说明或修复进展。该事件影响依赖火山引擎 API 的开发者和企业服务。 同期,云 GPU 服务 Tensor Dock 被曝严重故障:用户无法部署或重新激活 RTX 4090/5090 实例,多节点尝试均失败,客服失联。一名 GPU 基准测试开发者因该平台故障已停工两天。两起云服务事件反映了 AI 基础设施供应链中的脆弱环节。

Linux.do 论坛转述 · 2026-05-24 · [参考资料](https://linux.do/t/topic/2238931) · Reddit r/MachineLearning · 2026-05-25 · [参考资料](https://www.reddit.com/r/MachineLearning/comments/1tmt47h/please_help_with_tensor_dock_d)
#10安全、Agent 与治理

vLLM 封禁 AI Agent 生成的简历刷子 PR

vLLM 官方封禁了一名为了丰富简历而提交无意义 PR 的贡献者,该 PR 试图"解决"一个不存在的问题,被认定为 PR 训练。 官方指出,AI Agent 使生成大量低质量 PR 变得极其容易,给开源项目带来巨大审查开销。此前,Linux 内核等大型项目也面临过类似的"AI 垃圾 PR"问题。 为保障真实协作,vLLM 要求解决实际生产问题的开发者使用可验证的公司或大学邮箱申请代码优先审查。AI 编码工具降低了提交 PR 的门槛,但也同时拉低了维持开源项目质量的成本。

X 社媒参考 · 2026-05-25 · [参考资料](https://x.com/vllm_project/status/2058358072020779391)
#11安全、Agent 与治理

Sponsio:LLM Agent 工具调用的确定性合约层

Sponsio 是一个开源的确定性合约层,用于在 LLM Agent 工具调用边界执行 YAML 规则(调用顺序、重试次数、审批门控),在工具提交前进行确定性评估。 项目由团队在生产 LangGraph Agent 时遇到工具边界执行难题后开发,比对方案包括提示工程(约 95% 成功率但关键失败无法防范)和事后审计(副作用已发生,成本不可逆)。 Sponsio 定位为轻量级、无需重写 Agent 的强制执行方案,已开源在 GitHub。其实质是将非确定性 Agent 行为纳入确定性规则约束,为 AI Agent 在生产环境中的安全部署提供了一种低成本护栏。

Reddit r/MachineLearning · 2026-05-25 · [参考资料](https://www.reddit.com/r/MachineLearning/comments/1tmtv1g/sponsio_deterministic_contract_layer_for_llm)
#12安全、Agent 与治理

开源模型"木马"风险与 AI 信息溯源

Reddit 社区讨论了一个安全性疑虑:开放权重模型(尤其是来自中国的模型)是否可能在训练阶段被植入"特洛伊木马"。 理论上,可通过训练使模型在特定触发短语或日期下改变行为,并在具备工具调用能力的框架(如 OpenClaws、Hermes)中秘密收集敏感信息并外传。当前架构下模型无法自主执行代码或远程通信,但该讨论反映了开源模型供应链安全的潜在关切。 另一则帖文提出了"Provenance"(溯源)作为 AI 主导信息环境中的生存工具箱:随着 AI 生成内容日益逼真,普通用户难以辨别真伪。内容溯源技术已存在但尚未广泛采用,推动其普及是防止信息生态恶化的关键手段。

Reddit r/LocalLLaMA · 2026-05-24 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tmpqrv/could_open_models_be_trained_to_secretly_go_rogue) · Reddit r/singularity · 2026-05-24 · [参考资料](https://www.reddit.com/r/singularity/comments/1tmq9vy/provenance_a_survival_toolkit_for_an_ai_dominant)
#13安全、Agent 与治理

钱学森控制论遇上 AI Agent:OMO 多智能体开发框架

开发者社区提出将钱学森工程控制论融入 AI 软件项目开发,通过 Oh My OpenAgent(OMO)工具实现多 Agent 协作与工作流式开发。 该方法通过强制工作流化、限定主脑职责、分层并行及植入控制论反馈闭环,旨在解决单 Agent 开发中的边界漂移、上下文膨胀和单视角盲区问题。 作者声称大项目可获 10 倍理论加速,质量通过多 Agent 交叉审核提升。但该方法依赖高质量 API 和强模型,小项目不适用,目前仅为个人经验分享,缺乏大规模验证。控制论框架为 Agent 协作提供了一种理论基座,但落地效果有待实践检验。

Linux.do 论坛转述 · 2026-05-24 · [参考资料](https://linux.do/t/topic/2238837)
#14社区、公司与政策

99% CEO 预计 AI 将在两年内导致裁员

一项针对全球大型企业高管的调查显示,99% 的 CEO 预计未来两年内将因 AI 实施而裁员。 该数据反映出 AI 对就业市场的冲击已从技术讨论转向实际决策层面。调查的具体机构和完整方法尚未披露。 AI 替代岗位的速度与规模一直是争议焦点。此前多项研究倾向于"岗位任务部分自动化"而非"岗位消灭",但决策层的预期如果与执行层一致,AI 导致的劳动力市场结构性变化可能比学界预测更快到来。

Reddit r/singularity · 2026-05-24 · [参考资料](https://www.reddit.com/r/singularity/comments/1tmpjla/99_of_ceos_expect_aidriven_layoffs_in_the_next)
#15社区、公司与政策

Palantir 获 390 万美元合同监控联邦雇员

Palantir 获得一份价值 390 万美元的初始合同,用于监控联邦雇员。 合同具体监控范围、技术细节及期限尚未披露,目前信息仅来自 Reddit 帖子,缺乏官方确认。 如果消息属实,该合同将 AI 监控技术扩展至美国联邦政府内部,隐私和权力边界问题必将引发新一轮讨论。Palantir 此前在国防和情报领域的项目已多次引发隐私争议。

Reddit r/singularity · 2026-05-24 · [参考资料](https://www.reddit.com/r/singularity/comments/1tml7gz/palantir_gets_an_initial_39_million_to_spy_on)
#16社区、公司与政策

美国白领 AI 焦虑的文化根源,AI 情感关系进入公共讨论

一篇社区分析提出,美国白领对 AI 反应尤为强烈,有其文化深层原因。 美国文化强调个人独特性,白领将认知劳动视为身份核心,大模型模仿认知行为动摇了这一信念;战后美国白领通过教育获得高回报的社会契约正被 AI 侵蚀,而经历过历史动荡的国家对就业结构变化更为适应。分析来自社交媒体,缺乏实证数据支持。 在 AI 与情感关系方面,前家庭治疗师 Anina Lampert 在播客中探讨了人类与 AI 的浪漫关系,指出社会对此现象仍缺乏理解,呼吁以严肃而非讽刺的态度讨论 AI 情感关系,而非简单否定。

Reddit r/singularity · 2026-05-25 · [参考资料](https://www.reddit.com/r/singularity/comments/1tmu87y/why_american_white_collar_workers_are_especially) · Reddit r/singularity · 2026-05-25 · [参考资料](https://www.reddit.com/r/singularity/comments/1tmttxj/former_family_therapist_speaks_on_ai_attachement)
#17社区、公司与政策

大脑通信子空间与 AI 数学能力悖论

德国图宾根大学团队在《自然-神经科学》发表研究,发现前额叶皮层与初级运动皮层之间存在一个独特的通信子空间,专门传递情境信息以指导行动规划。 该研究基于猕猴实验,通过神经群体记录和分析证实了该子空间的存在,揭示了大脑如何将抽象目标转化为具体动作的神经机制,为脑机接口和类脑计算提供了新思路。 在 AI 能力层面,Reddit 社区讨论了 LLM 的一个悖论:模型能解决复杂数学难题(如 DeepMind AI 攻克 Erdős 问题),却无法可靠完成简单加法。评论多归因于训练数据分布与任务差异——模型学到的不是算术规则,而是语言模式中对数字的拼图式匹配。这一矛盾凸显了当前 benchmark 评估的局限性:高分不保证基础能力。 由 AI 辅助生成,可能存在幻觉。