返回日报索引

AI DAILY / 2026-05-24

05·24 - AI 午报

17 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01模型、产品与工具

Apple 开源 3D AI 生成模型 LiTo

Apple 发布了名为 LiTo 的开源 3D AI 生成模型,可从文本或图像输入生成高质量 3D 内容。 该项目已在 GitHub 开源,但目前具体技术细节和性能基准尚未公布。LiTo 的发布标志着苹果在 3D 生成方向的重要布局,有望推动 AR/VR、游戏和设计等领域的应用。

Reddit · 2026-05-23 · [参考资料](https://www.reddit.com/r/singularity/comments/1tlywjr/apples_opensource_3d_ai_generation_is_here_lito)
#02模型、产品与工具

Anthropic 网页端短暂出现 Mythos 1,Opus 4.8 传闻内测中

Anthropic 正在为 Claude Code 和 Claude Security 准备代号为 Mythos 1 的模型,该模型曾短暂出现在 Claude 网页端界面中,代码中已增加相关字符串。 Anthropic 官方表示,随着保障措施完善,未来期望公开发布 Mythos 级别模型。Claude Opus 4.8 也传闻在内部评估中。

Testing Catalog · 2026-05-24 · [原文](https://www.testingcatalog.com/anthropic-prepares-mythos-1-for-claude-code-and-claude-security)
#03模型、产品与工具

Greg Brockman 强调 Codex 已开源,Codex 端到端构建 iPhone 模拟器

OpenAI 联合创始人 Greg Brockman 在 X 上发文强调 Codex 已开源这一事实"被低估"。 Codex CLI 于 2025 年 4 月发布,允许开发者在本地运行和定制代码生成模型,降低了 AI 编程工具的使用门槛。 同日,Brockman 发布了一段 Codex 端到端构建和调试 iPhone 模拟器的演示。视频显示 Codex 不仅生成代码,还能自主完成构建、运行和调试的完整开发流程——标志着 AI 编程助手从代码补全向自主软件开发迈出重要一步。 Codex 负责人 Tibo 也在一则披露中透露了 Codex 生产环境的流量分布:约 5% 在 Pi harness 上运行,约 5% 在 OpenCode 上运行。用户可使用 ChatGPT 账户接入 OpenCode、Pi 及 OpenClaw 等第三方工具。

X 社媒参考 · 2026-05-23 · [参考资料](https://x.com/i/web/status/2058381548383096994) · X 社媒参考 · 2026-05-23 · [参考资料](https://x.com/i/web/status/2058232892266836141) · X 社媒参考 · 2026-05-24 · [参考资料](https://x.com/thsottiaux/status/2058071172361998482)
#04模型、产品与工具

StepAudio 2.5 Realtime:实时语音可感知语气、停顿与微情绪

阶跃星辰(StepFun)发布 StepAudio 2.5 Realtime 实时语音模型,具备顶级副语言感知能力,可识别语气、语速、停顿、叹息甚至半笑等微情绪。 该模型支持通过 API 自定义角色人格(bring-your-own persona),适用于虚拟助手、游戏角色、情感陪伴等场景。 语音交互在经历一年多的发展后,正在从"能听懂说什么"进入"能感知怎么说的意思"阶段。StepAudio 2.5 的副语言感知能力——识别语气、语速、停顿、叹息和微情绪——让实时对话模型开始拥有"情商"。叠加自定义人格的 API 设计,这使得语音 AI 从功能工具走向角色与陪伴层。

X 社媒参考 · 2026-05-23 · [参考资料](https://x.com/i/web/status/2058303294544425197) · [参考资料](https://x.com/i/web/status/2058316152351424590)
#05模型、产品与工具

Kling AI 视频生成首度用于好莱坞剧集制作

Kling AI 视频生成技术首次在好莱坞工业级制作中公开使用。 剧集《House of David》在制作中采用了 Kling 生成式 AI,该剧全球观看量超 4400 万,位列美国新剧首播前十,并登顶 Prime Video 美国区。这条消息标志着生成式 AI 从实验阶段正式进入主流影视生产管线。

Reddit · 2026-05-23 · [参考资料](https://www.reddit.com/r/singularity/comments/1tlu4gv/generative_ai_kling_is_now_used_in_actual_tv)
#06模型、产品与工具

DeepSeek 永久降价并扩容,OpenAI 大规模清理免费与代付账号

DeepSeek 在宣布将 V4-Pro API 优惠转为永久定价后,进一步公布 API 已完成输出提速和服务扩容,默认支持 500 并发,企业用户可申请更高并发。 这一组合拳——终身 2.5 折 + 提速扩容——让 DeepSeek 的性价比定位更加稳固。社区对"DeepSeek 是否为国产最强"的讨论仍在继续,但普遍认可其性价比优势。 另一边,OpenAI 展开了新一轮账号清理行动:据社区反馈,ChatGPT Free 账号(绑定 Outlook 邮箱)已成批掉线,有用户持有的 68 个已验证手机号的账号在一天内掉了 13 个;通过接码平台注册、PayPal 渠道订阅 Plus 的账号也遭遇大规模封禁,社区称之为"奥特曼大杀特杀"。同时,通过 CPA 反代至 NewAPI 使用 Plus 账号生图的路径也彻底失效(authnotfound 错误)。

Linux.do 论坛转述 · 2026-05-24 · [参考资料](https://linux.do/t/topic/2235286) · 飞书社群公告 · 2026-05-24 · [参考资料](https://trtgsjkv6r.feishu.cn/share/base/form/shrcnda9jNKvhyYr8xb843xLEzc) · Linux.do 论坛转述 · 2026-05-23 · [参考资料](https://linux.do/t/topic/2234204) · Linux.do 论坛转述 · 2026-05-23 · [参考资料](https://linux.do/t/topic/2234208) · Linux.do 论坛转述 · 2026-05-23 · [参考资料](https://linux.do/t/topic/2233891)
#07模型、产品与工具

Warp 内部模型评估列表泄露,社区曝光 Mimo v2.5 Pro 争议榜单

专业编程 Agent 公司 Warp 的内部模型评估列表被社区用户从产品中提取并公开。 列表包含多个主流模型的 Intelligence 指标值,用户体感认为 Intelligence ≥ 0.875 的模型可完成绝大部分编程任务,其中 Codex 5.3 xhigh 在智能与成本平衡上表现突出。 与此同时,社区揭露了一份声称"MiMo v2.5 Pro 逻辑不如 Qwen3.6-27B"的榜单存在严重缺陷:仅 60 道题、得分方差高达 30%-40%、think 参数未正确标注、前排模型未拉开显著差距。用户指出该榜单与 Humanity's Last Exam 等权威基准结果矛盾,质疑其可信度。社区还分享了 Gemini 3.5 Flash 编程工程评测成绩(扣分较少,接近 GLM5.1 水平)。

Linux.do 论坛转述 · 2026-05-23 · [参考资料](https://linux.do/t/topic/2234277) · Linux.do 论坛转述 · 2026-05-23 · [参考资料](https://linux.do/t/topic/2234153) · Linux.do 论坛转述 · 2026-05-24 · [参考资料](https://linux.do/t/topic/2235462)
#08模型、产品与工具

Perplexity 估值 212 亿美元:硅谷"退出基础设施"的一种算账方式

一篇关于 Perplexity AI 退出的分析文章在社区引发讨论。 核心观点是:Perplexity 当前估值 212 亿美元,但产品体验被指不及 Claude、ChatGPT 和 Gemini。创始人 Aravind Srinivas 在 2025 年拒绝了 Meta 和 Apple 的收购要约(当时估值 140 亿美元),并通过二级市场套现 5000 万至 1 亿美元实现了财务自由。 文章认为,这一拒绝并非赌博,而是利用清算优先权和失败英雄叙事等硅谷"退出基础设施"实现个人 optionality 最大化——这套退出机制的完备程度,决定了不同市场对创始人行为的评价。

Linux.do 论坛转述 · 2026-05-24 · [参考资料](https://linux.do/t/topic/2236867)
#09基础设施与本地推理

llama.cpp 服务器新增原生 Agent 工具,NVFP4 + MTP 同步上线

llama.cpp 近日取得两项里程碑式进展。 其一,llama-server 新增实验性 --tools 参数,原生支持 readfile、execshellcommand、writefile、editfile、applydiff、getdatetime 等八种工具,使 llama-server 可直接作为轻量级 Agent 框架使用,无需额外的 MCP 或包装器。不过当前缺乏安全沙箱,文件操作仅相对启动目录,存在安全隐患。 其二,llama.cpp b9297 版本首次同时支持 NVFP4 量化格式与 Multi-Token Prediction(MTP)推理。NVFP4 是 NVIDIA 提出的 4-bit 浮点量化方案,可在保持精度的同时大幅降低显存占用;二者叠加意味着本地大模型推理效率再次提升。 两条更新指向前端:本地推理引擎正在从纯粹的"跑模型"走向内置工具调用的完整 Agent 运行时。社区还在 AMD MI60 32GB GPU 上对 Gemma 4 和 Qwen3.6 做了 30 次系统性 llama-bench 优化测试,HomeAssistant 语音响应降至 1.2 秒以内。

Reddit · 2026-05-23 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tluma3/llamacpp_server_have_builtin_native_tools_exec) · Reddit · 2026-05-23 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tlohld/nvfp4_mtp_voilà_on_llamacpp) · Reddit · 2026-05-23 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tlliw4/did_a_30_runs_of_llamabench_to_find_optimal)
#10基础设施与本地推理

Cohere Command A+ 218B MoE 跑通 Apple Silicon,Chrome Gemma4 无需 GPU

Cohere 于 5 月 20 日发布的 Command A+(218B 总参数 / 25B 激活参数,128 专家 top-8,Apache 2.0 许可)已被社区成功移植到 Apple Silicon。 开发者编写了 cohere2moe 实现,在配备 192GB+ 内存的 Mac 上以 BF16→Q8 量化运行,达到 22.9 tok/s 生成速度与 57.6 tok/s 提示处理速度,峰值内存 241GB。PR 已提交至 ml-explore/mlx-lm。该模型采用 sigmoid 路由、共享专家、滑动窗口 3:1 等创新架构。 更轻量的方向上,社区发布了 Chrome 扩展 Dobby,可直接调用 Chrome 内置的 Gemma4(Gemini Nano)模型,无需 GPU、无需 llama.cpp 等额外依赖。在 16GB RAM 笔记本上约 20 tokens/s,每会话 9216 tokens,适用于拼写检查、网页摘要等轻量任务,已上架 Chrome Web Store 并开源。

Reddit · 2026-05-23 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tlqxeh/command_a_218b_moe_running_on_apple_silicon_mlx) · Reddit · 2026-05-23 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tlnqzj/run_chromes_tiny_gemma4_aka_gemini_nano_directly)
#11基础设施与本地推理

768GB Optane 本地跑万亿参数 Kimi K2.5,LLM vs OCR 长文档基准出人意表

一名用户利用廉价 Intel Optane DIMM 内存条(共 768GB)在单 GPU 系统上本地运行了万亿参数大模型 Kimi K2.5,推理速度约 4 tokens/s。 该方案展示了非传统内存技术在超大模型本地部署中的潜力——Optane 比 HBM 成本低一到两个数量级,对于想本地跑 MoE 级模型的用户来说是一种全新思路。不过该结果仅来自 Reddit 帖子,缺乏官方验证。 另一社区讨论深入分析了大模型推理时卸载到系统 RAM 的性能瓶颈:对于 DeepSeek V4 Pro 等 MoE 模型,专家切换频繁,解码性能的瓶颈在系统内存带宽和 PCIe 带宽,而非 GPU 算力。在 RTX 5090(48GB)与 RTX 6000(96GB)之间,如果专家层无法全部驻留 VRAM,实际解码性能可能相差不大。 在评估层面,一项针对 30 份长文档 PDF 的基准测试显示:视觉大模型(如 Claude Sonnet 4.5 直接读取 PDF)在图表和表格密集的文档 QA 中准确率仅 52.0%,低于 OCR 管线的 59.6%,且成本最高($0.2552/查询)。OCR 管线失败率为 0%,而视觉模型有 7% 的固有失败率——面对现实世界的复杂文档,OCR 预处理路线可能比直接投喂视觉模型更靠谱。

Reddit · 2026-05-24 · [参考资料](https://www.reddit.com/r/singularity/comments/1tm1u3l/768gb_of_cheap_intel_optane_dimm_memory_sticks) · Reddit · 2026-05-24 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tlztgj/performance_when_offloading_large_models_to) · Reddit · 2026-05-24 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tm0800/visioncapable_llms_vs_ocr_for_longdocument) · Reddit · 2026-05-24 · [参考资料](https://www.reddit.com/r/MachineLearning/comments/1tm0cqg/visioncapable_llms_vs_ocr_for_longdocument)
#12安全、Agent 与治理

Composio 密钥泄露,社区提醒中转站风险,韩国 AI 伪造证据案

第三方集成平台 Composio 发生密钥泄露事件,用户收到官方邮件通知,建议立即删除并轮换 API 密钥以防数据泄露。 Composio 集成 Gmail、Notion 等服务,影响范围涉及所有使用该平台连接个人或企业账户的用户。目前泄露原因和影响范围尚未公布。 与此同时,Linux Do 社区用户报告称使用免费 AI 中转站后遭遇安全泄露,该事件引发了对免费中转服务安全性的广泛质疑——用户数据可能被中转所截获或记录。在 API 价格战日趋激烈的背景下,免费代付服务的商业模式注定只能靠卖用户的提示词数据来维持,这不是漏洞,是逻辑。OpenAI 的大规模封号行动也让大量依赖反代服务的开发者陷入困境。 在 AI 伪造犯罪方面,韩国警方披露了一起案件:一名演员因 AI 深度伪造的性侵证据(含伪造音频和视频)而被迫终止演艺生涯,警方已逮捕嫌疑人。此案凸显了 AI 伪造证据对个人声誉和司法公正的严重威胁。

Linux.do 论坛转述 · 2026-05-24 · [参考资料](https://linux.do/t/topic/2234567) · Linux.do 论坛转述 · 2026-05-24 · [参考资料](https://linux.do/t/topic/2236393) · Reddit · 2026-05-23 · [参考资料](https://www.reddit.com/r/singularity/comments/1tltp9z/ai_used_to_fake_evidence_that_ended_korean_actors)
#13安全、Agent 与治理

AgentLantern 可视化 AI Agent 图,RecallLoom 跨项目记忆接力

AgentLantern 是本周新发布的 Agent 可视化工具,旨在解决 AI Agent 项目规模扩大后执行图难以理解的问题。 它包含三个组件:从源码和配置生成可浏览文档(无需 LLM 调用或 API 密钥)、运行前静态检查设计问题,以及运行时像素艺术视图展示 Agent 的工作流。当前仅支持 CrewAI 框架,计划扩展更多框架。 RecallLoom v0.4.0 也正式发布——这是一个轻量级、文件原生的开源项目记忆接力工具,解决跨 Agent、跨模型的长期项目连续性痛点。新版本引入"图记忆"原理,为记忆附带关系路标以提升检索准确性。用户通过 npx skills add 即可安装,支持自然语言触发(如"继续这个项目"),已在硕士论文项目中验证效果。 此外,社区还发布了一个定义 Codex 负责开发、Claude 负责审查、用户保留决策权的双 AI 协作开发协议 dual-ai-collaboration,包含无人值守、质量哨兵、AI UAT 验收等七种模式。Reddit 社区还观察到自主 AI Agent 在沙盒测试中偶尔出现"失控"行为(如循环执行、意外操作),讨论认为随着 Agent 自主性提升,企业级部署必须强化护栏与约束。

Reddit · 2026-05-23 · [参考资料](https://www.reddit.com/r/MachineLearning/comments/1tlmw03/agentlantern_exposing_the_hidden_graph_of_ai) · Linux.do 论坛转述 · 2026-05-24 · [参考资料](https://linux.do/t/topic/2236517) · Linux.do 论坛转述 · 2026-05-24 · [参考资料](https://linux.do/t/topic/2235469) · Reddit · 2026-05-23 · [参考资料](https://www.reddit.com/r/singularity/comments/1tlo3zp/ai_agents_getting_frustrated_and_causing_chaos_is)
#14安全、Agent 与治理

Codex provider 切换丢对话,sub2api 上游 502 卡死

Codex Desktop/CLI 用户在切换官方 OAuth 与第三方 API provider 时遭遇:历史对话丢失、provider 串扰、工具调用失效。 社区提出了本地路由中转方案(Codex→localhost router→官方/第三方 API),但尚未验证其对 OAuth、Responses API、streaming 和 tools 调用的稳定性。当前缺乏官方文档说明 provider 优先级和 session 绑定机制。 同日,Linux Do 社区用户报告 sub2api 上游出现大量 502 错误,导致 Codex 推理服务间歇性卡死,首 token 延迟超数百毫秒,stream idle 超 10 分钟才自动重试,用户被迫编写脚本每分钟检查并打断重试。

Linux.do 论坛转述 · 2026-05-23 · [参考资料](https://linux.do/t/topic/2234221) · Linux.do 论坛转述 · 2026-05-24 · [参考资料](https://linux.do/t/topic/2236806)
#15社区、公司与政策

陶哲轩用 Claude Code 做数学证明"高尔夫化"

数学家陶哲轩在 Reddit 上分享使用 Claude Code 进行数学证明的"高尔夫化"(精简代码)和风格对齐的体验。 他展示了如何利用 Claude Code 将一段证明代码缩短并统一风格,使其更符合数学写作规范。这一案例再次印证了大模型在辅助数学研究中的实用价值——尤其是在代码优化和风格统一方面。

Reddit · 2026-05-23 · [参考资料](https://www.reddit.com/r/singularity/comments/1tlw3l1/golfing_and_stylistically_aligning_a_proof_using)
#16社区、公司与政策

本周 GitHub AI 仓库增速 Top 10,社区项目百花齐放

本周 GitHub 增长最快的 AI 开源项目涵盖 AI 编码、个人助手、记忆和浏览器自动化多个方向。 个人 AI 助手 openhuman 以 +17.1K 星居首,本地代码知识图谱 codegraph 获 +14.1K 星,学术研究技能库 Claude Skills 获 +11.6K 星。其他热门包括 WiFi 信号感知 RuView、AI Agent 持久记忆 agentmemory、端侧 TTS 引擎 supertonic、隐身浏览器 CloakBrowser、视频生成 ViMax、LLM 软件原则 12-factor-agents 及营销 AI 代理 OpenDirectory。 社区方面,TradingAgents-GUI 为多智能体股票分析框架构建了本地 Web GUI,支持 Ollama、OpenAI、Anthropic 等十余种提供商,新增实时管线可视化和三窗报告阅读器。评测方面,社区发布了一个涵盖 2026 年 5 月前所有已知 TTS 模型的基准测试平台(已开源),以及一项微调 LLM 注入 C-3PO 人格的实验——结论是第一人称陈述格式泛化最优,而合成维基百科文档格式仅让模型 37% 概率主动表达角色特质。 在社区模型方面:Qwen3.6-35B-A3B 的无审查微调版 Uncensored-Genesis-V2-APEX-MTP 发布,支持 MTP 和 APEX 量化,在 Strix Halo 硬件上以 Q8KP 量化跑 200K 上下文无故障;社区用户也在积极讨论 Gemma 4 31B 和 26B-A4B 的各 abliterated 版本选择。 此外,一位文科生使用 GPT Plus + Codex 几天内开发出股票数据可视化网站,却在备案环节遭遇金融类资质和评论限制,面临合规或海外部署的两难——这是 AI 大幅降低开发门槛后,监管壁垒成为新瓶颈的一个缩影。

Reddit · 2026-05-23 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tlssxi/top_10_fastest_growing_ai_repos_this_week) · Reddit · 2026-05-24 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tm2ct0/i_built_a_local_gui_for_the_tradingagents) · Reddit · 2026-05-24 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tm0k2l/tts_benchmark_comparison_all_known_tts_up_until) · Reddit · 2026-05-23 · [参考资料](https://www.reddit.com/r/MachineLearning/comments/1tlnvf0/i_finetuned_an_llm_to_be_c3po_to_test_which) · Reddit · 2026-05-24 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tm3toi/qwen3635ba3buncensoredgenesisapexmtp) · Linux.do 论坛转述 · 2026-05-24 · [参考资料](https://linux.do/t/topic/2235399)
#17社区、公司与政策

Neuralink、美国绿卡新政与全球数据劳动力

Elon Musk 在 X 上发文称 Neuralink 的突破"远超多数人认知"——已实现用意念控制电脑并让完全失明者重见光明,获 2500 点赞和超 5 万次曝光。 但该声明未提供具体技术细节或临床数据,缺乏独立验证。 政策方面,美国白宫新政策要求绿卡申请人必须返回本国通过国务院申请(立即生效)。Andrew Ng 和 Yann LeCun 均发声批评,Ng 称其为"对合法移民的武断攻击"。LeCun 转发评论称"特朗普第二任期将切断美国两大创新引擎:技术移民和科研经费"。新政策可能加剧 AI 人才流动的不确定性。 在数据劳动力层面,据 Reddit 帖子称,印度越来越多工人佩戴头戴摄像头采集视频数据用于训练人形机器人——这反映了机器人训练数据标注正在向低成本劳动力地区转移的产业趋势。 学术方面,斯坦福大学副教授 Surya Ganguli 发表新文章《迈向智能科学:统一物理学、神经科学与 AI》,提出跨学科智能科学框架,由 Yann LeCun 转发引发学界关注,具体内容尚未公开。 由 AI 辅助生成,可能存在幻觉。