返回日报索引

AI DAILY / 2026-05-19

05·19 - AI 午报

11 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01开发工具与 Agent 平台

Cursor 发布 Composer 2.5,并预告更大规模自研模型

Cursor 发布 Composer 2.5,并把下一阶段从零训练大模型的计划写进同一篇公告。 新模型基于 Moonshot Kimi K2.5 开源 checkpoint 训练,官方称相较 Composer 2,在长时间任务持续工作、复杂指令遵循、沟通风格和 effort calibration 上有改进。定价为每百万输入 token 0.50 美元、每百万输出 token 2.50 美元,上线首周提供双倍额度。 训练部分,公告列出 Targeted RL with textual feedback、Synthetic data、Sharded Muon and dual mesh HSDP 等章节。材料中还提到定向文本反馈强化学习、25 倍合成任务规模和 Sharded Muon 优化器。Cursor 同时宣布与 SpaceXAI 合作,将在 Colossus 2 集群上从零训练更大模型,使用此前模型约 10 倍总计算量;官方未披露新模型参数规模、架构和发布时间表。

Cursor Blog · 2026-05-19 · [原文](https://cursor.com/blog/composer-2-5)
#03开发工具与 Agent 平台

Anthropic 收购 Stainless

Anthropic 宣布收购 SDK 与 MCP server 工具平台 Stainless。 Stainless 自 Anthropic API 早期起为其生成官方 SDK,可将 API 规格转换为 TypeScript、Python、Go、Java、Kotlin 等语言客户端库,也能生成 CLI 和 MCP server。公告称数百家公司依赖 Stainless 工具链使用 API,收购后 Stainless 创始人 Alex Rattray 及团队将加入 Anthropic。 Anthropic 表示将逐步关停 Stainless 的 hosted product,但现有客户可继续保留并修改已经生成的 SDK。公告未披露交易金额;据媒体报道,该交易金额超过 3 亿美元。

Anthropic · 2026-05-18 · [原文](https://www.anthropic.com/news/anthropic-acquires-stainless)
#04开发工具与 Agent 平台

GitHub Copilot 云 Agent 可一键修复失败 Actions

GitHub 为 Copilot Business 和 Enterprise 用户上线 Actions 失败一键修复。 当 GitHub Actions workflow 运行失败时,用户可在 workflow run logs 页面点击 “Fix with Copilot”。Copilot cloud agent 会分析日志错误,生成修复方案,并把修改推送到仓库分支,同时标记为待审查状态。 同批更新中,GitHub Spaces API 和 CLI 远程控制功能转为 GA。Spaces API 用于以编程方式管理开发环境,CLI 远程控制可在命令行中操作 Spaces 实例。公告还提到 Copilot Chat 交互体验改进,但未展开具体变更项、使用限制或费率。

GitHub Changelog · 2026-05-18 · [原文](https://github.blog/changelog/2026-05-18-one-click-fixes-for-failing-actions-with-copilot-cloud-agent)
#05开发工具与 Agent 平台

OpenRouter 发布 long-horizon agents SDK

OpenRouter 发布 long-horizon agents SDK,面向可运行数小时的多步 Agent 循环。 页面列出 multi-hour loops、cost and step ceilings、resumable state、streaming progress、voice input、human-in-the-loop approvals 等模块。停止条件包括 maxCost、stepCountIs,用于在预算或步数耗尽时终止运行。 SDK 可持久化 conversation messages、tool results 和 shared context,支持 crash、deploy 或 human review 后 replay / resume;流式进度可推送 token、tool calls 和 step events。语音端点包括 /api/v1/audio/transcriptions 和 /api/v1/audio/speech。工具包还包含 retry with backoff、人工审批和 Self-Ask & Review 循环。

OpenRouter · 2026-05-19 · [原文](https://openrouter.ai/long-horizon)
#06开发工具与 Agent 平台

Browserbase 推出 Browse.sh 技能目录

Browserbase 发布并开源 Browse.sh,把浏览器 Agent 的网站操作沉淀成技能目录与 CLI。 目录首批覆盖 Airbnb、Amazon、Booking.com 等网站,提供预设操作指南;平台称可将部分浏览器任务的 token 消耗降低约 50 倍。社区成员可提交新网站技能,CLI 工具和技能目录已公开。 Browse.sh 调用 Browserbase 底层浏览器自动化能力时需要 API key。技能目录负责把高层意图转换为更具体的页面操作步骤,减少 Agent 对 DOM 和点击路径的实时推理。Browserbase 还提到已与 Ramp、Lovable 等平台创建认证技能;完整网站覆盖清单和定价细节未在发布材料中列出。 ---

Browse.sh · 2026-05-19 · [原文](http://browse.sh/)
#09模型、研究与推理

Qwen3.7 Max / Plus Preview 据称已在 Qwen Studio 上线

Qwen 官方社媒称 Qwen3.7-Max-Preview 与 Qwen3.7-Plus-Preview 已在 Qwen Studio 上线。 帖文同步公布 LMSys Chatbot Arena 成绩:Max Preview 在 Text 赛道总排名第 13,数学、编程等分项进入前十;Plus Preview 参与 Vision 赛道,总排名第 16。 这次发布为预览版,社媒消息未附完整参数规模、上下文窗口、计费方式或 API 文档。帖文信息称正式版本预计会在近期阿里云峰会上推出。 ### #8/#24 llama.cpp MTP 支持进入社区实测 llama.cpp 5 月 16 日合并 PR #22673,将 MTP 投机解码纳入主分支。 Reddit 用户给出的启用方式为 --spec-type draft-mtp --spec-draft-n-max N,并称相同 seed 和 temperature 下输出与 baseline byte-identical。测试对象包括 Qwen3.6 27B dense 和 Qwen3.6 35B-A3B MoE。 Qwen3.6 27B 的社区数据为:Strix Halo、ROCm 7.0.2 上,Q4KM 从 11.7 到 21.2 tok/s,Q80 从 7.4 到 18.1 tok/s;单 RTX 3090 450W 上,Q4KM 从 38.7 到 59.5 tok/s;双 RTX 3090 layer-split 上,Q80 从 25.7 到 55.9 tok/s。MoE 模型提升较小:Strix Halo 从 49.5 到 69.4 tok/s,RTX 3090 从 120.0 到 148.3 tok/s。 另一条 Reddit 帖附视频,标题称 MTP 在 AMD Strix Halo 与 Radeon 9700 AI Pro 上可带来约 2 倍生成速度。评论区也提到不同后端行为不一致:有人在纯 CPU 后端加载 GLM-4.5-Air 量化模型时未加 MTP 参数也看到提速,但 Metal 后端无同样效果;也有人反馈长上下文下提速会衰减。测试者同步发布了博客、构建命令、功耗曲线和原始 YAML 数据。

Alibaba Qwen X 账号 · 2026-05-19 · [参考资料](https://x.com/Alibaba_Qwen/status/2056403591464984753)
#10行业与政策快讯

Google I/O 将于北京时间明天凌晨举行

Google DeepMind 预告 Google I/O 将于 2026 年 5 月 19 日 10:00 PT 直播,对应北京时间 5 月 20 日 01:00。 预告称大会将展示 AI 相关 breakthroughs、tools 和 innovations,并附 X 平台直播入口。 推文未列出具体模型、产品、API、开发者工具名称或完整议程。主办方也未在这条预告中提供字幕语言、重播安排或分会场细节。 ### #7/#22 报道称 Musk 诉 OpenAI 案败诉,Musk 方表示将上诉 The Decoder 报道称,Musk 针对 OpenAI 和 Sam Altman 的 1340 亿美元诉讼在加州奥克兰陪审团阶段败诉。 报道称,九人陪审团经过三周庭审和约两小时合议后,一致认定起诉已超过法定诉讼时效。主审法官 Yvonne Gonzalez Rogers 支持陪审团裁决,并称有大量证据支持。 该案核心指控是 OpenAI 违背创立时的非营利承诺,并通过与微软合作转向营利性架构。报道还提到,OpenAI 律师指出 Musk 本人曾在控制权条件下提议将 OpenAI 转为营利性实体。X 转发材料称,Musk 律师 Marc Toberoff 对裁决回应为 “Appeal”,并表示将继续上诉。

Google DeepMind X 账号 · 2026-05-18 · [参考资料](https://x.com/i/web/status/2056475403926028455)
#11行业与政策快讯

Meta 裁员与组织扁平化消息来自论坛转述

linux.do 论坛转述称,Meta 计划在本周三启动约 10% 裁员,并削减管理岗位。 转述称此次调整预计影响近 8000 名员工,由人力资源主管 Janelle Gale 通过内部备忘录传达,通知将分三批在当地时间凌晨 4 点发出。 转述还称,Meta 将把超过 7000 名员工调往 AI 相关新项目。帖子未附内部备忘录原文或公司公开声明,也未说明受影响部门、地区、遣散方案、转岗业务线、职级或薪酬变化。

linux.do 论坛转述 · 2026-05-19 · [参考资料](https://linux.do/t/topic/2203090)
#14模型、研究与推理

FlashRT 项目方称,小批量推理瓶颈不只 GEMM

FlashRT 项目方发布 CUDA-first 推理运行时,目标是小批量、实时 ML 工作负载。 作者用 C++/CUDA kernel 重写推理路径,替代 PyTorch、TensorRT 等通用运行时。帖子列出的延迟来源包括碎片化小 kernel、norm/residual/activation 边界、量化/反量化、布局转换、Python/runtime 调度、图编译融合失败,以及 FP8/FP4 区域周边的精度转换。 项目方给出的结果包括:Jetson Thor 上 Pi0.5 约 44ms、Pi0 约 46ms、GROOT N1.6 约 41-45ms;RTX 5090 上 Pi0.5 约 17.6ms、GROOT N1.6 约 12.5-13.1ms、Pi0-FAST 约 2.39ms/token;Qwen3.6 27B 在 RTX 5090 上以 NVFP4 推理约 129 tok/s。作者还写到,FP8 持续有效,但 FP4/NVFP4 只有在足够大且深度融合的区域才有明显收益。

Reddit r/MachineLearning · 2026-05-18 · [参考资料](https://www.reddit.com/r/MachineLearning/comments/1tgyx41/rewriting_model_inference_with_cuda_kernels_the) · [代码](https://github.com/LiangSu8899/FlashRT)
#15行业与政策快讯

Dario Amodei 再谈 AI 增长与失业风险

Reddit 视频转发标题称,Anthropic CEO Dario Amodei 谈到 AI 可能带来高 GDP 增长与高失业率并存。 帖子标题写到,AI 可能导致一种历史上没有出现过的组合:很高的 GDP 增长和很高的失业率,并称 10% 以上失业率是可能的。 该视频由 Reddit 用户发布在 r/singularity,时长约 145 秒,未附完整文字稿,也未披露具体演讲场合和日期。帖子和视频中未展示量化模型、起止时间表或按行业划分的失业率推演。 ### #19/#23 NVIDIA Vera CPU 与 SpaceX 互动来自 X X 平台消息称,Elon Musk 与 NVIDIA 的 Ian Buck 会面,并收到 NVIDIA Vera CPU 试用。 另一条 NVIDIA 官方账号相关转发感谢 SpaceX 和 Musk,并称期待他们试用 Vera CPU。相关内容仍停留在社媒互动层面。 Vera CPU 被描述为 NVIDIA 面向 AI 与 HPC 的下一代 Arm 架构服务器处理器,预计 2026 年推出。公开材料未披露核心数、制程、内存配置、互联规格、正式发布时间、SpaceX 采购数量、部署计划或应用场景。 ### #20/#21 Claude Design 与 Claude Code 的社媒快讯 Claude 官方社媒称,Claude Design 各订阅计划 token 上限翻倍;Claude Code /fast 默认切换到 Opus 4.7。 Claude Design 调整覆盖免费版、Pro 版和 Team 版,但未公布翻倍后的具体 token 数值或前后对比表。 ClaudeDevs 账号称,Claude Code 的 /fast 模式响应速度约为标准模式 2.5 倍,同时保持同等质量;该模式按更高 token 费率计费,可通过 /fast 命令启用。两条社媒消息未附完整日志、文档链接、价格倍率、适用地区或生效时间表。 ### #12/#13 Ken Griffin 观点与内存价格预测 Reddit 讨论了两个偏观点和供应链的线索:Ken Griffin 的 AI Agent 案例,以及 2027 年下半年 RAM 价格预测。 Ken Griffin 相关帖称,Citadel 部署的 AI Agent 在数天内完成了过去需要金融博士团队数月的高技能工作;原帖没有附完整演讲或采访链接。 内存价格帖称,前三星芯片高管预测,中国厂商大规模投入可能导致 2027 年下半年内存价格回落。帖子把变量指向长鑫存储(CXMT)扩产、约 42 亿美元上海 IPO 计划、HBM 后端封装投资,以及 2026 年底约 3 万片 HBM 月产能目标;评论区还讨论 DDR5 价格、既有厂商竞争和部分产能已被预订等问题。

Reddit r/singularity · 2026-05-18 · [参考资料](https://www.reddit.com/r/singularity/comments/1tgyv3s/dario_amodei_ai_will_lead_to_very_high_gdp_growth)
#18模型、研究与推理

OpenRouter 社媒称 xAI Grok Imagine 模型上线

OpenRouter 社媒称 xAI Grok creative stack 的三款图像模型已上线。 三个模型分别是 Grok Imagine Image Quality、Grok Imagine Fast 和 Grok Imagine V2,对应照片级图像生成、快速图像生成和创意图像生成等不同定位。 该消息来自 OpenRouter 在 X 平台的转发,尚未附 xAI 官方技术文档或模型卡。社媒消息未说明这些模型是否对全部 OpenRouter 用户开放,也未列出价格、分辨率、区域限制、安全策略、版本号或生成耗时。 ---