#01 数学与通用推理
OpenAI 通用推理模型攻克 Erdős 平面单位距离问题 OpenAI 宣布其内部通用推理模型在平面单位距离问题上给出新构造,推翻 Paul Erdős 1946 年提出的相关猜想。 该问题研究平面上 n 个点最多能产生多少对距离恰好为 1 的点对。OpenAI 文章称,模型构造出无限族点集,使单位距离对数至少达到 n^{1+δ}(δ>0),优于此前基于缩放方格网格的 n^{1+C/log log n} 构造。 OpenAI 称证明思路将代数数论中的无限类域塔和 Golod-Shafarevich 理论用于组合几何问题,并非由专门为该问题设计的数学系统完成。配套材料显示,Noga Alon、Tim Gowers、Arul Shankar、Jacob Tsimerman 等外部数学家参与了证明检查或 companion paper;Princeton 教授 Will Sawin 后续改进显示 δ 可取 0.014。 模型名称、架构、训练方法、运行成本和成功率未公开。除 OpenAI 官方博客外,Reddit 讨论帖还嵌入 OpenAI 官方链接与 OpenAI X 链接;多条 X 转述未提供可直接读取的完整正文。
OpenAI 官方博客 · 2026-05-20 · [原文](https://openai.com/index/model-disproves-discrete-geometry-conjecture) · Reddit · 2026-05-21 · [参考资料](https://www.reddit.com/r/singularity/comments/1tj6tua/oai_researcher_on_erdos_problem_this_is_the) #04 Agent 模型与企业模型
千问发布新一代旗舰模型 Qwen3.7-Max 阿里千问团队正式发布面向 Agent 时代的新旗舰模型 Qwen3.7-Max,官方将其定位为全能基座。 该模型着力强化编程、办公自动化与长周期自主执行能力。在编程 Agent、通用 Agent 及高难度推理等评测维度上,该模型被列为表现领先,但具体对比基准、模型列表和数据集细节未公开。 在一项持续 35 小时、进行 1158 次工具调用的自主内核优化实验中,Qwen3.7-Max 相对参考实现获得了 10.0 倍的几何平均加速,参考实现的具体配置与复现条件未披露。模型采用任务‑运行框架‑验证器正交解耦训练架构,原生适配 Claude Code、OpenClaw 和 Qwen Code 等主流智能体框架,并支持 MCP 集成与多智能体协作,可通过工具调用操控机器狗等具身设备。 API 即将通过阿里云百炼上线,目前未公布价格、上线时间与可用区域。第三方独立验证也未开展,模型的实际表现尚待进一步检验。
Qwen 官方博客 · 2026-05-21 · [原文](https://qwenlm.github.io/zh/blog/qwen3.7) #05 Agent 模型与企业模型
Cohere 发布开源模型 Command A+:218B 总参数 MoE 架构,支持 128K 上下文与 64K 输出 Cohere 于 2026 年 5 月 20 日发布旗舰级开源大模型 Command A+,基于 Apache 2.0 许可开放权重。 该模型采用稀疏 MoE 架构,总参数量 218B,激活参数为 25B,统一了前代 Command A Reasoning、Command A Vision 和 Command A Translate 的能力,原生支持图像输入、128K 上下文窗口以及最长 64K 的输出长度,语言支持从 23 种扩展至 48 种,专为 Agentic 任务、RAG 流程、多模态文档处理及企业级高性能场景进行优化。 在官方公布的基准测试中,Command A+ 相比前代 Command A Reasoning 有大幅跃升。其中 τ²-Bench Telecom 得分从 37% 提升至 85%,Terminal-Bench Hard 从 3% 提升至 25%;多模态方面,MMMU 得分达到 75.1%(前代 Command A Vision 为 65.3%),MathVista 从 73.5% 提升至 80.6%。在 Cohere 内部 North 应用中,Agentic 问答准确率提升 20%,电子表格分析质量提升 32%,记忆性能从 39% 提升至 54%。需注意上述数据均为厂商自测结果,部分基准如 MT-AIME 使用内部翻译版本。 效率部署方面,模型提供 BF16、FP8 和 W4A4 三种量化版本,其中 W4A4 版本在最低配置下仅需单块 B200 或两块 H100 GPU 即可运行。相比 Command A Reasoning,输出速度最高提升 63%,首 token 延迟降低 17%,并引入推测解码带来 1.5 至 1.6 倍推理加速。新设计的分词器在阿拉伯语、韩语和日语上的 token 效率分别提升 20%、16% 和 18%。 模型权重已在 Hugging Face 发布,同时支持 vLLM 和 Transformers 框架。进一步的独立评测与部署成本信息尚未公布,实际硬件表现可能因工作负载而异。
Cohere 官方博客 · 2026-05-20 · [原文](https://cohere.com/blog/command-a-plus) #06 生成模型与基础设施
NVIDIA 发布 SANA-WM 世界模型 NVIDIA 研究团队发布 SANA-WM,可基于单张图像、文本提示和摄像机轨迹生成 720p、60 秒视频。 项目页显示,该模型面向分钟级世界建模,包含约 26 亿参数,采用混合线性注意力机制和双分支摄像机控制设计,输入可包含 6 自由度摄像机轨迹。 官方材料称,SANA-WM 在单块 H100 GPU 上可完成一分钟视频推理;经过蒸馏和 NVFP4 量化的变体可在 RTX 5090 上用约 34 秒完成 60 秒 720p 视频去噪。双向检查点、推理代码和相关组件已在 Hugging Face 开放。 项目页可访问并返回标题 SANA-WM | Efficient Minute-Scale World Modeling。实际生成质量、复杂场景稳定性、摄像机控制精度和消费级显卡端完整推理体验仍未见第三方系统评测。
NVIDIA 项目页 · 2026-05-21 · [原文](https://nvlabs.github.io/Sana/WM) #07 生成模型与基础设施
阿里云发布磐久 AL128 超节点服务器及自研真武 M890 芯片 在 2026 阿里云峰会上,阿里云正式发布磐久 AL128 超节点服务器。 该服务器为单机柜设计,紧密耦合 128 张首次亮相的自研训推一体芯片真武 M890,并搭载自研互联芯片 ICN Switch 1.0,可将 128 张 AI 芯片组成一台计算机,P2P 时延低于 150ns。官方宣称,该服务器能支持万亿参数大模型单节点运行,主打解决 Agent 场景下的海量并发推理和大模型训练需求,目前已上线百炼平台。 首次亮相的真武M890芯片采用自研并行计算架构,内置144GB显存,性能是其前代真武810E的3倍,片间互联带宽达到800GB/s。该芯片原生支持FP32到FP4等多种数据精度,可应用于高精度训练、低精度和超低精度推理的全场景。在低精度推理场景下,官方称可在保证模型输出质量的同时显著降低单次推理的算力开销。平头哥同时首次公布了真武系列芯片的路线规划,未来两年将陆续推出算力更强的真武V900、真武J900两代芯片。目前真武系列AI芯片已累计出货56万片,服务20多个行业的400多家客户。 峰会上,阿里云还发布了旗舰模型Qwen3.7-Max,据称在第三方盲测中位列国产第一,并推出聚合150多款模型API的新门户“千问云”,面向Agent时代提供一站式模型服务。云产品已进行Skill化、MCP化和CLI化改造,以便Agent化调用。百炼平台计划接入Kimi、DeepSeek等第三方模型,但其具体性能指标、第三方盲测细节、芯片量产情况及具体接入时间表均未披露。
阿里云微信公众号 · 2026-05-21 · [原文](https://mp.weixin.qq.com/s/1lz9yxEobWao6milBdizgA) #08 商业与资本
Exa 完成 2.5 亿美元 C 轮融资 a16z 宣布领投 Exa 的 2.5 亿美元 C 轮融资,Exa 本轮估值达到 22 亿美元。 a16z 投资公告称,Exa 从零构建面向 AI Agent 的搜索堆栈,重点服务长尾、复杂、低延迟查询,而不是把传统网页搜索接口直接包装给模型调用。 公告披露,Exa 提供低于 200 毫秒的搜索延迟和定制嵌入模型,客户包括 Cursor、Cognition、HubSpot、Monday.com 等,覆盖 5000 多家企业和 40 万开发者。Exa 计划用新资金训练下一代模型,并将基础设施扩展到每秒十万次搜索。 a16z 页面可访问并返回标题 Investing in Exa | Andreessen Horowitz。公告未披露 Exa 的营收、毛利、留存率、搜索调用量构成,也未给出与 Google、Bing 或其他 Agent 搜索服务的同口径市场份额对比。
a16z 投资公告 · 2026-05-20 · [原文](https://a16z.com/announcement/investing-in-exa) #14 Agent 模型与企业模型
千问发布实时同传模型 Qwen3.5-LiveTranslate 通义实验室正式发布实时同传翻译大模型 Qwen3.5-LiveTranslate-Flash,基于 Qwen3.5-Omni Thinker-Talker 架构构建。 该模型将输入文本与音频的语种支持扩展至 60 种,音频输出语种提升至 29 种。模型端到端的字均延迟降至 2.8 秒,同时支持实时跨语言音色克隆,可以在翻译输出中保留原说话人的音色特征,并提供最高 1000 个词条的动态热词配置能力,以优化特定术语或专有名词的处理效果。 在 FLEURS 等公开基准测试中,Qwen3.5-LiveTranslate-Flash 的翻译准确率优于前代版本及主流语音大模型。目前官方 Blog 与在线 Demo 已开放体验,阿里云百炼平台的集成服务也即将上线,意图覆盖会议同传、跨国交流及内容本地化等应用场景。 目前公开的评测结果主要来自厂商自述,尚未出现独立的第三方验证数据;在线 Demo 的实际响应情况可能受网络与并发量限制,生产环境中的延迟与准确率表现仍需进一步观察,官方未附具体的实际环境性能参数。
Qwen 官方博客 · 2026-05-21 · [原文](https://qwen.ai/blog?id=qwen3.5-livetranslate) #15 生成模型与基础设施
Z.ai 等联合部署 ZCube 推理网络架构 社媒消息称,Z.ai、Harnets.AI 与清华大学联合开发的 ZCube 已部署到 GLM-5.1 推理生产集群。 该网络架构采用完全扁平化拓扑,面向 Prefill-Decode 分离场景下的流量不对称和网络拥塞问题。 发布材料称,在 GLM-5.1 推理服务中,ZCube 将网络硬件成本降低 33%,平均 GPU 推理吞吐量提升 15%,TTFT P99 尾部延迟降低 40.6%。相关集群在不修改应用层的情况下已稳定运行超过两周,论文据称被 ACM SIGCOMM 2025 接收。 该条原始 URL 为 X 帖,页面未提供可直接读取的完整正文。模型规模、集群节点数、交换机配置、成本口径以及在其他模型上的泛化结果未在可读信息里展开。
X 社媒参考 · 2026-05-21 · [参考资料](https://x.com/Zai_org/status/2057216685040443743) #16 商业与资本
Anthropic 与 SpaceX / xAI 算力合作 社媒消息称,Anthropic 将与 SpaceX 扩大算力合作,并在 Colossus 2 数据中心部署 GB200 算力服务 Claude 推理。 Anthropic 联合创始人 Tom Brown 的 X 帖是本条主要来源之一,但页面未提供可直接读取的完整原帖正文。 本地社媒详情缓存还显示,Elon Musk 在社交平台确认 SpaceX 以服务形式向 Anthropic 及其他公司提供规模化 AI 算力;TechCrunch 转述称,Anthropic 与 xAI 的算力采购协议覆盖孟菲斯 Colossus 1 数据中心全部 300 兆瓦算力输出,金额为每月 12.5 亿美元,期限至 2029 年 5 月,并包含任意一方提前 90 天通知终止的条款。Reddit 讨论称该合作规模可能高于此前报道,涉及 Colossus 1 和 Colossus 2 的部分容量。 Anthropic 的收入展望、运营利润和新一轮融资估值均属于报道或投资者口径,尚非已审计财务结果。双方未在可读信息里披露完整合同、容量分配、服务等级和实际交付时间表。
X 社媒参考 · 2026-05-21 · [参考资料](https://x.com/nottombrown/status/2057194829986300375) · Reddit · 2026-05-20 · [参考资料](https://www.reddit.com/r/singularity/comments/1tj0efw/anthropicspacex_deal_seems_much_larger_than) · TechCrunch · 2026-05-20 · [补充报道](https://techcrunch.com/2026/05/20/anthropic-will-pay-xai-1-25-billion-per-month-for-compute) #17 商业与资本
报道称 OpenAI 准备近期提交 IPO 申请 据《华尔街日报》2026 年 5 月 21 日报道,OpenAI 计划在未来几天或几周内向美国监管机构秘密提交首次公开募股申请。 首席执行官 Sam Altman 希望公司能在 2026 年 9 月前完成上市准备。目前 OpenAI 已选定 Goldman Sachs 和 Morgan Stanley 作为本次 IPO 的承销商,协助处理相关事宜。OpenAI 官方尚未确认具体时间表和最终估值,报道未附完整上市文件或官方声明全文。 社媒与科技圈传闻显示,OpenAI 本次 IPO 的估值可能在 1 万亿至 2 万亿美元之间。TechCrunch 转述称,OpenAI 正朝 9 月上市窗口推进;The Information 的社媒账号也转发相关报道。此前 OpenAI 已通过多轮融资获得大量资金,包括微软的数十亿美元投资。秘密提交 IPO 申请通常会让招股书等细节在监管审核过程中逐步公开,目前实际估值、发行规模和财务数据均处于未披露状态。 《华尔街日报》的独家消息未提供董事会决议或内部备忘录作为佐证。OpenAI 是否已经正式提交文件、监管审核进度、财务数据、股权结构和发行规模均未公开。
WSJ · 2026-05-21 · [参考资料](https://www.wsj.com/tech/ai/openai-is-preparing-to-file-for-an-ipo-very-soon-0ec95af5?mod=hp_lead_pos1) · TechCrunch · 2026-05-20 · [补充报道](https://techcrunch.com/2026/05/20/openai-barrels-towards-ipo-that-may-happen-in-september/) · Axios · 2026-05-20 · [补充报道](https://www.axios.com/2026/05/20/openai-ipo-spacex-musk) #23 Agent 模型与企业模型
Gemini 3.5 Flash 面向 Agent 和编码场景升级 Google 在 I/O 2026 期间推出 Gemini 3.5 Flash,并把它放在 Agent 和编码场景的核心位置。 Google 及多家媒体报道均提到,该模型在编码和智能体任务上优于 Gemini 3.1 Pro,输出速度约为其他前沿模型的 4 倍;Google DeepMind CEO Demis Hassabis 的 X 帖也重复了“编码与智能体任务超过 3.1 Pro”和“4 倍更快”两项说法,随后被 Google Fellow Jeff Dean 转发。 公开报道还称,Gemini 3.5 Flash 进入 Gemini 应用、AI Mode in Search 和 Gemini API,并面向多步任务、工具调用、长程任务与“子智能体”协作做了设计。部分报道提到 Terminal-Bench 2.1、MCP Atlas 等 Agent 与编码基准,但不同来源披露的指标粒度不一,Google 未在社媒短帖中列出完整评测表、硬件设置或所有对比模型。 社媒缓存中的原帖文本在“4x faster than other frontier m…”处截断,因此不能补出完整对比对象。定价、区域可用性、API 配额和第三方独立评测仍需以 Google 后续文档及实际调用表现为准。
Google I/O 相关报道 · 2026-05-19 · [参考资料](https://www.androidcentral.com/apps-software/google-thinks-gemini-3-5-flash-can-finally-make-ai-agents-more-useful) · X 社媒参考 · 2026-05-21 · [参考资料](https://x.com/i/web/status/2057272410014187693) #24 生成模型与基础设施
Stability AI 发布 Stable Audio 3.0 系列音频模型 Stability AI 于 2026 年 5 月 21 日正式推出 Stable Audio 3.0 系列音频生成模型。 该系列基于全新的语义-声学自编码器架构,共包含 Small SFX、Small、Medium 和 Large 四个规格。其中 Small SFX、Small 和 Medium 三个模型的权重已在 Hugging Face 平台开放,而 Large 模型则仅通过 API 及付费自托管服务提供。模型在完全许可的数据集上训练,支持最长 6 分钟的音频生成,涵盖音效和音乐等多种类型。 用户对使用 Stable Audio 3.0 生成的内容拥有所有权。根据官方公布的社区许可证条款,年收入低于 100 万美元的用户可以免费将模型用于商业用途,包括内容分发与商业化。Stability AI 还同步开放了面向专业音乐家的产品套件候补名单,提供更专业的创作工具。 官方未公布 Large 模型的具体性能指标与推理速度。此外,已开放权重的 Small SFX、Small 和 Medium 模型在移动设备上的实际运行效果、延迟表现以及对于复杂音乐结构的生成质量,尚缺乏第三方评测数据,仍有待用户和开发者的后续验证。
Stability AI · 2026-05-21 · [原文](https://stability.ai/stable-audio) #25 Agent 模型与企业模型
论坛用户称 AI Studio 版 Gemini 3.5 Flash 会更频繁调用搜索 linux.do 论坛用户称,AI Studio 中的 Gemini 3.5 Flash 在日常问答前更频繁调用搜索引擎做背景查询。 该帖描述称,模型会在回答前先调查,回复速度仍然较快,并把这一变化与 Gemini 日常聊天的信息获取能力联系起来。 该论坛帖未附 Google 官方说明、产品变更日志、配额表或稳定复现步骤;免费用户限额也未在帖子中确认。该条按 AI Studio 体验变化的社区观察处理,不写作 Google 已正式宣布的新功能。
linux.do 论坛转述 · 2026-05-21 · [参考资料](https://linux.do/t/topic/2210127) #26 安全与产品机制
GitHub 调查内部仓库未授权访问 GitHub 正在调查一起内部仓库未授权访问事件,多家安全媒体称约 3800 个内部仓库被窃取。 本地详情缓存和公开报道均指向同一条主线:一名 GitHub 员工安装被投毒的 Visual Studio Code 扩展后,攻击者取得设备侧访问能力;自称 TeamPCP 的组织随后在地下论坛声称持有相关内部源码和仓库数据。 公开报道称,GitHub 已移除恶意扩展版本、隔离受影响终端并启动响应流程。GitHub 的说法是目前没有证据显示客户数据受到影响,并已轮换关键凭证;被窃数据的具体目录、是否包含安全工具或生产配置、攻击者停留时间和完整影响范围仍未公开。
GitHub X 社媒参考 · 2026-05-20 · [参考资料](https://x.com/github/status/2056949168208552080) · VentureBeat · 2026-05-20 · [补充报道](https://venturebeat.com/security/github-confirms-3800-repos-stolen-poisoned-vs-code-extension-supply-chain-worm-microsoft-python-sdk) #27 安全与产品机制
ChatGPT 推出 Trusted Contact 安全功能 OpenAI 推出 ChatGPT Trusted Contact,让成年用户可选择一名信任联系人,在严重自伤风险场景下接收提醒。 OpenAI 官方说明称,该功能为可选机制,用户可指定朋友、家人或照护者作为联系人;当自动系统和受训审核人员判断对话可能显示严重安全风险时,ChatGPT 可通过邮件、短信或应用内通知提醒该联系人查看情况。 OpenAI Help Center 进一步说明,被邀请者可通过邮件、短信、WhatsApp 或 ChatGPT 应用收到邀请。该机制不等同于紧急服务,通知内容也不会完整披露用户对话;功能面向成人用户,具体地区、账号类型和通知渠道可用性以产品端显示为准。
OpenAI 官方博客 · 2026-05-07 · [原文](https://openai.com/index/introducing-trusted-contact-in-chatgpt/) · OpenAI Help Center · [原文](https://help.openai.com/en/articles/20001195-being-someones-trusted-contact) #28 安全与产品机制
论坛用户称 ChatGPT 会在对话中透出账号元数据 linux.do 论坛用户称,在关闭记忆和聊天记录后,ChatGPT 仍可能在对话中透出账号真实姓名、邮箱等元数据。 帖子描述称,用户在新窗口询问模型可从元数据知道什么后,模型能够说出其姓名和邮箱;该用户随后通过自定义指令要求模型不要使用账号个人信息,观察到模型不再主动输出相关内容。 该帖属于单用户社区观察,未附 OpenAI 官方说明、客户端日志、请求头或稳定复现步骤。它与 Trusted Contact 等产品安全机制不同,涉及账号资料是否被模型上下文可见的问题,后续需要以 OpenAI 产品设置说明、隐私文档或更完整的复现报告为准。
linux.do 论坛转述 · 2026-05-21 · [参考资料](https://linux.do/t/topic/2212857) #29 平台与开发者工具
Google 发布广告 AI Agent Ask Advisor Google 在 Google Marketing Live 2026 上发布 Ask Advisor,把 Google Ads、Google Analytics 与 Merchant Center 连接成面向广告主的 AI Agent。 用户可用自然语言提出营销目标,例如为某类商品寻找新客户;Ask Advisor 可读取 Merchant Center 中的商品信息,并在 Google Ads 中辅助创建广告系列。 Ask Advisor 还可跨广告、分析和电商数据解释效果归因,并给出后续投放操作。目前该功能先面向英文账户 Beta 测试。Google 同时宣布 Asset Studio 将集成 Gemini Omni,用于图片、视频等多模态素材生成;AI Mode 中也在测试由 Gemini 驱动的新搜索广告形态。
Google Ads Blog · 2026-05-20 · [原文](https://blog.google/products/ads-commerce/ask-advisor) #30 平台与开发者工具
OpenAI 在新加坡设立首个海外 Applied AI Lab OpenAI 宣布“OpenAI for Singapore”多年期计划,承诺投入超过 3 亿新元,并在新加坡设立首个美国境外 Applied AI Lab。 该计划与新加坡数字发展及信息部合作,目标是在未来几年创造 200 多个本地技术岗位,并把新加坡建设为 Forward-Deployed Engineers 的全球枢纽之一。 OpenAI 称,该实验室将直接与企业和公共部门合作,覆盖公共服务、金融、医疗和数字基础设施等领域。配套计划还包括 OpenAI Academy 新加坡分会、面向教师的 Codex hackathon、Forward-Deployed Engineer 培训和面向微型企业、中小企业的 AI 工作坊。
OpenAI 官方博客 · 2026-05-19 · [原文](https://openai.com/index/introducing-openai-for-singapore) #31 平台与开发者工具
白宫拟建立前沿模型发布前自愿审查框架 Reuters 援引 The Information 报道称,白宫国家网络总监办公室已向 OpenAI、Anthropic、Reflection AI 等公司介绍前沿 AI 模型审查计划。 报道称,相关行政令拟建立自愿框架,让情报等政府机构可在模型发布前进行评估。 报道提到,前沿模型开发者可能需要在重大发布前通知政府,并可在发布前最多 90 天将模型共享给政府机构。该计划仍处于报道阶段,最终行政令文本、参与企业名单、评估标准和不参与后的处理方式尚未公开。
Reuters · 2026-05-20 · [补充报道](https://www.reuters.com/legal/litigation/white-house-briefs-ai-firms-plans-model-review-information-reports-2026-05-20) #32 平台与开发者工具
NVIDIA 将 H100 推理延迟压到个位数微秒 NVIDIA 技术博客称,其在 H100 GPU 上实现了端到端个位数微秒级深度学习推理延迟,目标场景是资本市场低延迟交易。 方案结合 TensorRT、CUDA Graph 优化和定制 CUDA 内核,面向多层感知器、LSTM 等金融交易中常见模型。 NVIDIA 将这一方案定位为 GPU 对 FPGA、ASIC 等专用低延迟硬件的补充路径:在保留模型复杂度和开发灵活性的同时追求接近专用硬件的响应速度。博客未披露完整模型规模、网络通信影响、高并发抖动和真实交易系统部署案例。
NVIDIA Technical Blog · 2026-04-02 · [原文](https://developer.nvidia.com/blog/achieving-single-digit-microsecond-latency-inference-for-capital-markets) #33 平台与开发者工具
NVIDIA 发布 Agent 评估与定制化指南 NVIDIA 连续发布两篇 Agent 技术博客,分别讨论 AI Agent 的评估方法和企业定制化路径。 评估篇将静态模型基准与 Agent 端到端行为区分开,强调任务完成率、工具调用、规划、错误恢复和轨迹记录;定制化篇面向把通用模型改造成业务任务专家。 定制化篇覆盖提示工程、RAG、微调、工具使用、记忆机制和多智能体协作等方向,应用场景包括物流调度、工单分类、代码生成和多步骤流程编排。两篇文章主要是方法框架,未给出统一数据集、基准分数或可复现实验配置。
NVIDIA Technical Blog · 2026-05-20 · [原文](https://developer.nvidia.com/blog/mastering-agentic-techniques-ai-agent-evaluation) · [原文](https://developer.nvidia.com/blog/mastering-agentic-techniques-ai-agent-customization) #34 平台与开发者工具
OpenClaw 发布 2026.5.19 版本 OpenClaw 发布 v2026.5.19,Android Talk Mode 升级为基于 Gateway 中继的实时语音会话。 新版支持流式麦克风输入、实时音频播放、工具结果桥接和屏幕转录文本,Mac 应用设置页也改为更统一的布局与缓存导航。 该版本还新增 meme-maker、Python 调试、节点检查器调试和融合图表生成等技能;CLI 增加 defineToolPlugin 与 openclaw plugins build/validate/init,用于创建类型化工具插件。QA-Lab 新增运行时一致性测试和工具覆盖率报告,修复项包括内存搜索 JS 回退向量路径阻塞、Telegram 论坛主题阻塞和 MCP 工具模式兼容问题。
GitHub Release · 2026-05-20 · [原文](https://github.com/openclaw/openclaw/releases/tag/v2026.5.19) #35 平台与开发者工具
Hugging Face 上线 Hardware 页面与模型参数筛选 Hugging Face 为 Dataset Leaderboard 新增按模型参数量级筛选结果的功能,并上线 Hardware 页面展示社区硬件使用情况。 参数筛选可帮助用户按 1B-7B、7B-13B 等规模查看基准结果,更快匹配本地或云端算力约束。 Hardware 页面由 Hugging Face 联合创始人 Julien Chaumond 对外介绍,目标是统计社区实际使用的 GPU、CPU、VRAM 分布和推理硬件情况。该页面的采样口径、更新频率和是否覆盖私有部署尚未在公开信息中展开。
Hugging Face · 2026-05-21 · [参考资料](https://huggingface.co/datasets?benchmark=benchmark%3Aofficial&sort=trending) · X 社媒参考 · [参考资料](https://x.com/julien_c/status/2056918922929365342) #36 平台与开发者工具
Hermes agent 接入 Grok 网络搜索 NousResearch 的 Hermes agent 文档显示,项目已集成 xAI Grok 的网络搜索能力。 用户可通过 Grok Responses API 调用 websearch 工具,并用 XAIAPIKEY 或 OAuth 登录配置搜索后端;config.yaml 可设置 web.backend: "xai"、模型、允许域名、排除域名和超时时间。 文档同时写明,该功能只提供搜索,不提供网页正文提取;若需要抽取页面内容,需要搭配 Firecrawl、Tavily 等后端。Grok 搜索返回的标题、描述和 URL 由 LLM 生成,官方文档提醒需要校验返回链接,避免恶意查询诱导出攻击者控制的 URL。
Hermes Agent Docs · 2026-05-21 · [原文](https://hermes-agent.nousresearch.com/docs/user-guide/features/web-search) #37 平台与开发者工具
HalBench 开源前沿模型谄媚与幻觉测试 Reddit r/LocalLLaMA 用户发布 HalBench,用 3200 个错误前提提示词测试前沿模型的顺从、反驳和回避表现。 该基准覆盖 8 种错误机制和 4 个领域,作者用 Microsoft Harrier-OSS-v1-0.6B 嵌入模型进行句子级投影评分,把回复分成 HARD、SOFT 和 DEFER 三档。 作者公布的初步结果显示,Sonnet 4.6 平均分 0.565,Grok 4.3 为 0.498,GPT-5.4 为 0.381,Gemini 3.1 Pro 为 0.339;所有模型在“真实实体的虚假属性”类别上表现较弱。该项目已开放数据集、Hugging Face Space 和 Python 包,但评分器、提示集代表性和模型调用设置仍需要更多独立复测。
Reddit r/LocalLLaMA · 2026-05-20 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tizvih/halbench_i_built_a_custom_sycophancy_and)