返回日报索引

AI DAILY / 2026-05-26

05·26 - AI 午报:华为宣布韬定律,6 月或将出现模型发布潮

17 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01社区、公司与政策

华为发布韬(τ)定律,麒麟芯片首发逻辑折叠技术

华为在 ISCAS 2026 上提出半导体新原则「韬(τ)定律」,主张以「时间缩微」替代「几何缩微」,通过「逻辑折叠」技术压缩信号传播时延,持续提升晶体管密度与系统性能。 华为称过去六年基于该定律已量产 381 款芯片,即将发布的麒麟芯片将首发逻辑折叠技术,预计到 2031 年高端芯片晶体管密度达到 1.4 纳米制程同等水平。 韬定律的核心思路是:在物理制程缩微逼近极限时,换道从时序优化入手继续提升性能密度。该理论若成立,对半导体产业演进路径影响深远,但华为未公开具体技术验证数据,第三方复现和评估尚属空白。

华为麒麟微信公众号 · 2026-05-26 · [原文](https://mp.weixin.qq.com/s/txF-C8pXnmGwqNLFEDep8A)
#02社区、公司与政策

6月 AI 模型发布潮传闻 + 阿里云百炼虚标额度

社区传闻 6 月将迎来 AI 模型密集发布期,涉及 Google Gemini 3.5 Pro、OpenAI GPT-5.6、Anthropic Sonnet 4.8/Opus 4.8/Mythos 1、xAI Grok 5、Kimi K3、DeepSeek V4.1 及 MiniMax M3 等。 其中 Gemini 3.5 Pro 基本确认,其余均未得到官方确认。 在服务定价侧,阿里云百炼新推出的 Token Plan 团队套餐被指虚标额度。用户实测发现 698 元/席位的 100,000 Credits 实际仅值约 1000 元,相当于 API 定价的 7 折,与宣传中的「大额抵扣」严重不符。Qwen3.7 Max 不支持隐式缓存也导致实际消耗远超预期。

Linux.do 论坛转述 · 2026-05-26 · [参考资料](https://linux.do/t/topic/2246155) · [参考资料](https://linux.do/t/topic/2247053)
#03社区、公司与政策

教皇与 Anthropic 联合创始人开展 AI 伦理高层对话

教皇方济各(Leo XIV)发布通谕《Magnifica humanitas》,邀请 Anthropic 联合创始人 Chris Olah 出席发布会并发表演讲,聚焦 AI 发展中的伦理与人文关怀。 Olah 在发言中强调技术应服务于人类尊严。此事标志着 AI 前沿企业与宗教机构在伦理治理层面的罕见直接接触。 通谕全文和演讲具体内容尚未完全公开,National Catholic Reporter 和多家媒体报道了这一事件。r/singularity 社区对此次对话态度分化:部分用户认为宗教界参与 AI 治理是积极信号,另一些则质疑其权威性和实际影响力。

Reddit r/singularity · 2026-05-26 · [参考资料](https://www.reddit.com/r/singularity/comments/1tnp8m2/its_happening) · X 社媒参考 · 2026-05-25 · [参考资料](https://x.com/i/web/status/2058983299092009421)
#04社区、公司与政策

METR AI 时间线图遭 NYU 研究员严厉批评

NYU Stern 研究员 Nathan Witkin 发长文严厉批评 METR 的 AI 时间线图存在多项严重错误,认为该图「无法挽救」。 他指出,METR Long Tasks 基准测试的人类基线数据部分来自作者猜测而非实测,支付时薪导致测试者故意拖延,样本偏向作者熟人,且未区分熟悉代码库与不熟悉的人类速度差异(可达 5-18 倍)。部分任务存在测试-训练数据污染。 Gary Marcus 和 Ernest Davis 也撰文补充了更多错误。METR 时间线图是 AI 社区引用最广的「AI 将多快替代人类」参考之一,此番批评动摇了其方法论根基。Witkin 呼吁 AI 领域停止过度依赖此类有缺陷的基准。

Reddit r/MachineLearning · 2026-05-25 · [参考资料](https://www.reddit.com/r/MachineLearning/comments/1tnhnh5/the_famous_metr_ai_time_horizons_graph_contains)
#05社区、公司与政策

Qwen3.7-Max 盲测在 Web 开发任务中超越 Claude Opus 4-6

据 Arena AI WebDev Leaderboard 盲测排行榜,Qwen3.7-Max 在 Web 开发任务上超越 Claude Opus 4-6,排名第一。 该排行榜基于用户盲测投票。具体分数、测试用例数量和统计显著性未披露。 Qwen3.7-Max 是阿里最新旗舰模型,若排名成绩获得进一步独立验证,国产模型在代码生成这一高价值场景中已具备与 OpenAI、Anthropic 正面竞争的能力。

Linux.do 论坛转述 · 2026-05-26 · [参考资料](https://linux.do/t/topic/2246198)
#06模型、产品与工具

OpenBMB 发布 MiniCPM5-1B,2B 以下最强开源基础模型

OpenBMB 正式发布并开源 MiniCPM5 系列首个模型 MiniCPM5-1B,拥有 10.8 亿参数,在 Artificial Analysis 小模型榜单中以 17.9 分排名第一,成为 2B 参数以下最强开源基础模型。 该模型支持混合推理,通过 think 模板切换快速回答与深度思考模式;INT4 量化后体积约 0.5GB,可在手机、浏览器及 CPU 上本地运行。 训练采用 AI 辅助编写的 ForgeTrain 框架,后训练结合强化学习与在线策略蒸馏,在数学、代码等任务上平均分提升 16 点,超长回复比例下降 29 个百分点。模型权重、训练数据及部署代码已全部开源。 MiniCPM5-1B 的发布进一步压缩了小模型的性能边界,0.5GB 的量化体积使端侧和边缘设备上部署高性能 AI 更可行。

OpenBMB HuggingFace · 2026-05-26 · [原文](https://huggingface.co/openbmb/MiniCPM5-1B)
#07模型、产品与工具

Grok V9-Medium 训练完成,1.5T 参数,年内开源 0.5T

Elon Musk 宣布 SpaceXAI 的 1.5T 参数 Grok V9-Medium 基础模型已完成训练,进入微调阶段,预计 2-3 周内公开发布。 该模型在补充训练中加入了大量 Cursor 数据,将显著提升复杂编程任务能力,并替代当前生产中的 0.5T v8-Small 模型。 Musk 同时承诺今年年底开源 0.5T 参数模型。这一表态与 xAI 一贯的开放姿态一致,但具体性能对比数据和开源协议尚未公布。1.5T 参数规模若兑现,将使 Grok 跻身最大规模公开可用的语言模型之一。

X 社媒参考 · 2026-05-26 · [参考资料](https://x.com/elonmusk/status/2058787384364265734)
#08模型、产品与工具

Grok Build Beta 发布:Plan Mode + Imagine + CLI

xAI 宣布 Grok Build 平台进入 Beta 阶段,面向所有 SuperGrok 和 X Premium+ 用户开放,包含 Plan Mode 任务规划、Imagine 图像与视频生成、CLI 自动化编排三大核心模块。 Elon Musk 称其 TUI「最漂亮且高性能」,社区开发者的初步评测认为其编码能力「与 Claude 不相上下」。 Grok Build 将 Grok 从对话助手扩展为一站式创作与开发平台。Plan Mode 支持制定任务计划并编排子 Agent 执行;Imagine 模块可生成图像和视频;CLI 工具链允许用户构建自动化工作流和编排器。Beta 阶段预计持续约一个月。

X 社媒参考 · 2026-05-26 · [参考资料](https://x.com/xai/status/2058973760708091907) · [参考资料](https://x.com/i/web/status/2059075834447601721)
#09模型、产品与工具

Google Antigravity 新增 Gemini 3.5 Flash Low

Google 旗下开发平台 Antigravity 新增 Gemini 3.5 Flash (Low) 模型选项,专为简单任务优化,生成 token 数较 Medium 版减少约 45%,在 SWE 任务上表现通常优于 Gemini 3 Flash (High)。 同时,所有付费用户的 Gemini 配额已重置。该模型已支持 IDE、CLI 和桌面端应用。 此次更新回应了用户反馈——简单任务消耗过多 token 的痛点。Low/Medium/High 三档策略让开发者可根据任务复杂度选择合适档位,降低使用成本。

X 社媒参考 · 2026-05-26 · [参考资料](https://x.com/antigravity/status/2058741814237241812)
#10模型、产品与工具

ima copilot 全面开放,上线 Skill 发布功能

腾讯 ima 宣布全面开放具备记忆与知识库的 Agent copilot,取消此前超十万人排队限制。 该 copilot 支持全场景感知,可在不离开当前页面的情况下读取、总结和调用知识库,并允许用户自行接入各大模型 API KEY。 同时,ima 知识号上线 Skill 发布功能,首批推出微信读书与腾讯招聘 Skill。用户可在知识广场发现或发布 Skill,发布入口目前仅限 PC 端。ima 将浏览器侧边栏形态的 AI 助手与知识库深度整合,skill 发布功能的开放使其从工具向平台演进。

ima.copilot 微信公众号 · 2026-05-26 · [原文](https://mp.weixin.qq.com/s/R22ySmNraCJ4W4o2nbJu1w)
#11模型、产品与工具

腾讯混元 Hy-MT2 翻译模型登顶 HF 趋势榜

腾讯混元团队在 HuggingFace 发布 Hy-MT2 系列翻译模型,其中 Hy-MT2-1.8B 登顶开源模型趋势榜第一,Hy-MT2-30B-A3B 位列第四,上线后下载量已超 7000 次。 该系列采用混合专家架构,在翻译质量与推理效率上取得平衡。 Hy-MT2 的登顶反映了国产大模型在垂直领域开源生态中的竞争力提升,也验证了轻量化 MoE 架构在翻译任务上的有效性。

官方 HuggingFace · 2026-05-26 · [参考资料](https://huggingface.co/tencent/Hy-MT2-1.8B)
#12基础设施与本地推理

llama.cpp 双优化:Split Mode 修复 + CUDA FWHT 7-9% 提升

llama.cpp 发布 b9320 版本,修复了 Split Mode Tensor 模式下多 GPU 推理的 VRAM 耗尽崩溃问题,此前每 90-120 分钟会因显存溢出崩溃。 社区测试显示 Split Mode 相比 Layer 模式在 Token Generation 速度上有约 35% 的提升,修复后多卡用户可安全利用性能优势。修复代码已合并入主分支。 同时,社区贡献者 am17an 提交了 PR #23615,为 CUDA 后端实现快速沃尔什-阿达玛变换(FWHT),用于加速 KV 缓存量化。在 NVIDIA RTX 5090 上测试 Gemma 4 26B-A4B Q4KM 模型,预填充阶段吞吐量提升 1-2%,文本生成阶段提升 7-9%。两则改进先后落地,对本地多 GPU 部署用户都是直接利好。

Reddit r/LocalLLaMA · 2026-05-25 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tne40m/llamacpp_split_mode_tensor_fix_incoming) · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tnfqng/cuda_add_fast_walshhadamard_transform_by_am17an)
#13基础设施与本地推理

ThriftAttention:长上下文 FP4 注意力显存降低 40%

ThriftAttention 提出选择性混合精度方法,在长上下文场景下动态识别注意力矩阵中需要高精度的关键区域,仅对部分元素使用 FP16,其余保持 FP4,128K 上下文下显存开销降低约 40%,困惑度损失小于 0.5%。 该方法针对 FP4 量化推理中的注意力瓶颈做了精准优化,在模型质量保持方面数据可观。 该工作目前仅在 Reddit 社区和 arXiv 预印本分享,尚未见大规模复现报告,但对低显存设备的长上下文推理场景有实际价值。

Reddit r/LocalLLaMA · 2026-05-25 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tnm56l/thriftattention_selective_mixed_precision_for)
#14基础设施与本地推理

12×V100 集群跑本地法律 AI + DCGAN 推理跑通 MCU

一位律师用户分享了用 12 块 V100 32GB 集群搭建本地 AI 法律文书系统的最新进展。 软件栈从 vLLM 全面迁移至 llama.cpp,原因是 vLLM 在 Volta 架构上不支持 MoE 模型的 FP8/AWQ/Marlin 量化。实测表明 V100 上稠密模型性能不佳,MoE 模型表现理想。新增一台 EPYC 7302P + 4×RTX 3090 + 2×V100 的第二服务器。 另一极端场景:研究者在双核 RISC-V 微控制器 CH32H417 上成功运行 DCGAN 推理,生成 64×64 猫脸图像。纯 C 编写,12.6M 参数 int8 量化,在 512KB SRAM 限制下单张生成耗时 26 秒,瓶颈为 SD 卡读取速度。两个案例从相反方向展示了 AI 推理适配极端硬件的可能性。

Reddit r/LocalLLaMA · 2026-05-25 · [参考资料](https://www.reddit.com/r/LocalLLaMA/comments/1tnn29i/update_on_12x32gb_sxm_v100_cluster_local_ai_for) · Reddit r/MachineLearning · 2026-05-25 · [参考资料](https://www.reddit.com/r/MachineLearning/comments/1tnhfxp/dcgan_inference_on_a_microcontroller_126m)
#15安全、Agent 与模型前沿

Google DeepMind 发布 AlphaProof Nexus 数学 Agent 框架

Google DeepMind 发布 AlphaProof Nexus,一个面向研究级数学的智能体框架,结合形式化推理与搜索算法。 此为社区爆料,非官方公告或论文发布。若消息属实,该框架可能是继此前 DeepMind AI 自主解决 Erdős 问题后的进一步系统化输出。 框架具体架构、与现有工具(Lean、Coq 等)的集成方式以及独立基准测试结果尚无信息。

X 社媒参考 · 2026-05-25 · [参考资料](https://x.com/i/web/status/2058945928011124826)
#16安全、Agent 与模型前沿

"Attention is All You Need"作者呼吁超越 Transformer

「Attention is All You Need」论文作者之一在 Pathway 公司举办的「后 Transformer」辩论中,公开呼吁业界超越 Transformer 架构。 该研究者指出 Transformer 在效率、长序列处理等方面存在根本局限,并展示了状态空间模型、线性注意力等替代方案的最新进展。辩论虽是社区活动,但来自原作者的表态信号意义明显。 同期,Delta Attention Residuals 论文提出即插即用残差升级方案,通过路由子层增量而非累积隐藏状态,解决跨层注意力的路由坍塌问题。在 7.6B 参数模型上验证集困惑度降低 8.2%,仅增加 0.008% 参数(约 589K),从 220M 到 7.6B 规模均优于标准残差。

Reddit r/singularity · 2026-05-25 · [参考资料](https://www.reddit.com/r/singularity/comments/1tnf90m/one_of_the_authors_of_attention_is_all_you_need) · Reddit r/MachineLearning · 2026-05-25 · [参考资料](https://www.reddit.com/r/MachineLearning/comments/1tndn5b/Delta_Attention_Residuals)
#17安全、Agent 与模型前沿

社区多 Agent 开源项目:Spice、openteams、Codex /goal

多个社区 Agent 框架集中出现:Spice 在现有执行 Agent 之上增加显式决策层,将「观察-选项-选择-执行-反馈」记录为可审查的 Decision Cards。 已开源,支持 LLM 配置和外部 Agent 交接。 openteams 提供自由聊天和工作流两种多 Agent 协作模式,工作流模式通过独立调度确保 DAG 依赖正确执行。Codex /goal 工作流文档则通过结构化卡片(批次、状态、依赖、自检、风险、验收标准)和严格执行协议,解决单次指令长度限制问题。三者在解决 Agent 可解释性、多步骤可靠性和任务续接等方面各有侧重。 由 AI 辅助生成,可能存在幻觉。