返回日报索引

AI DAILY / 2026-06-15

06·15 - AI 午报:OpenAI 1.5亿伙伴网络 · 智谱上市 · EAGLE 合并 llama.cpp

今天是商业化和基础设施双线推进的一天:OpenAI 宣布投入 1.5 亿美元建设合作伙伴网络,从直销转向生态合作;智谱 AI 正式上市,开盘涨 45% 后回落至 +32%。基础设施侧,EAGLE 推测解码合并进 llama.cpp 主分支,Gemma 4 12B 在 Pixel 手机实现 <10W 低功耗推理。但安全面也不平静——中转站提示词注入技术在被论文提出检测方法后已出现针对性绕过,Claude 护栏被针对性加固后仍无法完全自检。

10 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01产品与商业

OpenAI 宣布 1.5 亿美元合作伙伴网络,从直销转向生态合作

OpenAI 宣布推出 OpenAI Partner Network,投入 1.5 亿美元帮助全球合作伙伴加速企业级 AI 的采用、部署和转型。该网络将整合咨询、系统集成和技术合作伙伴资源,提供培训、市场支持和联合销售机会。 这是 OpenAI 从直接销售向生态合作模式的重要转变,通过合作伙伴网络扩大企业客户覆盖范围。官方目前仅发布简短公告,具体合作伙伴名单、参与条件和资金分配细节尚未披露。

#02产品与商业

智谱 AI 正式上市,开盘涨 45% 后回落至 +32%

智谱 AI 于 6 月 15 日正式上市,开盘股价较发行价上涨 45%,随后回落至 +32% 附近。作为国内头部大模型公司,智谱的 IPO 表现反映了市场对 AI 创业公司的信心,但消息目前仅来自论坛用户讨论,尚无官方公告或主流财经媒体详细报道,股价数据需进一步核实。 ---

#03安全与政策

中转站提示词注入新技术绕过 Claude 护栏,论文检测方法已被针对性对抗

社区测试发现,部分 AI API 中转站采用了更高级的提示词注入技术绕过 Claude 等模型的安全护栏。与早期中转站不同,本次测试的目标站点不仅注入额外提示词,还通过特定标签设置强护栏,使 Claude 多次自检后仍无法识别被篡改部分。 arXiv 2604.08407 论文提出的通过 prompttokens 膨胀检测注入的方法,已被中转站针对性地优化对抗——注入方会调整 token 计数以避免被检测。测试中高版本模型(Opus 4.8)在正确引导下可以识别异常内容,相关检测提示词已在 GitHub 开源。央视近期也报道了相关安全问题。

#04安全与政策

LeCun 评价 Anthropic 争议:"种瓜得瓜"

Yann LeCun 就 Anthropic 近期争议在 X 平台发表评论,表示完全赞同"种瓜得瓜(One reaps what one sows)"的观点。LeCun 随后澄清他从未说过"LLM 是且永远不会是严肃的",而是指"LLM 本身不够",需要与规划、推理和世界模型结合。该事件折射出 AI 安全与开放研究之间的持续张力,但具体争议内容和完整论述尚未完全公开。 ---

#05模型与开源

EAGLE 推测解码框架合并进 llama.cpp 主分支

EAGLE(Efficient and Accurate Generation of Language Examples)推测解码框架的支持已被合并到 llama.cpp 主分支。EAGLE 通过草稿模型和验证器实现无损加速,在多种硬件上可提升 LLM 推理速度 2-3 倍。此次合并使 llama.cpp 用户可直接使用 EAGLE 进行推理加速,无需额外配置,由社区贡献者实现,目前处于早期阶段,需用户自行编译启用。

Reddit r/LocalLLaMA · 2026-06-14原文
#06模型与开源

Nemotron Super 120B 深上下文基准:PP 速度在 32K 超越 GPT-OSS

Reddit 用户对 Nemotron Super(120B)、GPT-OSS 120B、Qwen 3.5 122B 和 Qwen 3.6 35B 进行了深上下文性能对比。在 Strix Halo 128GB 共享内存、Vulkan 后端环境下,Nemotron Super 表现出色:其提示处理(PP)速度在 32K 上下文深度超越 GPT-OSS 120B,在 16K 深度超越 Qwen 3.5 122B,且支持最高 400K 上下文。令牌生成速度在 128K 以下不及竞品,但 PP 优势明显,适合代码分析等长上下文场景。测试为单用户非官方基准,未启用 MTP 投机解码。

Reddit r/LocalLLaMA · 2026-06-14原文
#07模型与开源

GPTQ 4-bit 量化补偿数学原理:从拉格朗日乘子到 Cholesky 分解

一篇技术博客从零推导了 GPTQ 4-bit 量化为何不严重破坏模型困惑度的数学原理。核心思路是 GPTQ 将权重视为相关而非独立:量化一个权重后,利用层输入的逆 Hessian 矩阵精确计算相邻权重的补偿量以吸收量化误差。 文章用拉格朗日乘子法推导更新规则,手动演算 2 特征小示例,并给出向量化 PyTorch 实现(torch.outer 一次更新所有输出神经元)。还讨论了工程细节:1% Hessian 阻尼防止奇异性、Cholesky 分解替代原始逆矩阵避免浮点误差放大、按行切片 Hessian 的 C 连续内存优化。 ---

Reddit r/LocalLLaMA · 2026-06-14原文
#08工程与 Agent

Gemma 4 12B 在 Pixel 10 Pro 以 <10W 功耗运行,6.5 tok/s

Reddit 用户 bennmann 在 Google Pixel 10 Pro 手机上通过 Termux 运行 llama.cpp,成功以低于 10 瓦功耗本地运行 Gemma 4 12B 模型(Q3KXL 量化),并启用 MTP 投机解码。实测提示处理速度 6.5 tokens/s,生成速度 1.3 tokens/s。该测试展示了旗舰手机在低功耗下运行大模型的可行性,虽然生成速度仍较慢,但为移动端本地 AI 推理提供了实践参考。

Reddit r/LocalLLaMA · 2026-06-14原文
#09工程与 Agent

自研 C99 CPU 推理引擎性能仅为 llama.cpp 的 1/7.3

开发者在 C99 中从零编写 LLM 推理引擎,在 DeepSeek-V2-Lite-Chat Q4KS 模型上仅达 1.90 tok/s,而 llama.cpp 同硬件同线程数达 13.79 tok/s,性能差距 7.3 倍。 根本原因已定位:自研引擎将 Q4K 权重反量化为 F32(每权重 4 字节),而 llama.cpp 使用融合 Q4K×Q8K 点积内核,仅读取 0.5 字节/权重,带宽效率高 8 倍。两个引擎均受内存带宽限制,但 llama.cpp 从相同带宽中获取 7 倍吞吐量。作者记录了所有无效尝试(SIMD 后端切换、INT8 分类器优化、Q4K 零拷贝),指出唯一能缩小差距的方案是实现融合 Q4K 矩阵向量核。

Reddit r/LocalLLaMA · 2026-06-14原文
#10工程与 Agent

Agent 长会话"上下文腐烂"与记忆溯源成为社区焦点

两个 Agent 工程问题在社区引发集中讨论。一是"上下文腐烂":在长时间编码 Agent 会话中,上下文窗口积累旧调试记录、失败工具调用和废弃计划等噪声,导致模型推理质量随会话增长而下降。社区认为单纯扩大上下文窗口无法解决,需要设计外部持久记忆机制,仅将当前最相关的信息拉入提示词。 二是记忆溯源:持久化 Agent 无法区分"已验证事实"与"单次推断",导致旧推断被提升为事实、过时信息重新出现,且难以审计决策依据。开发者开始自建方案:按来源标记记忆(verified/inferred/speculative),在关键使用前强制重新验证。Zep、Mem0、Cognee 等现有记忆框架尚未原生解决该问题。 ---