返回日报索引

AI DAILY / 2026-06-16

06·16 - AI 午报:Fable 5 蒸馏模型开源,xAI 连发两项工具更新

Anthropic 仅上线 4 天即遭出口管制的 Fable-5 模型,已被社区蒸馏为开源模型 Qwable-v1 并发布权重。xAI 同一天推送了两项工具更新:Grok Build 接入 Warp 终端,Agent Dashboard 支持多 Agent 并行管理。模型评测侧,HalBench v2.3 显示 Qwen 3.6 以 27B 参数在幻觉抵抗上超过 GPT-5.4;网络安全垂直模型 OpenMythos 开源发布。

9 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01产品与商业

社区从 Fable-5 API 泄露轨迹中蒸馏出 Qwable-v1,模型与数据集全开源

Anthropic 最强模型 Claude Fable-5 仅上线 4 天(6 月 9 日至 12 日)即因美国出口管制被全球暂停。社区团队利用 API 中泄露的 4659 条完整思维链轨迹,在 Qwen3.6-35B-A3B 上蒸馏出开放权重模型 Qwable-v1。 Fable-5 在 SWE-bench Pro 上达到 80.3%,定价 $50/M 输出 token,API 内置反蒸馏分类器实时屏蔽思维链输出。Qwable-v1 捕获了绕过分类器的代码轨迹,在单张 H200 上训练 14 小时。该模型继承了 Fable-5 的编码能力,并学会了 Claude 风格的 XML 工具调用格式。 模型权重、IQ4XS / Q4KM / Q5KM / Q80 四种 GGUF 量化版本以及 SFT 数据集均已在 HuggingFace 以 AGPL-3.0 协议开源。

Reddit r/LocalLLaMA · 2026-06-16原文
#02产品与商业

MiniMax M3 登陆 Kimchi Coding 自主编码代理

MiniMax 的前沿开放权重模型 M3 被集成到 Cast AI 开发的 Kimchi Coding 中,成为首个搭载该模型的自主编码代理。M3 此前已在多个推理评测中表现出色,此次集成将 M3 的代码能力引入终端开发场景。CommandCodeAI 也同期宣布在其终端工具中接入 M3,用户通过 npm install 即可免费使用至 6 月 17 日。

#03产品与商业

微信小程序接入 AI 问答需提交《在用证明》,开发者面临合规困境

微信小程序接入 AI 问答功能时,腾讯要求开发者提供深度合成服务《在用证明》,需包含小程序主体、appid、订单有效期及算法备案号。使用 DeepSeek API 的开发者面临核心难题:API 提供方是否出具此类证明,还是开发者需自行完成算法备案。微信开放社区相关公告下尚无明确的解决方案。 ---

#04模型与开源

HalBench v2.3:Qwen 3.6 成最佳开源幻觉抵抗模型,超越 GPT-5.4

HalBench 发布 v2.3 版本,在虚假前提设定下测试了 33 个模型(29 个开源)的阿谀奉承和幻觉倾向。Qwen 3.6(约 27B 参数)以 36.6% 的 pushback 率(拒绝虚假前提的比例)登顶开源榜,超越 GPT-5.4 和 Gemini 3.1 Pro。Phi-4 垫底,仅 2.3%。 关键发现:模型大小与 pushback 相关性弱,训练配方比参数量更关键;"权威专家"框架是最容易导致模型顺从的 prompt 技巧。Meta 的 Llama 系列连续多个版本表现不佳。

Reddit r/LocalLLaMA · 2026-06-15原文
#05模型与开源

OpenMythos 发布:基于漏洞修复分支对训练的网络安全开源 LLM

开源社区团队在 Build Small Hackathon 中发布 OpenMythos,一个专注于网络安全领域的开源大语言模型,权重和数据集已公开在 HuggingFace。 训练分两阶段:先对 1840 条高质量 ArXiv 论文和结构化 CVE 数据集进行监督微调,再通过 GitHub 漏洞/修复分支对的强化学习验证(RLVR)提升准确性。RLVR 阶段使用验证器模型检查输出是否识别正确漏洞并提供正确修复,显著减少了漏洞类别混淆和不确定性校准问题——通用 LLM 在安全任务中常出现的幻觉 CVE 细节和遗漏代码漏洞模式等缺陷。

Reddit r/LocalLLaMA · 2026-06-15原文
#06模型与开源

Nex2 mini Phase Twin:16GB 显卡跑 30B 模型,单卡 89 tok/s

社区开发者发布 Nex2 mini Phase Twin 模型,专为 Intel Arc A770 16GB 显卡优化,单卡推理速度达 89 tok/s。模型基于硬件自动选择内核并校准,双卡配置性能更优。权重已上传至 HuggingFace,面向本地 LLM 部署场景。 ---

Reddit r/LocalLLaMA · 2026-06-16原文
#07工具与 Agent

SuperGrok / X Premium 用户可在 Warp 终端使用 Grok Build 模型

xAI 宣布 SuperGrok 和 X Premium 订阅用户现可在终端模拟器 Warp 中使用 Grok Build 模型进行代码生成和调试。用户在 Warp Agent 设置中切换模型即可调用,无需额外配置。Grok 的能力由此从 Web 端和 X 平台扩展至开发者工具链。

#08工具与 Agent

xAI Agent Dashboard 上线多 Agent 并行管理功能

xAI 在 Agent Dashboard 中推出多 Agent 管理功能,支持同时查看多个 AI Agent 的状态、回复需要关注的 Agent 并分派新任务。该功能面向多 Agent 并行工作场景,目前通过 xAI 官方账号发布。

#09工具与 Agent

vLLM nightly 推出 Qwen3+ 流式解析器,修复断流与工具调用分块失败

vLLM 在 nightly 版本中为 Qwen3+ 系列模型推出新的流式解析器。此前 Qwen3.6-27B 在流式推理时频繁中途停止响应,工具调用也因分块边界问题失败——这些问题严重影响了 Agent 工作流的稳定性。早期用户测试显示新解析器有效修复了上述问题。 ---