#01基础设施与推理优化
KVarN KV cache 量化:6-bit 精度匹配 q80,4-bit 匹配 q50
KVarN 量化方法在 BeeLlama v0.3.2(llama.cpp 分支)中实现,基准测试显示其在每个位宽上都能匹配传统量化高一级的精度。 在 Qwen 3.6 27B 模型 64k 上下文场景下,KVarN 6-bit 的 Mean KLD 为 0.002338,与 q80 的 0.002328 几乎相同,但缓存大小仅为 40.4%(q80 为 53.1%)。KVarN 4-bit 的 Mean KLD 为 0.002533,对应 q50 级别精度,缓存仅占 40.4%。 该技术对 VRAM 受限的本地推理场景意义明显——用户可以在不损失精度的前提下,将 KV cache 内存占用压缩近四分之一。当前实现的 prompt 处理速度较慢(bf16 为 850 tok/s,KVarN 6-bit 降至 689 tok/s),但作者表示这可能通过后续优化改善。
#02基础设施与推理优化
Gemma 4 12B QAT 搭配 MTP 在 12GB 显卡实现 120 tok/s
社区开发者 janvitos 在 RTX 4070 Super 12GB 上,通过 llama.cpp 的 Gemma 4 MTP PR 分支,使用 Unsloth 的 Gemma 4 12B QAT 量化模型(Q4KXL)和自制 8-bit 辅助草稿模型,实现了平均 120 tok/s 的推理速度。 无 MTP 时速度约 60 tok/s,启用 MTP 后提升约 2 倍,草稿接受率约 65.8%。 该方案需要 12GB VRAM 且依赖 Linux 系统(CachyOS)以释放全部显存,Windows 下可能因显存占用过高无法运行。Google 刚发布 QAT 变体的 Gemma 4 模型,社区便迅速产出了可用的 MTP 加速方案。
#03基础设施与推理优化
turbovec 宣称 1000 万文档向量索引从 31GB 压缩至 4GB
Reddit 用户宣称 turbovec 可将 1000 万文档的向量索引从 31GB(float32)压缩至 4GB,且搜索速度超过 FAISS。 该工具通过新型压缩算法降低内存占用,同时保持检索精度。 若属实,将显著降低大规模向量搜索的硬件门槛,推动边缘设备与实时检索应用。但当前信息仅来自 Reddit 帖子,缺乏官方文档、基准测试细节及第三方验证。
#04基础设施与推理优化
dvlt.cu:纯 CUDA/C++ 推理引擎,5MB 二进制无 Python 依赖
开发者 yassa9 发布 dvlt.cu,一个完全从零使用 CUDA/C++ 编写的推理引擎,专为 NVIDIA 的 DVLT 3D 变压器模型设计。 该二进制文件仅 5MB,无 Python、PyTorch、TensorFlow、ONNX、llama.cpp、vLLM 或 Hugging Face 运行时依赖,仅依赖 cuBLASLt 和 cuTLASS。 用户下载 NVIDIA 提供的 1.17 亿参数权重后即可在图像或视频上运行推理,输出为点云和相机位姿。该项目展示了极简依赖的高性能 3D 推理方案。 ---
#05Agent 与开源模型
UIUC 团队开源 20B 搜索 Agent Harness-1
UIUC 等大学联合团队发布并开源了 20B 参数搜索 Agent Harness-1,采用"状态外化"框架,将检索状态维护交给环境,模型仅负责语义决策。 在涵盖网页、金融、专利和多跳问答的 8 个检索基准中,Harness-1 取得 0.730 的平均精选召回率,以 11.4 个百分点的优势超越次强开源搜索 Agent,与更大规模的前沿模型搜索器保持竞争力。 模型基于 openai/gpt-oss-20b 微调,已在 Hugging Face 和 GitHub 开源。
#06Agent 与开源模型
Cohere 发布首个编程模型 BLS-Mini-Code-1.0 早期权重
Cohere 在 Hugging Face 上发布其首个编程模型 BLS-Mini-Code-1.0 的早期访问版本。 该模型采用混合专家架构,总参数量 30B、活跃参数量 3B,含 128 个专家每次激活 8 个,支持全局与 4096 滑动窗口交错注意力,最大位置长度 50 万。 目前模型权重已上线,但官方强调尚未完全就绪,基准测试、许可证和详细运行说明将在后续正式发布时提供。此举标志着 Cohere 从通用模型向垂直编程领域的拓展。
#07Agent 与开源模型
Hermes Agent v0.16.0:原生桌面应用与完整中文界面
Nous Research 发布 Hermes Agent v0.16.0(代号 The Surface Release),核心更新是推出基于 Electron 的原生桌面应用。 新版本支持 macOS/Linux/Windows 一键安装、内更新、拖拽文件、多配置文件并发会话,并首次提供完整简体中文界面。 Web Dashboard 升级为全功能管理面板,支持在浏览器中配置 MCP 服务器、消息通道、凭据和 Webhooks。默认技能集精简,NVIDIA/skills 加入可信 Skills Hub,新增 /undo [N] 命令。该版本关闭 399 个 issue,修复 CVE-2026-48710 等安全漏洞。 ---
#08行业与政策
OpenAI 与美国政府就入股事宜谈判超过一年
据多家媒体报道,OpenAI 与美国政府已就政府入股 OpenAI 进行了一年多的谈判。 核心方案是 OpenAI 自愿向政府捐赠股份,建立向美国公民分红的"公共财富基金"。参议员 Bernie Sanders 计划提出《美国人工智能主权财富基金法案》,对大型 AI 公司股份征收一次性 50% 税,政府将获得投票权和董事会席位。 OpenAI 估值超过 8500 亿美元,正筹备 IPO。该安排可能为 OpenAI 提供政治保护,但也引发"大而不倒"担忧。目前尚无具体条款,法律机制不明,谈判仍有流产可能。
#09行业与政策
Anthropic 新模型 Claude Mythos 5 在 API 中短暂现身
社区成员爆料称,Anthropic 的 API 和开发者模式中短暂出现了名为 Claude Mythos 5 的新模型标识。 据 TestingCatalog 等消息源透露,Claude Mythos 将作为独立于 Haiku、Sonnet 和 Opus 的全新模型类别发布,定位高于 Opus 系列。内部代号可能为 claude-oceanus-v1-p,此前已提供给部分红队成员测试。 目前该标识已被撤下,Anthropic 官方尚未回应。该消息来自社交媒体爆料,需谨慎对待。
#10行业与政策
SpaceX IPO 已获约 1500 亿美元认购,达募资计划两倍
据两名知情人士透露,SpaceX 本次 IPO 已获得约 1500 亿美元投资者认购资金,认购额度达到募资计划的两倍,成为史上规模最大的 IPO。 但当前数据仅为前期推介阶段的意向申购,大型机构资金通常在申购末期才递交订单,实际获配数量将在定价环节敲定。 该消息来自第一财经公众号转引,尚未得到 SpaceX 官方确认。 ---
#11产品与安全
Neuralink 脑机接口帮助瘫痪 20 年患者重新绘画
据 NewsNation 报道,瘫痪 20 年的 Audrey Crews 在植入 Neuralink 脑机接口设备后,恢复了手部运动功能,能够再次拿起画笔绘画。 这一进展展示了脑机接口技术在恢复运动功能方面的潜力。 目前信息来源为社交媒体转发,缺乏 Neuralink 官方详细报告或同行评审数据。
#12产品与安全
MiniMax M3 vs Anthropic Opus:$0.07 与 $3.39 同捕获 13/17 个 bug
MiniMax 官方账号发布对比测试:其 M3 模型(成本 $0.07)与 Anthropic Opus(成本 $3.39)在 17 个 bug 检测任务中均捕获 13 个,M3 成本仅为 Opus 的 2%。 该测试由 @kilocode 完成。 具体方法、数据集和复现细节尚未公开。若结果可靠,M3 在代码缺陷检测上实现了极致的性价比。但当前信息仅来自一条推文,缺乏完整实验报告。 ---