返回日报索引

AI DAILY / 2026-07-27

07·27 - AI 午报:MiniMax M3补齐本地稀疏注意力与视觉支持,Sentient OS让Mac主动工作

今天的重点是本地模型继续补齐“能运行、能推理、能行动”的工具链:MiniMax M3的稀疏注意力与视觉支持进入llama.cpp主线,Sentient OS把个人资料整理和Computer Use放到Mac端,ISONGraph则用更紧凑的图谱格式节省上下文。Grok Build新增深度研究命令,Qwen社区测试开始更细地比较Agent微调、延迟与工具调用成本。

10 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01本地推理与数据结构

MiniMax M3的稀疏注意力与视觉支持合入llama.cpp主线

llama.cpp在7月26日先后合并MiniMax M3的稀疏注意力与视觉支持,相关实现已经进入主线。 M3采用60层、128专家的MoE结构,其中包含3个稠密层和57个MoE层。MiniMax Sparse Attention会把可见上下文按128 token分块,每个query选择16个block,也就是固定读取2048个KV token,使解码阶段的注意力计算量不再随上下文长度继续增长。 视觉支持随后通过独立PR合并,视觉塔沿用Qwen2.5-VL风格的ViT预处理路径,并加入三轴时空RoPE与两阶段patch merge。项目维护者特别说明,稀疏注意力是模型训练语义的一部分,不是可以随意关闭的加速开关;密集注意力只能作为兼容回退,可能损害输出质量。

ggml-org/llama.cpp · GitHub · 2026-07-26原文
#02本地推理与数据结构

ISONGraph用1698个token表示测试图谱,较JSON节省68.6%

ISONGraph项目发布面向大模型上下文的紧凑属性图格式,项目方测试中,同一批图谱从JSON的5406个token降至1698个。 测试覆盖7个数据集与10种序列化格式,ISONGraph自报节省68.6%的token,同时保持90%的整体准确率;数据遍历准确率为92%,多跳查询准确率为80%,其他参测格式落在40%至70%之间。 项目采用MIT许可证,提供Python、TypeScript、Rust、Go、C++与C#实现,并配套查询语言和多跳遍历功能。上述数字来自项目README与仓库内测试,不是独立第三方评测;仓库今年1月创建,截至核查时仍处早期阶段。

ISONGraph · GitHub · 2026-07-27原文
#03本地推理与数据结构

BeeLlama.cpp v0.4.1扩展KV缓存量化与高精度尾部

BeeLlama.cpp v0.4.1把KVarN原生注意力扩展到CPU、Vulkan和HIP等后端,并继续完善KV缓存的混合精度方案。 这个llama.cpp分叉允许把最近一段token保留为BF16或F16,其余KV缓存继续量化,减少长上下文占用的同时,保住离当前任务最近的信息。 项目作者把1024-token的高精度尾部作为首个测试档位。在Qwen3.6 27B Q5KS、64K上下文的作者测试中,kvarn5 + tail 1024使用1488 MiB KV缓存,相当于q80基线的68.4%;KLD中位数为q80基线的101.3%。这些结果只对应作者给定的模型、量化与测试环境。 测试报告:https://anbeeld.com/articles/kv-cache-precision-tail-implementation-and-benchmarks

BeeLlama.cpp · GitHub · 2026-07-26原文
#04Agent与本地应用

Sentient OS让Mac夜间整理个人资料并主动提出可执行任务

开源项目Sentient OS尝试把“主动式个人AI”放到Mac本地:系统夜间读取新增文件、截图、聊天与邮件,过滤垃圾和敏感内容,再把去除个人身份信息的摘要写入本地知识库。 第二天,应用会根据这些资料提出可以由Computer Use完成的任务,例如补写遗漏回复或处理即将续费的订阅。 项目README称约90%的计算在Mac上完成,剩余部分交给用户选择的前沿模型;原始资料不离开设备,出站知识库使用AES-256-GCM加密。应用要求Apple Silicon M1及以上、macOS 15及以上,8GB内存即可运行。项目采用AGPL-3.0许可证,截至核查时有359颗星与30个fork。

Sentient OS · GitHub · 2026-07-27原文
#05Agent与本地应用

Grok Build新增/deep-research命令,以并行Agent生成带引用报告

Elon Musk在X宣布Grok Build新增/deep-research命令。 被其引用的功能说明称,这个命令会让受限的并行Agent开展研究、交叉检查证据,并把结果整理成带引用的报告。 目前公开消息只有社交平台上的简短发布,未列出价格、配额、开放范围或完整技术文档。功能是否已经向全部Grok Build用户开放,也没有同步说明。 参考资料:https://x.com/elonmusk/status/2081449658363134075

X @elonmusk · 2026-07-26
#06Agent与本地应用

本地Qwen驱动机械臂,对78部手机执行电池测试

一家手机评测机构把本地视觉语言模型接入机械臂,用更接近真人的操作流程测试78部手机。 工业相机画面先交给模型识别屏幕内容、按钮与可执行动作,再据此计算机械臂路径;视频作者称,从收到图像到算出路径的端到端耗时低于2秒。 本地服务器配有NVIDIA H20与RTX PRO 6000 Blackwell,分别运行Qwen3.6-35B-A3B与Qwen3.6-27B。前者处理快速滚动场景,后者负责精确操作与失败复核。配置与延迟来自视频转录和社区整理,项目未提供完整技术报告。 参考资料:https://www.reddit.com/r/LocalLLaMA/comments/1v7l1ly/unexpecteduseoflocalllm

Battery Life 5.0 视频;Reddit r/LocalLLaMA · 2026-07-27原文
#07模型测试与产品动态

90次Agent测试中,Qwen3.6基础模型比两个微调版更守纪律

一名开发者用6个任务、5次重复和3个模型完成90次独立运行,对比Qwen3.6-27B基础模型、ThinkingCap与Fable Fusion。 三个模型的所有运行都通过了任务grader,但ThinkingCap比基础模型少用34%的思考token,从47.6K降至31.6K,输出token少23%,并在6个任务中的5个取得最快速度;Fable完成相同结果时,模型调用次数比基础模型多24%。 作者随后检查全部90份运行记录,认为基础模型的行为最稳定,未出现事实编造。Fable调查范围更广,但一次价格问题使用94次工具调用,并把真实人物错误地归到无关项目。测试使用作者自建Agent harness与单张RTX 5090,结果不代表其他框架或任务集。

Kyle Marble · 开发者测试 · 2026-07-26原文
#08模型测试与产品动态

OpenAI团队成员称ChatGPT Work活跃用户数已超过Codex

OpenAI团队成员Tibo在X表示,ChatGPT Work的活跃用户数量已经超过Codex。 这条消息没有附具体人数,OpenAI也未说明“活跃用户”采用日活、周活还是月活口径。 这是员工个人账号披露的数据节点,不是OpenAI正式统计公告。此前两期午报分别报道了Work的云浏览器能力以及服务异常后的额度重置,本次只记录用户规模排序这一项新增信息。 参考资料:https://x.com/thsottiaux/status/2081198608293187635

X @thsottiaux · 2026-07-26
#09模型测试与产品动态

Andrej Karpathy否认从Anthropic离职的传闻

Andrej Karpathy本人在X否认已经从Anthropic离职。 面对社交平台上的相关说法,Karpathy直接回复称这是“流传在Twitter上的奇怪错误信息”,并给出否定答复。 这次回应只确认离职传闻不实,没有披露其当前项目、岗位变化或新的研究安排。相关信息来自当事人本人账号。 参考资料:https://x.com/karpathy/status/2081193667529003247

X @karpathy · 2026-07-26
#10模型测试与产品动态

Kimi K3截至午报发稿时仍未开放完整权重

Kimi官方此前承诺在7月27日前开放Kimi K3完整权重,但截至午报发稿时,Hugging Face官方页面仍显示“Upcoming release”。 页面已经设置7月27日倒计时,权重文件尚未进入正式可下载状态。 Kimi官方博客将K3描述为2.8万亿参数MoE模型,每个token从896个专家中激活16个。由于7月27日当天尚未结束,目前只能记录午间状态,不能据此认定官方已经错过发布日期。 模型页:https://huggingface.co/moonshotai/Kimi-K3 ---