MiniMax M3的稀疏注意力与视觉支持合入llama.cpp主线
llama.cpp在7月26日先后合并MiniMax M3的稀疏注意力与视觉支持,相关实现已经进入主线。 M3采用60层、128专家的MoE结构,其中包含3个稠密层和57个MoE层。MiniMax Sparse Attention会把可见上下文按128 token分块,每个query选择16个block,也就是固定读取2048个KV token,使解码阶段的注意力计算量不再随上下文长度继续增长。 视觉支持随后通过独立PR合并,视觉塔沿用Qwen2.5-VL风格的ViT预处理路径,并加入三轴时空RoPE与两阶段patch merge。项目维护者特别说明,稀疏注意力是模型训练语义的一部分,不是可以随意关闭的加速开关;密集注意力只能作为兼容回退,可能损害输出质量。