返回日报索引

AI DAILY / 2026-08-23

08·23 - AI 午报:GLM 复活 AMD 老卡推理支持,energygraph 补上三厂 GPU 功耗监控

今天的核心是开源工具链补全:GLM 协助的 llama.cpp 分支让 AMD 老卡(Radeon VII、MI50、MI60)重新进入本地推理序列,energygraph 1.3 补上了 NVIDIA/Intel/AMD 三家 GPU 功耗的终端级监控。Qwen3.8-27B 在单卡 RTX 5090 上实测完整 262K 上下文,也是有具体数字的工程进展。

5 NEWS ITEMSHYPO-WRITER 写作档案ASIA/SHANGHAI
#01开源与硬件

GLM 协助:llama.cpp AMD GFX906 分支复活 GCN HIP 支持

一位开发者在 r/LocalLLaMA 发布了他用 GLM 协助创建的 llama.cpp 分支,目标是把 GFX906 系的 AMD 老卡重新带回推理场景。GFX906 对应 Vega 20 世代,覆盖 Radeon VII、MI50 与 MI60,都属于 GCN 5.1 架构。这套架构走的是 HIP 后端,而 ROCm 官方主线近年逐步收窄对 GCN 的支持,老卡想在当前 llama.cpp 上跑本地模型基本没有官方路径。 分支做的是把 HIP 内核按 GCN 特性重新适配,让这些被官方放弃的卡重新进入 llama.cpp 的推理流程。作者发帖的目的很直接——征求反馈,项目还处于早期阶段。Radeon VII 上的 16GB HBM2 显存在当时是消费级旗舰配置,这类卡在二手市场仍有一批保有量,恢复支持对预算受限的本地推理用户有实际意义。

Reddit r/LocalLLaMA · 2026-08-22原文
#02开源与硬件

energygraph 1.3:零依赖终端 GPU 功耗监控

终端功耗监控工具 energygraph 发布 1.3 版本,主打零依赖和轻量,直接在终端里实时查看耗电情况。新版补上了 dGPU 支持,覆盖英伟达、英特尔和 AMD 三家;依据厂商的传感器支持程度,还可以细分到 CPU 核心、iGPU、平台系统与 DRAM 的单独功耗。同一份命令行界面里,GPU 与整机功耗可以并排显示。 对本地跑模型的用户来说,功耗读数直接对应显卡负载与散热状态,是判断推理任务是否吃满硬件的快捷手段。工具保持零依赖,安装与运行都不需要额外运行时。作者在 r/LocalLLaMA 发布这一版本,重点说明各家驱动对传感器信息的暴露程度并不一致,per-core 与 DRAM 功耗能读到多少,取决于硬件与驱动支持。

Reddit r/LocalLLaMA · 2026-08-22原文
#03开源与硬件

Qwen3.8-27B 单卡 RTX 5090:实测 262K 完整上下文

Reddit r/LocalLLaMA 用户 8 月 22 日分享在单卡 RTX 5090 上跑通 joshebbs/qwen3.8-27b-uncensored-nvfp4-modelopt 的完整 262,144 tokens 上下文。权重 safetensors 19.18 GiB,保留 vision tower 与 MTP head,结构为 64 层混合:48 层 Gated DeltaNet 加 16 层 full-attention。 实测基于 vLLM 0.27.1、concurrency 1。prefill 阶段 8,192 in 达 PP 7,005 tok/s、TTFT 1.169 s;131,072 in 降到 PP 2,781 tok/s、TTFT 47.128 s,稳态 TG 64.7 tok/s;262,000 in 时 TTFT 166.004 s。decode 端 1,024 in→512 out 稳态 TG 77.2 tok/s、TPOT 119.3 ms;短上下文 mean TPOT 12.959 ms,128K 已驻留时升至 15.463 ms,生成速度降约 16.2% 至 64.7 tok/s。 显存上模型加载 18.51 GiB,以 --kv-cache-memory-bytes 9150000000 固定 KV pool 8.52 GiB,vLLM 报告 KV 容量 268,170 tokens。前缀缓存测试(36,864 tokens 共享前缀加 16 tokens 唯一后缀)冷 TTFT 6.437 s,缓存命中中位数 0.288 s,冷到缓存加速约 22.3 倍。作者提示,启用 prefix caching 时 vLLM 会把混合 Mamba/DeltaNet cache 放进 experimental align mode,输出异常时先关闭该选项。 ---

Reddit r/LocalLLaMA · 2026-08-22原文
#04快讯

Liquid AI 预告 100B 新模型,暂无官方公告

Liquid AI 创始人在 X 上披露即将推出 100B 规模的下一代模型(可能是 LFM 第 3 代),并发起投票询问社区期待方向。Liquid AI 目前拥有全球最快的 LLM 架构之一,其小模型也处于目前最好的 SLM 之列。帖中未附具体发布时间、上下文长度或价格参数,官方尚未发布正式公告。

Reddit r/LocalLLaMA · 2026-08-22原文
#05快讯

Qwen3.8 27B Q8 vs Qwen3.6 27B BF16 编码实测对比

一位用户在企业级 Web 应用开发任务上对比了 Q8KXL 量化的 Qwen3.8 27B 与 BF16 的 Qwen3.6 27B。受 RAM 限制,BF16 的 Qwen3.6 运行在 150K 上下文;Q8KXL 的 Qwen3.8 则通过 rope-scale 1.4 把上下文扩展到 367K(约 900 页)。测试中 Qwen3.6 使用默认推理模式,Qwen3.8 使用 xhigh 思维模式。两个模型均在实际企业级应用上完成测试,同一 27B 规模下同时涉及量化方式、上下文长度和推理模式三个变量。帖中未附完整 benchmark 数据,也未说明具体硬件配置。 ---