← IoT-Pub老显卡实验室 · ep03首页

单张 22G 2080Ti 榨干 Qwen3-27B

五种量化实测 + 45 t/s 服务端配方(KVMem 256K + DFlash2)

2026-09-22本地实测llama.cpp2080 Ti

环境

配置
GPU2080 Ti 22G 改装版 ×1(原双卡,本集拔掉一张)
引擎llama.cpp CUDA 2026-09 构建 / llama-kvmem-server(KVMem+DFlash2 补丁版)
模型Qwen3.8-27B(UD 动态量化 / GSQ / DFlash2 系列)
系统Ubuntu · 8 线程 · 模型盘 /mnt 挂载

一、llama-bench 跑分:五种量化同台

命令全部一致,只换模型:

llama-bench -m <model>.gguf -ngl 99 -p 512 -n 128 -r 2 -t 8
量化文件显存峰值pp512tg128结论
Q4_K_M (UD)15.32 GiB16.1 GB680 t/s26.2 t/s速度王,22G 卡天花板
IQ4_XS (UD)13.26 GiB14.1 GB693 t/s23.8 t/s甜点位:省 2GB prefill 最快
IQ3_S (GSQ+MTP)11.14 GiB12.4 GB626 t/s21.0 t/s11G 原版卡也能全量塞
Q2_LynnStyle12.10 GiB12.9 GB529 t/s21.0 t/s胜在体积
Q8_0 (DFlash2)~29 GiB装不下context 创建失败

二、真正能用的速度:KVMem 256K + DFlash2 服务端

裸 bench 只是下限。日常服务端配方(Q2_LynnStyle 底模):

# /mnt/windows/Download/llama.cpp/deploy/start-kvmem-dflash.sh
KV_ROOT=/mnt/windows/Download/kvmem-llama.cpp
MODEL=/mnt/windows/Download/models/merkyor/Qwen3.8-27B-EfficientThink-SimPO-Q2-LynnStyle.gguf
DRAFT=/mnt/windows/Download/models/merkyor/dflash2-qwen38-27b-Q4_K_M.gguf
PORT=8001  CTX=262144          # 256K 逻辑上下文
BUDGET=96256  RESERVE=16384    # 物理工作集 96256 tok(q8_0 KV) + 生成预留
THREADS=8   GPU=0              # gpu-mode.conf 是唯一事实来源

实测体感:日用 45-48 t/s,简单代码任务中位 66.9 t/s,ngram 热复用场景 227 t/s——比裸 bench 的 21 t/s 翻倍,靠 DFlash2 投机解码 + ngram-mod 热复用。

systemd 托管:

[Service]
WorkingDirectory=/mnt/windows/Download/llama.cpp
ExecStart=/mnt/windows/Download/llama.cpp/deploy/start-kvmem-dflash.sh
Restart=on-failure

三、显存账本

四、结论

视频版见 B 站「老显卡实验室」ep03:完整跑分过程与配置画面。