ByteNoteByteNote
Qwen3.8-27B 在 RTX 4090 D 上的测试报告
字

字节笔记本

2026年9月26日

Qwen3.8-27B 在 RTX 4090 D 上的测试报告

API中转
¥120

在直通了 RTX 4090 D 的 PVE 虚拟机里,Qwen3.8-27B 的 4-bit 量化可以完整放进 24 GB 显存:短上下文生成大约每秒 48 个 token,显存占用 16.1–16.6 GB,忙时功耗 226 W、峰值 360 W,温度最高 65°C。这篇是完整测试记录。

测试时间:2026-09-24

结论

Qwen3.8-27B 的 4-bit 量化可以完整放进这张直通的 RTX 4090 D。短上下文下生成速度大约每秒 48 个 token,显存占用大约 16.1–16.6 GB,忙时功耗大约 226 W,峰值 360 W,温度最高 65°C。

环境

项值
宿主机新 PVE,Wi-Fi 192.168.50.110,ssh pve-new
虚拟机VM 100 ubuntu-2604,Ubuntu 26.04.1 LTS,UEFI + q35
显卡NVIDIA GeForce RTX 4090 D,直通 0000:01:00(含声卡 01:00.1)
驱动nvidia-driver-595-open,595.91.07,compute capability 8.9
显存总量24564 MiB,功耗墙 425 W
推理程序llama.cpp b11064(CUDA 13.3),全部层在 GPU,Flash Attention 打开
虚拟机内存24 GB。测试时实际占用约 4.3 GiB,另有约 17 GiB 是模型文件缓存

宿主机核显 UHD 770 仍留给 PVE,没有把 4090 的显示留在宿主机上。

模型

项值
模型Qwen3.8-27B(2026-08 开源,Apache 2.0)
权重Unsloth Qwen3.8-27B-UD-Q4_K_XL.gguf
量化Q4_K Medium,文件 16.34 GiB
参数量27.32B,稠密模型
路径虚拟机 /home/pan/Qwen3.8-27B-UD-Q4_K_XL.gguf

这是目前能放进 24 GB 显存的最新 Qwen 开源稠密模型。全精度大约 55 GB,4090 D 放不下,所以用 4-bit。

速度

llama-bench,上下文为预填充 512 token、生成 128 token,重复 2 次。

测试速度
预填充 pp5122715 ± 189 token/s
生成 tg12847.61 ± 0.05 token/s

另一次真实对话:提示处理 278.2 token/s,生成 46.6 token/s。提示更长,所以预填充比 512 token 的基准慢,生成速度和基准一致。

显存

状态显存
空闲1 MiB
模型已加载、短上下文16078–16552 MiB(约 16.1–16.6 GB)

24 GB 里还剩大约 8 GB,给更长上下文的 KV 缓存。上下文拉长后,速度会低于上面这组 128 token 的数字。

功耗和温度

采样间隔 1 秒。空闲是加载模型之前;忙时是 GPU 占用率至少 30% 的采样。

状态功耗温度核心频率占用率
空闲13–18 W36°C210 MHz0%
模型已加载平均 200 W,最高 360 W最高 65°C约 2520–2730 MHz平均 92%
算力忙时平均 226 W,最高 360 W最高 65°C约 2700 MHz平均 98%,最高 100%

功耗墙是 425 W。这次峰值大约用到 85%,没有顶满。

回答抽样

提示:「请用中文用四句话介绍你自己,并算出 17 乘 23。」

生成上限是 120 个 token。它先进入思考,写到「我是通义千问,一个由阿里巴巴通义实验室研发的大语言模型」时额度用完,四句话和乘法结果没有写完。速度数据来自完整基准,不受这次截断影响。

相关文章

分享: