
字节笔记本
2026年9月26日
Qwen3.8-27B 在 RTX 4090 D 上的测试报告
在直通了 RTX 4090 D 的 PVE 虚拟机里,Qwen3.8-27B 的 4-bit 量化可以完整放进 24 GB 显存:短上下文生成大约每秒 48 个 token,显存占用 16.1–16.6 GB,忙时功耗 226 W、峰值 360 W,温度最高 65°C。这篇是完整测试记录。
测试时间:2026-09-24
结论
Qwen3.8-27B 的 4-bit 量化可以完整放进这张直通的 RTX 4090 D。短上下文下生成速度大约每秒 48 个 token,显存占用大约 16.1–16.6 GB,忙时功耗大约 226 W,峰值 360 W,温度最高 65°C。
环境
| 项 | 值 |
|---|---|
| 宿主机 | 新 PVE,Wi-Fi 192.168.50.110,ssh pve-new |
| 虚拟机 | VM 100 ubuntu-2604,Ubuntu 26.04.1 LTS,UEFI + q35 |
| 显卡 | NVIDIA GeForce RTX 4090 D,直通 0000:01:00(含声卡 01:00.1) |
| 驱动 | nvidia-driver-595-open,595.91.07,compute capability 8.9 |
| 显存总量 | 24564 MiB,功耗墙 425 W |
| 推理程序 | llama.cpp b11064(CUDA 13.3),全部层在 GPU,Flash Attention 打开 |
| 虚拟机内存 | 24 GB。测试时实际占用约 4.3 GiB,另有约 17 GiB 是模型文件缓存 |
宿主机核显 UHD 770 仍留给 PVE,没有把 4090 的显示留在宿主机上。
模型
| 项 | 值 |
|---|---|
| 模型 | Qwen3.8-27B(2026-08 开源,Apache 2.0) |
| 权重 | Unsloth Qwen3.8-27B-UD-Q4_K_XL.gguf |
| 量化 | Q4_K Medium,文件 16.34 GiB |
| 参数量 | 27.32B,稠密模型 |
| 路径 | 虚拟机 /home/pan/Qwen3.8-27B-UD-Q4_K_XL.gguf |
这是目前能放进 24 GB 显存的最新 Qwen 开源稠密模型。全精度大约 55 GB,4090 D 放不下,所以用 4-bit。
速度
llama-bench,上下文为预填充 512 token、生成 128 token,重复 2 次。
| 测试 | 速度 |
|---|---|
| 预填充 pp512 | 2715 ± 189 token/s |
| 生成 tg128 | 47.61 ± 0.05 token/s |
另一次真实对话:提示处理 278.2 token/s,生成 46.6 token/s。提示更长,所以预填充比 512 token 的基准慢,生成速度和基准一致。
显存
| 状态 | 显存 |
|---|---|
| 空闲 | 1 MiB |
| 模型已加载、短上下文 | 16078–16552 MiB(约 16.1–16.6 GB) |
24 GB 里还剩大约 8 GB,给更长上下文的 KV 缓存。上下文拉长后,速度会低于上面这组 128 token 的数字。
功耗和温度
采样间隔 1 秒。空闲是加载模型之前;忙时是 GPU 占用率至少 30% 的采样。
| 状态 | 功耗 | 温度 | 核心频率 | 占用率 |
|---|---|---|---|---|
| 空闲 | 13–18 W | 36°C | 210 MHz | 0% |
| 模型已加载 | 平均 200 W,最高 360 W | 最高 65°C | 约 2520–2730 MHz | 平均 92% |
| 算力忙时 | 平均 226 W,最高 360 W | 最高 65°C | 约 2700 MHz | 平均 98%,最高 100% |
功耗墙是 425 W。这次峰值大约用到 85%,没有顶满。
回答抽样
提示:「请用中文用四句话介绍你自己,并算出 17 乘 23。」
生成上限是 120 个 token。它先进入思考,写到「我是通义千问,一个由阿里巴巴通义实验室研发的大语言模型」时额度用完,四句话和乘法结果没有写完。速度数据来自完整基准,不受这次截断影响。



