CanRunAI

Open-weight local model

Qwen 3 8B

Popular general-purpose reasoning model for 8–12GB consumer GPUs at 4-bit.

Parameters
8.191B
Recommended quantization
Q4_K_M
Weight estimate
5.5GB
Maximum context
40K

Official model card

Quantization memory at the default context

QuantizationWeightsKV cacheTotal VRAM
FP1616.50GB1.21GB19.36GB
Q8_09.30GB1.21GB11.44GB
Q6_K6.99GB1.21GB9.00GB
Q5_K_M5.91GB1.21GB7.92GB
Q4_K_M5.50GB1.21GB7.51GB
Q3_K_M4.60GB1.21GB6.61GB
Q2_K2.69GB1.21GB4.70GB

GPUs to check for this model