CanRunAI

Open-weight local model

Qwen 3 14B

General reasoning model comfortable on 16GB GPUs at 4-bit with moderate context.

Parameters
14.768B
Recommended quantization
Q4_K_M
Weight estimate
9.3GB
Maximum context
40K

Official model card

Quantization memory at the default context

QuantizationWeightsKV cacheTotal VRAM
FP1629.80GB1.34GB34.12GB
Q8_016.40GB1.34GB19.38GB
Q6_K12.60GB1.34GB15.20GB
Q5_K_M10.66GB1.34GB13.07GB
Q4_K_M9.30GB1.34GB11.57GB
Q3_K_M7.70GB1.34GB9.84GB
Q2_K4.85GB1.34GB6.99GB

GPUs to check for this model