Open-weight local model
Qwen 3 14B
General reasoning model comfortable on 16GB GPUs at 4-bit with moderate context.
- Parameters
- 14.768B
- Recommended quantization
- Q4_K_M
- Weight estimate
- 9.3GB
- Maximum context
- 40K
Quantization memory at the default context
| Quantization | Weights | KV cache | Total VRAM |
|---|---|---|---|
| FP16 | 29.80GB | 1.34GB | 34.12GB |
| Q8_0 | 16.40GB | 1.34GB | 19.38GB |
| Q6_K | 12.60GB | 1.34GB | 15.20GB |
| Q5_K_M | 10.66GB | 1.34GB | 13.07GB |
| Q4_K_M | 9.30GB | 1.34GB | 11.57GB |
| Q3_K_M | 7.70GB | 1.34GB | 9.84GB |
| Q2_K | 4.85GB | 1.34GB | 6.99GB |
GPUs to check for this model
- Can RTX 4060 Ti 16 GB run it?
- Can Intel Arc A770 16GB run it?
- Can Apple MacBook Pro M3 Pro (14-core GPU) 18GB run it?
- Can Apple MacBook Pro M3 Pro (18-core GPU) 18GB run it?
- Can RTX 5080 16GB run it?
- Can RTX 5070 Ti 16GB run it?
- Can RTX 5070 Ti SUPER 16GB run it?
- Can RTX 5080 Mobile 16GB run it?
- Can RTX 6070 16GB run it?
- Can RTX 4080 SUPER 16GB run it?