Open-weight local model
Qwen 3 8B
Popular general-purpose reasoning model for 8–12GB consumer GPUs at 4-bit.
- Parameters
- 8.191B
- Recommended quantization
- Q4_K_M
- Weight estimate
- 5.5GB
- Maximum context
- 40K
Quantization memory at the default context
| Quantization | Weights | KV cache | Total VRAM |
|---|---|---|---|
| FP16 | 16.50GB | 1.21GB | 19.36GB |
| Q8_0 | 9.30GB | 1.21GB | 11.44GB |
| Q6_K | 6.99GB | 1.21GB | 9.00GB |
| Q5_K_M | 5.91GB | 1.21GB | 7.92GB |
| Q4_K_M | 5.50GB | 1.21GB | 7.51GB |
| Q3_K_M | 4.60GB | 1.21GB | 6.61GB |
| Q2_K | 2.69GB | 1.21GB | 4.70GB |