Open-weight local model
Google Gemma 3 27B IT
Near the limit of a 24GB card at 4-bit. Text estimates exclude vision overhead.
- Parameters
- 27B
- Recommended quantization
- Q4_K_M
- Weight estimate
- 17.2GB
- Maximum context
- 128K
Quantization memory at the default context
| Quantization | Weights | KV cache | Total VRAM |
|---|---|---|---|
| FP16 | 54.50GB | 4.16GB | 64.11GB |
| Q8_0 | 29.80GB | 4.16GB | 36.94GB |
| Q6_K | 23.03GB | 4.16GB | 29.50GB |
| Q5_K_M | 19.49GB | 4.16GB | 25.60GB |
| Q4_K_M | 17.20GB | 4.16GB | 23.08GB |
| Q3_K_M | 14.30GB | 4.16GB | 19.89GB |
| Q2_K | 8.86GB | 4.16GB | 13.91GB |
GPUs to check for this model
- Can RTX 4090 24GB run it?
- Can RTX 5090 32GB run it?
- Can RTX 5090 D 32GB run it?
- Can RTX 6090 32GB run it?
- Can Nvidia TITAN V CEO Edition 32GB run it?
- Can Nvidia RTX 5000 Ada Generation 32GB run it?
- Can Apple MacBook Pro M4 Max (40-core GPU) 48GB run it?
- Can Apple MacBook Pro M3 Max (40-core GPU) 48GB run it?
- Can Apple MacBook Pro M4 Pro (16-core GPU) 48GB run it?