CanRunAI

Open-weight local model

Google Gemma 3 4B IT

Compact multimodal option. Text estimates exclude image encoder and vision activation peaks.

Parameters
4.3B
Recommended quantization
Q4_K_M
Weight estimate
3.3GB
Maximum context
128K

Official model card

Quantization memory at the default context

QuantizationWeightsKV cacheTotal VRAM
FP168.80GB1.14GB10.82GB
Q8_05.10GB1.14GB7.04GB
Q6_K3.67GB1.14GB5.61GB
Q5_K_M3.10GB1.14GB5.04GB
Q4_K_M3.30GB1.14GB5.24GB
Q3_K_M2.80GB1.14GB4.74GB

GPUs to check for this model