CanRunAI

Open-weight local model

Qwen 2.5 Coder 7B Instruct

Popular code-specialized model that is practical on an 8GB GPU at 4-bit with modest context.

Parameters
7.616B
Recommended quantization
Q4_K_M
Weight estimate
5.1GB
Maximum context
32K

Official model card

Quantization memory at the default context

QuantizationWeightsKV cacheTotal VRAM
FP1615.60GB0.47GB17.63GB
Q8_08.70GB0.47GB10.04GB
Q6_K6.50GB0.47GB7.77GB
Q5_K_M5.50GB0.47GB6.77GB
Q4_K_M5.10GB0.47GB6.37GB
Q3_K_M4.30GB0.47GB5.57GB

GPUs to check for this model