Salta ai contenuti

Modelli e quantizzazione

<nome>:<tag> — il tag indica dimensione, variante e quantizzazione.

Riferimento Significato
qwen2.5:7b 7 miliardi di parametri, quantizzazione di default (Q4_K_M)
qwen2.5:7b-instruct variante instruct (chat/istruzioni)
qwen2.5:7b-instruct-q8_0 stessa, quantizzata a 8 bit
qwen2.5:14b-instruct 14B, default Q4_K_M
Finestra del terminale
ollama show qwen2.5:7b-instruct

Mostra architettura, parametri, contesto massimo, quantizzazione e capability (es. tools).

Quant Byte/parametro 7B su disco Qualità
Q4_K_M ~0.6 ~4.7 GB buona, default
Q5_K_M ~0.7 ~5.4 GB migliore, +15% memoria
Q8_0 ~1.07 ~8.1 GB quasi originale
F16 2 ~15 GB originale

Regola: meglio un modello più grande in Q4 che uno più piccolo in Q8.

RAM usata ≈ peso del modello + KV cache. La KV cache cresce con il contesto (num_ctx) e con le richieste parallele.

Modello Q4 Peso Con ctx 8k Con ctx 32k
3B ~2 GB ~3 GB ~4 GB
7B ~4.7 GB ~6 GB ~8 GB
14B ~9 GB ~11 GB ~14 GB
32B ~20 GB ~23 GB ~28 GB

Su Apple Silicon la GPU può usare circa il 65–75% della memoria unificata: oltre, il modello va in parte su CPU e rallenta.

Finestra del terminale
ollama ps

La colonna PROCESSOR mostra 100% GPU oppure uno split CPU/GPU.

Uso Modello consigliato Perché
k8sgpt --explain qwen2.5:7b-instruct spiega risultati già trovati dagli analyzer
HolmesGPT, kubectl-ai, kagent qwen2.5:14b-instruct o superiore servono tool calling affidabile e ragionamento multi-step
Mac da 8 GB qwen2.5:3b-instruct solo k8sgpt, qualità limitata

Alternative valide con supporto tools: qwen3:8b, qwen3:14b, llama3.1:8b, mistral-nemo. Verifica sempre la capability:

Finestra del terminale
ollama show qwen3:14b | grep -A3 -i capabilities
Finestra del terminale
ollama pull qwen2.5:14b-instruct
Finestra del terminale
ollama list
Finestra del terminale
ollama cp qwen2.5:7b-instruct k8s-default
Finestra del terminale
ollama rm qwen2.5:3b-instruct