Modelli e quantizzazione
<nome>:<tag> — il tag indica dimensione, variante e quantizzazione.
| Riferimento | Significato |
|---|---|
qwen2.5:7b |
7 miliardi di parametri, quantizzazione di default (Q4_K_M) |
qwen2.5:7b-instruct |
variante instruct (chat/istruzioni) |
qwen2.5:7b-instruct-q8_0 |
stessa, quantizzata a 8 bit |
qwen2.5:14b-instruct |
14B, default Q4_K_M |
ollama show qwen2.5:7b-instructMostra architettura, parametri, contesto massimo, quantizzazione e capability (es. tools).
Quantizzazione
Sezione intitolata “Quantizzazione”| Quant | Byte/parametro | 7B su disco | Qualità |
|---|---|---|---|
| Q4_K_M | ~0.6 | ~4.7 GB | buona, default |
| Q5_K_M | ~0.7 | ~5.4 GB | migliore, +15% memoria |
| Q8_0 | ~1.07 | ~8.1 GB | quasi originale |
| F16 | 2 | ~15 GB | originale |
Regola: meglio un modello più grande in Q4 che uno più piccolo in Q8.
Memoria reale
Sezione intitolata “Memoria reale”RAM usata ≈ peso del modello + KV cache. La KV cache cresce con il contesto (num_ctx) e con le richieste parallele.
| Modello Q4 | Peso | Con ctx 8k | Con ctx 32k |
|---|---|---|---|
| 3B | ~2 GB | ~3 GB | ~4 GB |
| 7B | ~4.7 GB | ~6 GB | ~8 GB |
| 14B | ~9 GB | ~11 GB | ~14 GB |
| 32B | ~20 GB | ~23 GB | ~28 GB |
Su Apple Silicon la GPU può usare circa il 65–75% della memoria unificata: oltre, il modello va in parte su CPU e rallenta.
ollama psLa colonna PROCESSOR mostra 100% GPU oppure uno split CPU/GPU.
Scelta per il debug Kubernetes
Sezione intitolata “Scelta per il debug Kubernetes”| Uso | Modello consigliato | Perché |
|---|---|---|
k8sgpt --explain |
qwen2.5:7b-instruct |
spiega risultati già trovati dagli analyzer |
| HolmesGPT, kubectl-ai, kagent | qwen2.5:14b-instruct o superiore |
servono tool calling affidabile e ragionamento multi-step |
| Mac da 8 GB | qwen2.5:3b-instruct |
solo k8sgpt, qualità limitata |
Alternative valide con supporto tools: qwen3:8b, qwen3:14b, llama3.1:8b, mistral-nemo. Verifica sempre la capability:
ollama show qwen3:14b | grep -A3 -i capabilitiesGestione
Sezione intitolata “Gestione”ollama pull qwen2.5:14b-instructollama listollama cp qwen2.5:7b-instruct k8s-defaultollama rm qwen2.5:3b-instruct