| Setup |
RAM/VRAM |
Latenza per spiegazione |
Adatto a |
| Ollama 7B Q4, CPU 4–8 core |
8 GB RAM |
20–60 s |
k8sgpt batch |
| Ollama 14B Q4, CPU 8–16 core |
14–16 GB RAM |
1–3 min |
RCA Holmes occasionale |
| Ollama 14B Q4, 1 GPU 24 GB |
12 GB VRAM |
3–10 s |
agenti interattivi, pochi utenti |
| vLLM 14B AWQ, 1 GPU 24 GB |
~22 GB VRAM |
2–8 s, richieste parallele |
team, RCA automatica sugli alert |
| vLLM 32B AWQ, 1 GPU 48 GB |
~44 GB VRAM |
4–12 s |
diagnosi più accurate |
Valori indicativi, come ordine di grandezza: misura sul tuo hardware con ollama run --verbose o le metriche vLLM.
Su CPU la velocità dipende soprattutto dalla banda di memoria, non dal numero di core: oltre 16 core il guadagno è minimo.
| Oggetto |
Dimensione |
| PVC Ollama |
2× la somma dei modelli (spazio per aggiornamenti) |
| PVC vLLM |
2× il modello HF |
| Registry |
modello compresso + versioni precedenti mantenute |
| Componente |
CPU req |
RAM req |
| k8sgpt operator |
50m |
64Mi |
| k8sgpt runtime |
100m |
128Mi |
| HolmesGPT |
100m |
256Mi–512Mi |
| CronJob RCA |
100m |
256Mi |
- Fase 1: Ollama 7B su CPU + k8sgpt operator. Costo quasi nullo, valore immediato.
- Fase 2: Ollama 14B su CPU + HolmesGPT on-demand dal bastion.
- Fase 3: nodo GPU + vLLM + RCA automatica sugli alert.