Salta ai contenuti

Sizing

Setup RAM/VRAM Latenza per spiegazione Adatto a
Ollama 7B Q4, CPU 4–8 core 8 GB RAM 20–60 s k8sgpt batch
Ollama 14B Q4, CPU 8–16 core 14–16 GB RAM 1–3 min RCA Holmes occasionale
Ollama 14B Q4, 1 GPU 24 GB 12 GB VRAM 3–10 s agenti interattivi, pochi utenti
vLLM 14B AWQ, 1 GPU 24 GB ~22 GB VRAM 2–8 s, richieste parallele team, RCA automatica sugli alert
vLLM 32B AWQ, 1 GPU 48 GB ~44 GB VRAM 4–12 s diagnosi più accurate

Valori indicativi, come ordine di grandezza: misura sul tuo hardware con ollama run --verbose o le metriche vLLM.

Su CPU la velocità dipende soprattutto dalla banda di memoria, non dal numero di core: oltre 16 core il guadagno è minimo.

Oggetto Dimensione
PVC Ollama 2× la somma dei modelli (spazio per aggiornamenti)
PVC vLLM 2× il modello HF
Registry modello compresso + versioni precedenti mantenute
Componente CPU req RAM req
k8sgpt operator 50m 64Mi
k8sgpt runtime 100m 128Mi
HolmesGPT 100m 256Mi–512Mi
CronJob RCA 100m 256Mi
  1. Fase 1: Ollama 7B su CPU + k8sgpt operator. Costo quasi nullo, valore immediato.
  2. Fase 2: Ollama 14B su CPU + HolmesGPT on-demand dal bastion.
  3. Fase 3: nodo GPU + vLLM + RCA automatica sugli alert.