Troubleshooting
| Sintomo | Causa probabile | Fix |
|---|---|---|
connection refused su 11434 |
daemon spento | brew services start ollama |
address already in use |
app e formula entrambe attive | chiudi l’app: osascript -e 'quit app "Ollama"' |
| risposte lentissime | modello in swap o split CPU/GPU | ollama ps, modello più piccolo, meno contesto |
model not found |
nome/tag diverso | ollama list, usa il nome esatto |
| tool calling non funziona su modello importato | manca il TEMPLATE |
vedi Modelli offline |
tail -f $(brew --prefix)/var/log/ollama.logOLLAMA_DEBUG=1 ollama servekind e rete
Sezione intitolata “kind e rete”| Sintomo | Causa | Fix |
|---|---|---|
pod non raggiunge host.docker.internal:11434 |
Ollama su loopback | OLLAMA_HOST=0.0.0.0:11434 ollama serve |
localhost:9090 non risponde |
NodePort non mappata | usa kubectl port-forward |
| pod Pending per risorse | Docker Desktop con poca RAM | aumenta RAM in Settings → Resources |
| alert non scattano | durata for: non trascorsa |
attendi 15 min, controlla localhost:9090/alerts |
kubectl run curl --rm -it --restart=Never --image=curlimages/curl -- curl -sv http://host.docker.internal:11434/api/versionkubectl describe node ai-mon-control-plane | grep -A8 "Allocated resources"| Sintomo | Causa | Fix |
|---|---|---|
--explain in timeout |
LLM lento | modello più piccolo, --filter più stretti |
| spiegazioni vecchie | cache | --no-cache o k8sgpt cache purge |
| guasto non rilevato | analyzer disattivo | k8sgpt filters list, k8sgpt filters add <X> |
| runtime operator in ImagePullBackOff | version o repository errati |
allinea il CR al registry |
nessun Result |
CR non riconciliato | log di k8sgpt-operator-controller-manager |
HolmesGPT
Sezione intitolata “HolmesGPT”| Sintomo | Causa | Fix |
|---|---|---|
| loop di tool call | modello debole | 14B+ |
| ignora Prometheus | toolset non caricato | holmes toolset list, verifica URL |
401/403 su Thanos |
token senza cluster-monitoring-view |
vedi OpenShift |
| risposta troncata | contesto | num_ctx più alto nel Modelfile |
Deploy in-cluster
Sezione intitolata “Deploy in-cluster”| Sintomo | Causa | Fix |
|---|---|---|
initContainer model-fetcher fallisce su TLS |
CA del registry mancante | ConfigMap registry-ca, variabile CA_FILE |
unauthorized su oras pull |
secret non montato o scaduto | ricrea registry-internal |
sha256sum fallisce |
pacchetto corrotto | ripeti il push dal lato connesso |
| Ollama OOMKilled | limit sotto modello + KV cache | alza il limit o riduci OLLAMA_CONTEXT_LENGTH |
| i tool non raggiungono l’LLM | NetworkPolicy | label ai-llm-access=true sul namespace del tool |
vLLM CUDA out of memory |
modello troppo grande | AWQ, --max-model-len più basso, --gpu-memory-utilization |
kubectl -n ai-llm describe pod -l app=ollamakubectl -n ai-llm logs deploy/ollama -c model-fetcherkubectl -n ai-llm get events --sort-by=.lastTimestamp | tail -20Cleanup completo del lab
Sezione intitolata “Cleanup completo del lab”kind delete cluster --name ai-monbrew services stop ollamaollama rm qwen2.5:7b-instruct qwen2.5:14b-instruct k8s-srerm -rf ~/.holmes ~/Library/Application\ Support/k8sgptdocker desktop stop