Panoramica offline
Stessi tool del lab, tre differenze:
- Supply chain: ogni immagine, chart e modello arriva dal registry interno.
- LLM in-cluster: Ollama (CPU o GPU) o vLLM (GPU) in un namespace dedicato
ai-llm. - Perimetro: agenti con RBAC read-only, NetworkPolicy che isolano l’LLM, nessun egress.
registry.internal è un segnaposto per il tuo registry (Harbor, Quay, MSR, Nexus).
Artefatti
Sezione intitolata “Artefatti”| Artefatto | Origine (lato connesso) | Forma offline | Pagina |
|---|---|---|---|
| Immagine Ollama | docker.io/ollama/ollama |
immagine mirrorata, digest fissato | Mirror |
| Immagine vLLM | docker.io/vllm/vllm-openai |
immagine mirrorata | vLLM |
| Model fetcher | build interna (UBI + oras) | immagine interna | Modello OCI |
| Modello | Ollama store o GGUF/safetensors HF | artefatto OCI | Modello OCI |
| k8sgpt operator + runtime | charts.k8sgpt.ai, ghcr.io/k8sgpt-ai/* |
chart .tgz + immagini |
k8sgpt offline |
| HolmesGPT | chart Robusta + immagine | chart .tgz + immagine |
HolmesGPT offline |
| Monitoring | già presente (OCP monitoring, kube-prometheus-stack) | — | OpenShift |
Sequenza
Sezione intitolata “Sequenza”- Mirror di immagini e chart.
- Modello nel registry come artefatto OCI.
- Namespace
ai-llmcon LLM, PVC, Service, NetworkPolicy. - Namespace e RBAC read-only per i tool.
- k8sgpt operator puntato all’LLM interno.
- HolmesGPT (servizio e/o CronJob sugli alert).
- Test con un namespace di prova (riusa
shop-demo.yamlcon immagini mirrorate).
Prerequisiti
Sezione intitolata “Prerequisiti”kubectl auth can-i create namespacekubectl get storageclasskubectl get nodes -L node-role.kubernetes.io/worker,nvidia.com/gpu.presentkubectl describe node <worker> | grep -A6 Allocatable