Salta ai contenuti

Start, stop e risorse

Un modello caricato occupa RAM finché non viene scaricato; il daemon a vuoto pesa pochissimo. Per liberare risorse agisci su tre livelli: modello, daemon, stack Docker.

Finestra del terminale
ollama ps
Finestra del terminale
pgrep -fl ollama
Finestra del terminale
ps -o pid,rss,command -p $(pgrep -d, -f ollama) | awk 'NR==1{print;next}{printf "%s %.1f GB %s\n",$1,$2/1024/1024,$3}'
Finestra del terminale
memory_pressure | tail -1

Libera subito RAM/VRAM, il modello resta su disco:

Finestra del terminale
ollama stop qwen2.5:7b-instruct

Equivalente via API (utile negli script):

Finestra del terminale
curl -s http://localhost:11434/api/generate -d '{"model":"qwen2.5:7b-instruct","keep_alive":0}'

Tenere il modello caricato a tempo indeterminato durante una sessione di test:

Finestra del terminale
curl -s http://localhost:11434/api/generate -d '{"model":"qwen2.5:7b-instruct","keep_alive":-1}'

Formula come servizio:

Finestra del terminale
brew services stop ollama
Finestra del terminale
brew services start ollama
Finestra del terminale
brew services restart ollama

Formula in foreground: Ctrl+C nel terminale. Se è rimasto un processo orfano:

Finestra del terminale
pkill -f "ollama serve"

App Ollama:

Finestra del terminale
osascript -e 'quit app "Ollama"'
Finestra del terminale
open -a Ollama

Verifica che la porta sia libera:

Finestra del terminale
lsof -nP -iTCP:11434 -sTCP:LISTEN || echo "ollama stopped"

Stop del solo cluster kind (lo stato resta, riparte com’era):

Finestra del terminale
docker stop ai-mon-control-plane
Finestra del terminale
docker start ai-mon-control-plane

Stop completo di Docker Desktop (libera la VM, 5–6 GB):

Finestra del terminale
docker desktop stop
Finestra del terminale
docker desktop start
Finestra del terminale
docker desktop status
Variabile Effetto Valore lab
OLLAMA_KEEP_ALIVE tempo prima di scaricare il modello 2m
OLLAMA_MAX_LOADED_MODELS modelli caricati insieme 1
OLLAMA_NUM_PARALLEL richieste parallele per modello (moltiplica la KV cache) 1
OLLAMA_CONTEXT_LENGTH contesto di default 8192
OLLAMA_FLASH_ATTENTION attention più efficiente in memoria 1
OLLAMA_KV_CACHE_TYPE KV cache quantizzata, richiede flash attention q8_0

Con ollama serve in foreground:

Finestra del terminale
OLLAMA_KEEP_ALIVE=2m OLLAMA_MAX_LOADED_MODELS=1 OLLAMA_NUM_PARALLEL=1 OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

Con brew services o l’app (launchd), imposta le variabili e riavvia:

Finestra del terminale
launchctl setenv OLLAMA_KEEP_ALIVE 2m
Finestra del terminale
launchctl setenv OLLAMA_FLASH_ATTENTION 1
Finestra del terminale
brew services restart ollama

launchctl setenv non sopravvive al reboot. Per rimuovere una variabile:

Finestra del terminale
launchctl unsetenv OLLAMA_KEEP_ALIVE
Finestra del terminale
alias ai-on='brew services start ollama && docker desktop start && docker start ai-mon-control-plane'
Finestra del terminale
alias ai-off='ollama ps | awk "NR>1{print \$1}" | xargs -n1 ollama stop; brew services stop ollama; docker desktop stop'
Finestra del terminale
alias ai-status='brew services info ollama; ollama ps 2>/dev/null; docker desktop status'
Finestra del terminale
du -sh ~/.ollama/models
Finestra del terminale
ollama list
Finestra del terminale
ollama rm qwen2.5:14b-instruct

Per spostare lo store su un disco esterno:

Finestra del terminale
launchctl setenv OLLAMA_MODELS /Volumes/External/ollama-models