Dialogo con Gemini.
Per creare un sistema Ubuntu 26.04 con Ollama posso usare due rtx 3060 con 12 GB?
Sì, puoi usare due schede NVIDIA in parallelo con Ollama su Ubuntu, ma ci sono un paio di chiarimenti tecnici e pratici da considerare:
1. Nota sul modello di scheda Ufficialmente la RTX 3070 esiste solo con 8 GB di VRAM. Se possiedi schede da 12 GB, si tratta molto probabilmente di:
VideoCardz.com
- RTX 3060 12 GB (molto diffuse per l’inferenza AI economica) Mercado Libre
- RTX 4070 / 4070 Ti 12 GB
- RTX 3080 12 GB
- Oppure RTX 3070 con mod hardware personalizzata per raddoppio VRAM.
2. Come gestisce Ollama il multi-GPU Ollama (basato sul backend llama.cpp) supporta nativamente il multi-GPU via layer splitting (pipeline parallelism):
- Riconoscimento automatico: Ollama rileva entrambi i dispositivi CUDA e ripartisce i layer del modello tra le due GPU in base alla memoria libera disponibile.
- VRAM aggregata: Con due schede da 12 GB ottieni 24 GB totali di VRAM, sufficienti per caricare interamente modelli come Llama 3 70B (in quantizzazioni spinte come Q2/Q3) oppure modelli da 14B–32B (ad esempio Qwen 2.5 14B/32B o Command-R) a precisioni elevate (Q4_K_M / Q8). Con due 3070 standard (8 GB ciascuna = 16 GB totali), puoi eseguire comodamente modelli fino a 14B o 8B non compressi.
- Nessun NVLink richiesto: I dati viaggiano sul bus PCIe, quindi non serve un bridge hardware.
3. Requisiti hardware e configurazione su Ubuntu
| Componente | Requisito consigliato |
|---|---|
| Scheda madre | Almeno due slot PCIe x16 fisici (preferibilmente con spaziatura adeguata per schede a doppio slot). Funziona anche a x8/x8 o x16/x4 senza cali drastici in inferenza. |
| Alimentatore (PSU) | Almeno 750W–850W di buona qualità (una 3070 consuma ~220W a pieno carico, una 3060 ~170W). |
| Driver NVIDIA | Installa i driver proprietari ufficiali (nvidia-driver-5xx) e verifica il rilevamento con nvidia-smi. |
| Flusso d’aria | Assicura una ventilazione adeguata: la scheda superiore riceve solitamente il calore dissipato da quella inferiore. |
Per verificare che Ollama stia sfruttando entrambe le schede durante la generazione, basta monitorare l’occupazione della memoria con:
Bash
watch -n 1 nvidia-smi
hai ragione è rtx 3060
Con due RTX 3060 da 12 GB hai una configurazione ideale ed estremamente conveniente per l’AI locale: ottieni 24 GB di VRAM totale con un consumo termico ed energetico contenuto (~170W di TDP per scheda).
Cosa puoi far girare con 24 GB di VRAM:
- Modelli da 7B / 8B / 14B: Esecuzione interamente in VRAM con contesti molto ampi (32k–128k token) e quantizzazioni alte (Q8_0 o FP16).
- Modelli da 32B (es. Qwen 2.5 32B, DeepSeek 33B): Entrano perfettamente in VRAM con quantizzazione Q4_K_M o Q5_K_M, offrendo risposte veloci (15–25 token/s).
- Modelli da 70B (es. Llama 3.x 70B): Eseguibili con quantizzazioni compatte (Q2_K o Q3_K_M), oppure scaricando pochi layer sulla RAM di sistema (CPU offload).
Consigli specifici per la configurazione:
- Alimentatore: Un buon alimentatore da 650W–750W è più che sufficiente.
- Linee PCIe: Anche se il secondo slot lavora a PCIe 3.0/4.0 a 4x o 8x, l’impatto sulla velocità di generazione dei token è trascurabile (il bottleneck è la memoria della GPU, non la banda PCIe tra layer consecutivi).
- Controllo allocazione: Di default Ollama bilancia la memoria in automatico, ma se vuoi forzare l’uso di entrambe o verificare come vengono mappate, puoi usare la variabile d’ambiente:Bash
CUDA_VISIBLE_DEVICES=0,1 ollama serve
Monitorando con nvidia-smi durante l’inferenza vedrai i layer del modello distribuiti simmetricamente su entrambe le 3060.
Gemini è un’AI e può fare errori, anche in merito a persone. La tua privacy e GeminiSi apre in una nuova finestra