Dialogo con Gemini.
Ecco una selezione dei principali modelli open source ottimizzati per l’uso locale tramite Ollama. Li ho suddivisi per categoria e “taglia” (i file tra parentesi indicano la VRAM indicativa richiesta per far girare la quantizzazione standard a 4-bit, ovvero Q4_K_M).
1. Modelli Generali e Multiuso (Chat, Sintesi, Reasoning)
🔴 Llama 3.3 (70B)
- Descrizione: Il modello di punta di Meta. Offre prestazioni paragonabili a GPT-4o su compiti di ragionamento complesso, analisi documentale avanzata, sintesi e scrittura. È la scelta top per scenari enterprise dove non si vuole scendere a compromessi sulla qualità.
- Hardware consigliato: Richiede hardware dedicato (almeno 40–48 GB di VRAM, es. 2x RTX 3090/4090 o server con GPU A100/Mac Studio con memoria unificata).
- Comando:
ollama run llama3.3
🔵 Llama 3.1 / 3.2 (8B e 3B)
- Descrizione: Lo standard de-facto per l’AI locale su macchine medio-piccole.
- Llama 3.2 (3B): Ultra-leggero, velocissimo, perfetto per compiti di classificazione, estrazione testo e chat semplice su PC senza GPU dedicate potenti. (~2.5 GB VRAM)
- Llama 3.1 (8B): Il miglior compromesso tra intelligenza, velocità e risorse. Adatto per RAG, riassunti di contratti e risposte strutturate. (~5.5 GB VRAM)
- Comando:
ollama run llama3.2oppureollama run llama3.1
🟡 Qwen 2.5 (7B / 14B / 32B / 72B)
- Descrizione: Sviluppato da Alibaba, la famiglia Qwen 2.5 è attualmente tra le migliori in assoluto per comprensione del contesto, aderenza alle istruzioni (instruction-following), formattazione JSON ed elaborazione dell’italiano.
- Perché usarlo: In contesti RAG aziendali (dove l’LLM deve estrarre dati rigidi da PostgreSQL o generare output in formati precisi) le versioni 7B e 14B superano spesso i concorrenti di pari taglia. (~5 GB per il 7B, ~10 GB per il 14B di VRAM).
- Comando:
ollama run qwen2.5:7boollama run qwen2.5:14b
🟢 Mistral / Mixtral (7B e 8x7B)
- Descrizione: Storico modello dell’azienda francese Mistral AI.
- Mistral 7B: Solido, fluido e con un’ottima comprensione dell’italiano e delle lingue europee. (~5 GB VRAM)
- Mixtral 8x7B (MoE – Mixture of Experts): Un’architettura a esperti che attiva solo una parte dei parametri per ogni token. Molto veloce e intelligente per task complessi. (~26 GB VRAM)
- Comando:
ollama run mistraloollama run mixtral
2. Modelli di Embedding (Indispensabili per PGvector e RAG)
Questi modelli non servono per chattare, ma per trasformare frasi e documenti in vettori numerici da salvare su PostgreSQL.
🟣 nomic-embed-text
- Descrizione: Il modello di embedding di riferimento per Ollama. Leggerissimo (~280 MB), genera vettori a 768 dimensioni ed è eccellente per la ricerca semantica su documenti in testo libero.
- Comando:
ollama pull nomic-embed-text
🟣 bge-m3
- Descrizione: Prodotto da BAAI, è un modello di embedding multilingua avanzato. Supporta testi lunghi (fino a 8192 token) ed è ideale se i documenti aziendali sono complessi o in più lingue.
- Comando:
ollama pull bge-m3
3. Modelli Vision (Analisi Immagini e PDF Scansionati)
👁️ Llama 3.2 Vision (11B / 90B)
- Descrizione: Modello multimodale di Meta capace di leggere sia testo che immagini.
- Caso d’uso aziendale: Analizzare PDF scansionati, fatture cartacee, planimetrie o grafici ed estrarre il testo/contenuto per poi salvarlo su PostgreSQL.
- Hardware: La versione 11B richiede circa 8-9 GB di VRAM.
- Comando:
ollama run llama3.2-vision
👁️ Phi-3.5 Vision (4.2B)
- Descrizione: Modello multimodale compatto di Microsoft. Estremamente efficiente nella lettura di tabelle, schermate e documenti strutturati legati a immagini.
- Comando:
ollama run phi3.5-vision
4. Modelli Specializzati (Coding & Reasoning)
💻 Qwen 2.5 Coder (7B / 14B / 32B)
- Descrizione: Uno dei migliori modelli Open Source per la generazione, il refactoring e la spiegazione di codice (Python, SQL, C++, Bash, ecc.). Superiore anche a modelli molto più grandi per compiti di programmazione.
- Comando:
ollama run qwen2.5-coder:7b
🧠 DeepSeek-R1 (e versioni “Distilled” 1.5B / 8B / 14B / 32B / 70B)
- Descrizione: Modelli specializzati nel ragionamento profondo (Reasoning / Chain-of-Thought). Prima di dare la risposta finale, mostrano i passaggi logici intermedi che effettuano.
- Caso d’uso aziendale: Utili per la risoluzione di problemi logici complessi, audit di codice o analisi di clausole legali intricate con ragionamento passo-passo.
- Comando:
ollama run deepseek-r1:8boollama run deepseek-r1:14b
Per una PMI o uno studio professionale, uno stack di modelli tipico che potresti installare sulla loro macchina server locale è:
nomic-embed-text→ Per la generazione degli embeddings su PostgreSQL/PGvector.qwen2.5:14boppurellama3.1:8b→ Come LLM principale per le risposte al personale (chat/RAG).llama3.2-vision→ Per elaborare eventuali documenti scansionati o immagini in ingresso.
Per quanto riguarda Gemini, la situazione è diversa rispetto ai modelli open source come Llama, Qwen o Mistral: Gemini è una famiglia di modelli proprietari sviluppati da Google, il che significa che i suoi pesi non sono rilasciati liberamente per l’esecuzione in locale.
Di conseguenza, non puoi scaricare o eseguire Gemini direttamente dentro Ollama sul server di un cliente.
Tuttavia, Gemini gioca un ruolo molto importante nell’ecosistema e puoi sfruttarlo nelle tue consulenze in due modi specifici.
1. Come usare Gemini nell’Architettura (Ibrida o Cloud)
Anche se la tua offerta principale per studi legali, cliniche o PMI si basa su AI 100% Locale (via Ollama + PGvector), ci sono scenari in cui Gemini diventa uno strumento complementare straordinario:
A. Architetture Ibride (Privacy Tiering)
Puoi progettare un sistema intelligente che smista le richieste in base alla sensibilità dei dati:
- Dati Sensibili / Interni: Elaborati in locale da Ollama (es.
Qwen 2.5/Llama 3.1) + PostgreSQL. Zero dati all’esterno. - Dati Pubblici / Task Non Riservati: Elaborati tramite le API di Gemini via cloud per sfruttare la sua enorme finestra di contesto e potenza di calcolo a costi molto contenuti.
B. Gestione di Documenti Immensi (Window Context fino a 1M+ Token)
Modelli come Gemini 1.5 Pro / Flash hanno una finestra di contesto sterminata (fino a 1-2 milioni di token).
- Se un cliente deve analizzare un intero bilancio da 500 pagine o un intero archivio storico in un singolo passaggio senza dover fare prima il “chunking” RAG, Gemini via API è imbattibile.
- In questo caso, la tua consulenza verterà su come anonimizzare o mascherare (PII masking) i dati sensibili in locale prima di inviare il testo alle API di Google.
Possiamo usare Gemini (es. tramite Google AI Studio o Gemini Code Assist) come assistente quotidiano di produttività:
- Scrittura e Refactoring di Codice: Per generare rapidamente script Python, query SQL complesse con
pgvector, configurazioni Docker o file di automazione per installazioni pressi clienti. - Prototipazione Rapida: Per testare la logica delle pipeline RAG o del Function Calling prima di fare il deploy dei modelli locali su Ollama.
Confronto Sintetico per i Clienti
Se un cliente ti chiede: “Perché installare Ollama in locale se esiste Gemini?”, la risposta chiara e sintetica da dare è:
| Caratteristica | Modelli Locali su Ollama (Llama, Qwen, ecc.) | Gemini (via API Cloud Google) |
| Privacy & GDPR | 100% Locale: Nessun dato esce dalla rete aziendale. | Cloud: I dati viaggiano su server terzi. |
| Funzionamento Offline | Sì: Funziona anche senza internet o in LAN air-gapped. | No: Richiede connessione internet costante. |
| Costi Operativi | Fissi: Nessun costo a chiamata (solo hardware/corrente). | A consumo: Pay-per-token/query. |
| Capacità di Contesto | Media/Alta (8k – 128k token). | Estrema (1M+ token). |
| Potenza Computazionale | Dipende dalle GPU locali acquistate. | Scalabilità cloud illimitata. |
In sintesi: Ollama è il cavallo di battaglia per la privacy, la sicurezza e l’infrastruttura locale; Gemini è un’ottima risorsa cloud da integrare quando la riservatezza totale non è il requisito vincolante o quando servono prestazioni di contesto enormi.
Con Anthropic (i creatori della famiglia di modelli Claude), la situazione è praticamente identica a quella di Google con Gemini: Claude è un ecosistema di modelli proprietari cloud-based.
I pesi di modelli come Claude 3.5 Sonnet, Claude 3.5 Haiku o Claude 3 Opus non sono rilasciati liberamente, quindi non è possibile eseguirli offline o in locale tramite Ollama.
Tuttavia, nel panorama dello sviluppo software, dell’integrazione dati e della consulenza, Anthropic ha un peso specifico enorme e va tenuto assolutamente in considerazione per diversi motivi.
1. Perché Claude (specie 3.5 Sonnet) è il “Gold Standard” attuale
Nel mondo dell’intelligenza artificiale per le aziende, Anthropic si è posizionata come leader in due settori chiave:
A. Scrittura di Codice e Architettura (Coding & Dev)
Per la programmazione, il refactoring, la scrittura di query SQL complesse (incluso pgvector) e la creazione di pipeline di backend, Claude 3.5 Sonnet è considerato da gran parte degli sviluppatori il miglior modello in assoluto sul mercato, spesso superiore anche a GPT-4o o Gemini.
- Per lo sviluppatore: È lo strumento ideale da affiancare all’ IDE per velocizzare la scrittura delle integrazioni Python/Node, degli script di gestione PostgreSQL e dei container Docker per le consulenze.
B. Comprensione del Testo e Formattazione Estremamente Aderente
Claude è celebre per l’eccezionale capacità di seguire istruzioni articolate (System Prompts) senza “allucinare” e per la qualità della scrittura in testo naturale (eccellente anche in italiano). Quando deve estrarre dati complessi da un documento e restituire un file JSON perfettamente strutturato, la sua precisione è altissima.
2. Come si inserisce nella Proposta di Consulenza
Se l’offerta principale verso studi legali, strutture sanitarie e PMI si basa sull’AI locale (Ollama + PGvector) per motivi di privacy e GDPR, come si colloca Anthropic?
Scenario A: La soluzione “Pure On-Premise” (Solo Ollama)
Per le informazioni sanitarie sensibili (Art. 9 GDPR), contenziosi legali riservati o segreti industriali, Claude non può essere usato direttamente sui dati grezzi perché i file dovrebbero viaggiare verso i server di Anthropic via API. In questo caso si usa esclusivamente il tuo stack locale (Ollama con Qwen, Llama, ecc.).
Scenario B: Architettura Ibrida con Anonymization Layer (Data Masking)
Se un cliente ha un problema di ragionamento o analisi così complesso che un modello locale da 8B o 14B parametri fatica a risolvere, puoi proporre un’architettura a due livelli:
- Fase 1 (Locale in Python/PG): Un programma locale analizza il documento riservato e rimuove/sostituisce automaticamente i dati sensibili (nomi, codici fiscali, importi, indirizzi) con dei segnaposto (es.
[CLIENTE_A],[IMPORTO_X]). - Fase 2 (Cloud via API Anthropic): Il testo anonimizzato viene inviato a Claude 3.5 Sonnet via API per eseguire la sintesi o il ragionamento giuridico/tecnico avanzato.
- Fase 3 (Locale): Il sistema riceve la risposta da Claude e ripristina i dati reali prima di mostrarli all’utente.
Mappa delle Alternative Locali a Claude
Uno degli aspetti più interessanti della tua consulenza sarà guidare i clienti che conoscono e apprezzano le capacità di Claude (o ChatGPT) verso i corrispettivi open-source da far girare in locale con Ollama:
| Se il cliente vorrebbe… | La risposta Cloud (Proprietaria) | L’alternativa Locale su Ollama (100% Privata) |
| Generazione Codice / SQL | Claude 3.5 Sonnet | qwen2.5-coder (7B / 14B / 32B) |
| Ragionamento logico passo-passo | Claude 3 Opale / Reasoning | deepseek-r1 (8B / 14B / 32B) |
| Chat, RAG e sintesi generale | Claude 3.5 Haiku / Sonnet | qwen2.5 (14B/32B) oppure llama3.1 (8B/70B) |
| Analisi PDF/Immagini | Claude 3.5 Sonnet (Vision) | llama3.2-vision oppure phi3.5-vision |
In sintesi: Anthropic / Claude rappresenta un punto di riferimento eccezionale per le performance e uno strumento di lavoro utilissimo per te durante lo sviluppo, ma nei progetti clienti dove privacy, sovranità dei dati e costi fissi sono prioritari, l’accoppiata Ollama + PostgreSQL rimane la strada maestra.
A differenza di Google (Gemini) e Anthropic (Claude), con DeepSeek la musica cambia completamente: è una vera e propria miniera d’oro per chi lavora con l’AI in locale e con Ollama.
DeepSeek è una società/laboratorio di ricerca che rilascia gran parte dei suoi modelli con licenza Open Source (MIT), consentendo l’uso commerciale libero, il download dei pesi e l’esecuzione 100% offline.
Negli ultimi mesi DeepSeek ha letteralmente sconvolto il mercato dell’AI per due motivi: prestazioni mostruose sul reasoning (ragionamento logico) ed efficienza di calcolo incredibile.
I Modelli DeepSeek Principali da Usare con Ollama
Su Ollama puoi trovare ed eseguire diverse famiglie di modelli DeepSeek, adatte a esigenze molto specifiche:
1. DeepSeek-R1 (Il modello “Reasoning” per eccellenza)
È il modello che ha ridefinito gli standard dei modelli di ragionamento.
- Come funziona: Prima di dare la risposta, genera un processo di pensiero interno (
<think> ... </think>) in cui analizza il problema passo dopo passo, verifica la propria logica e corregge eventuali errori. - Versione Originale (671B): Enorme, basato su architettura MoE (Mixture of Experts).
- Versioni “Distillate” (Disponibili su Ollama): Hanno preso la capacità di ragionamento di R1 e l’hanno “compressa” su basi più piccole (Llama e Qwen). Puoi eseguirle in locale con requisiti hardware accessibili a chiunque:
deepseek-r1:8b(~5 GB VRAM) → Ottimo per test e macchine standard.deepseek-r1:14b(~9 GB VRAM) → Il miglior compromesso per uso aziendale locale.deepseek-r1:32b(~20 GB VRAM) → Prestazioni vicine ai grandi modelli cloud.
2. DeepSeek-Coder (e Qwen2.5-Coder integrato)
- Descrizione: Modelli specializzati nella comprensione e generazione di codice, script di automazione e query SQL complesse.
- Caso d’uso: Perfetti se devi costruire agenti interni che devono interrogare il tuo database PostgreSQL aprendo connessioni o scrivendo query dinamiche sicure.
Come Usarli Concretamente con Ollama
L’installazione e l’uso sono immediati. Da terminale ti basta lanciare:
Bash
# Per scaricare ed eseguire la versione da 14B parametri (consigliata)
ollama run deepseek-r1:14b
Quando fai una domanda a un modello R1 tramite API o via Python, il modello restituirà la risposta strutturata così:
Plaintext
<think>
L'utente chiede di analizzare la clausola di recesso per il contratto X.
Verifico i vincoli nel testo estratto da PostgreSQL...
Il preavviso è di 60 giorni, ma c'è una penale se eseguito entro il primo anno.
Formulo la risposta in modo chiaro per lo studio legale.
</think>
In base ai documenti analizzati, la clausola di recesso prevede un preavviso di 60 giorni...
Casi d’Uso Ideali per i Tuoi Clienti (Studi Legali, Cliniche, PMI)
DeepSeek-R1 (nelle sue versioni locali) risolve uno dei limiti storici dei modelli LLM tradizionali: la fretta di rispondere (“allucinazione”).
- Studi Legali e Notarili:
- Problema: Analizzare contratti complessi con clausole incrociate o contraddittorie.
- Soluzione: DeepSeek-R1 legge i testi estratti da PostgreSQL e “ragiona” sui cavilli, confrontando le date di scadenza, le penali e i vincoli normativi prima di dare il parere finale.
- Strutture Mediche:
- Problema: Sintesi di cartelle cliniche stratificate negli anni con sintomi complessi.
- Soluzione: Il modello analizza la cronologia medica ricostruendo la sequenza temporale degli eventi clinici passo dopo passo nel suo blocco di pensiero.
- PMI e Dipartimenti Tecnici:
- Problema: Troubleshooting su manuali tecnici complessi o diagnosi di guasti.
- Soluzione: Invece di limitarsi a cercare una parola chiave, il modello esegue un ragionamento deduttivo per isolare le possibili cause radice del problema.
Il Valore Commerciale per la Consulenza
Poter offrire DeepSeek-R1 installato in locale ti dà un’arma di vendita formidabile:
- Incredibile rapporto qualità/prezzo: Fai girare un modello con capacità logiche paragonabili ai migliori sistemi proprietari cloud (come OpenAI o Claude) su una singola workstation o server aziendale con scheda NVIDIA (es. RTX 4090 o RTX 6000 Ada).
- Trasparenza del ragionamento: Puoi mostrare al cliente come l’AI è arrivata a una determinata conclusione leggendo i passaggi interni del testo.
- Zero Fuga Dati: Risolvi il problema della riservatezza senza dover rinunciare al “ragionamento avanzato”.