Modelli AI open source

Dialogo con Gemini.

Ecco una selezione dei principali modelli open source ottimizzati per l’uso locale tramite Ollama. Li ho suddivisi per categoria e “taglia” (i file tra parentesi indicano la VRAM indicativa richiesta per far girare la quantizzazione standard a 4-bit, ovvero Q4_K_M).

1. Modelli Generali e Multiuso (Chat, Sintesi, Reasoning)

🔴 Llama 3.3 (70B)

  • Descrizione: Il modello di punta di Meta. Offre prestazioni paragonabili a GPT-4o su compiti di ragionamento complesso, analisi documentale avanzata, sintesi e scrittura. È la scelta top per scenari enterprise dove non si vuole scendere a compromessi sulla qualità.
  • Hardware consigliato: Richiede hardware dedicato (almeno 40–48 GB di VRAM, es. 2x RTX 3090/4090 o server con GPU A100/Mac Studio con memoria unificata).
  • Comando: ollama run llama3.3

🔵 Llama 3.1 / 3.2 (8B e 3B)

  • Descrizione: Lo standard de-facto per l’AI locale su macchine medio-piccole.
    • Llama 3.2 (3B): Ultra-leggero, velocissimo, perfetto per compiti di classificazione, estrazione testo e chat semplice su PC senza GPU dedicate potenti. (~2.5 GB VRAM)
    • Llama 3.1 (8B): Il miglior compromesso tra intelligenza, velocità e risorse. Adatto per RAG, riassunti di contratti e risposte strutturate. (~5.5 GB VRAM)
  • Comando: ollama run llama3.2 oppure ollama run llama3.1

🟡 Qwen 2.5 (7B / 14B / 32B / 72B)

  • Descrizione: Sviluppato da Alibaba, la famiglia Qwen 2.5 è attualmente tra le migliori in assoluto per comprensione del contesto, aderenza alle istruzioni (instruction-following), formattazione JSON ed elaborazione dell’italiano.
  • Perché usarlo: In contesti RAG aziendali (dove l’LLM deve estrarre dati rigidi da PostgreSQL o generare output in formati precisi) le versioni 7B e 14B superano spesso i concorrenti di pari taglia. (~5 GB per il 7B, ~10 GB per il 14B di VRAM).
  • Comando: ollama run qwen2.5:7b o ollama run qwen2.5:14b

🟢 Mistral / Mixtral (7B e 8x7B)

  • Descrizione: Storico modello dell’azienda francese Mistral AI.
    • Mistral 7B: Solido, fluido e con un’ottima comprensione dell’italiano e delle lingue europee. (~5 GB VRAM)
    • Mixtral 8x7B (MoE – Mixture of Experts): Un’architettura a esperti che attiva solo una parte dei parametri per ogni token. Molto veloce e intelligente per task complessi. (~26 GB VRAM)
  • Comando: ollama run mistral o ollama run mixtral

2. Modelli di Embedding (Indispensabili per PGvector e RAG)

Questi modelli non servono per chattare, ma per trasformare frasi e documenti in vettori numerici da salvare su PostgreSQL.

🟣 nomic-embed-text

  • Descrizione: Il modello di embedding di riferimento per Ollama. Leggerissimo (~280 MB), genera vettori a 768 dimensioni ed è eccellente per la ricerca semantica su documenti in testo libero.
  • Comando: ollama pull nomic-embed-text

🟣 bge-m3

  • Descrizione: Prodotto da BAAI, è un modello di embedding multilingua avanzato. Supporta testi lunghi (fino a 8192 token) ed è ideale se i documenti aziendali sono complessi o in più lingue.
  • Comando: ollama pull bge-m3

3. Modelli Vision (Analisi Immagini e PDF Scansionati)

👁️ Llama 3.2 Vision (11B / 90B)

  • Descrizione: Modello multimodale di Meta capace di leggere sia testo che immagini.
  • Caso d’uso aziendale: Analizzare PDF scansionati, fatture cartacee, planimetrie o grafici ed estrarre il testo/contenuto per poi salvarlo su PostgreSQL.
  • Hardware: La versione 11B richiede circa 8-9 GB di VRAM.
  • Comando: ollama run llama3.2-vision

👁️ Phi-3.5 Vision (4.2B)

  • Descrizione: Modello multimodale compatto di Microsoft. Estremamente efficiente nella lettura di tabelle, schermate e documenti strutturati legati a immagini.
  • Comando: ollama run phi3.5-vision

4. Modelli Specializzati (Coding & Reasoning)

💻 Qwen 2.5 Coder (7B / 14B / 32B)

  • Descrizione: Uno dei migliori modelli Open Source per la generazione, il refactoring e la spiegazione di codice (Python, SQL, C++, Bash, ecc.). Superiore anche a modelli molto più grandi per compiti di programmazione.
  • Comando: ollama run qwen2.5-coder:7b

🧠 DeepSeek-R1 (e versioni “Distilled” 1.5B / 8B / 14B / 32B / 70B)

  • Descrizione: Modelli specializzati nel ragionamento profondo (Reasoning / Chain-of-Thought). Prima di dare la risposta finale, mostrano i passaggi logici intermedi che effettuano.
  • Caso d’uso aziendale: Utili per la risoluzione di problemi logici complessi, audit di codice o analisi di clausole legali intricate con ragionamento passo-passo.
  • Comando: ollama run deepseek-r1:8b o ollama run deepseek-r1:14b

Per una PMI o uno studio professionale, uno stack di modelli tipico che potresti installare sulla loro macchina server locale è:

  1. nomic-embed-text → Per la generazione degli embeddings su PostgreSQL/PGvector.
  2. qwen2.5:14b oppure llama3.1:8b → Come LLM principale per le risposte al personale (chat/RAG).
  3. llama3.2-vision → Per elaborare eventuali documenti scansionati o immagini in ingresso.

Per quanto riguarda Gemini, la situazione è diversa rispetto ai modelli open source come Llama, Qwen o Mistral: Gemini è una famiglia di modelli proprietari sviluppati da Google, il che significa che i suoi pesi non sono rilasciati liberamente per l’esecuzione in locale.

Di conseguenza, non puoi scaricare o eseguire Gemini direttamente dentro Ollama sul server di un cliente.

Tuttavia, Gemini gioca un ruolo molto importante nell’ecosistema e puoi sfruttarlo nelle tue consulenze in due modi specifici.

1. Come usare Gemini nell’Architettura (Ibrida o Cloud)

Anche se la tua offerta principale per studi legali, cliniche o PMI si basa su AI 100% Locale (via Ollama + PGvector), ci sono scenari in cui Gemini diventa uno strumento complementare straordinario:

A. Architetture Ibride (Privacy Tiering)

Puoi progettare un sistema intelligente che smista le richieste in base alla sensibilità dei dati:

  • Dati Sensibili / Interni: Elaborati in locale da Ollama (es. Qwen 2.5 / Llama 3.1) + PostgreSQL. Zero dati all’esterno.
  • Dati Pubblici / Task Non Riservati: Elaborati tramite le API di Gemini via cloud per sfruttare la sua enorme finestra di contesto e potenza di calcolo a costi molto contenuti.

B. Gestione di Documenti Immensi (Window Context fino a 1M+ Token)

Modelli come Gemini 1.5 Pro / Flash hanno una finestra di contesto sterminata (fino a 1-2 milioni di token).

  • Se un cliente deve analizzare un intero bilancio da 500 pagine o un intero archivio storico in un singolo passaggio senza dover fare prima il “chunking” RAG, Gemini via API è imbattibile.
  • In questo caso, la tua consulenza verterà su come anonimizzare o mascherare (PII masking) i dati sensibili in locale prima di inviare il testo alle API di Google.

Possiamo usare Gemini (es. tramite Google AI Studio o Gemini Code Assist) come assistente quotidiano di produttività:

  • Scrittura e Refactoring di Codice: Per generare rapidamente script Python, query SQL complesse con pgvector, configurazioni Docker o file di automazione per installazioni pressi clienti.
  • Prototipazione Rapida: Per testare la logica delle pipeline RAG o del Function Calling prima di fare il deploy dei modelli locali su Ollama.

Confronto Sintetico per i Clienti

Se un cliente ti chiede: “Perché installare Ollama in locale se esiste Gemini?”, la risposta chiara e sintetica da dare è:

CaratteristicaModelli Locali su Ollama (Llama, Qwen, ecc.)Gemini (via API Cloud Google)
Privacy & GDPR100% Locale: Nessun dato esce dalla rete aziendale.Cloud: I dati viaggiano su server terzi.
Funzionamento OfflineSì: Funziona anche senza internet o in LAN air-gapped.No: Richiede connessione internet costante.
Costi OperativiFissi: Nessun costo a chiamata (solo hardware/corrente).A consumo: Pay-per-token/query.
Capacità di ContestoMedia/Alta (8k – 128k token).Estrema (1M+ token).
Potenza ComputazionaleDipende dalle GPU locali acquistate.Scalabilità cloud illimitata.

In sintesi: Ollama è il cavallo di battaglia per la privacy, la sicurezza e l’infrastruttura locale; Gemini è un’ottima risorsa cloud da integrare quando la riservatezza totale non è il requisito vincolante o quando servono prestazioni di contesto enormi.

Con Anthropic (i creatori della famiglia di modelli Claude), la situazione è praticamente identica a quella di Google con Gemini: Claude è un ecosistema di modelli proprietari cloud-based.

I pesi di modelli come Claude 3.5 Sonnet, Claude 3.5 Haiku o Claude 3 Opus non sono rilasciati liberamente, quindi non è possibile eseguirli offline o in locale tramite Ollama.

Tuttavia, nel panorama dello sviluppo software, dell’integrazione dati e della consulenza, Anthropic ha un peso specifico enorme e va tenuto assolutamente in considerazione per diversi motivi.

1. Perché Claude (specie 3.5 Sonnet) è il “Gold Standard” attuale

Nel mondo dell’intelligenza artificiale per le aziende, Anthropic si è posizionata come leader in due settori chiave:

A. Scrittura di Codice e Architettura (Coding & Dev)

Per la programmazione, il refactoring, la scrittura di query SQL complesse (incluso pgvector) e la creazione di pipeline di backend, Claude 3.5 Sonnet è considerato da gran parte degli sviluppatori il miglior modello in assoluto sul mercato, spesso superiore anche a GPT-4o o Gemini.

  • Per lo sviluppatore: È lo strumento ideale da affiancare all’ IDE per velocizzare la scrittura delle integrazioni Python/Node, degli script di gestione PostgreSQL e dei container Docker per le consulenze.

B. Comprensione del Testo e Formattazione Estremamente Aderente

Claude è celebre per l’eccezionale capacità di seguire istruzioni articolate (System Prompts) senza “allucinare” e per la qualità della scrittura in testo naturale (eccellente anche in italiano). Quando deve estrarre dati complessi da un documento e restituire un file JSON perfettamente strutturato, la sua precisione è altissima.

2. Come si inserisce nella Proposta di Consulenza

Se l’offerta principale verso studi legali, strutture sanitarie e PMI si basa sull’AI locale (Ollama + PGvector) per motivi di privacy e GDPR, come si colloca Anthropic?

Scenario A: La soluzione “Pure On-Premise” (Solo Ollama)

Per le informazioni sanitarie sensibili (Art. 9 GDPR), contenziosi legali riservati o segreti industriali, Claude non può essere usato direttamente sui dati grezzi perché i file dovrebbero viaggiare verso i server di Anthropic via API. In questo caso si usa esclusivamente il tuo stack locale (Ollama con Qwen, Llama, ecc.).

Scenario B: Architettura Ibrida con Anonymization Layer (Data Masking)

Se un cliente ha un problema di ragionamento o analisi così complesso che un modello locale da 8B o 14B parametri fatica a risolvere, puoi proporre un’architettura a due livelli:

  1. Fase 1 (Locale in Python/PG): Un programma locale analizza il documento riservato e rimuove/sostituisce automaticamente i dati sensibili (nomi, codici fiscali, importi, indirizzi) con dei segnaposto (es. [CLIENTE_A], [IMPORTO_X]).
  2. Fase 2 (Cloud via API Anthropic): Il testo anonimizzato viene inviato a Claude 3.5 Sonnet via API per eseguire la sintesi o il ragionamento giuridico/tecnico avanzato.
  3. Fase 3 (Locale): Il sistema riceve la risposta da Claude e ripristina i dati reali prima di mostrarli all’utente.

Mappa delle Alternative Locali a Claude

Uno degli aspetti più interessanti della tua consulenza sarà guidare i clienti che conoscono e apprezzano le capacità di Claude (o ChatGPT) verso i corrispettivi open-source da far girare in locale con Ollama:

Se il cliente vorrebbe…La risposta Cloud (Proprietaria)L’alternativa Locale su Ollama (100% Privata)
Generazione Codice / SQLClaude 3.5 Sonnetqwen2.5-coder (7B / 14B / 32B)
Ragionamento logico passo-passoClaude 3 Opale / Reasoningdeepseek-r1 (8B / 14B / 32B)
Chat, RAG e sintesi generaleClaude 3.5 Haiku / Sonnetqwen2.5 (14B/32B) oppure llama3.1 (8B/70B)
Analisi PDF/ImmaginiClaude 3.5 Sonnet (Vision)llama3.2-vision oppure phi3.5-vision

In sintesi: Anthropic / Claude rappresenta un punto di riferimento eccezionale per le performance e uno strumento di lavoro utilissimo per te durante lo sviluppo, ma nei progetti clienti dove privacy, sovranità dei dati e costi fissi sono prioritari, l’accoppiata Ollama + PostgreSQL rimane la strada maestra.

A differenza di Google (Gemini) e Anthropic (Claude), con DeepSeek la musica cambia completamente: è una vera e propria miniera d’oro per chi lavora con l’AI in locale e con Ollama.

DeepSeek è una società/laboratorio di ricerca che rilascia gran parte dei suoi modelli con licenza Open Source (MIT), consentendo l’uso commerciale libero, il download dei pesi e l’esecuzione 100% offline.

Negli ultimi mesi DeepSeek ha letteralmente sconvolto il mercato dell’AI per due motivi: prestazioni mostruose sul reasoning (ragionamento logico) ed efficienza di calcolo incredibile.

I Modelli DeepSeek Principali da Usare con Ollama

Su Ollama puoi trovare ed eseguire diverse famiglie di modelli DeepSeek, adatte a esigenze molto specifiche:

1. DeepSeek-R1 (Il modello “Reasoning” per eccellenza)

È il modello che ha ridefinito gli standard dei modelli di ragionamento.

  • Come funziona: Prima di dare la risposta, genera un processo di pensiero interno (<think> ... </think>) in cui analizza il problema passo dopo passo, verifica la propria logica e corregge eventuali errori.
  • Versione Originale (671B): Enorme, basato su architettura MoE (Mixture of Experts).
  • Versioni “Distillate” (Disponibili su Ollama): Hanno preso la capacità di ragionamento di R1 e l’hanno “compressa” su basi più piccole (Llama e Qwen). Puoi eseguirle in locale con requisiti hardware accessibili a chiunque:
    • deepseek-r1:8b (~5 GB VRAM) → Ottimo per test e macchine standard.
    • deepseek-r1:14b (~9 GB VRAM) → Il miglior compromesso per uso aziendale locale.
    • deepseek-r1:32b (~20 GB VRAM) → Prestazioni vicine ai grandi modelli cloud.

2. DeepSeek-Coder (e Qwen2.5-Coder integrato)

  • Descrizione: Modelli specializzati nella comprensione e generazione di codice, script di automazione e query SQL complesse.
  • Caso d’uso: Perfetti se devi costruire agenti interni che devono interrogare il tuo database PostgreSQL aprendo connessioni o scrivendo query dinamiche sicure.

Come Usarli Concretamente con Ollama

L’installazione e l’uso sono immediati. Da terminale ti basta lanciare:

Bash

# Per scaricare ed eseguire la versione da 14B parametri (consigliata)
ollama run deepseek-r1:14b

Quando fai una domanda a un modello R1 tramite API o via Python, il modello restituirà la risposta strutturata così:

Plaintext

<think>
L'utente chiede di analizzare la clausola di recesso per il contratto X.
Verifico i vincoli nel testo estratto da PostgreSQL...
Il preavviso è di 60 giorni, ma c'è una penale se eseguito entro il primo anno.
Formulo la risposta in modo chiaro per lo studio legale.
</think>

In base ai documenti analizzati, la clausola di recesso prevede un preavviso di 60 giorni...

Casi d’Uso Ideali per i Tuoi Clienti (Studi Legali, Cliniche, PMI)

DeepSeek-R1 (nelle sue versioni locali) risolve uno dei limiti storici dei modelli LLM tradizionali: la fretta di rispondere (“allucinazione”).

  1. Studi Legali e Notarili:
    • Problema: Analizzare contratti complessi con clausole incrociate o contraddittorie.
    • Soluzione: DeepSeek-R1 legge i testi estratti da PostgreSQL e “ragiona” sui cavilli, confrontando le date di scadenza, le penali e i vincoli normativi prima di dare il parere finale.
  2. Strutture Mediche:
    • Problema: Sintesi di cartelle cliniche stratificate negli anni con sintomi complessi.
    • Soluzione: Il modello analizza la cronologia medica ricostruendo la sequenza temporale degli eventi clinici passo dopo passo nel suo blocco di pensiero.
  3. PMI e Dipartimenti Tecnici:
    • Problema: Troubleshooting su manuali tecnici complessi o diagnosi di guasti.
    • Soluzione: Invece di limitarsi a cercare una parola chiave, il modello esegue un ragionamento deduttivo per isolare le possibili cause radice del problema.

Il Valore Commerciale per la Consulenza

Poter offrire DeepSeek-R1 installato in locale ti dà un’arma di vendita formidabile:

  • Incredibile rapporto qualità/prezzo: Fai girare un modello con capacità logiche paragonabili ai migliori sistemi proprietari cloud (come OpenAI o Claude) su una singola workstation o server aziendale con scheda NVIDIA (es. RTX 4090 o RTX 6000 Ada).
  • Trasparenza del ragionamento: Puoi mostrare al cliente come l’AI è arrivata a una determinata conclusione leggendo i passaggi interni del testo.
  • Zero Fuga Dati: Risolvi il problema della riservatezza senza dover rinunciare al “ragionamento avanzato”.