Dialogo con DeepSeek
Potresti dare delle indicazioni per acquistare un computer potente con Aliexpress per eseguire modelli con Ollama su Ubuntu 26.04 anche ARM ?
Ciao, certo! Acquistare un mini PC potente su AliExpress per eseguire modelli AI con Ollama su Ubuntu 26.04 è un’ottima idea. La scelta principale è tra un sistema con una potente GPU AMD (per le prestazioni) e uno con architettura ARM (per l’efficienza energetica). Ecco una guida per aiutarti a districarti.
Scelta 1: La Via delle Prestazioni con AMD (Consigliata)
Questa è la strada che ti consiglio per ottenere le migliori prestazioni con Ollama. L’obiettivo è un mini PC con un processore AMD Ryzen serie 7040/8040 (con GPU Radeon 780M integrata) o con una scheda grafica AMD Radeon dedicata.
- I Pro: Le GPU AMD sono ufficialmente supportate da Ollama tramite il backend ROCm, che offre un’accelerazione enorme rispetto alla CPU, circa 3-5 volte più veloce . Con 16 GB di VRAM puoi eseguire modelli di dimensioni 7B-8B senza problemi . Inoltre, se vuoi la massima stabilità, Ollama supporta anche il backend Vulkan, che funziona molto bene e in modo più stabile su queste schede, seppur con un leggero calo di prestazioni (circa il 30-40%) .
- I Contro: ROCm è potente, ma su alcune GPU integrate (come la Radeon 780M) può essere “fragile” e causare crash. Esistono delle “ricette” per renderlo stabile, che richiedono un po’ di pazienza .
- Cosa Cercare su AliExpress:
- Processore: Cerca mini PC con AMD Ryzen 7 6800H o Ryzen 7 7840HS, che hanno la Radeon 780M.
- RAM: Assicurati che il sistema abbia almeno 32 GB di RAM (meglio se 64 GB), da condividere con la GPU. Per le schede video dedicate, punta a modelli con 16 GB di VRAM .
- Consigli per Ubuntu e Ollama:
- Ubuntu 26.04: La procedura di installazione è standard. Apri un terminale e lancia
curl -fsSL https://ollama.com/install.sh | sh. - ROCm vs. Vulkan: Su Ubuntu 26.04 con hardware AMD, Vulkan è spesso la scelta più affidabile per una configurazione “che funzioni subito” . Se vuoi provare ROCm, segui le guide su come installare i pacchetti ROCm 7.1 da Ubuntu e configurare il servizio Ollama con le giuste variabili d’ambiente, come
HSA_ENABLE_DXG_DETECTION=1se sei in WSL . Per la Radeon 780M, potresti aver bisogno di un kernel recente (versione7.0.0-15o superiore) per evitare un bug che causa il crash della GPU .
- Ubuntu 26.04: La procedura di installazione è standard. Apri un terminale e lancia
Scelta 2: La Via dell’Efficienza con ARM
Questa opzione è interessante se il tuo obiettivo è un PC a basso consumo per modelli AI non troppo grandi.
- I Pro: I sistemi ARM, come il Radxa Orion O6, sono spesso venduti su AliExpress a prezzi interessanti e consumano molta meno energia rispetto ai PC x86 . Ollama supporta nativamente l’architettura ARM64 .
- I Contro: Le prestazioni sono inferiori a quelle di una soluzione AMD con ROCm. Inoltre, il software per ARM non è sempre perfettamente compatibile e spesso la RAM è saldata, quindi non è espandibile in futuro .
- Cosa Cercare su AliExpress:
- Scheda/SBC: Tieni d’occhio il Radxa Orion O6, una scheda madre ITX con processore ARM a 12 core . Sarà probabilmente disponibile nei prossimi mesi.
- Dispositivi dedicati: Evita il “AI Pyramid Computing Box” (AX8850): è concepito per compiti di computer vision, non per eseguire LLM con Ollama .
- RAM: Ricerca modelli con almeno 16 GB di RAM, anche se per LLM più grandi ne servirebbero di più .
- Consigli per Ubuntu e Ollama: L’installazione è simile: scarica la versione ARM64 di Ollama (
ollama-linux-arm64.tgz) e installala sul tuo sistema .
⚠️ Attenzione agli annunci “AI”
Fai attenzione ad alcuni computer su AliExpress che pubblicizzano “AI” e “NPU”. Spesso si tratta di hardware specializzato, come il “AI Pyramid Computing Box”, che non è progettato per eseguire i modelli di Ollama, ma piuttosto per l’elaborazione di immagini in ambito IoT . Per il tuo scopo, la potenza di calcolo generica di una GPU AMD è molto più flessibile e performante.
In sintesi, per un’esperienza potente e flessibile, la scelta AMD è quella giusta. Se invece il consumo energetico è la tua priorità assoluta e sei disposto a fare dei compromessi sulle prestazioni, tieni d’occhio le novità nel mondo ARM.
Vorrei la soluzione hardware migliore per modelli importanti 70B …
Per eseguire modelli da 70B di parametri (come Llama 3 o DeepSeek-R1) in modo efficace su un sistema locale, la soluzione hardware migliore è quella che offre la maggiore quantità di memoria unificata ad alta velocità o di VRAM dedicata. I modelli di questa dimensione hanno bisogno di circa 40-50 GB di memoria anche nella versione quantizzata Q4 per funzionare bene. Ecco le due strade principali.
Percorso 1: La Soluzione “Pronta all’Uso” – Minisforum MS-S1 / Strix Halo
Se il tuo obiettivo è un mini PC potente da AliExpress, la scelta più promettente (anche se con qualche accortezza) è un sistema con il nuovo processore AMD Ryzen AI Max+ 395 (Strix Halo).
- Perché funziona: Questa APU ha una GPU Radeon 8060S con accesso a fino a 96 GB di memoria unificata. Questo consente di caricare un intero modello 70B Q4 nella memoria della GPU, ottenendo prestazioni elevate.
- Cosa cercare su AliExpress: Cerca mini PC come il Minisforum MS-S1 Max o altri sistemi basati su Strix Halo, che specificano almeno 64 GB, idealmente 96 GB o 128 GB di RAM unificata.
- Attenzione a Ubuntu 26.04: C’è un bug noto con le versioni recenti di Ollama (dalla 0.30.x) su questi chip, che non riescono a usare tutta la VRAM disponibile. La soluzione al momento è usare la versione 0.24.0 di Ollama, che funziona correttamente riconoscendo tutta la memoria disponibile (ad esempio 111.5 GB invece di 96 GB).
Percorso 2: La Via della Massima Potenza – Workstation con GPU Dedicata
Per prestazioni senza compromessi e una maggiore flessibilità futura, la soluzione “migliore” è una workstation che supporti più GPU.
- Perché funziona: Anche una singola GPU come la AMD Radeon RX 7900 XTX ha 24 GB di VRAM. Tuttavia, come mostrato, un modello 70B Q4 richiede circa 47 GB, quindi non ci sta interamente. Le prestazioni sarebbero comunque discrete (6-12 token/s) ma con parte del modello in CPU. La soluzione è usare due GPU, che condividono il carico.
- Configurazione consigliata: L’ideale è una scheda madre per AMD Ryzen Threadripper PRO (come quelle con chipset WRX90), che supporta:
- Prestazioni: Con questa configurazione, gli utenti riportano prestazioni eccellenti, con tempi di risposta di 5-7 secondi per il primo token, a patto di configurare Ollama per usare tutti i layer sulla GPU. Su Linux, il supporto multi-GPU con ROCm funziona bene.
Tabella Comparativa dei Requisiti
Per darti un’idea chiara dello spazio necessario, ecco quanto pesa un modello Llama 3.1 70B nelle diverse quantizzazioni, considerando anche un contesto di 4k token (circa 5.6 GB):
| Quantizzazione | Peso Modello | Totale (con contesto) | Cosa significa |
|---|---|---|---|
| q4_K_M | ~42 GB | ~47.6 GB | Buon compromesso qualità/velocità. La scelta più comune. |
| q3_K_M | ~31.5 GB | ~37.1 GB | Riduzione qualità percettibile. Potrebbe stare in 2×24 GB. |
| q2_K_S | ~21.0 GB | ~26.6 GB | Bassa qualità, ma veloce. Si adatta a quasi tutte le configurazioni. |
In sintesi, la scelta migliore su AliExpress è puntare su un mini PC AMD Strix Halo con almeno 96 GB di RAM, ricordando il bug di Ollama e usando la versione 0.24.0. Se il budget lo permette e vuoi la massima flessibilità, una workstation AMD Threadripper PRO con due RX 7900 XTX è la soluzione definitiva, anche se più complessa da assemblare.
Spero che queste indicazioni ti aiutino a fare la scelta giusta! Se hai altre domande, chiedi pure.