2026-07-28 · 4 min di lettura

GGUF, EXL2, GPTQ e AWQ: Un confronto completo per il serving di LLM

Scopri le principali differenze tra i formati di quantizzazione GGUF, EXL2, GPTQ e AWQ e come vengono utilizzati in llama.cpp e vLLM per utenti domestici e aziendali.

Introduzione

I moderni modelli linguistici di grandi dimensioni (LLM) sono estremamente affamati di memoria. Un modello da 70 miliardi di parametri in precisione completa (FP16) richiede circa 140 GB di VRAM, ben oltre anche le GPU consumer più potenti. La quantizzazione riduce la precisione dei pesi da 16 bit a 4 bit o inferiori, tagliando drasticamente i requisiti di memoria. Ma non tutti i formati di quantizzazione sono uguali. La scelta tra GGUF, EXL2, GPTQ e AWQ dipende dall'hardware, dal motore di serving e dalle priorità: portabilità, velocità o throughput multiutente.

Panoramica dei formati di quantizzazione

GGUF (GPT-Generated Unified Format) è il formato nativo di llama.cpp e il più versatile. Funziona su CPU, Apple Silicon, configurazioni miste CPU/GPU e supporta un'ampia gamma di livelli di quantizzazione (da 2 a 8 bit). È lo standard per distribuzioni locali, mono-utente e periferiche. GPTQ (Generalized Post-Training Quantization) è stato per lungo tempo lo standard GPU. È ottimizzato per GPU NVIDIA e offre un buon equilibrio tra compressione e velocità di inferenza, ma viene sempre più sostituito da formati più recenti come AWQ. AWQ (Activation-aware Weight Quantization) è l'attuale standard industriale per la produzione GPU. Protegge i pesi salienti in base ai pattern di attivazione, migliorando la precisione alla stessa larghezza di bit. È altamente ottimizzato per i kernel GPU NVIDIA moderni (Marlin) ed è ideale per il serving ad alto throughput. EXL2 è il formato del motore ExLlamaV2. Offre il controllo più fine sulla larghezza di bit (ad esempio 3.5, 4.25, 5.0 bit per peso) e consente di adattare con precisione un modello in VRAM limitata. È spesso il formato più veloce per la generazione mono-utente su GPU NVIDIA consumer.

Tabella comparativa dei formati

Confronto dei formati di quantizzazione
FormatoCaratteristiche principaliMigliore perMotori supportati
GGUFMassima portabilità, molti bit, mix CPU/GPUUso locale, utenti domestici, dispositivi edge, Apple Siliconllama.cpp, Ollama, LM Studio, (sperimentale in vLLM)
GPTQOttimizzato GPU, maturo, buon equilibrioDistribuzioni GPU legacy, inferenza basata su NVIDIAvLLM, ExLlamaV1, AutoGPTQ
AWQQuantizzazione consapevole dell'attivazione, alta precisione, kernel MarlinServing di produzione, alto throughput, GPU NVIDIA modernevLLM, TGI, AWQ Engine
EXL2Controllo dei bit più fine, massima velocità mono-utenteMono-utente, bassa latenza, GPU NVIDIA consumerExLlamaV2
← Scorri a destra per vedere altro →

Utilizzo in llama.cpp

llama.cpp è costruito attorno al formato GGUF. È il motore principale per gli utenti che non dispongono di una GPU NVIDIA dedicata di fascia alta, che devono eseguire modelli su CPU o Apple Silicon, o che necessitano di una soluzione universale facile da configurare. Con llama.cpp, puoi scaricare parti di un modello sulla GPU mantenendo il resto nella RAM di sistema (offloading CPU+GPU). Ciò consente di eseguire modelli di grandi dimensioni anche su dispositivi con VRAM limitata. Strumenti come Ollama e LM Studio utilizzano llama.cpp internamente, rendendo GGUF la scelta più semplice per i principianti. Per applicazioni di chat locali, generazione di testo su un laptop o dispositivi edge, GGUF è il campione indiscusso.

Utilizzo in vLLM

vLLM è progettato per ambienti di produzione ad alto throughput. Implementa PagedAttention e il batching continuo per servire molti utenti simultaneamente. Nativamente, vLLM supporta AWQ e GPTQ. Questi sono i formati da utilizzare quando si distribuisce vLLM in produzione. AWQ è preferito per la sua precisione e velocità superiori (specialmente con il kernel Marlin). GPTQ è ancora supportato, ma per i nuovi progetti si consiglia AWQ. GGUF è supportato solo sperimentalmente in vLLM e non è adatto alla produzione (spesso è più lento e meno ottimizzato). EXL2 non è supportato da vLLM; è esclusivo del motore ExLlamaV2, ottimizzato per la bassa latenza mono-utente.

Scegliere il formato giusto

Per utenti domestici o sviluppo locale: Usa GGUF con llama.cpp (o strumenti come Ollama). È il più compatibile, funziona su quasi qualsiasi hardware ed è facile da gestire. Per aziende o serving ad alto throughput: Usa AWQ con vLLM su GPU NVIDIA. Offre il miglior equilibrio tra velocità, precisione e scalabilità per servire molti utenti simultaneamente. Per utenti esperti (velocità mono-utente): Se hai una GPU NVIDIA e desideri la massima velocità di generazione per un singolo utente, usa EXL2 con il motore ExLlamaV2. Controlla sempre che il tuo motore di serving supporti il formato scelto prima di quantizzare un modello.

Conclusione

La scelta del formato di quantizzazione è una decisione strategica basata sul caso d'uso. GGUF domina lo spazio locale, AWQ guida nella produzione, EXL2 regna nella nicchia dell'alta velocità e GPTQ rimane un'opzione solida ma più vecchia. Comprendendo queste differenze, puoi ottimizzare il tuo serving di LLM sia per le esigenze domestiche che aziendali.

Lavoriamo insieme

Hai bisogno di maggiori informazioni, aiuto con il tuo progetto o di sviluppare un'idea?

Che si tratti di una domanda semplice, un dubbio rapido o una chat di 5 minuti, mandami un messaggio—non costa nulla e sono sempre pronto ad aiutare. Mi piace ascoltare per capire il problema, essere creativo nelle soluzioni e puntare a idee semplici, affidabili e non complicate da realizzare rapidamente.

Contattami

Cambia Argomento

Scegli un argomento specializzato da esplorare: