2026-07-28 · 5 min de lecture

GGUF, EXL2, GPTQ et AWQ : Une comparaison complète pour le service LLM

Découvrez les principales différences entre les formats de quantification GGUF, EXL2, GPTQ et AWQ et comment ils sont utilisés dans llama.cpp et vLLM pour les utilisateurs domestiques et d'entreprise.

Introduction

Les grands modèles de langage (LLM) modernes sont très gourmands en mémoire. Un modèle de 70 milliards de paramètres en pleine précision (FP16) nécessite environ 140 Go de VRAM, bien au-delà même des GPU grand public les plus puissants. La quantification réduit la précision des poids de 16 bits à 4 bits ou moins, réduisant considérablement les besoins en mémoire. Mais tous les formats de quantification ne se valent pas. Le choix entre GGUF, EXL2, GPTQ et AWQ dépend de votre matériel, de votre moteur de service et de vos priorités : portabilité, vitesse ou débit multi-utilisateur.

Aperçu des formats de quantification

GGUF (GPT-Generated Unified Format) est le format natif de llama.cpp et le plus polyvalent. Il fonctionne sur CPU, Apple Silicon, configurations mixtes CPU/GPU et prend en charge une large gamme de niveaux de quantification (2 à 8 bits). C'est la norme pour les déploiements locaux, mono-utilisateur et en périphérie. GPTQ (Generalized Post-Training Quantization) était le standard GPU de longue date. Il est optimisé pour les GPU NVIDIA et offre un bon équilibre entre compression et vitesse d'inférence, mais il est de plus en plus remplacé par des formats plus récents comme AWQ. AWQ (Activation-aware Weight Quantization) est la norme industrielle actuelle pour la production GPU. Il protège les poids importants en fonction des modèles d'activation, ce qui améliore la précision à la même largeur de bit. Il est hautement optimisé pour les noyaux GPU NVIDIA modernes (Marlin) et idéal pour le service à haut débit. EXL2 est le format du moteur ExLlamaV2. Il offre le contrôle le plus fin sur la largeur de bit (par exemple, 3,5, 4,25, 5,0 bits par poids) et permet d'adapter précisément un modèle dans une VRAM limitée. C'est souvent le format le plus rapide pour la génération mono-utilisateur sur les GPU NVIDIA grand public.

Tableau comparatif des formats

Comparaison des formats de quantification
FormatCaractéristiques principalesMeilleur pourMoteurs pris en charge
GGUFPortabilité maximale, nombreux bits, mélange CPU/GPUUtilisation locale, utilisateurs domestiques, périphériques, Apple Siliconllama.cpp, Ollama, LM Studio, (expérimental dans vLLM)
GPTQOptimisé GPU, mature, bon équilibreDéploiements GPU hérités, inférence basée sur NVIDIAvLLM, ExLlamaV1, AutoGPTQ
AWQQuantification consciente de l'activation, haute précision, noyau MarlinService de production, haut débit, GPU NVIDIA modernesvLLM, TGI, AWQ Engine
EXL2Contrôle de bit le plus fin, vitesse mono-utilisateur la plus élevéeMono-utilisateur, faible latence, GPU NVIDIA grand publicExLlamaV2
← Faites défiler vers la droite pour en voir plus →

Utilisation dans llama.cpp

llama.cpp est construit autour du format GGUF. C'est le moteur principal pour les utilisateurs qui ne possèdent pas de GPU NVIDIA haut de gamme dédié, qui ont besoin d'exécuter des modèles sur CPU ou Apple Silicon, ou qui ont besoin d'une solution universelle facile à configurer. Avec llama.cpp, vous pouvez décharger des parties d'un modèle sur le GPU tout en conservant le reste dans la RAM système (déchargement CPU+GPU). Cela permet d'exécuter de grands modèles même sur des appareils avec une VRAM limitée. Des outils comme Ollama et LM Studio utilisent llama.cpp en coulisse, faisant de GGUF le choix le plus simple pour les débutants. Pour les applications de chat locales, la génération de texte sur un ordinateur portable ou les appareils périphériques, GGUF est le champion incontesté.

Utilisation dans vLLM

vLLM est conçu pour les environnements de production à haut débit. Il implémente PagedAttention et le traitement par lots continu pour servir de nombreux utilisateurs simultanément. Nativement, vLLM prend en charge AWQ et GPTQ. Ce sont les formats que vous devez utiliser lors du déploiement de vLLM en production. AWQ est préféré en raison de sa précision et de sa vitesse supérieures (en particulier avec le noyau Marlin). GPTQ est toujours pris en charge, mais pour les nouveaux projets, AWQ est recommandé. GGUF n'est pris en charge qu'expérimentalement dans vLLM et ne convient pas à la production (il est souvent plus lent et moins optimisé). EXL2 n'est pas pris en charge par vLLM ; il est exclusif au moteur ExLlamaV2, optimisé pour la faible latence mono-utilisateur.

Choisir le bon format

Pour les utilisateurs domestiques ou le développement local : Utilisez GGUF avec llama.cpp (ou des outils comme Ollama). C'est le plus compatible, fonctionne sur presque tous les matériels et est facile à gérer. Pour les entreprises ou le service à haut débit : Utilisez AWQ avec vLLM sur GPU NVIDIA. Il offre le meilleur équilibre entre vitesse, précision et évolutivité pour servir plusieurs utilisateurs simultanément. Pour les utilisateurs avancés (vitesse mono-utilisateur) : Si vous avez un GPU NVIDIA et souhaitez la vitesse de génération la plus rapide pour un seul utilisateur, utilisez EXL2 avec le moteur ExLlamaV2. Vérifiez toujours que votre moteur de service prend en charge le format choisi avant de quantifier un modèle.

Conclusion

Le choix du format de quantification est une décision stratégique basée sur votre cas d'utilisation. GGUF domine l'espace local, AWQ mène en production, EXL2 règne sur le créneau de la haute vitesse et GPTQ reste une option solide mais plus ancienne. En comprenant ces différences, vous pouvez optimiser votre service LLM pour les besoins domestiques et d'entreprise.

Travaillons ensemble

Vous avez besoin de plus d'informations, d'aide pour votre projet ou pour développer une idée?

Qu'il s'agisse d'une question simple, d'un doute rapide ou d'une discussion de 5 minutes, envoyez-moi un message—cela ne coûte rien et je suis toujours prêt à vous aider. J'aime comprendre un problème, être créatif dans les solutions et me concentrer sur des idées simples, fiables et faciles à réaliser rapidement.

Me contacter

Changer de sujet

Choisissez un sujet spécialisé à explorer: