Aller au contenu principal
Bluecoders
← Glossaire de la tech

Quantization

MéthodeTechno

Quantization = le modèle compressé pour tourner moins cher

La quantization (quantification en français) est une technique qui réduit la précision des nombres utilisés pour stocker les paramètres d'un modèle d'IA, afin qu'il occupe moins de mémoire et s'exécute plus vite.

Un modèle stocke ses poids sous forme de nombres à virgule, souvent sur 16 ou 32 bits. La quantization les ramène à 8 bits, 4 bits, voire moins. Le modèle devient plus léger, tient sur un GPU plus modeste ou sur un ordinateur portable, et répond plus vite. La contrepartie : une possible perte de qualité, qu'il faut mesurer selon l'usage.

Il existe plusieurs méthodes (GPTQ, AWQ, formats GGUF pour l'exécution locale, etc.), appliquées après l'entraînement ou prises en compte pendant celui-ci. La quantization est très utilisée pour servir des modèles à poids ouverts en production et pour l'IA embarquée.

Pourquoi ça compte quand on recrute

Quantifier un modèle avec un outil tout fait prend quelques minutes. Savoir si la perte de qualité est acceptable pour un cas d'usage précis demande un vrai protocole d'évaluation, et c'est là que se voit le niveau. Posez la question : comment le candidat a-t-il mesuré l'impact de la quantization, sur quelles tâches, avec quel gain de coût ou de latence ? Ce savoir-faire se trouve chez les LLM engineers et ingénieurs inférence.

Un besoin en recrutement ?

Décrivez votre besoin. Un recruteur de votre secteur vous rappelle.