Quantization
Quantization = le modèle compressé pour tourner moins cher
La quantization (quantification en français) est une technique qui réduit la précision des nombres utilisés pour stocker les paramètres d'un modèle d'IA, afin qu'il occupe moins de mémoire et s'exécute plus vite.
Un modèle stocke ses poids sous forme de nombres à virgule, souvent sur 16 ou 32 bits. La quantization les ramène à 8 bits, 4 bits, voire moins. Le modèle devient plus léger, tient sur un GPU plus modeste ou sur un ordinateur portable, et répond plus vite. La contrepartie : une possible perte de qualité, qu'il faut mesurer selon l'usage.
Il existe plusieurs méthodes (GPTQ, AWQ, formats GGUF pour l'exécution locale, etc.), appliquées après l'entraînement ou prises en compte pendant celui-ci. La quantization est très utilisée pour servir des modèles à poids ouverts en production et pour l'IA embarquée.
Pourquoi ça compte quand on recrute
Quantifier un modèle avec un outil tout fait prend quelques minutes. Savoir si la perte de qualité est acceptable pour un cas d'usage précis demande un vrai protocole d'évaluation, et c'est là que se voit le niveau. Posez la question : comment le candidat a-t-il mesuré l'impact de la quantization, sur quelles tâches, avec quel gain de coût ou de latence ? Ce savoir-faire se trouve chez les LLM engineers et ingénieurs inférence.
