Aller au contenu principal
Bluecoders
← Glossaire de la tech

vLLM / TGI / SGLang

OutilTechno

vLLM / TGI / SGLang = les moteurs qui font tourner les LLM

vLLM, TGI (Text Generation Inference) et SGLang sont des moteurs d'inférence open source qui servent à faire tourner un grand modèle de langage rapidement et efficacement sur GPU, en production.

Faire tourner un LLM naïvement gaspille beaucoup de mémoire et de temps de calcul. Ces moteurs appliquent des optimisations comme le regroupement continu des requêtes, une gestion fine de la mémoire du GPU (vLLM a popularisé la technique PagedAttention), la prise en charge des modèles quantifiés ou la répartition d'un modèle sur plusieurs cartes. Ils exposent en général une API compatible avec celle d'OpenAI.

vLLM est issu de travaux de recherche à l'université de Berkeley, TGI est développé par Hugging Face, SGLang provient lui aussi de la recherche académique. Ce sont des briques centrales des plateformes d'inférence construites sur des modèles à poids ouverts.

Pourquoi ça compte quand on recrute

Avoir contribué au code de l'un de ces projets est un très bon signal : cela montre une compréhension fine des GPU, de la mémoire et des performances, vérifiable publiquement sur GitHub. Avoir seulement lancé un serveur vLLM avec la configuration par défaut est un bon début, pas une expertise. Demandez quels paramètres le candidat a ajustés, pour quel gain mesuré.

Un besoin en recrutement ?

Décrivez votre besoin. Un recruteur de votre secteur vous rappelle.