Le choix matériel dépend de la forme de la charge. La quantification peut réduire la mémoire des poids, mais compatibilité, latence et qualité doivent être mesurées.
Ce que vous saurez faire
Séance de 2 heures
- Décrire, en une phrase chacun, ce à quoi un CPU et un GPU sont respectivement adaptés pour l’inférence LLM, et nommer la propriété de la charge qui tranche entre les deux.
- Séparer une requête en sa phase de prefill et sa phase de décodage, et expliquer pourquoi la première est parallèle et la seconde reste séquentielle d’une position de token à l’autre.
- Calculer une estimation de mémoire des poids avec paramètres × bits par poids ÷ 8 pour n’importe quelle taille de modèle et n’importe quelle précision, sans erreur de calcul.
- Énumérer au moins cinq postes de mémoire que cette estimation exclut : cache KV, activations, surcharge de l’allocateur, tampons d’exécution, métadonnées, couches non quantifiées.
- Rédiger une porte de sortie de quantification qui nomme la référence, les tâches représentatives et les mesures exigées avant promotion.
- Expliquer pourquoi un fichier de modèle plus petit ne garantit pas une latence plus faible, en citant au moins deux mécanismes concrets.
- Énoncer que la précision du cache KV et celle des poids sont des choix indépendants, et prédire la conséquence mémoire d’une confusion entre les deux.
Rôles CPU et GPU
Le CPU convient au contrôle, au prétraitement et aux charges modestes. Le GPU offre beaucoup d’unités parallèles et une forte bande passante pour les tenseurs. Le prefill est parallèle ; le décodage reste séquentiel entre positions.
Estimation mémoire
Une première estimation des poids vaut paramètres × bits par poids ÷ 8. Elle exclut cache KV, activations, surcoût de l’allocateur, buffers et parfois des couches non quantifiées.
Porte de sortie quantifiée
Comparer au modèle de référence sur des tâches représentatives. Relever qualité, TTFT, latence inter-token, débit, pic mémoire, matériel, runtime et hash de l’artefact.
Ouvrir l’outil interactif — CPU et GPU Ouvrir l’outil interactif — quantification
Vérification rapide
Un fichier plus petit garantit-il une latence plus basse ?
Afficher la réponse
Non. Kernels, déquantification, charge et matériel peuvent inverser le résultat.
Quantifier les poids réduit-il automatiquement le cache KV ?
Afficher la réponse
Non. La précision des poids et celle du cache sont deux choix distincts.
Mettre en pratique
Faites les trois ateliers, puis vérifiez-vous avec le quiz de 10 questions.