Session systèmes 1/4 · Quiz et corrigé

Tokenizers et budgets de tokens

10 questions, une seule bonne réponse par question. L’objectif est de vérifier que vous savez raisonner dans l’espace des tokens : ce que produit un tokenizer, ce qui consomme la fenêtre de contexte, et ce qui doit être mesuré plutôt qu’estimé.

1. Que fait un tokenizer ?

Afficher la réponse

B — Le modèle opère sur des identifiants entiers issus d’un vocabulaire fixe. Le tokenizer est la correspondance entre le texte et cette suite d’identifiants, dans les deux sens.

2. La même phrase donne 14 tokens avec un tokenizer et 19 avec un autre. Qu’en conclure ?

Afficher la réponse

C — Les vocabulaires et les règles de fusion diffèrent d’une famille de modèles à l’autre. Un compte n’a de sens que si le tokenizer qui l’a produit est identifié.

3. Lequel de ces éléments peut constituer un token unique ?

Afficher la réponse

C — Les vocabulaires en sous-mots contiennent des fragments, de la ponctuation, des morceaux précédés d’une espace et des replis au niveau des octets, ce qui permet d’encoder même un texte inconnu.

4. Quels éléments doivent figurer dans le budget de tokens d’une requête ?

Afficher la réponse

C — La fenêtre de contexte contient toute la requête rendue, et la sortie générée doit y tenir également. Omettre la sortie réservée est l’erreur de budgétisation la plus fréquente.

5. Une requête demande 7 000 tokens d’entrée et une réponse de 1 500 tokens, dans une fenêtre de 8 000 tokens. Que se passe-t-il ?

Afficher la réponse

B — L’entrée et la sortie réservée doivent tenir dans la même fenêtre. Ici 8 500 dépasse 8 000 : soit l’entrée est réduite, soit la génération s’arrête prématurément.

6. Pourquoi la prose française coûte-t-elle généralement plus de tokens que la prose anglaise équivalente ?

Afficher la réponse

B — Les règles de fusion sont apprises sur les données d’entraînement. Un texte sous-représenté dans ces données est découpé en morceaux plus petits et plus nombreux, souvent 15 à 30 pour cent de plus pour le français, la valeur exacte dépendant du tokenizer.

7. Quel est le bon usage d’une règle empirique caractères par token ?

Afficher la réponse

C — Le ratio varie selon la langue, la mise en forme et le type de contenu. Il est utile pour un premier dimensionnement, mais tout contrôle qui conditionne ou tronque une requête doit utiliser le tokenizer réel.

8. Pourquoi faut-il épingler le tokenizer et le chat template à la même révision de modèle ?

Afficher la réponse

B — Une révision peut changer le vocabulaire, les tokens spéciaux ou la mise en forme du template. Un appariement incorrect fonctionne quand même, et c’est précisément ce qui rend la panne difficile à repérer.

9. Le budget est dépassé. Quelle est la réponse d’ingénierie saine ?

Afficher la réponse

B — Quelque chose est toujours supprimé quand la fenêtre déborde. Rendre la politique explicite transforme une perte invisible et arbitraire en une décision de conception révisable.

10. Quel jeu de tests sollicite le mieux une chaîne de tokenisation ?

Afficher la réponse

C — Les défaillances se concentrent aux frontières : écritures non latines, replis au niveau des octets, tokens spéciaux du template, et texte coupé au milieu d’un caractère codé sur plusieurs tokens.

Barème

Barème : 8 à 10 bonnes réponses — vous savez budgétiser une requête et défendre vos chiffres ; passez aux séances sur la récupération et l’assemblage de contexte. 5 à 7 bonnes réponses — les concepts tiennent mais l’arithmétique du budget est fragile ; refaites l’atelier B avec une autre requête avant de continuer. Moins de 5 — relisez les messages clés et refaites l’atelier A avec vos propres textes ; la suite du parcours suppose que vous raisonnez par défaut dans l’espace des tokens.

Cours apprenant · Aller aux exercices