Nucleus Sampling
Apprends comment l'échantillonnage de noyau (top-p) sélectionne les jetons pour la génération de texte par IA, et compare-le avec top-k, le décodage glouton et la température pour ajuster la diversité des sorties.
L'échantillonnage du noyau, également appelé échantillonnage top-p, est une méthode permettant de choisir le jeton suivant lors de la génération de texte par l'IA. Au lieu de toujours choisir le jeton le plus probable, le modèle élabore une liste restreinte dont les probabilités s'additionnent pour atteindre au moins un seuil choisi, puis effectue un échantillonnage aléatoire dans cette liste restreinte. La liste restreinte change à chaque prédiction : elle peut être petite lorsqu'une continuation est évidente et plus grande lorsque plusieurs continuations sont plausibles.
Comment fonctionne l'échantillonnage du noyau#
Un modèle linguistique attribue une probabilité à chaque jeton suivant possible. Ces probabilités sont généralement calculées à partir des scores de sortie du modèle à l'aide de la fonction softmax, ce qui permet aux valeurs d'avoir une somme égale à un. L'échantillonnage du noyau trie les jetons du plus probable au moins probable, les inclut jusqu'à ce que leur probabilité cumulative atteigne le seuil p, exclut le reste et effectue un échantillonnage parmi les jetons inclus. Ici, p représente la masse de probabilité, et non la probabilité d'un seul jeton. La documentation sur softmax de PyTorch explique la conversion de probabilité, tandis que le guide de décodage d'IBM décrit la coupure cumulative. (docs.pytorch.org)
Supposons que quatre jetons suivants possibles aient des probabilités de 0,50, 0,25, 0,15 et 0,10. Avec top_p=0.80, les deux premiers totalisent seulement 0,75, de sorte que le troisième est également inclus, ce qui porte la liste restreinte à 0,90. Le quatrième est exclu. Le modèle effectue ensuite un échantillonnage parmi les trois premiers en proportion de leurs probabilités après normalisation ; il n'accorde pas à chacun une chance égale. La coupure peut dépasser p parce que le jeton qui la franchit reste dans la liste restreinte. L'explication de top-p par Google Cloud décrit la même règle de sélection des jetons. (cloud.google.com)
Cette sélection se reproduit après chaque jeton généré. À mesure que la phrase se développe, le modèle calcule une nouvelle distribution et donc un nouveau noyau.
Top-p vs top-k, décodage glouton et température#
Ces paramètres affectent différentes parties de la génération :
- L'échantillonnage top-k conserve un nombre fixe de candidats, tels que les cinq jetons les plus probables. Top-p conserve suffisamment de candidats pour atteindre un seuil de probabilité, de sorte que sa liste restreinte n'a pas de taille fixe.
- Le décodage glouton sélectionne toujours le seul jeton le plus probable. Il est prévisible mais n'offre aucune des variations permises par l'échantillonnage.
- La température modifie la force avec laquelle le modèle privilégie les jetons à forte probabilité avant la sélection. Des températures plus basses concentrent la probabilité sur les choix principaux ; des températures plus élevées la répartissent plus largement. Top-p définit plutôt une coupure cumulative sur la distribution résultante.
Les implémentations peuvent combiner ces contrôles, mais leur interaction rend les résultats plus difficiles à interpréter. Lors de vos expérimentations, ne modifiez qu'un seul paramètre à la fois. La référence des paramètres des complations de chat d'OpenAI décrit top_p et recommande d'ajuster soit ce paramètre, soit la température plutôt que les deux en même temps. (platform.openai.com)
Où cela compte en pratique#
Dans un chatbot de service client, l'échantillonnage du noyau peut permettre plusieurs formulations naturelles d'une réponse de routine sans puiser dans toutes les continuations improbables. Par exemple, un assistant expliquant une politique de retour peut varier sa phrase d'ouverture tout en préservant les détails de la politique fournis dans son instruction. L'échantillonnage ne vérifie pas ces détails : une réponse fluide peut néanmoins être erronée, de sorte que les vérifications factuelles et un ancrage approprié restent nécessaires.
Dans la génération de légendes d'images, un modèle vision-langage peut disposer de plusieurs manières raisonnables de décrire la même scène de rue. Top-p peut varier la formulation des légendes tout en filtrant les choix de jetons à faible probabilité. Un pipeline visuel peut d'abord utiliser Ultralytics YOLO26 pour la détection d'objets, puis fournir les objets détectés comme contexte à un générateur de légendes. L'étape de détection de YOLO n'utilise pas l'échantillonnage du noyau pour choisir ses étiquettes d'objets ; le paramètre s'applique à l'étape de génération de langage en aval. Le didacticiel TensorFlow sur la génération de légendes d'images illustre la manière dont l'entrée visuelle et un décodeur de texte s'associent. (ibm.com)
Essayer top-p dans un flux de travail documenté#
L'interface LLM d'Ultralytics accepte des arguments de requête pour un point de terminaison de modèle linguistique compatible. Après avoir installé ultralytics[llm] et configuré OPENAI_API_KEY, cet exemple demande une réponse courte avec top_p=0.9 :
from ultralytics import LLM
# Use an endpoint that supports the top_p request argument.
llm = LLM("gpt-4.1-mini", api="chat.completions")
prompt = "Describe a city bus in one friendly sentence."
response = llm(prompt, top_p=0.9)
message = response.choices[0].message
print(message.content)Le code laisse la sélection des jetons au fournisseur du modèle linguistique. Son exécution à nouveau peut produire une formulation différente, mais top_p=0.9 ne garantit pas que chaque réponse sera différente. Vérifiez les paramètres pris en charge par le modèle sélectionné avant d'appliquer le même paramètre ailleurs.
Choisir un paramètre utile#
Commencez par la valeur par défaut du modèle, puis comparez les sorties sur des invites représentatives. Réduisez top_p si les réponses s'écartent vers des formulations improbables ; envisagez une valeur plus élevée si elles sont inutilement répétitives. Jugez le résultat en fonction de la tâche, et non de la seule variété. Pour les réponses aux clients ou les légendes, examinez l'exactitude factuelle et la présence des détails importants. Une liste restreinte plus étroite peut réduire certaines continuations inhabituelles, mais elle ne peut pas rendre vraies des déclarations non fondées. Les conseils d'IBM sur la génération de sorties précises traitent également les choix de décodage comme un seul élément d'un flux de travail de génération ancré. (ibm.com)









