Nucleus Sampling
Aprende cómo el muestreo por núcleo (top-p) selecciona tokens para la generación de texto con inteligencia artificial, y compáralo con top-k, la descodificación ávida y la temperatura para ajustar la diversidad de la salida.
El muestreo de núcleo, también llamado muestreo top-p, es una forma de elegir el siguiente token durante la generación de texto mediante inteligencia artificial. En lugar de elegir siempre el token más probable, el modelo crea una lista corta cuyas probabilidades suman al menos un umbral elegido, y luego selecciona aleatoriamente de esa lista corta. La lista corta cambia con cada predicción: puede ser pequeña cuando una continuación es obvia y más grande cuando varias continuaciones son plausibles.
Cómo funciona el muestreo de núcleo#
Un modelo de lenguaje asigna una probabilidad a cada posible siguiente token. Estas probabilidades se calculan comúnmente a partir de las puntuaciones de salida del modelo utilizando softmax, lo que hace que los valores sumen uno. El muestreo de núcleo ordena los tokens del más al menos probable, los incluye hasta que su probabilidad acumulada alcanza el umbral p, excluye el resto y realiza el muestreo a partir de los tokens incluidos. Aquí, p representa la masa de probabilidad, no la probabilidad de un solo token individual. La documentación de PyTorch sobre softmax explica la conversión de probabilidad, mientras que la guía de descodificación de IBM describe el corte acumulativo. (docs.pytorch.org)
Supón que cuatro posibles tokens siguientes tienen probabilidades de 0,50, 0,25, 0,15 y 0,10. Con top_p=0.80, los dos primeros suman solo 0,75, por lo que el tercero también se incluye, elevando la lista corta a 0,90. El cuarto queda excluido. A continuación, el modelo realiza el muestreo entre los primeros tres en proporción a sus probabilidades tras la normalización; no les da a cada uno las mismas oportunidades. El punto de corte puede superar a p porque el token que lo cruza permanece en la lista corta. La explicación de Google Cloud sobre top-p describe la misma regla de selección de tokens. (cloud.google.com)
Esta selección ocurre nuevamente después de cada token generado. A medida que la oración se desarrolla, el modelo calcula una nueva distribución y, por lo tanto, un nuevo núcleo.
Top-p frente a top-k, descodificación voraz y temperatura#
Estos ajustes afectan a diferentes partes de la generación:
- El muestreo top-k mantiene un número fijo de candidatos, como los cinco tokens más probables. Top-p mantiene suficientes candidatos para alcanzar un umbral de probabilidad, por lo que su lista corta no tiene un tamaño fijo.
- La descodificación voraz siempre selecciona el único token más probable. Es predecible, pero no ofrece ninguna de las variaciones que permite el muestreo.
- La temperatura cambia la intensidad con la que el modelo favorece los tokens de alta probabilidad antes de la selección. Las temperaturas más bajas concentran la probabilidad en las opciones principales; las temperaturas más altas la distribuyen de forma más amplia. En su lugar, top-p establece un corte acumulativo en la distribución resultante.
Las implementaciones pueden combinar estos controles, pero su interacción dificulta la interpretación de los resultados. Al experimentar, cambia un solo ajuste a la vez. La referencia de parámetros de Chat Completions de OpenAI describe top_p y recomienda ajustar este parámetro o la temperatura en lugar de ambos a la vez. (platform.openai.com)
Dónde importa en la práctica#
En un chatbot de atención al cliente, el muestreo de núcleo puede permitir varias formulaciones naturales de una respuesta rutinaria sin recurrir a todas las continuaciones improbables. Por ejemplo, un asistente que explique una política de devoluciones puede variar su oración inicial mientras preserva los detalles de la política proporcionados en su instrucción. El muestreo no verifica esos detalles: una respuesta fluida aún puede ser errónea, por lo que las comprobaciones de hechos y la fundamentación adecuada siguen siendo necesarias.
En el subtitulado de imágenes, un modelo de visión y lenguaje puede tener varias formas razonables de describir la misma escena callejera. Top-p puede variar la redacción de los subtítulos mientras filtra las opciones de tokens de baja probabilidad. Una canalización visual puede utilizar primero Ultralytics YOLO26 para la detección de objetos y, a continuación, proporcionar los objetos detectados como contexto a un generador de subtítulos. El paso de detección de YOLO no utiliza el muestreo de núcleo para elegir las etiquetas de los objetos; el ajuste se aplica al paso posterior de generación de lenguaje. El tutorial de subtitulado de imágenes de TensorFlow ilustra cómo encajan la entrada visual y un descodificador de texto. (ibm.com)
Cómo probar top-p en un flujo de trabajo documentado#
La interfaz de LLM de Ultralytics acepta argumentos de solicitud para un punto de conexión de modelo de lenguaje compatible. Tras instalar ultralytics[llm] y configurar OPENAI_API_KEY, este ejemplo solicita una respuesta corta con top_p=0.9:
from ultralytics import LLM
# Use an endpoint that supports the top_p request argument.
llm = LLM("gpt-4.1-mini", api="chat.completions")
prompt = "Describe a city bus in one friendly sentence."
response = llm(prompt, top_p=0.9)
message = response.choices[0].message
print(message.content)El código deja la selección de tokens en manos del proveedor del modelo de lenguaje. Ejecutarlo de nuevo puede producir una redacción diferente, pero top_p=0.9 no es una promesa de que cada respuesta vaya a diferir. Comprueba los parámetros compatibles del modelo seleccionado antes de aplicar el mismo ajuste en otra parte.
Cómo elegir un ajuste útil#
Empieza con el valor predeterminado del modelo y, a continuación, compara las salidas en instrucciones representativas. Reduce top_p si las respuestas se desvían hacia una redacción improbable; considera un valor más alto si son repetitivas sin necesidad. Juzga el resultado según la tarea, no solo por la variedad. En el caso de respuestas de clientes o subtítulos, revisa la precisión de los hechos y si están presentes los detalles importantes. Una lista corta más estrecha puede reducir algunas continuaciones inusuales, pero no puede hacer que las declaraciones sin fundamento sean verdaderas. La orientación de IBM sobre cómo generar resultados precisos también trata las elecciones de descodificación como un solo componente de un flujo de trabajo de generación fundamentado. (ibm.com)









