Las últimas novedades de OpenAI: Canvas, ajuste fino de visión y más
Acompáñanos para analizar más de cerca las recientes actualizaciones de ChatGPT publicadas por OpenAI. Exploraremos Canvas, el ajuste fino para capacidades de visión y la última función de búsqueda.

La última vez que analizamos los modelos o1 de OpenAI en septiembre (diseñados para mejorar el razonamiento), se han añadido muchas funciones nuevas e interesantes a ChatGPT. Algunas de estas novedades están orientadas a desarrolladores, mientras que otras están diseñadas para perfeccionar la experiencia de usuario. En general, cada actualización ayuda a que las interacciones con ChatGPT sean más intuitivas y eficaces.
Novedades como Canvas, diseñado para la escritura y programación colaborativas, y el ajuste fino de las capacidades de visión, que mejora la forma en que ChatGPT trabaja con imágenes, han despertado mucho interés y han animado a los usuarios a explorar posibilidades más creativas. Mientras tanto, las mejoras técnicas, como las nuevas API y los informes de pruebas de equidad, abordan aspectos como la integración de modelos y las prácticas de IA ética. ¡Vamos a profundizar para entender mejor las últimas funciones de ChatGPT de OpenAI!
Descripción general de la función Canvas de OpenAI#
Canvas es la primera gran actualización de la interfaz de usuario (UI) de ChatGPT desde su lanzamiento. Es una nueva interfaz con una disposición de dos pantallas, los prompts en la barra lateral izquierda y las respuestas en la ventana derecha. La nueva UI elimina el flujo de trabajo habitual de una estructura de chat de una sola pantalla y adopta una disposición de dos pantallas adecuada para realizar varias tareas a la vez y aumentar la productividad.

Fig. 1. Canvas incorpora actualizaciones de la UI a ChatGPT.
Antes de la introducción de Canvas, trabajar con documentos extensos en ChatGPT implicaba tener que desplazarse bastante hacia arriba y hacia abajo. En la nueva disposición, los prompts se muestran en la barra lateral izquierda, mientras que el documento de texto o el fragmento de código ocupa la mayor parte de la pantalla. Si lo necesitas, incluso puedes personalizar el tamaño de la barra lateral izquierda y de la pantalla de salida. Además, puedes seleccionar una parte del texto o una sección de código y editar esa sección concreta sin modificar todo el documento.

Fig. 2. Edita secciones concretas de texto mediante Canvas.
Si utilizas Canvas, observarás que no hay ningún botón ni interruptor específico para abrirlo en la interfaz de ChatGPT. En su lugar, cuando trabajas con el modelo GPT-4o, Canvas se abre automáticamente si detecta que estás editando, escribiendo o programando. Para prompts más sencillos, permanece inactivo. Si quieres abrirlo manualmente, puedes utilizar prompts como "Open the Canvas" o "Get me the Canvas layout."
Actualmente, Canvas está en fase beta y solo está disponible con GPT-4o. Sin embargo, OpenAI ha indicado que Canvas estará disponible para todos los usuarios gratuitos cuando salga de la fase beta.
Actualizaciones de la API de ChatGPT#
OpenAI ha lanzado tres nuevas actualizaciones de la API de ChatGPT destinadas a mejorar la eficiencia, la escalabilidad y la versatilidad. Veamos más de cerca cada una de estas novedades.
Destilación de modelos#
Mediante la función Model Distillation de las API de OpenAI, los desarrolladores pueden utilizar las salidas de modelos avanzados como GPT-4o u o1-preview para mejorar el rendimiento de modelos más pequeños y rentables como GPT-4o mini. La destilación de modelos es un proceso que consiste en entrenar modelos más pequeños para que imiten el comportamiento de otros más avanzados, lo que los hace más eficientes para tareas específicas.
Antes de introducir esta función, los desarrolladores tenían que coordinar manualmente diversas tareas utilizando distintas herramientas. Estas tareas incluían generar conjuntos de datos, medir el rendimiento del modelo y realizar el ajuste fino de los modelos, lo que a menudo hacía que el proceso fuera complejo y propenso a errores. La actualización Model Distillation permite a los desarrolladores utilizar Stored Completions, una herramienta que les permite generar conjuntos de datos automáticamente capturando y almacenando los pares de entrada y salida producidos por modelos avanzados mediante la API.
Otra función de Model Distillation, Evals (actualmente en fase beta), ayuda a medir el rendimiento de un modelo en tareas específicas, sin necesidad de crear scripts de evaluación personalizados ni utilizar herramientas independientes. Al utilizar conjuntos de datos generados con Stored Completions y evaluar el rendimiento con Evals, los desarrolladores pueden ajustar sus propios modelos GPT personalizados.

Fig. 3. Puedes utilizar Evals para medir el rendimiento del modelo.
Almacenamiento en caché de prompts#
A menudo, al crear aplicaciones de IA, especialmente chatbots, se utiliza repetidamente el mismo contexto (la información de fondo o el historial de conversaciones previas necesarios para entender la solicitud actual) en varias llamadas a la API. Prompt Caching permite a los desarrolladores reutilizar tokens de entrada usados recientemente (segmentos de texto que el modelo procesa para entender el prompt y generar una respuesta), lo que ayuda a reducir el coste y la latencia.
Desde el 1 de octubre, OpenAI ha aplicado automáticamente Prompt Caching a sus modelos, como GPT-4o, GPT-4o mini, o1-preview y o1-mini. Esto significa que, cuando los desarrolladores utilizan la API para interactuar con un modelo con un prompt largo (de más de 1.024 tokens), el sistema guarda las partes que ya ha procesado.
De este modo, si se vuelven a utilizar prompts iguales o similares, puede omitir el recálculo de esas partes. El sistema almacena automáticamente en caché la parte más larga del prompt que ha encontrado anteriormente, empezando por 1.024 tokens y añadiendo bloques de 128 tokens a medida que el prompt se alarga.
API en tiempo real#
Crear un asistente de voz suele implicar transcribir audio a texto, procesar el texto y volver a convertirlo en audio para reproducir la respuesta. La API en tiempo real de OpenAI pretende gestionar todo este proceso con una única solicitud a la API. Al simplificar el proceso, la API permite mantener conversaciones en tiempo real con la IA.
Por ejemplo, un asistente de voz integrado con la API en tiempo real puede realizar acciones específicas, como hacer un pedido o buscar información, basándose en las solicitudes de los usuarios. La API hace que el asistente de voz responda mejor y pueda adaptarse rápidamente a las necesidades de los usuarios. La API en tiempo real estuvo disponible en beta pública el 1 de octubre, con seis voces. El 30 de octubre se añadieron cinco voces más, hasta alcanzar un total de once voces disponibles.

Fig. 4. Ejemplo del uso de la API en tiempo real para practicar conversaciones en un idioma nuevo.
Ajuste fino de ChatGPT para tareas de visión#
Originalmente, el modelo de lenguaje y visión GPT-4o solo podía ajustarse y personalizarse utilizando conjuntos de datos exclusivamente de texto. Ahora, con el lanzamiento de la API de ajuste fino de visión, los desarrolladores pueden entrenar y personalizar GPT-4o utilizando conjuntos de datos de imágenes. Desde su lanzamiento, el ajuste fino de visión se ha convertido en un tema de gran interés entre desarrolladores e ingenieros de visión artificial.
Para ajustar las capacidades de visión de GPT-4o, los desarrolladores pueden utilizar conjuntos de datos de imágenes que van desde tan solo 100 imágenes hasta 50.000. Después de comprobar que el conjunto de datos cumple el formato requerido por OpenAI, se puede cargar en la plataforma de OpenAI y ajustar el modelo para aplicaciones específicas.
Por ejemplo, Automat, una empresa de automatización, utilizó un conjunto de datos de capturas de pantalla para entrenar GPT-4o con el fin de identificar elementos de UI en una pantalla a partir de una descripción. Esto ayuda a optimizar la Automatización robótica de procesos (RPA), ya que facilita que los bots interactúen con interfaces de usuario. En lugar de depender de coordenadas fijas o reglas de selectores complejas, el modelo puede identificar elementos de UI a partir de descripciones sencillas, lo que hace que las configuraciones de automatización sean más adaptables y fáciles de mantener cuando cambian las interfaces.

Fig. 5. Uso de una versión ajustada del modelo GPT-4o para detectar elementos de UI.
Equidad y detección de sesgos en ChatGPT#
Las preocupaciones éticas en torno a las aplicaciones de IA son un tema de conversación destacado a medida que la IA se vuelve cada vez más avanzada. Como las respuestas de ChatGPT se basan en los prompts proporcionados por los usuarios y en los datos disponibles en Internet, puede resultar difícil ajustar su lenguaje para que sea siempre responsable. Los informes indican que las respuestas de ChatGPT están sesgadas en función del nombre, el género y la raza. Para abordar este problema, el equipo interno de OpenAI llevó a cabo una primera prueba de equidad en primera persona.
Los nombres suelen contener indicios sutiles sobre nuestra cultura y factores geográficos. En la mayoría de los casos, ChatGPT ignora esos indicios sutiles de los nombres. Sin embargo, en algunos casos, los nombres que reflejan raza o cultura provocan respuestas diferentes de ChatGPT, y alrededor del 1 % de ellas contienen lenguaje dañino. Eliminar los sesgos y el lenguaje dañino es una tarea difícil para un modelo de lenguaje. No obstante, al compartir públicamente estos hallazgos y reconocer las limitaciones del modelo, OpenAI ayuda a los usuarios a perfeccionar sus prompts para obtener respuestas más neutrales e imparciales.

Fig. 6. Ejemplo de respuestas diferentes debido al nombre del usuario.
Entender la búsqueda de ChatGPT#
Cuando se lanzó ChatGPT por primera vez, en la comunidad de IA se debatía si podría sustituir a la navegación web tradicional. Ahora, muchos usuarios utilizan ChatGPT en lugar de Google Search.
La nueva actualización de OpenAI, la función Search, lleva esto un paso más allá. Con Search, ChatGPT genera respuestas actualizadas e incluye enlaces a fuentes relevantes. Desde el 31 de octubre, la función Search está disponible para todos los usuarios de ChatGPT Plus y Team, lo que hace que ChatGPT funcione más como un motor de búsqueda basado en IA.

Fig. 7. Ejemplo del uso de la nueva función Search de ChatGPT.
El camino por delante#
Las últimas actualizaciones de ChatGPT se centran en hacer que la IA sea más útil, flexible y justa. La nueva función Canvas ayuda a los usuarios a trabajar de forma más eficiente, mientras que el ajuste fino de visión permite a los desarrolladores personalizar los modelos para gestionar mejor las tareas visuales. Abordar la equidad y reducir los sesgos también son prioridades clave para garantizar que la IA funcione bien para todo el mundo, independientemente de quién sea. Tanto si eres un desarrollador que ajusta modelos como si simplemente utilizas las funciones más recientes, ChatGPT evoluciona para satisfacer una amplia variedad de necesidades. Con capacidades en tiempo real, integración visual y un enfoque centrado en el uso responsable, estas actualizaciones están creando una experiencia de IA más fiable y digna de confianza para todos.
Descubre más sobre la IA visitando nuestro repositorio de GitHub y uniéndote a nuestra comunidad. Obtén más información sobre las aplicaciones de IA en la conducción autónoma y la atención sanitaria.









