YOLO Vision 2026:
IA visual

Las últimas novedades de OpenAI: Canvas, ajuste fino de visión y más

Acompáñanos para analizar más de cerca las recientes actualizaciones de ChatGPT publicadas por OpenAI. Exploraremos Canvas, el ajuste fino para capacidades de visión y la última función de búsqueda.

ABAbirami Vina4 min read
Descripción general de las últimas actualizaciones de ChatGPT de OpenAI

La última vez que analizamos los modelos o1 de OpenAI en septiembre (diseñados para mejorar el razonamiento), se han añadido muchas funciones nuevas e interesantes a ChatGPT. Algunas de estas novedades están orientadas a desarrolladores, mientras que otras están diseñadas para perfeccionar la experiencia de usuario. En general, cada actualización ayuda a que las interacciones con ChatGPT sean más intuitivas y eficaces.

Novedades como Canvas, diseñado para la escritura y programación colaborativas, y el ajuste fino de las capacidades de visión, que mejora la forma en que ChatGPT trabaja con imágenes, han despertado mucho interés y han animado a los usuarios a explorar posibilidades más creativas. Mientras tanto, las mejoras técnicas, como las nuevas API y los informes de pruebas de equidad, abordan aspectos como la integración de modelos y las prácticas de IA ética. ¡Vamos a profundizar para entender mejor las últimas funciones de ChatGPT de OpenAI!

Descripción general de la función Canvas de OpenAI#

Canvas es la primera gran actualización de la interfaz de usuario (UI) de ChatGPT desde su lanzamiento. Es una nueva interfaz con una disposición de dos pantallas, los prompts en la barra lateral izquierda y las respuestas en la ventana derecha. La nueva UI elimina el flujo de trabajo habitual de una estructura de chat de una sola pantalla y adopta una disposición de dos pantallas adecuada para realizar varias tareas a la vez y aumentar la productividad.

Canvas incorpora actualizaciones de la UI a ChatGPT

Fig. 1. Canvas incorpora actualizaciones de la UI a ChatGPT.

Antes de la introducción de Canvas, trabajar con documentos extensos en ChatGPT implicaba tener que desplazarse bastante hacia arriba y hacia abajo. En la nueva disposición, los prompts se muestran en la barra lateral izquierda, mientras que el documento de texto o el fragmento de código ocupa la mayor parte de la pantalla. Si lo necesitas, incluso puedes personalizar el tamaño de la barra lateral izquierda y de la pantalla de salida. Además, puedes seleccionar una parte del texto o una sección de código y editar esa sección concreta sin modificar todo el documento.

Edición de secciones concretas de texto mediante Canvas

Fig. 2. Edita secciones concretas de texto mediante Canvas.

Si utilizas Canvas, observarás que no hay ningún botón ni interruptor específico para abrirlo en la interfaz de ChatGPT. En su lugar, cuando trabajas con el modelo GPT-4o, Canvas se abre automáticamente si detecta que estás editando, escribiendo o programando. Para prompts más sencillos, permanece inactivo. Si quieres abrirlo manualmente, puedes utilizar prompts como "Open the Canvas" o "Get me the Canvas layout."

Actualmente, Canvas está en fase beta y solo está disponible con GPT-4o. Sin embargo, OpenAI ha indicado que Canvas estará disponible para todos los usuarios gratuitos cuando salga de la fase beta.

Actualizaciones de la API de ChatGPT#

OpenAI ha lanzado tres nuevas actualizaciones de la API de ChatGPT destinadas a mejorar la eficiencia, la escalabilidad y la versatilidad. Veamos más de cerca cada una de estas novedades.

Destilación de modelos#

Mediante la función Model Distillation de las API de OpenAI, los desarrolladores pueden utilizar las salidas de modelos avanzados como GPT-4o u o1-preview para mejorar el rendimiento de modelos más pequeños y rentables como GPT-4o mini. La destilación de modelos es un proceso que consiste en entrenar modelos más pequeños para que imiten el comportamiento de otros más avanzados, lo que los hace más eficientes para tareas específicas.

Antes de introducir esta función, los desarrolladores tenían que coordinar manualmente diversas tareas utilizando distintas herramientas. Estas tareas incluían generar conjuntos de datos, medir el rendimiento del modelo y realizar el ajuste fino de los modelos, lo que a menudo hacía que el proceso fuera complejo y propenso a errores. La actualización Model Distillation permite a los desarrolladores utilizar Stored Completions, una herramienta que les permite generar conjuntos de datos automáticamente capturando y almacenando los pares de entrada y salida producidos por modelos avanzados mediante la API.

Otra función de Model Distillation, Evals (actualmente en fase beta), ayuda a medir el rendimiento de un modelo en tareas específicas, sin necesidad de crear scripts de evaluación personalizados ni utilizar herramientas independientes. Al utilizar conjuntos de datos generados con Stored Completions y evaluar el rendimiento con Evals, los desarrolladores pueden ajustar sus propios modelos GPT personalizados.

Uso de Evals para medir el rendimiento del modelo

Fig. 3. Puedes utilizar Evals para medir el rendimiento del modelo.

Almacenamiento en caché de prompts#

A menudo, al crear aplicaciones de IA, especialmente chatbots, se utiliza repetidamente el mismo contexto (la información de fondo o el historial de conversaciones previas necesarios para entender la solicitud actual) en varias llamadas a la API. Prompt Caching permite a los desarrolladores reutilizar tokens de entrada usados recientemente (segmentos de texto que el modelo procesa para entender el prompt y generar una respuesta), lo que ayuda a reducir el coste y la latencia.

Desde el 1 de octubre, OpenAI ha aplicado automáticamente Prompt Caching a sus modelos, como GPT-4o, GPT-4o mini, o1-preview y o1-mini. Esto significa que, cuando los desarrolladores utilizan la API para interactuar con un modelo con un prompt largo (de más de 1.024 tokens), el sistema guarda las partes que ya ha procesado.

De este modo, si se vuelven a utilizar prompts iguales o similares, puede omitir el recálculo de esas partes. El sistema almacena automáticamente en caché la parte más larga del prompt que ha encontrado anteriormente, empezando por 1.024 tokens y añadiendo bloques de 128 tokens a medida que el prompt se alarga.

API en tiempo real#

Crear un asistente de voz suele implicar transcribir audio a texto, procesar el texto y volver a convertirlo en audio para reproducir la respuesta. La API en tiempo real de OpenAI pretende gestionar todo este proceso con una única solicitud a la API. Al simplificar el proceso, la API permite mantener conversaciones en tiempo real con la IA.

Por ejemplo, un asistente de voz integrado con la API en tiempo real puede realizar acciones específicas, como hacer un pedido o buscar información, basándose en las solicitudes de los usuarios. La API hace que el asistente de voz responda mejor y pueda adaptarse rápidamente a las necesidades de los usuarios. La API en tiempo real estuvo disponible en beta pública el 1 de octubre, con seis voces. El 30 de octubre se añadieron cinco voces más, hasta alcanzar un total de once voces disponibles.

Uso de la API en tiempo real para practicar conversaciones en un idioma nuevo

Fig. 4. Ejemplo del uso de la API en tiempo real para practicar conversaciones en un idioma nuevo.

Ajuste fino de ChatGPT para tareas de visión#

Originalmente, el modelo de lenguaje y visión GPT-4o solo podía ajustarse y personalizarse utilizando conjuntos de datos exclusivamente de texto. Ahora, con el lanzamiento de la API de ajuste fino de visión, los desarrolladores pueden entrenar y personalizar GPT-4o utilizando conjuntos de datos de imágenes. Desde su lanzamiento, el ajuste fino de visión se ha convertido en un tema de gran interés entre desarrolladores e ingenieros de visión artificial.

Para ajustar las capacidades de visión de GPT-4o, los desarrolladores pueden utilizar conjuntos de datos de imágenes que van desde tan solo 100 imágenes hasta 50.000. Después de comprobar que el conjunto de datos cumple el formato requerido por OpenAI, se puede cargar en la plataforma de OpenAI y ajustar el modelo para aplicaciones específicas.

Por ejemplo, Automat, una empresa de automatización, utilizó un conjunto de datos de capturas de pantalla para entrenar GPT-4o con el fin de identificar elementos de UI en una pantalla a partir de una descripción. Esto ayuda a optimizar la Automatización robótica de procesos (RPA), ya que facilita que los bots interactúen con interfaces de usuario. En lugar de depender de coordenadas fijas o reglas de selectores complejas, el modelo puede identificar elementos de UI a partir de descripciones sencillas, lo que hace que las configuraciones de automatización sean más adaptables y fáciles de mantener cuando cambian las interfaces.

Uso de un modelo GPT-4o ajustado para detectar elementos de UI

Fig. 5. Uso de una versión ajustada del modelo GPT-4o para detectar elementos de UI.

Equidad y detección de sesgos en ChatGPT#

Las preocupaciones éticas en torno a las aplicaciones de IA son un tema de conversación destacado a medida que la IA se vuelve cada vez más avanzada. Como las respuestas de ChatGPT se basan en los prompts proporcionados por los usuarios y en los datos disponibles en Internet, puede resultar difícil ajustar su lenguaje para que sea siempre responsable. Los informes indican que las respuestas de ChatGPT están sesgadas en función del nombre, el género y la raza. Para abordar este problema, el equipo interno de OpenAI llevó a cabo una primera prueba de equidad en primera persona.

Los nombres suelen contener indicios sutiles sobre nuestra cultura y factores geográficos. En la mayoría de los casos, ChatGPT ignora esos indicios sutiles de los nombres. Sin embargo, en algunos casos, los nombres que reflejan raza o cultura provocan respuestas diferentes de ChatGPT, y alrededor del 1 % de ellas contienen lenguaje dañino. Eliminar los sesgos y el lenguaje dañino es una tarea difícil para un modelo de lenguaje. No obstante, al compartir públicamente estos hallazgos y reconocer las limitaciones del modelo, OpenAI ayuda a los usuarios a perfeccionar sus prompts para obtener respuestas más neutrales e imparciales.

Ejemplo de respuestas diferentes de ChatGPT debido al nombre del usuario

Fig. 6. Ejemplo de respuestas diferentes debido al nombre del usuario.

Entender la búsqueda de ChatGPT#

Cuando se lanzó ChatGPT por primera vez, en la comunidad de IA se debatía si podría sustituir a la navegación web tradicional. Ahora, muchos usuarios utilizan ChatGPT en lugar de Google Search.

La nueva actualización de OpenAI, la función Search, lleva esto un paso más allá. Con Search, ChatGPT genera respuestas actualizadas e incluye enlaces a fuentes relevantes. Desde el 31 de octubre, la función Search está disponible para todos los usuarios de ChatGPT Plus y Team, lo que hace que ChatGPT funcione más como un motor de búsqueda basado en IA.

Ejemplo del uso de la nueva función Search de ChatGPT

Fig. 7. Ejemplo del uso de la nueva función Search de ChatGPT.

El camino por delante#

Las últimas actualizaciones de ChatGPT se centran en hacer que la IA sea más útil, flexible y justa. La nueva función Canvas ayuda a los usuarios a trabajar de forma más eficiente, mientras que el ajuste fino de visión permite a los desarrolladores personalizar los modelos para gestionar mejor las tareas visuales. Abordar la equidad y reducir los sesgos también son prioridades clave para garantizar que la IA funcione bien para todo el mundo, independientemente de quién sea. Tanto si eres un desarrollador que ajusta modelos como si simplemente utilizas las funciones más recientes, ChatGPT evoluciona para satisfacer una amplia variedad de necesidades. Con capacidades en tiempo real, integración visual y un enfoque centrado en el uso responsable, estas actualizaciones están creando una experiencia de IA más fiable y digna de confianza para todos.

Descubre más sobre la IA visitando nuestro repositorio de GitHub y uniéndote a nuestra comunidad. Obtén más información sobre las aplicaciones de IA en la conducción autónoma y la atención sanitaria.

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático