YOLO Vision 2026:
IA de visión

Las últimas actualizaciones de OpenAI: Canvas, ajuste fino de visión y más

Acompáñanos a analizar las recientes actualizaciones de ChatGPT lanzadas por OpenAI. Exploraremos Canvas, el ajuste fino para capacidades de visión y la última función de búsqueda.

ABAbirami Vina4 min read
Una visión general de las últimas actualizaciones de ChatGPT de OpenAI

Después de que echáramos un vistazo a los modelos o1 de OpenAI en septiembre (los cuales se diseñaron para mejorar el razonamiento), se han añadido muchas características nuevas y emocionantes a ChatGPT. Algunos de estos lanzamientos están orientados a desarrolladores, y otros se han diseñado para perfeccionar la experiencia del usuario. En general, cada actualización ayuda a que las interacciones con ChatGPT sean más intuitivas y eficaces.

Actualizaciones como Canvas, diseñada para la escritura y la programación colaborativas, y el ajuste fino para las capacidades de visión que mejora la forma en que ChatGPT trabaja con imágenes, han despertado mucho interés, animando a los usuarios a explorar más posibilidades creativas. Mientras tanto, las mejoras técnicas, como las nuevas API y los informes de pruebas de equidad, abordan aspectos como la integración de modelos y las prácticas de IA ética. ¡Sumérgete y comprende mejor las últimas funciones de ChatGPT de OpenAI!

Una descripción general de la función Canvas de OpenAI#

Canvas es la primera actualización importante de la interfaz de usuario (UI) de ChatGPT desde su lanzamiento. Es una nueva interfaz con un diseño de dos pantallas, con sugerencias en la barra lateral izquierda y respuestas en la ventana derecha. La nueva UI elimina el flujo de trabajo habitual de una estructura de una sola pantalla tipo chat y pasa a un diseño de dos pantallas que se adapta a tareas múltiples para aumentar la productividad.

Canvas aporta actualizaciones de la interfaz de usuario a ChatGPT

Fig 1. Canvas aporta actualizaciones de la interfaz de usuario a ChatGPT.

Antes de que se introdujera Canvas, trabajar con documentos extensos en ChatGPT significaba tener que desplazarse hacia arriba y hacia abajo bastante. En el nuevo diseño, las indicaciones se muestran en la barra lateral izquierda, y el documento de texto o fragmento de código ocupa la mayor parte de la pantalla. Si es necesario, incluso puedes personalizar el tamaño de la barra lateral izquierda y la pantalla de resultados. Asimismo, puedes seleccionar una parte del texto o una sección de código y editar esa sección específica sin alterar todo el documento.

Edición de secciones específicas de texto usando Canvas

Fig 2. Edita secciones específicas de texto usando Canvas.

Si usas Canvas, notarás que no hay ningún botón específico o conmutador para abrirlo en la interfaz de ChatGPT. En su lugar, cuando trabajas con el modelo GPT-4o, Canvas se abre automáticamente si detecta que estás editando, escribiendo o programando. Para las indicaciones más sencillas, permanece inactivo. Si quieres abrirlo de forma manual, puedes usar indicaciones como "Open the Canvas" o "Get me the Canvas layout."

Actualmente, Canvas está en fase beta y solo disponible con GPT-4o. Sin embargo, OpenAI ha mencionado que Canvas estará disponible para todos los usuarios gratuitos una vez que salga de la fase beta.

Actualizaciones de la API de ChatGPT#

OpenAI ha lanzado tres nuevas actualizaciones de la API de ChatGPT destinadas a mejorar la eficiencia, la escalabilidad y la versatilidad. Echemos un vistazo más de cerca a cada una de estas actualizaciones.

Destilación de modelos#

Mediante la función de destilación de modelos a través de las API de OpenAI, los desarrolladores pueden usar los resultados de modelos avanzados como GPT-4o u o1-preview para mejorar el rendimiento de modelos más pequeños y rentables como GPT-4o mini. La destilación de modelos es un proceso que implica el entrenamiento de modelos más pequeños para imitar el comportamiento de otros más avanzados, lo que los hace más eficientes para tareas específicas.

Antes de que se introdujera esta función, los desarrolladores tenían que coordinar manualmente una variedad de tareas utilizando diferentes herramientas. Estas tareas incluían la generación de conjuntos de datos, la medición del rendimiento del modelo y el ajuste fino de modelos, lo que a menudo hacía que el proceso fuera complejo y propenso a errores. La actualización de la destilación de modelos permite a los desarrolladores usar Stored Completions, una herramienta que les permite generar conjuntos de datos automáticamente capturando y almacenando los pares de entrada y salida producidos por los modelos avanzados a través de la API.

Otra característica de la destilación de modelos, Evals (actualmente en versión beta), ayuda a medir el rendimiento de un modelo en tareas específicas, sin necesidad de crear scripts de evaluación personalizados ni de utilizar herramientas independientes. Utilizando los conjuntos de datos generados con Stored Completions y evaluando el rendimiento con Evals, los desarrolladores pueden ajustar sus propios modelos GPT personalizados.

Uso de Evals para medir el rendimiento del modelo

Fig 3. Puedes usar Evals para medir el rendimiento del modelo.

Almacenamiento en caché de sugerencias (Prompt Caching)#

A menudo, al crear aplicaciones de IA, especialmente chatbots, el mismo contexto (la información de fondo o el historial de conversación anterior necesarios para comprender la solicitud actual) se utilizará repetidamente para múltiples llamadas a la API. Prompt Caching hace posible que los desarrolladores reutilicen tokens de entrada (segmentos de texto que el modelo procesa para comprender la indicación y generar una respuesta) utilizados recientemente, lo que ayuda a reducir el coste y la latencia.

Desde el 1 de octubre, OpenAI ha aplicado automáticamente Prompt Caching a sus modelos como GPT-4o, GPT-4o mini, o1-preview y o1-mini. Esto significa que cuando los desarrolladores utilizan la API para interactuar con un modelo con una indicación larga (de más de 1.024 tokens), el sistema guarda las partes que ya ha procesado.

De esta forma, si se vuelven a utilizar las mismas sugerencias o similares, puede omitir el recálculo de esas partes. El sistema almacena automáticamente la parte más larga de la sugerencia que ha encontrado anteriormente, comenzando con 1,024 tokens y agregando fragmentos de 128 tokens a medida que la sugerencia se hace más larga.

API en tiempo real#

Crear un asistente de voz por lo general implica la necesidad de transcribir audio a texto, procesar el texto y luego convertirlo nuevamente a audio para reproducir la respuesta. La Realtime API de OpenAI tiene como objetivo gestionar todo este proceso con una sola solicitud de API. Al simplificar el proceso, la API permite conversaciones en tiempo real con la IA.

Por ejemplo, un asistente de voz integrado con la Realtime API puede realizar acciones específicas, como realizar un pedido o buscar información, basándose en las solicitudes de los usuarios. La API hace que el asistente de voz responda mejor y sea capaz de adaptarse rápidamente a las necesidades de los usuarios. La Realtime API estuvo disponible en versión beta pública el 1 de octubre, con seis voces. El 30 de octubre se añadieron cinco voces más, lo que hace un total de once voces disponibles.

Uso de la Realtime API para practicar conversaciones en un idioma nuevo

Fig 4. Un ejemplo de uso de la Realtime API para practicar conversaciones en un idioma nuevo.

Ajuste fino de ChatGPT para tareas de visión#

Originalmente, el modelo de lenguaje de visión GPT-4o solo podía ajustarse y personalizarse usando datasets exclusivamente de texto. Ahora, con el lanzamiento de la API de ajuste fino de visión, los desarrolladores pueden entrenar y personalizar GPT-4o usando datasets de imágenes. Desde su lanzamiento, el ajuste fino de visión se ha convertido en un tema de gran interés entre los desarrolladores e ingenieros de visión artificial.

Para realizar el ajuste fino de las capacidades de visión de GPT-4o, los desarrolladores pueden usar datasets de imágenes que van desde tan solo 100 imágenes hasta 50,000 imágenes. Después de asegurarse de que el dataset coincide con el formato requerido por OpenAI, se puede cargar en la plataforma de OpenAI y el modelo puede ajustarse para aplicaciones específicas.

Por ejemplo, Automat, una empresa de automatización, utilizó un conjunto de datos de capturas de pantalla para entrenar a GPT-4o para que sea capaz de identificar elementos de la interfaz de usuario en una pantalla basándose en una descripción. Esto ayuda a optimizar la Automatización Robótica de Procesos (RPA) al facilitar que los bots interactúen con las interfaces de usuario. En lugar de depender de coordenadas fijas o de reglas de selección complejas, el modelo puede identificar elementos de la interfaz de usuario basándose en descripciones sencillas, lo que hace que las configuraciones de automatización sean más adaptables y fáciles de mantener cuando las interfaces cambian.

Uso de un modelo GPT-4o ajustado para detectar elementos de la interfaz de usuario

Fig 5. Uso de una versión ajustada del modelo GPT-4o para detectar elementos de la interfaz de usuario.

Equidad y detección de sesgos en ChatGPT#

Las preocupaciones éticas en torno a las aplicaciones de IA son un tema destacado de conversación a medida que la IA se vuelve cada vez más avanzada. Debido a que las respuestas de ChatGPT se basan en las indicaciones proporcionadas por el usuario y en los datos disponibles en Internet, puede ser difícil ajustar su idioma para que sea responsable todo el tiempo. Los informes indican que las respuestas de ChatGPT están sesgadas en cuanto al nombre, el género y la raza. Para abordar este problema, el equipo interno de OpenAI realizó una prueba de equidad en primera persona.

Los nombres a menudo llevan indicios sutiles sobre nuestra cultura y factores geográficos. En la mayoría de los casos, ChatGPT ignorará los indicios sutiles en los nombres. Sin embargo, en algunos casos, los nombres que reflejan la raza o la cultura conducen a diferentes respuestas por parte de ChatGPT, y alrededor del 1% de ellas reflejan lenguaje dañino. Eliminar los sesgos y el lenguaje dañino es una tarea difícil para un modelo de lenguaje. Sin embargo, al compartir estos hallazgos públicamente y reconocer las limitaciones del modelo, OpenAI ayuda a los usuarios a refinar sus indicaciones para lograr respuestas más neutrales y sin sesgos.

Un ejemplo de respuestas de ChatGPT diferentes debido al nombre del usuario

Fig 6. Un ejemplo de respuestas diferentes debido al nombre del usuario.

Entendiendo la búsqueda de ChatGPT#

Cuando se lanzó ChatGPT por primera vez, hubo debates en la comunidad de IA sobre si podría reemplazar la navegación web tradicional. Ahora, muchos usuarios están usando ChatGPT en lugar de la Búsqueda de Google.

La nueva actualización de OpenAI, la función de Búsqueda, lleva esto un paso más allá. Con Búsqueda, ChatGPT genera respuestas actualizadas e incluye enlaces a fuentes relevantes. A partir del 31 de octubre, la función de Búsqueda está disponible para todos los usuarios de ChatGPT Plus y Team, lo que hace que ChatGPT funcione más como un motor de búsqueda impulsado por IA.

Un ejemplo de uso de la nueva función Search de ChatGPT

Fig 7. Un ejemplo de uso de la nueva función Search de ChatGPT.

El camino por delante#

Las actualizaciones recientes de ChatGPT se centran en hacer que la IA sea más útil, flexible y justa. La nueva función Canvas ayuda a los usuarios a trabajar de manera más eficiente, mientras que el ajuste fino de visión permite a los desarrolladores personalizar los modelos para manejar mejor las tareas visuales. Abordar la equidad y reducir el sesgo también son prioridades clave, asegurando que la IA funcione bien para todos, independientemente de quiénes sean. Tanto si eres un desarrollador que ajusta modelos como si solo estás usando las últimas funciones, ChatGPT está evolucionando para satisfacer una amplia gama de necesidades. Con capacidades en tiempo real, integración visual y un enfoque en el uso responsable, estas actualizaciones están construyendo una experiencia de IA más confiable y segura para todos.

Explora más sobre la IA visitando nuestro repositorio de GitHub y uniéndote a nuestra comunidad. Obtén más información sobre las aplicaciones de la IA en la conducción autónoma y la sanidad.

Explore solutions

Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información
Real-time AI that works with your team

IA en robótica

Potencia máquinas más inteligentes con modelos Ultralytics YOLO. La IA de visión en robótica impulsa la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Real-time AI that works with your team

IA en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La visión artificial por IA permite la inspección de paquetes, clasificación, seguimiento de vehículos y monitoreo de seguridad en almacenes en tiempo real.
Más información
Real-time AI that works with your team

IA en el sector minorista

Reimagina el comercio minorista con los modelos de Ultralytics YOLO. La visión artificial por IA potencia el seguimiento de inventario, el monitoreo de estantes, la gestión de colas y mejores perspectivas sobre los clientes.
Más información
Real-time AI that works with your team

IA en la atención sanitaria

Crea soluciones de salud con los modelos de Ultralytics YOLO. La IA de visión en la sanidad potencia imágenes médicas más rápidas, diagnósticos más inteligentes y supervisión de pacientes.
Más información
Real-time AI that works with your team

IA en la fabricación

Optimiza la fabricación con los modelos de Ultralytics YOLO. La visión artificial por IA impulsa el control de calidad, la detección de defectos, el cumplimiento del uso de PPE y la automatización de la línea de montaje.
Más información
Real-time AI that works with your operation

IA en automoción

Aplica la visión artificial en el sector automotriz con los modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para carreteras más inteligentes.
Más información
Real-time AI tailored to your operation

IA en agricultura

Lleva la visión artificial a la agricultura inteligente con los modelos de Ultralytics YOLO. Potencia el seguimiento de cultivos, el control del ganado y la agricultura de precisión para obtener rendimientos mayores y más inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu viaje con el futuro del aprendizaje automático