Ultralytics YOLO27:
IA visual

2024 comienza con una ola de IA generativa

Un vistazo a las interesantes innovaciones en IA del primer trimestre de 2024. Trataremos avances como la IA Sora de OpenAI, el chip cerebral de Neuralink y los últimos LLM.

ABAbirami Vina10 min read
Avances de la IA generativa de principios de 2024

La comunidad de la IA parece copar los titulares casi a diario. Los primeros meses de 2024 han sido emocionantes y han estado repletos de nuevas innovaciones en IA. Desde nuevos y potentes modelos de lenguaje de gran tamaño hasta implantes en el cerebro humano, 2024 apunta a ser un año increíble.

Estamos viendo cómo la IA transforma sectores, hace que la información sea más accesible e incluso da los primeros pasos hacia la fusión de nuestras mentes con las máquinas. Repasemos el primer trimestre de 2024 y analicemos más de cerca los avances logrados en IA en tan solo unos meses.

Los LLM están en auge#

Los modelos de lenguaje de gran tamaño (LLM), diseñados para comprender, generar y manipular el lenguaje humano a partir de enormes cantidades de datos de texto, ocuparon el centro de la escena en el primer trimestre de 2024. Muchas grandes empresas tecnológicas lanzaron sus propios modelos LLM, cada uno con capacidades únicas. El increíble éxito de LLM anteriores, como GPT-3, inspiró esta tendencia. Estos son algunos de los lanzamientos de LLM más destacados de principios de 2024.

Claude 3 de Anthropic#

Anthropic lanzó Claude 3 el 14 de marzo de 2024. El modelo Claude 3 está disponible en tres versiones: Opus, Sonnet y Haiku, cada una orientada a distintos mercados y finalidades. Haiku, el modelo más rápido, está optimizado para ofrecer respuestas rápidas y básicas. Sonnet equilibra velocidad e inteligencia y está dirigido a aplicaciones empresariales. Opus, la versión más avanzada, ofrece una inteligencia y una capacidad de razonamiento incomparables, y es ideal para tareas complejas y para alcanzar los mejores resultados en benchmarks.

Claude 3 ofrece muchas funciones y mejoras avanzadas:

  • Conversaciones multilingües mejoradas: capacidades mejoradas en idiomas como español, japonés y francés.
  • Funciones avanzadas de visión: capaz de gestionar diversos formatos visuales.
  • Menos rechazos: muestra una mayor comprensión con menos rechazos innecesarios, lo que indica una mejor comprensión del contexto.
  • Ventana de contexto ampliada: ofrece una ventana de contexto de 200K, pero puede procesar entradas de más de 1 millón de tokens según las necesidades del cliente.

Gráfico que muestra la comprensión contextual de Claude 3 frente a versiones anteriores

Fig. 1. Claude 3 tiene una mayor comprensión contextual que las versiones anteriores.

DBRX de Databricks#

Databricks DBRX es un LLM abierto de propósito general que Databricks lanzó el 27 de marzo de 2024. DBRX obtiene muy buenos resultados en diversos benchmarks, incluidos los de comprensión del lenguaje, programación y matemáticas. Supera a otros modelos consolidados y, al mismo tiempo, es aproximadamente un 40 % más pequeño que modelos similares.

Comparación de DBRX con otros modelos

Fig. 2. Comparación de DBRX con otros modelos.

DBRX se entrenó mediante la predicción del siguiente token con una arquitectura de mezcla de expertos (MoE) detallada, por lo que podemos observar mejoras significativas en el rendimiento del entrenamiento y la inferencia. Su arquitectura permite al modelo predecir con mayor precisión la siguiente palabra de una secuencia al consultar un conjunto diverso de submodelos especializados (los «expertos»). Estos submodelos son buenos gestionando distintos tipos de información o tareas.

Gemini 1.5 de Google#

Google presentó Gemini 1.5, un modelo de IA multimodal y eficiente en términos computacionales capaz de analizar grandes cantidades de datos de texto, vídeo y audio, el 15 de febrero de 2024. El modelo más reciente es más avanzado en cuanto a rendimiento, eficiencia y capacidades. Una característica clave de Gemini 1.5 es su gran avance en la comprensión de contextos largos. El modelo puede gestionar de forma constante hasta 1 millón de tokens. Las capacidades de Gemini 1.5 también se deben a una nueva arquitectura basada en MoE.

Comparación de las longitudes de contexto de LLM populares

Fig. 3. Comparación de las longitudes de contexto de LLM populares

Estas son algunas de las funciones más interesantes de Gemini 1.5:

  • Gestión de datos mejorada: permite cargar directamente PDF grandes, repositorios de código o vídeos extensos como prompts. El modelo puede razonar entre distintas modalidades y generar texto.
  • Carga y consulta de varios archivos: ahora los desarrolladores pueden cargar varios archivos y hacer preguntas.
  • Puede utilizarse para distintas tareas: está optimizado para escalar en tareas diversas y muestra mejoras en áreas como las matemáticas, la ciencia, el razonamiento, la capacidad multilingüe, la comprensión de vídeos y el código.

Imágenes sorprendentes generadas por IA#

El primer trimestre de 2024 ha dado a conocer modelos de IA generativa capaces de crear imágenes tan realistas que han suscitado debates sobre el futuro de las redes sociales y el progreso de la IA. Analicemos los modelos que están avivando la conversación.

Sora de OpenAI#

OpenAI, la empresa creadora de ChatGPT, anunció el 15 de febrero de 2024 un modelo de aprendizaje profundo de texto a vídeo de última generación llamado Sora. Sora es un generador de texto a vídeo capaz de crear vídeos de hasta un minuto de duración y gran calidad visual a partir de prompts de texto del usuario.

Por ejemplo, observa el siguiente prompt.

«Un mundo de papel artesanal magníficamente representado, con un arrecife de coral repleto de peces y criaturas marinas.»

Y este es un fotograma del vídeo generado.

Un fotograma de un vídeo generado por OpenAI Sora

Fig. 4. Un fotograma de un vídeo generado por Sora.

La arquitectura de Sora hace esto posible al combinar modelos de difusión para generar texturas y modelos Transformer para mantener la coherencia estructural. Hasta ahora, el acceso a Sora se ha concedido a miembros del equipo de red team y a un grupo selecto de artistas visuales, diseñadores y cineastas para comprender los riesgos y obtener comentarios.

Stable Diffusion 3 de Stability AI#

Stability AI anunció la llegada de Stable Diffusion 3, un modelo de generación de texto a imagen, el 22 de febrero de 2024. El modelo combina una arquitectura de Transformer de difusión y flow matching. Todavía no han publicado un artículo técnico, pero hay varias características clave que conviene tener en cuenta.

Imagen generada por Stable Diffusion 3 de un mago lanzando un hechizo cósmico

Fig. 5. Imagen generada a partir del prompt: «Una obra de arte de anime épica de un mago sobre una montaña de noche, lanzando un hechizo cósmico al cielo oscuro que dice "Stable Diffusion 3", formado por energía de colores» (Fuente)

El modelo más reciente de Stable Diffusion ofrece un mejor rendimiento, calidad de imagen y precisión al crear imágenes con varios sujetos. Stable Diffusion 3 también ofrecerá una variedad de modelos de entre 800 millones y 8 mil millones de parámetros. Permitirá a los usuarios elegir en función de sus necesidades específicas de escalabilidad y detalle.

Lumiere de Google#

El 23 de enero de 2024, Google lanzó Lumiere, un modelo de difusión de texto a vídeo. Lumiere utiliza una arquitectura llamada Space-Time-U-Net, o STUNet para abreviar. Esto ayuda a Lumiere a comprender dónde están las cosas y cómo se mueven en un vídeo. De este modo, puede generar vídeos fluidos y realistas.

Un fotograma de un vídeo generado por Google Lumiere de un panda tocando el ukelele

Fig. 6. Un fotograma de un vídeo generado a partir del prompt: «Panda toca el ukelele en casa.»

Con la capacidad de generar 80 fotogramas por vídeo, Lumiere está ampliando los límites y estableciendo nuevos estándares de calidad de vídeo en el ámbito de la IA. Estas son algunas de las funciones de Lumiere:

  • De imagen a vídeo: a partir de una imagen y un prompt, Lumiere puede animar imágenes y convertirlas en vídeos.
  • Generación estilizada: Lumiere puede crear vídeos con estilos específicos utilizando una única imagen de referencia.
  • Cinemagraphs: Lumiere puede animar regiones específicas de una imagen para crear escenas dinámicas, como un objeto concreto en movimiento mientras el resto de la escena permanece estático.
  • Relleno de vídeo: puede modificar partes de un vídeo, como cambiar la ropa de las personas que aparecen en él o alterar detalles del fondo.

El futuro parece estar aquí#

El comienzo de 2024 también ha traído numerosas innovaciones en IA que parecen sacadas de una película de ciencia ficción. Ahora se está trabajando en cosas que antes habríamos considerado imposibles. El futuro no parece tan lejano gracias a los siguientes descubrimientos.

Neuralink, la empresa de Elon Musk, implantó con éxito su chip cerebral inalámbrico en un ser humano el 29 de enero de 2024. Este es un gran paso hacia la conexión de los cerebros humanos con los ordenadores. Elon Musk compartió que el primer producto de Neuralink, llamado «Telepathy», está en desarrollo.

El implante de Neuralink

Fig. 7. El implante de Neuralink

El objetivo es permitir que los usuarios, especialmente quienes han perdido la funcionalidad de alguna extremidad, controlen dispositivos sin esfuerzo mediante sus pensamientos. Sus posibles aplicaciones van más allá de la comodidad. Elon Musk imagina un futuro en el que las personas con parálisis puedan comunicarse fácilmente.

HoloTile Floor de Disney#

El 18 de enero de 2024, Walt Disney Imagineering presentó HoloTile Floor. Se ha descrito como la primera plataforma de cinta de correr multidireccional para varias personas del mundo.

El Imagineer de Disney Lanny Smoot sobre el suelo HoloTile

Fig. 8. El Imagineer de Disney Lanny Smoot posa sobre su última innovación, el suelo HoloTile.

Puede moverse bajo cualquier persona u objeto, como si fuera telequinesis, para ofrecer una experiencia inmersiva de realidad virtual y aumentada. Puedes caminar en cualquier dirección y evitar colisiones mientras estás sobre ella. HoloTile Floor de Disney también puede instalarse en escenarios teatrales para bailar y moverse de formas creativas.

Vision Pro de Apple#

El 2 de febrero de 2024, el esperado visor Vision Pro de Apple salió al mercado. Cuenta con numerosas funciones y aplicaciones diseñadas para redefinir la experiencia de realidad virtual y aumentada. El visor Vision Pro se dirige a un público diverso al combinar entretenimiento, productividad y computación espacial. Apple anunció con orgullo que, en el momento de su lanzamiento, más de 600 aplicaciones, desde herramientas de productividad hasta servicios de juegos y entretenimiento, estaban optimizadas para Vision Pro.

Devin de Cognition#

El 12 de marzo de 2024, Cognition lanzó un asistente de ingeniería de software llamado Devin. Devin es el primer intento del mundo de crear un ingeniero de software de IA autónomo. A diferencia de los asistentes de programación tradicionales, que ofrecen sugerencias o completan tareas específicas, Devin está diseñado para gestionar proyectos completos de desarrollo de software, desde el concepto inicial hasta su finalización.

Puede aprender nuevas tecnologías, crear y desplegar aplicaciones completas, encontrar y corregir errores, entrenar sus propios modelos, contribuir a bases de código de código abierto y de producción, e incluso aceptar trabajos reales de desarrollo en sitios como Upwork.

Comparación de Devin con otros modelos

Fig. 9. Comparación de Devin con otros modelos.

Devin se evaluó en SWE-bench, un benchmark exigente que pide a los agentes resolver problemas reales de GitHub encontrados en proyectos de código abierto como Django y scikit-learn. Resolvió correctamente el 13,86 % de los problemas de principio a fin, frente al 1,96 % del modelo de última generación anterior.

Menciones destacadas#

Han ocurrido tantas cosas que no es posible cubrirlas todas en este artículo. Pero aquí tienes algunas menciones destacadas más.

  • El LATTE3D de NVIDIA, anunciado el 21 de marzo de 2024, es un modelo de IA de texto a 3D que crea al instante representaciones 3D a partir de prompts de texto.
  • El nuevo generador de texto a vídeo de Midjourney, presentado por su CEO David Holz, comenzó a entrenarse en enero y se espera que se lance pronto.
  • Para impulsar la revolución de los PC con IA, Lenovo lanzó el 8 de enero de 2024 el ThinkBook 13x con tecnología E Ink Prism y portátiles de alto rendimiento con IA.

¡Mantente al día de las tendencias de la IA con nosotros!#

El comienzo de 2024 fue testigo de avances revolucionarios en IA y de numerosos hitos tecnológicos importantes. Pero esto no es más que el principio de todo lo que la IA puede hacer. Si quieres obtener más información sobre los últimos avances en IA, Ultralytics te mantiene al día.

Consulta nuestro repositorio de GitHub para conocer nuestras últimas contribuciones a la visión artificial y la IA. También puedes consultar nuestras páginas de soluciones para ver cómo se utiliza la IA en sectores como la fabricación y la sanidad.

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático