El 2024 comienza con una ola de IA generativa
Un vistazo a las emocionantes innovaciones en IA del primer trimestre de 2024. Cubriremos avances como la IA Sora de OpenAI, el chip cerebral de Neuralink y los LLMs más recientes.

La comunidad de la IA parece ser noticia casi a diario. Los primeros meses de 2024 han sido emocionantes y están repletos de nuevas innovaciones en IA. Desde potentes nuevos modelos de lenguaje grandes hasta implantes cerebrales humanos, 2024 se perfila como un año increíble.
Estamos viendo cómo la IA transforma sectores, hace que la información sea más accesible e incluso da los primeros pasos hacia la fusión de nuestras mentes con las máquinas. Retrocedamos al primer trimestre de 2024 y examinemos más de cerca los progresos realizados en IA en solo unos pocos meses.
Los LLM son tendencia#
Los modelos de lenguaje grandes (LLM), diseñados para comprender, generar y manipular el lenguaje humano basándose en enormes cantidades de datos de texto, ocuparon un lugar central en el primer trimestre de 2024. Muchas grandes empresas tecnológicas lanzaron sus propios modelos LLM, cada uno con capacidades únicas. El increíble éxito de anteriores LLM como GPT-3 inspiró esta tendencia. Estos son algunos de los lanzamientos de LLM más destacados de principios de 2024.
Claude 3 de Anthropic#
Anthropic lanzó Claude 3 el 14 de marzo de 2024. El modelo Claude 3 cuenta con tres versiones: Opus, Sonnet y Haiku, cada una orientada a diferentes mercados y propósitos. Haiku, el modelo más rápido, está optimizado para respuestas rápidas y básicas. Sonnet equilibra la velocidad con la inteligencia y está dirigido a aplicaciones empresariales. Opus, la versión más avanzada, ofrece una inteligencia y un razonamiento sin precedentes, y es ideal para tareas complejas y para alcanzar las mejores puntuaciones en benchmarks.
Claude 3 cuenta con muchas funciones y mejoras avanzadas:
- Conversaciones multilingües mejoradas: capacidades mejoradas en idiomas como el español, el japonés y el francés.
- Funciones de visión avanzadas: capaz de manejar diversos formatos visuales.
- Minimización de rechazos: muestra mayor comprensión con menos rechazos innecesarios, lo que indica una mejor comprensión contextual.
- Ventana de contexto ampliada: ofrece una ventana de contexto de 200K, pero es capaz de procesar entradas de más de 1 millón de tokens según las necesidades del cliente.

Fig 1. Claude 3 tiene mayor conciencia contextual que las versiones anteriores.
DBRX de Databricks#
Databricks DBRX es un LLM abierto y de propósito general lanzado por Databricks el 27 de marzo de 2024. DBRX rinde muy bien en varios benchmarks, incluyendo comprensión del lenguaje, programación y matemáticas. Supera a otros modelos consagrados a la vez que es aproximadamente un 40% más pequeño que modelos similares.

Fig 2. Comparación de DBRX con otros modelos.
DBRX se entrenó mediante la predicción del siguiente token con una arquitectura de mezcla de expertos (MoE) de grano fino, y es por eso que podemos observar mejoras significativas en el rendimiento de entrenamiento e inferencia. Su arquitectura permite al modelo predecir con mayor precisión la siguiente palabra en una secuencia consultando un conjunto diverso de submodelos especializados (los "expertos"). Estos submodelos son buenos manejando diferentes tipos de información o tareas.
Gemini 1.5 de Google#
Google presentó Gemini 1.5, un modelo de IA multimodal y eficiente en computación que puede analizar grandes cantidades de texto, vídeo y audio, el 15 de febrero de 2024. El modelo más reciente es más avanzado en cuanto a rendimiento, eficiencia y capacidades. Una característica clave de Gemini 1.5 es su avance en la comprensión de contextos largos. El modelo es capaz de manejar hasta 1 millón de tokens de forma consistente. Las capacidades de Gemini 1.5 también se deben a una nueva arquitectura basada en MoE.

Fig 3. Comparación de longitudes de contexto de los LLM populares
Estas son algunas de las características más interesantes de Gemini’s 1.5:
- Manejo mejorado de datos: permite realizar cargas directas de archivos PDF extensos, repositorios de código o vídeos largos como prompts. El modelo puede razonar a través de modalidades y generar texto.
- Cargas y consultas de múltiples archivos: los desarrolladores ahora pueden cargar varios archivos y realizar preguntas.
- Puede usarse para diferentes tareas: está optimizado para escalar a través de diversas tareas y muestra mejoras en áreas como matemáticas, ciencia, razonamiento, multilingüismo, comprensión de vídeo y código.
Imágenes asombrosas creadas por IA#
El primer trimestre de 2024 ha revelado modelos de IA generativa que pueden crear imágenes tan reales que han provocado debates sobre el futuro de las redes sociales y el progreso de la IA. Analicemos los modelos que están dando que hablar.
Sora de OpenAI#
OpenAI, creador de ChatGPT, anunció el 15 de febrero de 2024 un modelo de aprendizaje profundo de texto a vídeo de última generación llamado Sora. Sora es un generador de texto a vídeo capaz de crear vídeos de un minuto de duración con alta calidad visual a partir de prompts textuales de los usuarios.
Por ejemplo, echa un vistazo al siguiente prompt.
“Un mundo de artesanía en papel magníficamente renderizado de un arrecife de coral, lleno de peces coloridos y criaturas marinas.”
Y aquí tienes un fotograma del vídeo resultante.

Fig 4. Un fotograma de un vídeo generado por Sora.
La arquitectura de Sora’s hace esto posible combinando modelos de difusión para la generación de texturas y modelos transformer para la coherencia estructural. Hasta ahora, el acceso a Sora se ha concedido a equipos de pruebas de seguridad (red teamers) y a un grupo selecto de artistas visuales, diseñadores y cineastas para comprender los riesgos y obtener comentarios.
Stable Diffusion 3 de Stability AI#
Stability AI anunció la llegada de Stable Diffusion 3, un modelo de generación de texto a imagen, el 22 de febrero de 2024. El modelo mezcla arquitectura de transformer de difusión y emparejamiento de flujos (flow matching). Todavía tienen que publicar un documento técnico, pero hay algunas características clave que conviene tener en cuenta.

Fig 5. La imagen generada a partir de la instrucción: “Epic anime artwork of a wizard atop a mountain at night casting a cosmic spell into the dark sky that says "Stable Diffusion 3" made out of colorful energy” (Fuente)
El último modelo de Stable Diffusion ofrece un rendimiento mejorado, calidad de imagen y precisión en la creación de imágenes con múltiples sujetos. Stable Diffusion 3 también ofrecerá una variedad de modelos que van desde los 800 millones hasta los 8 mil millones de parámetros. Permitirá a los usuarios elegir en función de sus necesidades específicas de escalabilidad y detalle.
Lumiere de Google#
El 23 de enero de 2024, Google lanzó Lumiere, un modelo de difusión de texto a vídeo. Lumiere utiliza una arquitectura llamada Space-Time-U-Net, o STUNet para abreviar. Esto ayuda a Lumiere a entender dónde están las cosas y cómo se mueven en un vídeo. Al hacerlo, puede generar vídeos fluidos y realistas.

Fig 6. Un fotograma de un vídeo generado a partir de la instrucción: “Panda play ukulele at home.”
Con la capacidad de generar 80 fotogramas por vídeo, Lumiere está superando los límites y estableciendo nuevos estándares para la calidad de vídeo en el espacio de la IA. Estas son algunas de las características de Lumiere:
- Imagen a vídeo: a partir de una imagen y un prompt, Lumiere puede animar imágenes y convertirlas en vídeos.
- Generación estilizada: Lumiere puede crear vídeos con estilos específicos utilizando una única imagen de referencia.
- Cinemagraphs: Lumiere puede animar regiones específicas dentro de una imagen para crear escenas dinámicas, como que un objeto concreto se mueva mientras el resto de la escena permanece estático.
- Video Inpainting: puede modificar partes de un vídeo, como cambiar la vestimenta de las personas que aparecen en él o alterar los detalles del fondo.
El futuro parece estar aquí#
El comienzo de 2024 también ha traído muchas innovaciones en IA que parecen sacadas de una película de ciencia ficción. Cosas que antes habríamos dicho que eran imposibles se están trabajando ahora. El futuro no parece tan lejano con los siguientes descubrimientos.
Neuralink de Elon Musk#
Neuralink, de Elon Musk, implantó con éxito su chip cerebral inalámbrico en un ser humano el 29 de enero de 2024. Este es un gran paso hacia la conexión de cerebros humanos con ordenadores. Elon Musk compartió que el primer producto de Neuralink, llamado 'Telepathy', está en desarrollo.

Fig 7. El implante de Neuralink
El objetivo es permitir a los usuarios, especialmente a aquellos que han perdido la funcionalidad de sus extremidades, controlar dispositivos sin esfuerzo a través de sus pensamientos. Las aplicaciones potenciales van más allá de la comodidad. Elon Musk imagina un futuro en el que las personas con parálisis puedan comunicarse fácilmente.
HoloTile Floor de Disney#
El 18 de enero de 2024, Walt Disney Imagineering presentó el HoloTile Floor. Ha sido denominado la primera superficie de cinta rodante omnidireccional para varias personas del mundo.

Fig 8. El Imagineer de Disney Lanny Smoot posa sobre su última innovación, el suelo HoloTile.
Puede moverse bajo cualquier persona u objeto como si fuera telequinesis para una experiencia inmersiva de realidad virtual y aumentada. Puedes caminar en cualquier dirección y evitar colisiones mientras estás sobre ella. El HoloTile Floor de Disney también puede instalarse en escenarios teatrales para bailar y moverse de formas creativas.
Vision Pro de Apple#
El 2 de febrero de 2024, el tan esperado casco Vision Pro de Apple salió al mercado. Cuenta con una serie de funciones y aplicaciones diseñadas para redefinir la experiencia de realidad virtual y aumentada. El casco Vision Pro atiende a una audiencia diversa combinando entretenimiento, productividad y computación espacial. Apple anunció con orgullo que más de 600 aplicaciones, que van desde herramientas de productividad hasta servicios de juegos y entretenimiento, estaban optimizadas para Vision Pro en su lanzamiento.
Devin de Cognition#
El 12 de marzo de 2024, Cognition lanzó un asistente de ingeniería de software llamado Devin. Devin es el primer intento del mundo de un ingeniero de software de IA autónomo. A diferencia de los asistentes de codificación tradicionales que ofrecen sugerencias o realizan tareas específicas, Devin está diseñado para manejar proyectos completos de desarrollo de software desde el concepto inicial hasta su finalización.
Puede aprender nuevas tecnologías, crear e implementar aplicaciones completas, encontrar y corregir errores, entrenar sus propios modelos, contribuir a bases de código de código abierto y de producción, e incluso aceptar trabajos de desarrollo reales desde sitios como Upwork.

Fig 9. Comparación de Devin con otros modelos.
Devin fue evaluado en SWE-bench, una exigente prueba de rendimiento que pide a los agentes que resuelvan problemas reales de GitHub encontrados en proyectos de código abierto como Django y scikit-learn. Resolvió correctamente el 13,86% de los problemas de principio a fin, en comparación con el 1,96% del estado de la técnica anterior.
Menciones honoríficas#
Ha sucedido tanto que no es posible cubrirlo todo en este artículo. Pero, aquí hay algunas menciones honoríficas más.
- LATTE3D de NVIDIA, anunciado el 21 de marzo de 2024, es un modelo de IA de texto a 3D que crea al instante representaciones tridimensionales a partir de indicaciones de texto.
- El nuevo generador de texto a vídeo de Midjourney, anticipado por el CEO David Holz, comenzó a entrenarse en enero y se espera que se lance pronto.
- Avanzando en la revolución del PC con IA, Lenovo lanzó el ThinkBook 13x con tecnología E Ink Prism y portátiles de alto rendimiento con IA el 8 de enero de 2024.
¡Mantente al día de las tendencias de IA con nosotros!#
El inicio de 2024 vio avances innovadores en IA y muchos hitos tecnológicos importantes. Pero esto es solo el comienzo de lo que la IA puede hacer. Si quieres saber más sobre los últimos desarrollos de IA, Ultralytics te tiene cubierto.
Echa un vistazo a nuestro repositorio de GitHub para ver nuestras últimas contribuciones en visión por ordenador e IA. También puedes consultar nuestras páginas de soluciones para ver cómo se utiliza la IA en sectores como la fabricación y la sanidad.






