Ultralytics YOLO27:
IA visual

Conectando el procesamiento del lenguaje natural y la visión artificial

Descubre cómo el procesamiento del lenguaje natural (NLP) y la visión artificial (CV) pueden trabajar juntos para transformar sectores mediante sistemas de inteligencia artificial multimodales más inteligentes.

ABAbirami Vina9 min read
Conectando el procesamiento del lenguaje natural y la visión artificial

El procesamiento del lenguaje natural (NLP) y la visión por ordenador (CV) son dos ramas distintas de la inteligencia artificial (AI) que han ganado mucha popularidad en los últimos años. Gracias a los avances en AI, estas dos ramas están ahora más interconectadas que nunca.

Un gran ejemplo de ello es el subtitulado automático de imágenes. La visión por ordenador puede utilizarse para analizar y comprender el contenido de una imagen, mientras que el procesamiento del lenguaje natural puede emplearse para [generar](https://ultralytics-translation-2.invalid un subtítulo que la describa. El subtitulado automático de imágenes se utiliza habitualmente en plataformas de redes sociales para mejorar la accesibilidad y en sistemas de gestión de contenidos para ayudar a organizar y etiquetar imágenes de forma eficiente.

Las innovaciones en NLP y Vision AI han dado lugar a muchos casos de uso de este tipo en diversos sectores. En este artículo, analizaremos más detenidamente el NLP y la visión por ordenador y explicaremos cómo funcionan ambos. También exploraremos aplicaciones interesantes que utilizan estas dos tecnologías conjuntamente. ¡Empecemos!

Comprender el NLP y Vision AI#

El NLP se centra en la interacción entre los ordenadores y el lenguaje humano. Permite a las máquinas comprender, interpretar y generar texto o voz de forma significativa. Puede utilizarse para realizar tareas como la traducción, el análisis de sentimientos o la generación de resúmenes.

Por su parte, la visión por ordenador ayuda a las máquinas a analizar y trabajar con imágenes y vídeos. Puede utilizarse para tareas como detectar objetos en una foto, el reconocimiento facial, el seguimiento de objetos o la clasificación de imágenes. La tecnología Vision AI permite a las máquinas comprender e interactuar mejor con el mundo visual.

Un ejemplo de clasificación de imágenes

Fig. 1. Un ejemplo de clasificación de imágenes.

Al integrarse con la visión por ordenador, el NLP puede aportar significado a los datos visuales combinando texto e imágenes, lo que permite una comprensión más profunda. Como dice el refrán, «una imagen vale más que mil palabras» y, al combinarla con texto, se vuelve aún más potente y ofrece información más enriquecedora.

Ejemplos del trabajo conjunto del NLP y la visión por ordenador#

Probablemente hayas visto el NLP y la visión por ordenador trabajando juntos en herramientas cotidianas sin darte cuenta, por ejemplo, cuando tu teléfono traduce el texto de una imagen.

De hecho, Google Translate utiliza tanto el procesamiento del lenguaje natural como la visión por ordenador para traducir texto de imágenes. Cuando haces una foto de una señal de tráfico en otro idioma, la visión por ordenador identifica y extrae el texto, mientras que el NLP lo traduce a tu idioma preferido.

El NLP y el CV trabajan juntos para que el proceso sea fluido y eficiente, lo que permite a los usuarios comprender e interactuar con información en distintos idiomas en tiempo real. Esta integración fluida de tecnologías elimina las barreras de comunicación.

Función de Google Translate que traduce texto de una imagen

Fig. 2. Función Translate de Google.

Estas son otras aplicaciones en las que el NLP y la visión por ordenador trabajan conjuntamente:

  • Coches autónomos: el CV puede utilizarse para detectar señales de tráfico, carriles y obstáculos, mientras que el NLP puede procesar órdenes habladas o el texto de las señales de tráfico.
  • Lectores de documentos: Vision AI puede reconocer texto de documentos escaneados o escritura manuscrita, y el procesamiento del lenguaje natural puede interpretar y resumir la información.
  • Búsqueda visual en aplicaciones de compras: la visión por ordenador puede identificar productos en fotos, mientras que el NLP procesa los términos de búsqueda para mejorar las recomendaciones.
  • Herramientas educativas: el CV puede reconocer notas manuscritas o entradas visuales, y el NLP puede proporcionar explicaciones o comentarios basados en el contenido.

Conceptos clave que conectan la visión por ordenador y el NLP#

Ahora que hemos visto cómo se utilizan la visión por ordenador y el procesamiento del lenguaje natural, exploremos cómo se combinan para hacer posible la AI multimodal.

La AI multimodal combina la comprensión visual de la visión por ordenador con la comprensión lingüística del NLP para procesar y conectar información de textos e imágenes. Por ejemplo, en la sanidad, la AI multimodal puede ayudar a analizar una radiografía y generar un resumen escrito y claro de posibles problemas, ayudando a los médicos a tomar decisiones más rápidas y precisas.

Comprensión del lenguaje natural (NLU)#

La comprensión del lenguaje natural es un subconjunto especializado del NLP que se centra en interpretar y extraer el significado del texto mediante el análisis de su intención, contexto, semántica, tono y estructura. Mientras que el NLP procesa texto sin formato, el NLU permite a las máquinas comprender el lenguaje humano de forma más eficaz. Por ejemplo, el análisis sintáctico es una técnica de NLU que convierte el texto escrito en un formato estructurado que las máquinas pueden entender.

Diagrama de la relación entre el NLP y el NLU

Fig. 3. La relación entre el NLP y el NLU.

El NLU trabaja con la visión por ordenador cuando los datos visuales contienen texto que debe comprenderse. La visión por ordenador, mediante tecnologías como el reconocimiento óptico de caracteres (OCR), extrae texto de imágenes, documentos o vídeos. Esto puede incluir tareas como escanear un recibo, leer el texto de una señal o digitalizar notas manuscritas.

A continuación, el NLU procesa el texto extraído para comprender su significado, contexto e intención. Esta combinación permite que los sistemas hagan algo más que reconocer texto. Pueden categorizar gastos a partir de recibos o analizar el tono y los sentimientos. Juntos, la visión por ordenador y el NLU convierten el texto visual en información significativa y útil para la toma de decisiones.

Ingeniería de prompts#

La ingeniería de prompts es el proceso de diseñar prompts de entrada claros, precisos y detallados para guiar a los sistemas de AI generativa, como los modelos de lenguaje de gran tamaño (LLMs) y los modelos de visión y lenguaje (VLMs), en la producción de los resultados deseados. Estos prompts actúan como instrucciones que ayudan al modelo de AI a comprender la intención del usuario.

Una ingeniería de prompts eficaz requiere comprender las capacidades del modelo y elaborar entradas que maximicen su capacidad para generar respuestas precisas, creativas o esclarecedoras. Esto es especialmente importante en el caso de los modelos de AI que trabajan tanto con texto como con imágenes.

Tomemos como ejemplo el modelo DALL·E de OpenAI. Si le pides que cree «una imagen fotorrealista de un astronauta montando a caballo», puede generar exactamente eso basándose en tu descripción. Esta capacidad resulta muy útil en ámbitos como el diseño gráfico, donde los profesionales pueden convertir rápidamente ideas textuales en maquetas visuales, ahorrar tiempo y aumentar la productividad.

Una imagen creada con DALL-E de OpenAI

Fig. 4. Una imagen creada con DALL-E de OpenAI.

Quizá te preguntes cómo se relaciona esto con la visión por ordenador: ¿acaso no es simplemente AI generativa? En realidad, ambas están estrechamente relacionadas. La AI generativa se basa en los fundamentos de la visión por ordenador para crear resultados visuales completamente nuevos.

Los modelos de AI generativa que crean imágenes a partir de prompts de texto se entrenan con grandes conjuntos de datos de imágenes acompañadas de descripciones textuales. Esto les permite aprender las relaciones entre el lenguaje y conceptos visuales como objetos, texturas y relaciones espaciales.

Estos modelos no interpretan los datos visuales del mismo modo que lo hacen los sistemas tradicionales de visión por ordenador, por ejemplo, al reconocer objetos en imágenes del mundo real. En su lugar, utilizan lo que han aprendido sobre estos conceptos para generar nuevos elementos visuales basados en prompts. Al combinar este conocimiento con prompts bien elaborados, la AI generativa puede producir imágenes realistas y detalladas que coinciden con la entrada del usuario.

Respuesta a preguntas (QA)#

Los sistemas de respuesta a preguntas están diseñados para comprender preguntas en lenguaje natural y proporcionar respuestas precisas y pertinentes. Utilizan técnicas como la recuperación de información, la comprensión semántica y el aprendizaje profundo para interpretar y responder a las consultas.

Los modelos avanzados, como GPT-4o de OpenAI, pueden gestionar la respuesta visual a preguntas (VQA), es decir, pueden analizar imágenes y responder a preguntas sobre ellas. Sin embargo, GPT-4o no realiza directamente tareas de visión por ordenador. En su lugar, utiliza un codificador de imágenes especializado para procesar imágenes, extraer características y combinarlas con su comprensión del lenguaje para proporcionar respuestas.

Capacidad de ChatGPT para responder visualmente a preguntas

Fig. 5. Capacidad de ChatGPT para responder visualmente a preguntas. Imagen del autor.

Otros sistemas pueden ir un paso más allá integrando completamente capacidades de visión por ordenador. Estos sistemas pueden analizar directamente imágenes o vídeos para identificar objetos, escenas o texto. Al combinarse con el procesamiento del lenguaje natural, pueden gestionar preguntas más complejas sobre contenido visual. Por ejemplo, pueden responder «¿Qué objetos hay en esta imagen?» o «¿Quién aparece en esta grabación?» detectando e interpretando los elementos visuales.

Aprendizaje sin ejemplos (ZSL)#

El aprendizaje sin ejemplos (ZSL) es un método de aprendizaje automático que permite a los modelos de AI abordar tareas nuevas que no han visto, sin haber sido entrenados específicamente para ellas. Lo consigue utilizando información adicional, como descripciones o relaciones semánticas, para conectar lo que el modelo ya conoce (clases conocidas) con categorías nuevas que no ha visto.

En el procesamiento del lenguaje natural, el ZSL ayuda a los modelos a comprender y trabajar con temas para los que no han sido entrenados, basándose en las relaciones entre palabras y conceptos. Del mismo modo, en la visión por ordenador, el ZSL permite a los modelos reconocer objetos o escenas que nunca han encontrado antes, relacionando características visuales, como alas o plumas, con conceptos conocidos, como aves.

El ZSL conecta el NLP y el CV al combinar la comprensión del lenguaje con el reconocimiento visual, por lo que resulta especialmente útil para tareas que implican ambos elementos. Por ejemplo, en la respuesta visual a preguntas, un modelo puede analizar una imagen y comprender al mismo tiempo una pregunta relacionada para proporcionar una respuesta precisa. También resulta útil para tareas como el subtitulado de imágenes.

Conclusiones clave#

La unión del procesamiento del lenguaje natural y la visión por ordenador ha dado lugar a sistemas de AI capaces de comprender tanto textos como imágenes. Esta combinación se utiliza en muchos sectores, desde ayudar a los coches autónomos a leer señales de tráfico hasta mejorar los diagnósticos médicos y hacer que las redes sociales sean más seguras. A medida que estas tecnologías mejoren, seguirán facilitando la vida y abriendo nuevas oportunidades en una amplia variedad de ámbitos. Para obtener más información, visita nuestro repositorio de GitHub y participa en nuestra comunidad. Explora las aplicaciones de AI en coches autónomos y agricultura en nuestras páginas de soluciones. 🚀

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático