Ultralytics YOLO27:
Eventos

Impulso de proyectos de CV con las herramientas de código abierto de Hugging Face

Acompáñanos para volver a escuchar una ponencia principal de YOLO Vision 2024 centrada en cómo las herramientas de código abierto de Hugging Face están impulsando el desarrollo de la IA.

ABAbirami Vina10 min read
Impulso de proyectos de CV con herramientas de código abierto de Hugging Face

Elegir los algoritmos adecuados es solo una parte de la creación de soluciones de visión artificial impactantes. Los ingenieros de IA suelen trabajar con grandes conjuntos de datos, ajustar modelos para tareas específicas y optimizar sistemas de IA para obtener un rendimiento real. A medida que las aplicaciones de IA se adoptan más rápidamente, también crece la necesidad de herramientas que simplifiquen estos procesos.

En YOLO Vision 2024 (YV24), el evento híbrido anual impulsado por Ultralytics, expertos en IA y entusiastas de la tecnología se reunieron para explorar las últimas innovaciones en visión artificial. El evento suscitó debates sobre diversos temas, como las formas de acelerar el desarrollo de aplicaciones de IA.

Uno de los momentos destacados del evento fue una ponencia principal sobre Hugging Face, una plataforma de IA de código abierto que agiliza el entrenamiento, la optimización y la implementación de modelos. Pavel Iakubovskii, ingeniero de Machine Learning en Hugging Face, explicó cómo sus herramientas mejoran los flujos de trabajo para tareas de visión artificial, como detectar objetos en imágenes, clasificar imágenes en distintos grupos y realizar predicciones sin entrenamiento previo con ejemplos específicos (aprendizaje zero-shot).

Hugging Face Hub aloja y proporciona acceso a varios modelos de visión artificial, como Ultralytics YOLO11. En este artículo, resumiremos las conclusiones clave de la ponencia de Pavel y veremos cómo los desarrolladores pueden utilizar las herramientas de código abierto de Hugging Face para crear e implementar modelos de IA rápidamente.

Pavel en el escenario de YV24

Fig. 1. Pavel en el escenario de YV24.

Hugging Face Hub permite desarrollar IA más rápidamente#

Pavel comenzó su ponencia presentando Hugging Face como una plataforma de IA de código abierto que ofrece modelos preentrenados para una gran variedad de aplicaciones. Estos modelos están diseñados para distintas ramas de la IA, incluido el procesamiento del lenguaje natural (NLP), la visión artificial y la IA multimodal, lo que permite a los sistemas procesar diferentes tipos de datos, como texto, imágenes y audio.

Pavel mencionó que Hugging Face Hub ya ha alojado más de 1 millón de modelos y que los desarrolladores pueden encontrar fácilmente modelos adecuados para sus proyectos específicos. Hugging Face pretende simplificar el desarrollo de IA ofreciendo herramientas para entrenar, ajustar e implementar modelos. Cuando los desarrolladores pueden experimentar con distintos modelos, el proceso de integración de la IA en aplicaciones reales se simplifica.

Aunque al principio Hugging Face era conocido por NLP, desde entonces se ha expandido a la visión artificial y la IA multimodal, lo que permite a los desarrolladores abordar una gama más amplia de tareas de IA. También cuenta con una comunidad sólida en la que los desarrolladores pueden colaborar, compartir conocimientos y obtener ayuda a través de foros, Discord y GitHub.

Explorar modelos de Hugging Face para aplicaciones de visión artificial#

Profundizando en el tema, Pavel explicó cómo las herramientas de Hugging Face facilitan la creación de aplicaciones de visión artificial. Los desarrolladores pueden utilizarlas para tareas como la clasificación de imágenes, la detección de objetos y las aplicaciones de visión y lenguaje.

También señaló que muchas de estas tareas de visión artificial pueden resolverse con modelos preentrenados disponibles en Hugging Face Hub, lo que ahorra tiempo al reducir la necesidad de entrenar desde cero. De hecho, Hugging Face ofrece más de 13 000 modelos preentrenados para tareas de clasificación de imágenes, incluidos modelos para clasificar alimentos y mascotas, y para detectar emociones.

Para destacar la accesibilidad de estos modelos, dijo: "Probablemente ni siquiera necesites entrenar un modelo para tu proyecto: puede que encuentres en Hub uno que alguien de la comunidad ya haya entrenado."

Modelos de Hugging Face para la detección de objetos#

Como ejemplo adicional, Pavel explicó cómo Hugging Face puede ayudar con la detección de objetos, una función clave de la visión artificial que se utiliza para identificar y localizar objetos dentro de las imágenes. Incluso con una cantidad limitada de datos etiquetados, los modelos preentrenados disponibles en Hugging Face Hub pueden hacer más eficiente la detección de objetos.

También ofreció una breve visión general de varios modelos creados para esta tarea que puedes encontrar en Hugging Face:

  • Modelos de detección de objetos en tiempo real: Para entornos dinámicos en los que la velocidad es fundamental, modelos como el Transformer de detección (DETR) ofrecen capacidades de detección de objetos en tiempo real. DETR se entrena con el conjunto de datos COCO y está diseñado para procesar características multiescala de forma eficiente, por lo que resulta adecuado para aplicaciones en las que el tiempo es crítico.
  • Modelos de visión y lenguaje: Estos modelos combinan el procesamiento de imágenes y texto, lo que permite a los sistemas de IA asociar imágenes con descripciones o reconocer objetos que van más allá de sus datos de entrenamiento. Entre los ejemplos se incluyen CLIP y SigLIP, que mejoran la búsqueda de imágenes al vincular el texto con elementos visuales y permiten a las soluciones de IA identificar objetos nuevos comprendiendo su contexto.
  • Modelos de detección de objetos zero-shot: Pueden identificar objetos que no han visto antes al comprender la relación entre imágenes y texto. Algunos ejemplos son OwlVit, GroundingDINO y OmDet, que utilizan el aprendizaje zero-shot para detectar objetos nuevos sin necesidad de datos de entrenamiento etiquetados.

Cómo utilizar los modelos de Hugging Face#

A continuación, Pavel centró la atención en el uso práctico de los modelos de Hugging Face y explicó tres formas en las que los desarrolladores pueden aprovecharlos: explorar modelos, probarlos rápidamente y personalizarlos más.

Demostró cómo los desarrolladores pueden explorar modelos directamente en Hugging Face Hub sin escribir código, lo que facilita probarlos al instante mediante una interfaz interactiva. Pavel añadió: "Puedes probarlo sin escribir ni una sola línea de código ni descargar el modelo en tu ordenador". Como algunos modelos son grandes, ejecutarlos en Hub ayuda a evitar limitaciones de almacenamiento y procesamiento.

Cómo utilizar los modelos de Hugging Face

Fig. 2. Cómo utilizar los modelos de Hugging Face.

Además, la API de inferencia de Hugging Face permite a los desarrolladores ejecutar modelos de IA con sencillas llamadas a la API. Es ideal para realizar pruebas rápidas, proyectos de prueba de concepto y prototipos rápidos sin necesidad de una configuración compleja.

Para casos de uso más avanzados, los desarrolladores pueden utilizar el framework Transformers de Hugging Face, una herramienta de código abierto que proporciona modelos preentrenados para tareas de texto, visión y audio, y que admite tanto PyTorch como TensorFlow. Pavel explicó que, con solo dos líneas de código, los desarrolladores pueden recuperar un modelo de Hugging Face Hub y conectarlo a una herramienta de preprocesamiento, como un procesador de imágenes, para analizar datos de imagen en aplicaciones de IA de visión.

Optimizar los flujos de trabajo de IA con Hugging Face#

A continuación, Pavel explicó cómo Hugging Face puede agilizar los flujos de trabajo de IA. Uno de los temas clave que abordó fue la optimización del mecanismo de atención en Transformers, una función esencial de los modelos de aprendizaje profundo que les ayuda a centrarse en las partes más relevantes de los datos de entrada. Esto mejora la precisión de las tareas relacionadas con el procesamiento del lenguaje y la visión artificial. Sin embargo, puede consumir muchos recursos.

Optimizar el mecanismo de atención puede reducir significativamente el uso de memoria y, al mismo tiempo, mejorar la velocidad. Pavel señaló: "Por ejemplo, al cambiar a una implementación de atención más eficiente, podrías obtener un rendimiento hasta 1,8 veces más rápido".

Hugging Face ofrece compatibilidad integrada con implementaciones de atención más eficientes dentro del framework Transformers. Los desarrolladores pueden activar estas optimizaciones especificando una implementación de atención alternativa al cargar un modelo.

Optimum y Torch Compile#

También habló de la cuantización, una técnica que reduce el tamaño de los modelos de IA al disminuir la precisión de los números que utilizan sin afectar demasiado al rendimiento. Esto permite que los modelos utilicen menos memoria y se ejecuten más rápido, por lo que resultan más adecuados para dispositivos con una potencia de procesamiento limitada, como los smartphones y los sistemas integrados.

Para mejorar aún más la eficiencia, Pavel presentó la biblioteca Optimum de Hugging Face, un conjunto de herramientas diseñado para optimizar e implementar modelos. Con solo unas pocas líneas de código, los desarrolladores pueden aplicar técnicas de cuantización y convertir modelos a formatos eficientes como ONNX (Open Neural Network Exchange), lo que permite ejecutarlos sin problemas en distintos tipos de hardware, incluidos servidores en la nube y dispositivos edge.

Pavel hablando sobre la biblioteca Optimum y sus funciones

Fig. 3. Pavel habló sobre la biblioteca Optimum y sus funciones.

Por último, Pavel mencionó las ventajas de Torch Compile, una función de PyTorch que optimiza la forma en que los modelos de IA procesan los datos para que se ejecuten de manera más rápida y eficiente. Hugging Face integra Torch Compile en sus bibliotecas Transformers y Optimum, lo que permite a los desarrolladores aprovechar estas mejoras de rendimiento con cambios mínimos en el código.

Al optimizar la estructura de cálculo del modelo, Torch Compile puede acelerar los tiempos de inferencia y aumentar la frecuencia de fotogramas de 29 a 150 fotogramas por segundo sin comprometer la precisión ni la calidad.

Implementar modelos con las herramientas de Hugging Face#

A continuación, Pavel explicó brevemente cómo los desarrolladores pueden ampliar e implementar modelos de IA de visión mediante las herramientas de Hugging Face después de seleccionar el modelo adecuado y elegir el mejor enfoque de desarrollo.

Por ejemplo, los desarrolladores pueden implementar aplicaciones de IA interactivas con Gradio y Streamlit. Gradio permite crear interfaces web para modelos de Machine Learning, mientras que Streamlit ayuda a crear aplicaciones de datos interactivas con sencillos scripts de Python.

Pavel también señaló: “No necesitas empezar a escribirlo todo desde cero”, en referencia a las guías, los cuadernos de entrenamiento y los scripts de ejemplo que proporciona Hugging Face. Estos recursos ayudan a los desarrolladores a empezar rápidamente sin tener que crear todo desde cero.

Pavel hablando sobre las capacidades de Hugging Face en YV24

Fig. 4. Pavel hablando sobre las capacidades de Hugging Face en YV24.

Ventajas de Hugging Face Hub#

Al concluir su ponencia principal, Pavel resumió las ventajas de utilizar Hugging Face Hub. Destacó cómo simplifica la gestión y la colaboración en torno a los modelos. También llamó la atención sobre la disponibilidad de guías, cuadernos y tutoriales, que pueden ayudar tanto a principiantes como a expertos a comprender e implementar modelos de IA.

"Ya hay muchos espacios interesantes en Hub. Puedes encontrar otros similares, clonar el código compartido, modificar unas líneas, sustituir el modelo por el tuyo y volver a publicarlo", explicó, animando a los desarrolladores a aprovechar la flexibilidad de la plataforma.

Conclusiones clave#

Durante su ponencia en YV24, Pavel compartió cómo Hugging Face proporciona herramientas que permiten entrenar, optimizar e implementar modelos de IA. Por ejemplo, innovaciones como Transformers, Optimum y Torch Compile pueden ayudar a los desarrolladores a mejorar el rendimiento de los modelos.

A medida que los modelos de IA se vuelven más eficientes, los avances en cuantización y la implementación en dispositivos edge facilitan su ejecución en dispositivos con recursos limitados. Estas mejoras, combinadas con herramientas como Hugging Face y modelos avanzados de visión artificial como Ultralytics YOLO11, son fundamentales para crear aplicaciones de IA de visión escalables y de alto rendimiento.

¡Únete a nuestra creciente comunidad! Explora nuestro repositorio de GitHub para aprender sobre IA y consulta nuestras licencias de YOLO para empezar tus proyectos de IA de visión. ¿Te interesan innovaciones como la visión artificial en la atención sanitaria o la visión artificial en la agricultura? ¡Visita nuestras páginas de soluciones para descubrir más!

Explore solutions

Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información
Visión por computadora para imágenes aéreas

Visión por computadora para imágenes aéreas

Transforma imágenes de drones y aéreas en información en tiempo real para agricultura, acuicultura, supervisión ambiental, conservación y análisis geoespacial con Ultralytics YOLO.
Más información
Visión artificial en la industria aeroespacial

Visión artificial en la industria aeroespacial

Lleva la IA de visión al monitoreo aéreo con los modelos Ultralytics YOLO. Potencia drones, flujos de trabajo aeroespaciales, conservación ambiental e industrias geoespaciales con soluciones de visión artificial.
Más información

Protege cada sitio con los modelos Ultralytics YOLO. La IA de visión potencia el monitoreo perimetral, la detección de amenazas, el reconocimiento de matrículas y la seguridad laboral.
Más información
Visión artificial en robótica

Visión artificial en robótica

Impulsa máquinas más inteligentes con los modelos de Ultralytics YOLO. La IA de visión en robótica permite la navegación autónoma, la percepción, el seguimiento de objetos y el control en tiempo real.
Más información
Visión artificial en logística

Visión artificial en logística

Optimiza la logística con los modelos de Ultralytics YOLO. La IA de visión permite inspeccionar paquetes, clasificarlos, realizar el seguimiento de vehículos y supervisar la seguridad de los almacenes en tiempo real.
Más información
Visión artificial en comercio minorista

Visión artificial en comercio minorista

Reinventa el comercio minorista con los modelos de Ultralytics YOLO. La IA de visión impulsa el seguimiento del inventario, la supervisión de estanterías, la gestión de colas y un conocimiento más inteligente de los clientes.
Más información
Visión por computador en el sector sanitario

Visión por computador en el sector sanitario

Crea soluciones sanitarias con modelos de Ultralytics YOLO. La IA de visión en el sector sanitario permite obtener imágenes médicas más rápidamente, diagnósticos más inteligentes y supervisar a los pacientes.
Más información
Visión por computador en la fabricación

Visión por computador en la fabricación

Optimiza la fabricación con modelos de Ultralytics YOLO. La IA de visión impulsa el control de calidad, la detección de defectos, el cumplimiento del PPE y la automatización de las líneas de montaje.
Más información
Visión artificial en el sector automovilístico

Visión artificial en el sector automovilístico

Aplica visión artificial en el sector automovilístico con modelos de Ultralytics YOLO. La IA de visión mejora la seguridad vial, la asistencia al conductor y la automatización de vehículos para conseguir carreteras más inteligentes.
Más información
Visión artificial en agricultura

Visión artificial en agricultura

Lleva la IA de visión a la agricultura inteligente con modelos de Ultralytics YOLO. Impulsa la supervisión de cultivos, el seguimiento del ganado y la agricultura de precisión para obtener cosechas mayores e inteligentes.
Más información

¡Construyamos juntos el futuro de la IA!

Comienza tu recorrido hacia el futuro del aprendizaje automático