Poda y cuantización en visión por computador: guía rápida
Descubre por qué la poda y la cuantización son esenciales para optimizar los modelos de visión por computador y permitir un rendimiento más rápido en dispositivos periféricos.

Los dispositivos edge son cada vez más habituales a medida que avanza la tecnología. Desde relojes inteligentes que controlan tu frecuencia cardíaca hasta drones aéreos que vigilan las calles, los sistemas edge pueden procesar datos en tiempo real de forma local, dentro del propio dispositivo.
Este método suele ser más rápido y seguro que enviar datos a la nube, especialmente en aplicaciones que manejan datos personales, como la detección de matrículas o el seguimiento de gestos. Estos son ejemplos de visión artificial, una rama de la inteligencia artificial (AI) que permite a las máquinas interpretar y comprender información visual.

Fig. 1. Un ejemplo de detección de matrículas. (Fuente)
Sin embargo, es importante tener en cuenta que estas aplicaciones requieren modelos de visión AI capaces de realizar cálculos complejos, utilizar pocos recursos y funcionar de forma independiente. La mayoría de los modelos de visión artificial se desarrollan para sistemas de alto rendimiento, por lo que son menos adecuados para su implementación directa en dispositivos edge.
Para superar esta brecha, los desarrolladores suelen aplicar optimizaciones específicas que adaptan el modelo para que funcione de forma eficiente en hardware más pequeño. Estos ajustes son fundamentales para las implementaciones edge en entornos reales, donde la memoria y la capacidad de procesamiento son limitadas.
Curiosamente, los modelos de visión artificial como Ultralytics YOLO11 ya están diseñados para ofrecer eficiencia en dispositivos edge, por lo que son excelentes para tareas en tiempo real. Sin embargo, su rendimiento puede mejorarse aún más mediante técnicas de optimización de modelos, como la poda y la cuantización, que permiten realizar inferencias más rápidas y reducir el uso de recursos en dispositivos con capacidades limitadas.
En este artículo analizaremos más detenidamente qué son la poda y la cuantización, cómo funcionan y cómo pueden ayudar a los modelos YOLO a rendir en implementaciones edge reales. ¡Empecemos!
Poda y cuantización: técnicas fundamentales para la optimización de modelos#
Al preparar modelos de visión AI para implementarlos en dispositivos edge, uno de los objetivos principales es conseguir que el modelo sea ligero y fiable sin sacrificar rendimiento. Esto suele implicar reducir el tamaño y las exigencias computacionales del modelo para que pueda funcionar de forma eficiente en hardware con memoria, energía o capacidad de procesamiento limitadas. Dos formas habituales de conseguirlo son la poda y la cuantización.
La poda es una técnica de optimización de modelos de AI que ayuda a hacer las redes neuronales más pequeñas y eficientes. En muchos casos, algunas partes del modelo, como determinadas conexiones o nodos, no contribuyen demasiado a sus predicciones finales. La poda identifica y elimina estas partes menos importantes, lo que reduce el tamaño del modelo y acelera su rendimiento.
Por otro lado, la cuantización es una técnica de optimización que reduce la precisión de los números que utiliza un modelo. En lugar de depender de números de coma flotante de 32 bits y alta precisión, el modelo cambia a formatos más pequeños y eficientes, como enteros de 8 bits. Este cambio ayuda a reducir el uso de memoria y acelera la inferencia, el proceso mediante el cual el modelo realiza predicciones.

Fig. 2. Una vista de la poda y la cuantización. (Fuente)
Cómo funcionan la poda y la cuantización#
Ahora que entendemos mejor qué son la poda y la cuantización, veamos cómo funcionan ambas.
La poda se realiza mediante un proceso conocido como análisis de sensibilidad. Este identifica qué partes de los modelos de redes neuronales, como determinados pesos, neuronas o canales, contribuyen menos a la predicción de salida final. Estas partes pueden eliminarse con un efecto mínimo sobre la precisión. Después de la poda, normalmente se vuelve a entrenar el modelo para ajustar su rendimiento. Este ciclo puede repetirse para encontrar el equilibrio adecuado entre tamaño y precisión.
Por su parte, la cuantización de modelos se centra en cómo gestiona los datos el modelo. El proceso comienza con la calibración, en la que el modelo se ejecuta con datos de muestra para aprender el rango de valores que necesita procesar. A continuación, esos valores se convierten de coma flotante de 32 bits a formatos de menor precisión, como enteros de 8 bits.

Fig. 3. La cuantización ayuda a reducir el tamaño y la complejidad del modelo. (Fuente)
Hay varias herramientas disponibles que facilitan el uso de la poda y la cuantización en proyectos de AI reales. La mayoría de los frameworks de AI, como PyTorch y TensorFlow, incluyen compatibilidad integrada con estas técnicas de optimización, lo que permite a los desarrolladores integrarlas directamente en el proceso de implementación del modelo.
Una vez optimizado el modelo, herramientas como ONNX Runtime pueden ayudar a ejecutarlo de forma eficiente en varias plataformas de hardware, como servidores, ordenadores de sobremesa y dispositivos edge. Además, Ultralytics ofrece integraciones que permiten exportar modelos YOLO a formatos adecuados para la cuantización, lo que facilita reducir el tamaño del modelo y mejorar el rendimiento.
Descripción general de la optimización de modelos YOLO de Ultralytics#
Los modelos YOLO de Ultralytics, como YOLO11, son ampliamente reconocidos por su rápida detección de objetos en un solo paso, lo que los hace ideales para tareas de visión AI en tiempo real. Ya están diseñados para ser lo bastante ligeros y eficientes como para implementarse en dispositivos edge. Sin embargo, las capas responsables de procesar las características visuales, llamadas capas convolucionales, aún pueden exigir una capacidad de cálculo considerable durante la inferencia.
Puede que te preguntes: si Ultralytics YOLO11 ya está optimizado para su uso en dispositivos edge, ¿por qué necesita más optimización? En pocas palabras, no todos los dispositivos edge son iguales. Algunos funcionan con un hardware muy básico, como pequeños procesadores integrados que consumen menos energía que una bombilla LED estándar.
En estos casos, incluso un modelo optimizado como Ultralytics YOLO11 necesita optimización adicional para garantizar un rendimiento fluido y fiable. Técnicas como la poda y la cuantización ayudan a reducir el tamaño del modelo y acelerar la inferencia sin afectar significativamente a la precisión, por lo que son ideales para estos entornos con recursos limitados.
Para facilitar la aplicación de estas técnicas de optimización, Ultralytics admite varias integraciones que pueden utilizarse para exportar modelos YOLO a múltiples formatos, como ONNX, TensorRT, OpenVINO, CoreML y PaddlePaddle. Cada formato está diseñado para funcionar bien con determinados tipos de hardware y entornos de implementación.
Por ejemplo, ONNX se utiliza a menudo en flujos de trabajo de cuantización por su compatibilidad con una amplia variedad de herramientas y plataformas. TensorRT, por su parte, está altamente optimizado para dispositivos NVIDIA y admite inferencias de baja precisión mediante INT8, por lo que es ideal para implementaciones de alta velocidad en GPU edge.
Casos de uso destacados de la optimización de modelos YOLO de Ultralytics#
A medida que la visión artificial se extiende a diversas aplicaciones reales, los modelos YOLO optimizados hacen posible ejecutar tareas como la detección de objetos, la segmentación de instancias y el seguimiento de objetos en hardware más pequeño y rápido. A continuación, analizaremos un par de casos de uso en los que la poda y la cuantización hacen que estas tareas de visión artificial sean más eficientes y prácticas.
Vigilancia inteligente impulsada por Ultralytics YOLO11#
Muchos espacios industriales, así como zonas públicas, dependen de la supervisión en tiempo real para mantener la seguridad. Lugares como estaciones de transporte, instalaciones de fabricación y grandes espacios al aire libre necesitan sistemas de visión AI capaces de detectar personas o vehículos con rapidez y precisión. A menudo, estos lugares funcionan con conectividad limitada y restricciones de hardware, lo que dificulta implementar modelos grandes.
En estos casos, un modelo de visión AI optimizado como Ultralytics YOLO11 es una excelente solución. Su tamaño compacto y su rapidez lo hacen perfecto para ejecutarse en dispositivos edge de bajo consumo, como cámaras integradas o sensores inteligentes. Estos modelos pueden procesar los datos visuales directamente en el dispositivo, lo que permite detectar en tiempo real infracciones de seguridad, accesos no autorizados o actividades anómalas sin depender de un acceso constante a la nube.

Fig. 4. Ultralytics YOLO11 puede utilizarse para supervisar lugares públicos como estaciones de metro.
Mejora de la seguridad en obras de construcción con Ultralytics YOLO11#
Las obras de construcción son entornos dinámicos e impredecibles, llenos de maquinaria pesada, trabajadores en movimiento y actividad constante. Las condiciones pueden cambiar rápidamente debido a modificaciones en los horarios, el movimiento de equipos o incluso cambios repentinos en el tiempo. En un entorno tan dinámico, la seguridad de los trabajadores puede parecer un desafío constante.
La supervisión en tiempo real desempeña un papel fundamental, pero los sistemas tradicionales suelen depender del acceso a la nube o de hardware caro que puede no resultar práctico en la obra. Aquí es donde modelos como Ultralytics YOLO11 pueden marcar la diferencia. YOLO11 puede optimizarse para ejecutarse en dispositivos edge pequeños y eficientes que funcionan directamente en la obra sin necesidad de conexión a Internet.
Por ejemplo, imagina una gran obra de construcción, como la ampliación de una autopista que se extiende por varias hectáreas. En este tipo de entorno, realizar un seguimiento manual de cada vehículo o equipo puede ser difícil y llevar mucho tiempo. Un dron equipado con una cámara y un modelo Ultralytics YOLO11 optimizado puede ayudar detectando y siguiendo vehículos automáticamente, supervisando el flujo del tráfico e identificando problemas de seguridad, como accesos no autorizados o comportamientos de conducción peligrosos.

Fig. 5. Análisis de imágenes de dron de una obra de construcción. (Fuente)
Ventajas y desventajas de la poda y la cuantización en visión artificial#
Estas son algunas ventajas clave que ofrecen los métodos de optimización de modelos de visión artificial, como la poda y la cuantización:
- Implementación rentable: Los modelos más pequeños y eficientes pueden reducir la necesidad de hardware caro y de alta gama, lo que hace que la AI sea más accesible y escalable en distintos casos de uso.
- Menor latencia: Al simplificar la arquitectura del modelo y reducir la sobrecarga computacional, estas técnicas pueden ayudar a conseguir tiempos de respuesta más rápidos en aplicaciones en tiempo real.
- Eficiencia energética: Reducir la carga computacional también disminuye el consumo de energía, algo especialmente útil en sistemas móviles o alimentados por batería.
Aunque la poda y la cuantización ofrecen muchas ventajas, también implican ciertas concesiones que los desarrolladores deben tener en cuenta al optimizar modelos. Estas son algunas limitaciones importantes:
- Concesiones en la precisión: Si la poda es demasiado agresiva o se utiliza una cuantización con un número de bits muy bajo, la precisión del modelo, medida mediante métricas como mAP, puede disminuir.
- Limitaciones del hardware: No todos los dispositivos admiten formatos de menor precisión, como INT8, con la misma eficacia. Esto puede limitar dónde y cómo se puede implementar un modelo optimizado.
- Complejidad de implementación: Conseguir buenos resultados suele requerir un ajuste cuidadoso y específico para cada modelo. Es posible que los desarrolladores tengan que volver a entrenar el modelo y realizar pruebas exhaustivas para mantener el rendimiento y mejorar la eficiencia.
Conclusiones clave#
La poda y la cuantización son técnicas útiles que ayudan a los modelos YOLO a rendir mejor en dispositivos edge. Reducen el tamaño del modelo, disminuyen sus necesidades de cálculo y aceleran las predicciones, todo ello sin una pérdida apreciable de precisión.
Estos métodos de optimización también ofrecen a los desarrolladores la flexibilidad necesaria para adaptar los modelos a distintos tipos de hardware sin tener que reconstruirlos por completo. Con algunos ajustes y pruebas, resulta más fácil aplicar la visión AI en situaciones reales.
¡Únete a nuestra creciente comunidad! Explora nuestro repositorio de GitHub para obtener más información sobre AI. ¿Listo para empezar tus proyectos de visión artificial? Consulta nuestras opciones de licencia. Descubre la AI en la agricultura y la visión AI en el ámbito sanitario visitando nuestras páginas de soluciones.









