Neural Processing Unit (NPU)
Descubre cómo una unidad de procesamiento neuronal (NPU) acelera la IA. Aprende a desplegar Ultralytics YOLO26 en NPU para realizar computación e inferencia eficientes y de bajo consumo en el edge.
Una Unidad de procesamiento neuronal (NPU) es un circuito de hardware especializado diseñado específicamente para acelerar la ejecución de algoritmos de inteligencia artificial y aprendizaje automático. A diferencia de los procesadores de propósito general, las NPU están diseñadas con una arquitectura que gestiona de forma nativa las complejas operaciones matriciales paralelas fundamentales para los modelos de aprendizaje profundo. Al ejecutar estos cálculos con una eficiencia extrema, una NPU reduce drásticamente el consumo energético y mejora significativamente la latencia de inferencia. Esto las convierte en un componente esencial de los teléfonos móviles, portátiles y dispositivos IoT especializados modernos, donde es fundamental implementar modelos complejos de forma eficiente sin agotar rápidamente la batería.
Las NPU frente a otros procesadores#
Para comprender el valor de una NPU, resulta útil distinguirla de otros aceleradores de hardware habituales en el ámbito de la AI:
- Unidad central de procesamiento (CPU): El «cerebro» de propósito general de un ordenador. Aunque puede ejecutar código de aprendizaje automático, las CPU gestionan las tareas de forma secuencial, lo que las hace lentas e ineficientes para las multiplicaciones matriciales intensivas que requieren los modelos de visión modernos.
- Unidad de procesamiento gráfico (GPU): Diseñadas para el procesamiento paralelo, las GPU son excepcionales para gestionar cargas de trabajo masivas de aprendizaje profundo. Sin embargo, consumen mucha energía y generan un calor considerable, por lo que son más adecuadas para el entrenamiento en la nube que para la computación perimetral alimentada por batería.
- Unidad de procesamiento tensorial (TPU): Un circuito integrado de aplicación específica desarrollado por Google para el aprendizaje automático. Aunque su concepto es similar al de una NPU, las TPU suelen asociarse a enormes racks de servidores de computación en la nube, mientras que las NPU normalmente están integradas directamente en sistemas en chip (SoCs) de consumo.
Aplicaciones reales de las NPU#
El auge de las NPU ha hecho posible ejecutar inteligencia artificial (AI) directamente en los dispositivos de los usuarios sin depender de una conexión constante a la nube.
- Smartphones y visión móvil: Los dispositivos móviles modernos aprovechan ampliamente las NPU internas, como Apple Neural Engine o la NPU Qualcomm Hexagon, para impulsar la fotografía computacional, el reconocimiento facial en tiempo real y la traducción de texto local. Al procesar los datos de imagen en el propio dispositivo, conservan la duración de la batería y garantizan la privacidad de los datos.
- Portátiles con AI: Los procesadores avanzados para PC ahora incorporan NPU integradas para gestionar tareas en segundo plano, como el desenfoque del fondo y la corrección de la mirada durante las videoconferencias, sin sobrecargar la CPU principal, lo que permite a los usuarios realizar varias tareas con fluidez.
- Implementaciones de AI en el perímetro: Las cámaras de vigilancia inteligentes y los sistemas robóticos utilizan NPU especializadas, como Google Coral Edge TPU o hardware de Intel integrado, para realizar la detección de objetos instantáneamente en el propio origen. Esto elimina los cuellos de botella del ancho de banda y permite tomar decisiones en fracciones de segundo.
Uso de NPU con Ultralytics YOLO#
Para los desarrolladores que quieren aprovechar las NPU, implementar modelos de visión artificial se ha vuelto increíblemente sencillo. Con el potente modelo Ultralytics YOLO26, puedes exportar tu red entrenada a formatos optimizados para diversos aceleradores de hardware. Para simplificar todo este ciclo de vida, Ultralytics Platform ofrece herramientas sólidas para gestionar conjuntos de datos en la nube, realizar anotaciones automatizadas e implementar modelos optimizados en prácticamente cualquier entorno de implementación de modelos.
Cuando trabajes localmente, puedes utilizar integraciones de frameworks como ONNX Runtime, PyTorch ExecuTorch o TensorFlow Lite para dirigirte a la NPU. A continuación se muestra un ejemplo rápido en Python que demuestra cómo exportar un modelo YOLO al formato OpenVINO, que delega sin problemas las cargas de trabajo computacionales en las NPU de Intel para acelerar la inferencia en tiempo real.
from ultralytics import YOLO
# Load the highly recommended Ultralytics YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Export to OpenVINO with int8 quantization for optimal NPU performance
model.export(format="openvino", int8=True)
# Run highly efficient, accelerated inference on the edge device
results = model("path/to/environment_image.jpg")





