Neural Processing Unit (NPU)
Saiba como uma Unidade de Processamento Neural (NPU) acelera a IA. Descubra como implementar o Ultralytics YOLO26 em NPUs para computação e inferência eficientes e de baixo consumo na periferia.
Uma Unidade de Processamento Neural (NPU) é um circuito de hardware especializado, concebido especificamente para acelerar a execução de algoritmos de inteligência artificial e aprendizagem automática. Ao contrário dos processadores de uso geral, as NPU são desenvolvidas com uma arquitetura que processa nativamente as complexas operações matriciais paralelas centrais aos modelos de aprendizagem profunda. Ao executar estes cálculos com extrema eficiência, uma NPU reduz drasticamente o consumo de energia e melhora significativamente a latência de inferência. Isto torna as NPU um componente essencial dos telemóveis, portáteis e dispositivos IoT especializados modernos, nos quais é fundamental implementar modelos complexos de forma eficiente sem esgotar rapidamente a bateria.
NPU em comparação com outros processadores#
Para compreender o valor de uma NPU, é útil distingui-la de outros aceleradores de hardware comuns no panorama da IA:
- Unidade central de processamento (CPU): o "cérebro" de uso geral de um computador. Embora sejam capazes de executar código de aprendizagem automática, as CPU processam as tarefas sequencialmente, o que as torna lentas e ineficientes para a pesada multiplicação de matrizes necessária aos modernos modelos de visão.
- Unidade de processamento gráfico (GPU): concebidas para o processamento paralelo, as GPU são excecionais no tratamento de cargas de trabalho enormes de aprendizagem profunda. No entanto, consomem muita energia e geram bastante calor, sendo mais adequadas para o treino na nuvem do que para a computação de periferia alimentada por bateria.
- Unidade de processamento tensorial (TPU): um circuito integrado específico para aplicações, desenvolvido pela Google para a aprendizagem automática. Embora sejam semelhantes às NPU em conceito, as TPU estão geralmente associadas a enormes racks de servidores de computação em nuvem, enquanto as NPU são normalmente integradas diretamente em sistemas em chip (SoCs) de consumo.
Aplicações reais das NPU#
A ascensão das NPU permitiu executar inteligência artificial (AI) diretamente nos dispositivos dos utilizadores, sem depender de uma ligação constante à nuvem.
- Smartphones e visão móvel: os dispositivos móveis modernos utilizam intensivamente NPU internas, como o Apple Neural Engine ou a Qualcomm Hexagon NPU, para potenciar a fotografia computacional, o reconhecimento facial em tempo real e a tradução local de texto. Ao processarem os dados de imagem no próprio dispositivo, preservam a autonomia da bateria e garantem a privacidade dos dados.
- Portáteis com IA: os processadores avançados para PC incluem agora NPU integradas para gerir tarefas em segundo plano, como a desfocagem do fundo e a correção do olhar durante a videoconferência, sem sobrecarregar a CPU principal, permitindo aos utilizadores realizar várias tarefas em simultâneo com fluidez.
- Implementações de IA na periferia: as câmaras de vigilância inteligentes e os sistemas robóticos utilizam NPU especializadas, como a Google Coral Edge TPU ou o hardware da Intel integrado, para realizar a deteção de objetos instantaneamente e diretamente na origem. Isto elimina estrangulamentos de largura de banda e permite tomar decisões em frações de segundo.
Utilizar NPU com o Ultralytics YOLO#
Para os programadores que pretendem tirar partido das NPU, implementar modelos de visão computacional tornou-se extremamente simples. Com o poderoso modelo Ultralytics YOLO26, podes exportar a tua rede treinada para formatos otimizados para vários aceleradores de hardware. Para simplificar todo este ciclo de vida, a Ultralytics Platform fornece ferramentas robustas para a gestão de conjuntos de dados na nuvem, anotação automatizada e implementação de modelos otimizados em praticamente qualquer ambiente de implementação de modelos.
Ao trabalhar localmente, podes utilizar integrações com frameworks como o ONNX Runtime, o PyTorch ExecuTorch ou o TensorFlow Lite para direcionar a NPU. Abaixo, encontras um exemplo rápido em Python que demonstra como exportar um modelo YOLO para o formato OpenVINO, que delega de forma transparente as cargas de trabalho computacionais nas NPU Intel para acelerar a inferência em tempo real.
from ultralytics import YOLO
# Load the highly recommended Ultralytics YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Export to OpenVINO with int8 quantization for optimal NPU performance
model.export(format="openvino", int8=True)
# Run highly efficient, accelerated inference on the edge device
results = model("path/to/environment_image.jpg")





