Convolutional Neural Network (CNN)
Explora cómo las redes neuronales convolucionales (CNN) impulsan la visión por ordenador moderna. Aprende sobre sus capas y aplicaciones, y cómo ejecutar Ultralytics YOLO26 para IA en tiempo real.
Una red neuronal convolucional (CNN) es una arquitectura especializada de aprendizaje profundo diseñada para procesar datos con una topología en forma de cuadrícula, especialmente imágenes digitales. Inspiradas en la estructura biológica de la corteza visual, las CNN son especialmente capaces de conservar las relaciones espaciales dentro de los datos de entrada. A diferencia de las redes neuronales tradicionales, que convierten una imagen en una larga lista de números, las CNN analizan regiones pequeñas y superpuestas de una imagen para aprender automáticamente jerarquías de características, desde bordes y texturas sencillos hasta formas y objetos complejos. Esta capacidad las convierte en la tecnología fundamental de los sistemas modernos de visión artificial (CV).
Cómo funcionan las redes neuronales convolucionales#
La potencia de una CNN reside en su capacidad para reducir una imagen compleja a una forma más fácil de procesar sin perder las características esenciales para obtener una buena predicción. Esto se consigue mediante una cadena de capas diferenciadas que transforma el volumen de entrada en una clase o un valor de salida:
- Capa de convolución: Es el componente básico principal. Utiliza un conjunto de filtros entrenables (o kernels) que se desplazan por la imagen de entrada como una linterna. En cada posición, el filtro realiza una operación matemática denominada convolución, creando un mapa de características que resalta patrones específicos, como líneas horizontales o gradientes de color.
- Función de activación: Después de la convolución, se aplica una función no lineal a la salida. La opción más habitual es ReLU (Rectified Linear Unit), que convierte en cero los valores de píxel negativos. Esto introduce no linealidad, lo que permite a la red aprender patrones complejos que van más allá de las relaciones lineales simples.
- Capa de pooling: También conocida como submuestreo, esta capa reduce la dimensionalidad de los mapas de características. Técnicas como el max pooling conservan únicamente las características más importantes (los valores más altos) de una región, lo que reduce la carga computacional y ayuda a evitar el sobreajuste.
- Capa totalmente conectada: En la fase final, las características procesadas se aplanan y se introducen en una red neuronal (NN) estándar. Esta capa utiliza las características de alto nivel identificadas por las capas anteriores para realizar una clasificación o predicción final, como «gato» o «perro».
Aplicaciones en el mundo real#
Las CNN han transformado sectores enteros al automatizar tareas visuales con una precisión sobrehumana.
- Diagnóstico médico: En el ámbito sanitario, las CNN ayudan a los radiólogos a identificar anomalías en exploraciones médicas más rápido que el ojo humano. Por ejemplo, los modelos de aprendizaje profundo analizan exploraciones de MRI y CT para detectar signos tempranos de tumores o fracturas. Las investigaciones sobre la IA en radiología ponen de relieve cómo estas herramientas mejoran la coherencia y la velocidad del diagnóstico.
- Sistemas autónomos: Los coches autónomos dependen en gran medida de las CNN para percibir su entorno. Modelos como YOLO26 utilizan backbones CNN eficientes para realizar detección de objetos en tiempo real e identificar peatones, señales de tráfico y otros vehículos con el fin de tomar decisiones de conducción en fracciones de segundo.
CNN frente a Transformers de visión (ViT)#
Aunque las CNN han sido durante mucho tiempo el estándar para las tareas de visión, ha surgido una arquitectura más reciente denominada Transformer de visión (ViT).
- CNN procesa las imágenes mediante características locales y es muy eficiente con conjuntos de datos más pequeños debido a su «sesgo inductivo» (supone que los píxeles cercanos están relacionados). Destaca en situaciones que requieren inferencia en tiempo real en dispositivos periféricos.
- ViT divide las imágenes en parches y los procesa mediante mecanismos globales de autoatención. Esto le permite capturar dependencias de largo alcance en toda una imagen, pero normalmente requiere conjuntos de datos enormes y más potencia de cálculo para entrenarse de forma eficaz.
Ejemplo de implementación#
Las bibliotecas modernas facilitan el uso de modelos basados en CNN. El paquete ultralytics proporciona acceso a modelos de última generación como YOLO26, que incorporan arquitecturas CNN altamente optimizadas para una inferencia rápida.
El siguiente ejemplo muestra cómo cargar un modelo CNN preentrenado y ejecutar una predicción:
from ultralytics import YOLO
# Load a YOLO26 model, which uses an advanced CNN architecture
model = YOLO("yolo26n.pt")
# Run inference on an image to identify objects
results = model("https://ultralytics.com/images/bus.jpg")
# Display the prediction results
results[0].show()Herramientas de desarrollo#
El desarrollo de CNN cuenta con el respaldo de un sólido ecosistema de herramientas de código abierto. Los ingenieros suelen utilizar frameworks como PyTorch o TensorFlow para crear arquitecturas personalizadas. Estas bibliotecas proporcionan las operaciones de bajo nivel con tensores necesarias para la convolución y la retropropagación.
Para los equipos que buscan agilizar el ciclo de vida de los proyectos de visión artificial, desde la recopilación de datos hasta el despliegue, Ultralytics Platform ofrece una solución integral. Simplifica los flujos de trabajo complejos y permite a los desarrolladores centrarse en aplicar CNN para resolver problemas empresariales en lugar de gestionar la infraestructura. Además, los modelos se pueden exportar a formatos como ONNX o TensorRT para realizar despliegues de alto rendimiento en dispositivos periféricos.









