Los mejores modelos de detección de objetos
Explora los mejores modelos de detección de objetos de 2026, desde Ultralytics YOLO hasta RT-DETR, comparando sus arquitecturas, compromisos de rendimiento y factores de implementación.

A principios de este año, Andrew Ng, pionero de la IA y el aprendizaje automático, introdujo el concepto de detección agéntica de objetos. Este enfoque utiliza un agente de razonamiento para detectar objetos basándose en un prompt de texto, sin necesitar grandes cantidades de datos de entrenamiento.
Poder identificar objetos en imágenes y vídeos sin necesitar enormes conjuntos de datos etiquetados es un paso hacia sistemas de visión artificial más inteligentes y flexibles. Sin embargo, la IA de visión agéntica aún se encuentra en sus primeras etapas.
Aunque puede encargarse de tareas generales, como detectar personas o señales de tráfico en una imagen, las aplicaciones de visión artificial más precisas siguen dependiendo de los modelos tradicionales de detección de objetos. Estos modelos se entrenan con conjuntos de datos grandes y cuidadosamente etiquetados para aprender exactamente qué deben buscar y dónde se encuentran los objetos.

Fig. 1. Un ejemplo de detección de objetos. (Fuente)
La detección de objetos tradicional es esencial porque proporciona tanto reconocimiento, es decir, identificar qué es el objeto, como localización, es decir, determinar exactamente dónde se encuentra en la imagen. Esta combinación permite que las máquinas realicen de forma fiable tareas complejas del mundo real, desde vehículos autónomos hasta automatización industrial y diagnóstico médico.
Gracias a los avances tecnológicos, los modelos de detección de objetos siguen mejorando: son más rápidos, precisos y adecuados para entornos reales. En este artículo repasaremos algunos de los mejores modelos de detección de objetos disponibles actualmente. ¡Empecemos!
La necesidad de la detección de objetos#
Las tareas de visión artificial, como la clasificación de imágenes, pueden utilizarse para determinar si una imagen contiene un coche, una persona u otro objeto. Sin embargo, no pueden determinar dónde se encuentra el objeto dentro de la imagen.
Aquí es donde la detección de objetos resulta especialmente útil. Los modelos de detección de objetos pueden identificar qué objetos están presentes y señalar también sus ubicaciones exactas. Este proceso, conocido como localización, permite que las máquinas comprendan las escenas con mayor precisión y respondan adecuadamente, ya sea deteniendo un coche autónomo, guiando un brazo robótico o resaltando una zona en una imagen médica.
El auge del aprendizaje profundo ha transformado la detección de objetos. En lugar de depender de reglas programadas manualmente, los modelos modernos aprenden patrones directamente a partir de anotaciones y datos visuales. Estos conjuntos de datos enseñan a los modelos qué aspecto tienen los objetos, dónde suelen aparecer y cómo afrontar desafíos como los objetos pequeños, las escenas abarrotadas o las condiciones de iluminación variables.
De hecho, los sistemas de detección de objetos de última generación pueden detectar con precisión varios objetos a la vez. Esto convierte la detección de objetos en una tecnología fundamental para aplicaciones como la conducción autónoma, la robótica, la atención sanitaria y la automatización industrial.
Cómo funcionan las tareas de detección de objetos#
La entrada de un modelo de detección de objetos es una imagen, que puede proceder de una cámara, un fotograma de vídeo o incluso una exploración médica. La imagen de entrada se procesa mediante una red neuronal, normalmente una red neuronal convolucional (CNN), entrenada para reconocer patrones en datos visuales.
Dentro de la red, la imagen se analiza por etapas. Según las características que detecta, el modelo predice qué objetos están presentes y dónde aparecen.
Estas predicciones se representan mediante cuadros delimitadores, que son rectángulos dibujados alrededor de cada objeto detectado. Para cada cuadro delimitador, el modelo asigna una etiqueta de clase (por ejemplo, coche, persona o perro) y una puntuación de confianza que indica hasta qué punto está seguro de la predicción (también puede interpretarse como una probabilidad).

Fig. 2. Las predicciones de detección de objetos pueden visualizarse mediante cuadros delimitadores.
El proceso general depende en gran medida de la extracción de características. El modelo aprende a identificar patrones visuales útiles, como bordes, formas, texturas y otras características distintivas. Estos patrones se codifican en mapas de características, que ayudan a la red a comprender la imagen en varios niveles de detalle.
Detección de objetos: de dos etapas y de una etapa#
Según la arquitectura del modelo, los detectores de objetos utilizan distintas estrategias para localizar objetos, equilibrando velocidad, precisión y complejidad.
Muchos modelos de detección de objetos, especialmente los detectores de dos etapas como Faster R-CNN, se centran en partes específicas de la imagen denominadas regiones de interés (ROIs). Al concentrarse en estas zonas, el modelo prioriza las regiones con mayor probabilidad de contener objetos en lugar de analizar todos los píxeles por igual.
Por otro lado, los modelos de una etapa, como los primeros modelos YOLO, no seleccionan ROIs específicos como hacen los modelos de dos etapas. En su lugar, dividen la imagen en una cuadrícula y utilizan cuadros predefinidos, denominados cuadros ancla, junto con mapas de características para predecir objetos en toda la imagen en una sola pasada.
Actualmente, los modelos de detección de objetos más avanzados están explorando enfoques sin anclas. A diferencia de los modelos tradicionales de una etapa, que dependen de cuadros ancla predefinidos, los modelos sin anclas predicen directamente las ubicaciones y los tamaños de los objetos a partir de mapas de características. Esto puede simplificar la arquitectura, reducir la sobrecarga computacional y mejorar el rendimiento, especialmente al detectar objetos de formas y tamaños variados.
Un vistazo a los mejores modelos de detección de objetos#
Actualmente existen muchos modelos de detección de objetos, cada uno diseñado con objetivos específicos. Algunos están optimizados para el rendimiento en tiempo real, mientras que otros se centran en lograr la máxima precisión. Elegir el modelo adecuado para una solución de visión artificial suele depender de tu caso de uso concreto y de tus requisitos de rendimiento.
A continuación, exploraremos algunos de los mejores modelos de detección de objetos de 2026.
1. Modelos YOLO de Ultralytics#
Una de las familias de modelos de detección de objetos más utilizadas actualmente es la familia de modelos YOLO de Ultralytics. YOLO, siglas de You Only Look Once, es popular en numerosos sectores porque ofrece un sólido rendimiento de detección, además de ser rápido, fiable y fácil de utilizar.
La familia YOLO de Ultralytics incluye Ultralytics YOLOv5, Ultralytics YOLOv8, Ultralytics YOLO11 y el próximo Ultralytics YOLO26, con distintas opciones para diferentes requisitos de rendimiento y casos de uso. Gracias a su diseño ligero y a la optimización de su velocidad, los modelos YOLO de Ultralytics son ideales para la detección en tiempo real y pueden implementarse en dispositivos periféricos con una potencia de cálculo y una memoria limitadas.

Fig. 3. Uso de Ultralytics YOLO11 para la detección de objetos (Fuente)
Más allá de la detección básica de objetos, estos modelos son muy versátiles. También admiten tareas como la segmentación de instancias, que delimita los objetos a nivel de píxel, y la estimación de la pose, que identifica puntos clave en personas u objetos. Esta flexibilidad convierte a los modelos YOLO de Ultralytics en una opción habitual para una amplia variedad de aplicaciones, desde la agricultura y la logística hasta el comercio minorista y la fabricación.
Otra razón clave de la popularidad de los modelos YOLO de Ultralytics es el paquete de Python de Ultralytics, que proporciona una interfaz sencilla y fácil de usar para entrenar, ajustar y desplegar modelos. Los desarrolladores pueden empezar con pesos preentrenados, personalizar los modelos para sus propios conjuntos de datos y desplegarlos con solo unas pocas líneas de código.
2. RT-DETR y RT-DETRv2#
RT-DETR (Transformer de detección en tiempo real) y el más reciente RT-DETRv2 son modelos de detección de objetos diseñados para utilizarse en tiempo real. A diferencia de muchos modelos tradicionales, pueden recibir una imagen y proporcionar directamente las detecciones finales sin utilizar la supresión de no máximos (NMS).
NMS es un paso que elimina los cuadros superpuestos adicionales cuando un modelo predice el mismo objeto más de una vez. Omitir NMS hace que el proceso de detección sea más sencillo y rápido.
Estos modelos combinan CNN con transformers. La CNN encuentra detalles visuales como bordes y formas, mientras que el Transformer es un tipo de red neuronal capaz de observar toda la imagen a la vez y comprender cómo se relacionan sus distintas partes. Esta comprensión integral permite al modelo detectar objetos cercanos o superpuestos.
RT-DETRv2 mejora el modelo original con características como la detección multiescala, que ayuda a encontrar objetos pequeños y grandes, y una mejor gestión de las escenas complejas. Estos cambios mantienen la rapidez del modelo y mejoran su precisión.
3. RF-DETR#
RF-DETR es un modelo basado en Transformer y diseñado para tiempo real, que combina la precisión de las arquitecturas Transformer con la velocidad necesaria para las aplicaciones del mundo real. Al igual que RT-DETR y RT-DETRv2, utiliza un Transformer para analizar toda la imagen y una CNN para extraer características visuales detalladas, como bordes, formas y texturas.
El modelo predice directamente los objetos a partir de la imagen de entrada, omitiendo los cuadros ancla y la supresión de no máximos, lo que simplifica el proceso de detección y mantiene rápida la inferencia. RF-DETR también admite la segmentación de instancias, lo que le permite delimitar los objetos a nivel de píxel, además de predecir cuadros delimitadores.
4. EfficientDet#
EfficientDet, presentado a finales de 2019, es un modelo de detección de objetos diseñado para un escalado eficiente y un alto rendimiento. Lo que diferencia a EfficientDet es el escalado compuesto, un método que escala simultáneamente la resolución de entrada, la profundidad de la red y la anchura de la red, en lugar de ajustar solo un factor. Este enfoque ayuda al modelo a mantener una precisión estable, tanto si se amplía para tareas de alto rendimiento como si se reduce para implementaciones ligeras.
Otro componente clave de EfficientDet es su red piramidal de características eficiente (FPN), que permite al modelo analizar imágenes a múltiples escalas. Este análisis multiescala es crucial para detectar objetos de distintos tamaños, ya que permite a EfficientDet identificar de forma fiable objetos pequeños y grandes dentro de la misma imagen.
5. PP-YOLOE+#
PP-YOLOE+, presentado en 2022, es un modelo de detección de objetos de estilo YOLO, lo que significa que detecta y clasifica objetos en una sola pasada sobre la imagen. Este enfoque lo hace rápido y adecuado para aplicaciones en tiempo real, al tiempo que mantiene una alta precisión.
Una de las principales mejoras de PP-YOLOE+ es el aprendizaje alineado con la tarea, que ayuda a que las puntuaciones de confianza del modelo reflejen la precisión con la que se localizan los objetos. Esto resulta especialmente útil para detectar objetos pequeños o superpuestos.

Fig. 4. Detección de objetos mediante PP-YOLOE+ (Fuente)
El modelo también utiliza una arquitectura de cabeza desacoplada, que separa las tareas de predecir las ubicaciones de los objetos y las etiquetas de clase. Esto le permite dibujar cuadros delimitadores con mayor precisión y clasificar correctamente los objetos.
6. GroundingDINO#
GroundingDINO es un modelo de detección de objetos basado en Transformer que combina visión y lenguaje. En lugar de depender de un conjunto fijo de categorías, permite detectar objetos mediante prompts de texto en lenguaje natural.
Al alinear las características visuales de una imagen con descripciones de texto, el modelo puede localizar objetos aunque esas etiquetas exactas no estuvieran presentes en sus datos de entrenamiento. Esto significa que puedes proporcionar al modelo prompts con descripciones como «una persona con casco» o «un coche rojo cerca de un edificio», y generará cuadros delimitadores precisos alrededor de los objetos coincidentes.
Además, al admitir la detección zero-shot, GroundingDINO reduce la necesidad de volver a entrenar o ajustar el modelo para cada nuevo caso de uso, lo que lo hace muy flexible para una amplia variedad de aplicaciones. Esta combinación de comprensión del lenguaje y reconocimiento visual abre nuevas posibilidades para sistemas de IA interactivos y adaptativos.
Métricas habituales para evaluar detectores de objetos#
Al comparar varios modelos de detección de objetos, quizá te preguntes cómo saber cuál ofrece realmente el mejor rendimiento. Es una buena pregunta, porque, además de la arquitectura del modelo y la calidad de tus datos, muchos factores pueden afectar al rendimiento.
Los investigadores suelen basarse en benchmarks compartidos y métricas de rendimiento estándar para evaluar los modelos de forma coherente, comparar resultados y comprender las compensaciones entre velocidad y precisión. Los benchmarks estándar son especialmente importantes porque muchos modelos de detección de objetos se evalúan con los mismos conjuntos de datos, como el conjunto de datos COCO.
Medición de la precisión y la velocidad de detección#
Estas son algunas de las métricas habituales utilizadas para evaluar los modelos de detección de objetos:
- Intersección sobre unión (IoU): Esta métrica mide cuánto se solapa un cuadro delimitador predicho con el objeto real de una imagen. Compara el cuadro dibujado por el modelo con el cuadro de referencia, que corresponde a la ubicación del objeto tal como está etiquetada en el conjunto de datos. La IoU se calcula dividiendo el área de solapamiento entre el área de unión de los dos cuadros. Una IoU más alta indica que el modelo está colocando el cuadro con mayor precisión, mientras que una IoU más baja significa que la predicción es menos precisa. En términos sencillos, la IoU muestra hasta qué punto las predicciones del modelo coinciden con las ubicaciones reales de los objetos.
- Precisión media promedio (mAP): Es la métrica principal utilizada para evaluar el rendimiento general de la detección de objetos. Tiene en cuenta tanto el número de objetos que el modelo detecta correctamente como la precisión de esas detecciones en distintos niveles de confianza y categorías de objetos.
- Fotogramas por segundo (FPS) y latencia: los FPS indican cuántas imágenes o fotogramas de vídeo puede procesar un modelo en un segundo. Por ejemplo, un modelo que funciona a 30 FPS puede procesar 30 fotogramas por segundo. Unos FPS más altos significan que el sistema puede responder más rápido, algo importante en casos de uso como el vídeo en directo, la supervisión del tráfico o la robótica. La latencia, por otro lado, mide cuánto tarda el modelo en procesar una sola imagen o fotograma desde el momento en que lo recibe hasta que el resultado está listo.
Ventajas y desventajas de utilizar algoritmos de detección de objetos#
Estas son algunas de las principales ventajas de utilizar modelos de detección de objetos en aplicaciones del mundo real:
- Escalabilidad en distintos sectores: La detección de objetos puede aplicarse a una amplia variedad de casos de uso, desde la supervisión del tráfico y el análisis del comercio minorista hasta la atención sanitaria, la agricultura y la fabricación.
- Reduce el trabajo manual: Automatizar las tareas de inspección y supervisión visuales reduce la necesidad de una supervisión humana constante y ayuda a los equipos a centrarse en tareas de mayor valor.
- Se beneficia de los ecosistemas de código abierto: Las comunidades activas de código abierto y los recursos disponibles en GitHub facilitan el acceso a modelos preentrenados, la experimentación y la personalización de soluciones.
A pesar de estas ventajas, existen limitaciones prácticas que pueden afectar al rendimiento de los modelos de detección de objetos. Estos son algunos factores importantes que debes tener en cuenta:
- Requisitos de datos de alta calidad: Los modelos de detección de objetos dependen de conjuntos de datos grandes y bien anotados para su entrenamiento. Crear y mantener estos datos puede llevar mucho tiempo, resultar costoso y ser difícil de escalar.
- Necesidades computacionales: Los modelos que ofrecen una mayor precisión de detección suelen requerir una potencia de procesamiento considerable, tanto durante el entrenamiento como durante la implementación en tiempo real. Esto suele implicar utilizar GPU de alto rendimiento, lo que puede aumentar los costes de infraestructura.
- Sensibilidad a las condiciones del mundo real: Las variaciones en la iluminación, los ángulos de cámara, el clima y las escenas abarrotadas pueden afectar al rendimiento de la detección, por lo que es necesario realizar pruebas y ajustes continuos.
Conclusiones clave#
El mejor modelo de detección de objetos para tu proyecto de visión artificial depende de tu caso de uso, la configuración de tus datos, tus requisitos de rendimiento y las limitaciones de tu hardware. Algunos modelos están optimizados para la velocidad, mientras que otros se centran en la precisión, y la mayoría de las aplicaciones del mundo real necesitan un equilibrio entre ambas. Gracias a los frameworks de código abierto y a las comunidades activas en GitHub, cada vez es más fácil evaluar, adaptar e implementar estos modelos para usos prácticos.
Para obtener más información, explora nuestro repositorio de GitHub. Únete a nuestra comunidad y consulta nuestras páginas de soluciones para informarte sobre aplicaciones como la IA en la atención sanitaria y la visión artificial en el sector de la automoción. Descubre nuestras opciones de licencia para empezar hoy mismo con la IA de visión.









