¿Qué es la correspondencia de imágenes en la visión artificial? Una breve introducción
Descubre cómo funciona la coincidencia de imágenes en la IA de visión y explora las tecnologías fundamentales que ayudan a las máquinas a detectar, comparar y comprender datos visuales.

Cuando miras dos imágenes del mismo objeto, como una pintura y una fotografía de un coche, es fácil darse cuenta de lo que tienen en común. Sin embargo, para las máquinas no es tan sencillo.
Para realizar este tipo de comparaciones, las máquinas recurren a la visión artificial, una rama de la inteligencia artificial (AI) que les ayuda a interpretar y comprender la información visual. La visión artificial permite a los sistemas detectar objetos, comprender escenas y extraer patrones de imágenes o vídeos.
En particular, algunas tareas visuales van más allá de analizar una sola imagen. Consisten en comparar imágenes para encontrar similitudes, detectar diferencias o seguir cambios a lo largo del tiempo.
La IA de visión abarca un amplio conjunto de técnicas, y una capacidad esencial, conocida como correspondencia de imágenes, se centra en identificar similitudes entre imágenes, incluso cuando varían la iluminación, los ángulos o los fondos. Esta técnica puede utilizarse en diversas aplicaciones, como la robótica, la realidad aumentada y la cartografía geográfica.
En este artículo, veremos qué es la correspondencia de imágenes, sus técnicas principales y algunas de sus aplicaciones en el mundo real. ¡Empecemos!
¿Qué es la correspondencia de imágenes?#
La correspondencia de imágenes permite a un sistema informático comprender si dos imágenes contienen contenido similar. Las personas pueden hacerlo de forma intuitiva al fijarse en las formas, los colores y los patrones.
Los ordenadores, en cambio, se basan en datos numéricos. Analizan las imágenes examinando cada píxel, que es la unidad más pequeña de una imagen digital.
Cada imagen se almacena como una cuadrícula de píxeles, y normalmente cada píxel contiene valores para el rojo, el verde y el azul (RGB). Estos valores pueden cambiar cuando una imagen se gira, se cambia de tamaño, se observa desde un ángulo diferente o se captura con distintas condiciones de iluminación. Debido a estas variaciones, comparar imágenes píxel a píxel a menudo no resulta fiable.
Para que las comparaciones sean más coherentes, la correspondencia de imágenes se centra en características locales, como esquinas, bordes y regiones con textura, que tienden a mantenerse estables aunque una imagen cambie ligeramente. Al detectar estas características, o puntos clave, en varias imágenes, un sistema puede compararlas con mucha más precisión.
Este proceso se utiliza ampliamente en casos de uso como la navegación, la localización, la realidad aumentada, la cartografía, la reconstrucción 3D y la búsqueda visual. Cuando los sistemas identifican los mismos puntos en distintas imágenes o en varios fotogramas, pueden seguir el movimiento, comprender la estructura de la escena y tomar decisiones fiables en entornos dinámicos.

Fig. 1. Ejemplo de correspondencia de imágenes de un coche con puntos clave similares identificados. (Fuente)
Cómo funciona la correspondencia de imágenes#
La correspondencia de imágenes consta de varios pasos clave que ayudan a los sistemas a identificar y comparar regiones similares dentro de las imágenes. Cada paso mejora la precisión, la coherencia y la robustez en distintas condiciones.
Así funciona la correspondencia de imágenes, paso a paso:
- Detección de características: Primero, el sistema identifica puntos clave distintivos en una imagen que permanecen estables aunque cambien la iluminación, la escala o el ángulo de visión. Estos puntos resaltan zonas como esquinas, bordes o regiones con textura que destacan visualmente.
- Descripción de características: A continuación, cada punto clave se convierte en un descriptor, un vector numérico compacto que captura el patrón visual alrededor de ese punto. Estos descriptores ofrecen una forma fiable de comparar características entre distintas imágenes.
- Correspondencia de características: Los descriptores de dos imágenes se comparan mediante algoritmos de correspondencia que calculan hasta qué punto se parecen. Este paso empareja los puntos clave que parecen corresponderse y descarta las correspondencias más débiles o poco fiables.
- Verificación geométrica: Por último, el sistema comprueba si los puntos clave correspondientes forman una relación geométrica realista. Elimina las correspondencias incorrectas, denominadas valores atípicos, mediante un método conocido como RANSAC (consenso de muestras aleatorias), que garantiza que solo se conserven los pares de puntos fiables. Una vez identificadas las correspondencias válidas, el sistema estima la transformación que relaciona mejor las dos imágenes. A menudo se trata de una transformación afín, que compensa cambios como el escalado, la rotación y el desplazamiento, o de una homografía, que también puede gestionar cambios de perspectiva. El uso de estas transformaciones permite al sistema alinear las imágenes con precisión, aunque se hayan capturado desde puntos de vista ligeramente diferentes.

Fig. 2. (a) Extracción de puntos característicos y (b) correspondencia de características. (Fuente)
Técnicas principales utilizadas en la correspondencia de imágenes#
Antes de explorar las aplicaciones de la correspondencia de imágenes en el mundo real, veamos más de cerca las técnicas de correspondencia de imágenes utilizadas en los sistemas de visión artificial.
Correspondencia de imágenes basada en plantillas#
La correspondencia de plantillas es uno de los métodos de correspondencia de imágenes más sencillos. Generalmente se considera una técnica de procesamiento de imágenes, en lugar de un método moderno de visión artificial, porque se basa en comparaciones directas de píxeles y no extrae características visuales más profundas.
Se utiliza para localizar una imagen de referencia más pequeña, o plantilla, dentro de una escena más grande. Funciona mediante un algoritmo que desplaza una plantilla por la imagen principal y calcula una puntuación de similitud en cada posición para medir hasta qué punto coinciden ambas regiones. El área con la puntuación más alta se considera la mejor correspondencia e indica dónde es más probable que aparezca el objeto en la escena.

Fig. 3. Una vista del uso de la correspondencia de plantillas. (Fuente)
Esta técnica funciona bien cuando la escala, la rotación y la iluminación del objeto se mantienen constantes, por lo que es una buena opción para entornos controlados o comparaciones de referencia. Sin embargo, su rendimiento disminuye cuando el objeto tiene un aspecto diferente al de la plantilla, por ejemplo, cuando cambia de tamaño, se gira, queda parcialmente oculto o aparece sobre un fondo ruidoso o complejo.
Técnicas clásicas de correspondencia de imágenes basadas en características#
Antes de que el aprendizaje profundo se adoptara ampliamente, la correspondencia de imágenes se basaba principalmente en algoritmos clásicos de visión artificial que detectaban puntos clave distintivos en una imagen. En lugar de comparar cada píxel, estos métodos analizan los gradientes de la imagen, es decir, los cambios de intensidad, para resaltar esquinas, bordes y regiones con textura que destacan.
A continuación, cada punto clave detectado se representa mediante un resumen numérico compacto denominado descriptor. Al comparar dos imágenes, un algoritmo de correspondencia evalúa estos descriptores para encontrar los pares más similares.
Una puntuación de similitud alta suele indicar que el mismo punto físico aparece en ambas imágenes. Los algoritmos de correspondencia también utilizan métricas de distancia específicas o reglas de puntuación para determinar hasta qué punto se alinean las características, lo que mejora la fiabilidad general.
Estos son algunos de los principales algoritmos clásicos de visión artificial utilizados para la correspondencia de imágenes:
-
SIFT (transformación de características invariante a la escala): Identifica puntos clave mediante el análisis de los gradientes de intensidad de la imagen, lo que permite reconocerlos aunque la imagen se amplíe, se reduzca o se gire.
-
SURF (características robustas aceleradas): Este algoritmo es similar a SIFT, pero está optimizado para ofrecer mayor velocidad. Utiliza aproximaciones rápidas de operaciones basadas en gradientes, por lo que resulta adecuado para aplicaciones que requieren tiempos de respuesta reducidos.
-
ORB (FAST orientado y BRIEF rotado): Combina dos algoritmos llamados FAST y BRIEF. FAST encuentra rápidamente puntos similares a esquinas en una imagen, mientras que BRIEF crea una descripción compacta de cada punto para poder establecer correspondencias entre imágenes. ORB también mejora ambos pasos al añadir la gestión de la rotación, lo que lo hace rápido y fiable.

Fig. 4. Puntos característicos SURF extraídos y relacionados entre dos imágenes. (Fuente)
Técnicas de correspondencia de imágenes basadas en aprendizaje profundo#
A diferencia de los métodos clásicos, que se basan en reglas específicas, el aprendizaje profundo aprende automáticamente características a partir de grandes conjuntos de datos, que son recopilaciones de datos visuales de los que los modelos de IA aprenden patrones. Estos modelos suelen ejecutarse en GPU (unidades de procesamiento gráfico), que proporcionan la gran potencia de cálculo necesaria para procesar grandes lotes de imágenes y entrenar redes neuronales complejas de forma eficiente.
Esto permite a los modelos de IA gestionar cambios del mundo real, como la iluminación, los ángulos de la cámara y las oclusiones. Algunos modelos también combinan todos los pasos en un único flujo de trabajo, lo que ofrece un rendimiento robusto en condiciones exigentes.
Estos son algunos enfoques basados en aprendizaje profundo para la extracción y la correspondencia de características de imágenes:
-
Extracción de características basada en CNN: Estos modelos aprenden automáticamente patrones visuales clave a partir de grandes conjuntos de datos. Reconocen características que probablemente no cambien, por lo que resultan fiables para establecer correspondencias de objetos en distintas escenas.
-
Correspondencia basada en embeddings: En lugar de comparar directamente los píxeles, este método convierte las imágenes en representaciones numéricas compactas conocidas como embeddings. A continuación, el algoritmo de correspondencia compara estos embeddings para encontrar elementos visuales similares. Modelos como FaceNet, que genera embeddings para reconocer y comparar rostros, y CLIP, que asigna imágenes y texto a un espacio compartido para tareas como la búsqueda de imágenes y la correspondencia semántica, siguen este enfoque.
-
Flujos de correspondencia de extremo a extremo: Los sistemas de aprendizaje profundo más avanzados suelen combinar la detección, la descripción y la correspondencia de puntos clave en un flujo de trabajo unificado. Modelos como SuperPoint y D2-Net aprenden tanto los puntos clave como los descriptores directamente a partir de mapas de características de CNN, mientras que SuperGlue actúa como un algoritmo de correspondencia aprendido que empareja estos descriptores de forma más fiable que los métodos tradicionales. En conjunto, estos componentes crean un flujo de extremo a extremo que ofrece mayor precisión y robustez en condiciones exigentes que los enfoques clásicos basados en características.
-
Correspondencia basada en Transformer: Este método utiliza mecanismos de atención para vincular regiones correspondientes entre dos imágenes, lo que permite alinear parches incluso cuando existen grandes cambios de perspectiva, iluminación o textura. Modelos como LoFTR (Transformer de características locales) alcanzan una precisión mucho mayor porque el campo receptivo global del Transformer permite realizar correspondencias fiables en zonas con poca textura, borrosas o repetitivas, donde fallan los detectores tradicionales. LoFTR produce correspondencias semidensas y de alta confianza, y supera ampliamente a los métodos anteriores de vanguardia en pruebas de referencia tanto en interiores como en exteriores.
-
Modelos centrados en la eficiencia: Los modelos más recientes de correspondencia de imágenes aspiran a ofrecer una gran precisión con una ejecución más rápida. Modelos como LightGlue están diseñados para ejecutarse de forma eficiente en dispositivos con una potencia de cálculo limitada, manteniendo al mismo tiempo una buena calidad de correspondencia.
Aplicaciones de la correspondencia de imágenes en el mundo real#
Ahora que comprendemos mejor cómo funciona la correspondencia de imágenes, veamos algunas aplicaciones del mundo real en las que desempeña un papel importante.
Robótica más inteligente impulsada por la correspondencia de imágenes#
Los robots suelen trabajar en entornos concurridos y cambiantes, donde necesitan comprender qué objetos están presentes y cómo están colocados. La correspondencia de imágenes puede ayudar a los robots a comprender los objetos que ven comparándolos con imágenes almacenadas o de referencia. Esto facilita que reconozcan objetos, sigan su movimiento y se adapten incluso cuando cambian la iluminación o los ángulos de la cámara.
Por ejemplo, en un almacén, un sistema robótico de recogida y colocación puede utilizar la correspondencia de imágenes para identificar y manipular distintos artículos. Primero, el robot recoge un objeto y después compara su imagen con muestras de referencia para identificarlo.

Fig. 5. Un robot reconoce y recoge objetos mediante su correspondencia con imágenes de referencia. (Fuente)
Una vez encontrada la correspondencia, el robot sabe cómo clasificar o colocar el objeto correctamente. Este enfoque permite a los robots reconocer tanto objetos conocidos como nuevos sin tener que volver a entrenar todo el sistema. También les ayuda a tomar mejores decisiones en tiempo real, como organizar estanterías, ensamblar piezas o reorganizar artículos.
Mejora de la reconstrucción 3D mediante una mejor correspondencia de imágenes#
En ámbitos como la cartografía con drones, la realidad virtual y la inspección de edificios, los sistemas suelen necesitar reconstruir un modelo 3D a partir de varias imágenes 2D. Para ello, se basan en la correspondencia de imágenes para identificar puntos clave comunes, como esquinas o regiones con textura, que aparecen en varias imágenes.
Estos puntos compartidos ayudan al sistema a comprender cómo se relacionan las imágenes entre sí en el espacio 3D. Esta idea está estrechamente relacionada con la estructura a partir del movimiento (SfM), una técnica que construye estructuras 3D identificando y relacionando puntos clave en imágenes capturadas desde distintos puntos de vista.
Si la correspondencia no es precisa, el modelo 3D resultante puede aparecer distorsionado o incompleto. Por este motivo, los investigadores trabajan para mejorar la fiabilidad de la correspondencia de imágenes para la reconstrucción 3D, y los avances recientes han mostrado resultados prometedores.
Un ejemplo interesante es HashMatch, un algoritmo de correspondencia de imágenes más rápido y robusto. HashMatch convierte los detalles de las imágenes en patrones compactos llamados códigos hash, lo que facilita identificar las correspondencias correctas y eliminar los valores atípicos, incluso cuando varían la iluminación o los puntos de vista.
Al probarlo con conjuntos de datos a gran escala, HashMatch generó modelos de reconstrucción 3D más limpios y realistas, con menos errores de alineación. Esto lo hace especialmente útil para aplicaciones como la cartografía con drones, los sistemas de RA y la conservación del patrimonio cultural, donde la precisión es fundamental.
El papel de la correspondencia de imágenes en la realidad aumentada#
En el caso de la realidad aumentada (AR), mantener los objetos virtuales alineados con el mundo real suele ser un desafío. Los entornos exteriores pueden cambiar constantemente en función de las condiciones ambientales, como la luz solar y el tiempo. Las diferencias sutiles del mundo real pueden hacer que los elementos virtuales parezcan inestables o ligeramente desplazados.
Para resolver este problema, los sistemas de RA utilizan la correspondencia de imágenes para interpretar su entorno. Al comparar los fotogramas capturados en directo por la cámara con imágenes de referencia almacenadas, pueden comprender dónde se encuentra el usuario y cómo ha cambiado la escena.

Fig. 6. Puntos característicos relacionados entre dos imágenes. (Fuente: theijes.com)
Por ejemplo, en un estudio sobre entrenamiento de RA en exteriores de estilo militar con gafas XR (realidad extendida), los investigadores utilizaron SIFT y otros métodos basados en características para relacionar detalles visuales entre imágenes reales y de referencia. Las correspondencias precisas mantuvieron los elementos virtuales correctamente alineados con el mundo real, incluso cuando el usuario se movía rápidamente o cambiaba la iluminación.
Conclusiones clave#
La correspondencia de imágenes es un componente fundamental de la visión artificial, ya que permite a los sistemas comprender cómo se relacionan entre sí distintas imágenes o cómo cambia una escena con el tiempo. Desempeña un papel fundamental en la robótica, la realidad aumentada, la reconstrucción 3D, la navegación autónoma y muchas otras aplicaciones del mundo real en las que la precisión y la estabilidad son esenciales.
Con modelos de IA avanzados como SuperPoint y LoFTR, los sistemas actuales son mucho más robustos que los métodos anteriores. A medida que sigan avanzando las técnicas de aprendizaje automático, los módulos de visión especializados, las redes neuronales y los conjuntos de datos, es probable que la correspondencia de imágenes sea más rápida, precisa y adaptable.
Únete a nuestra creciente comunidad y explora nuestro repositorio de GitHub para acceder a recursos prácticos de IA. Para crear soluciones con IA de visión hoy mismo, explora nuestras opciones de licencia. Descubre cómo la IA en la agricultura está transformando el sector agrícola y cómo la IA de visión en la sanidad está dando forma al futuro visitando nuestras páginas de soluciones.









