¿Qué es la transformación de características invariante a la escala (SIFT)?
Explora el algoritmo SIFT. Descubre qué es SIFT y sus potentes funciones para la visión artificial invariante a la escala. Mejora el procesamiento de tus imágenes.

Para ver una explicación visual de los conceptos tratados en este artículo, mira el vídeo siguiente.
Hoy en día, muchos de los dispositivos inteligentes que utilizamos, desde teléfonos y cámaras hasta sistemas domóticos, incorporan soluciones de IA capaces de reconocer rostros, objetos e incluso escenas visuales completas. Esta capacidad procede de la visión artificial, un campo de la inteligencia artificial que permite a las máquinas comprender e interpretar imágenes y vídeos.
Por ejemplo, si haces una foto de la Torre Eiffel desde cualquier ángulo o distancia, tu dispositivo normalmente seguirá pudiendo reconocerla mediante visión artificial y organizarla en la carpeta correcta de tu galería. Aunque parece sencillo, reconocer objetos no siempre lo es. Las imágenes pueden verse muy diferentes dependiendo de su tamaño, ángulo, escala o iluminación, lo que dificulta que las máquinas los identifiquen de forma coherente.
Para ayudar a resolver este problema, los investigadores desarrollaron un algoritmo de visión artificial llamado Transformada de características invariantes a la escala, o SIFT. Este algoritmo permite detectar objetos en distintas condiciones de observación. Creado por David Lowe en 1999, SIFT se diseñó para encontrar y describir puntos clave únicos de una imagen, como esquinas, bordes o patrones que siguen siendo reconocibles incluso cuando la imagen cambia de tamaño, se gira o recibe una iluminación diferente.
Antes de que se popularizaran los modelos de visión artificial basados en aprendizaje profundo, como Ultralytics YOLO11, SIFT era una técnica muy utilizada en visión artificial. Era un enfoque estándar para tareas como el reconocimiento de objetos, cuyo objetivo es identificar un elemento concreto en una foto, y la correspondencia de imágenes, en la que las fotos se alinean buscando características visuales superpuestas.
En este artículo, analizaremos SIFT con una breve explicación de qué es, cómo funciona a alto nivel y por qué es importante en la evolución de la visión artificial. ¡Empecemos!
Por qué el algoritmo SIFT es esencial para la visión artificial#
En una imagen, un objeto puede aparecer de muchas formas diferentes. Por ejemplo, una taza de café puede fotografiarse desde arriba, de lado, bajo una luz solar intensa o bajo una lámpara de luz cálida. La misma taza también puede parecer más grande cuando está cerca de la cámara y más pequeña cuando está lejos.
Todas estas diferencias hacen que enseñar a un ordenador a reconocer un objeto sea una tarea complicada. Esta tarea de visión artificial, conocida como detección de objetos, requiere que los modelos de IA de visión identifiquen y localicen objetos con precisión, incluso cuando cambian su tamaño, ángulo o condiciones de iluminación.
Para hacerlo posible, la visión artificial se basa en un proceso llamado extracción o detección de características. En lugar de intentar comprender toda la imagen de una vez, un modelo busca características visuales distintivas, como esquinas marcadas, patrones únicos o texturas que sigan siendo reconocibles desde distintos ángulos, escalas y condiciones de iluminación.
En concreto, eso es lo que hace la Transformada de características invariantes a la escala, o SIFT. SIFT es un algoritmo de detección y descripción de características que puede identificar objetos de forma fiable en imágenes, independientemente de cómo se hayan capturado.
Lograr la invariancia a la escala#
El algoritmo SIFT tiene varias propiedades importantes que lo hacen útil para el reconocimiento de objetos. Una de las principales se denomina invariancia a la escala. Esto significa que SIFT puede reconocer distintas partes de un objeto tanto si parece grande y está cerca de la cámara como si parece pequeño y está lejos. Aunque el objeto no sea completamente visible, el algoritmo puede seguir identificando los mismos puntos clave.
Lo consigue mediante un concepto llamado teoría del espacio de escalas. En pocas palabras, la imagen se desenfoca en distintos niveles para crear varias versiones. Después, SIFT examina estas versiones para encontrar patrones y detalles que permanezcan iguales, independientemente de cómo cambien el tamaño o la nitidez de la imagen.
Por ejemplo, una señal de tráfico fotografiada a unos metros de distancia parecerá mucho más grande que la misma señal capturada desde lejos, pero SIFT puede seguir detectando las mismas características distintivas. Esto permite hacer corresponder correctamente las dos imágenes, aunque la señal aparezca en escalas muy diferentes.
Garantizar la invariancia a la rotación#
Los objetos de las imágenes también pueden aparecer girados, a veces incluso boca abajo. SIFT gestiona esto mediante una propiedad llamada invariancia a la rotación. Para cada punto clave que detecta, el algoritmo asigna una orientación coherente basándose en los gradientes locales de la imagen. De este modo, el mismo objeto puede reconocerse independientemente de cómo esté girado.
Puedes imaginarlo como si marcaras cada punto clave con una pequeña flecha que indicara hacia dónde apunta. Al alinear las características con estas orientaciones, SIFT garantiza que los puntos clave coincidan correctamente incluso cuando el objeto está girado. Por ejemplo, un monumento capturado en una foto apaisada puede seguir identificándose correctamente aunque otra foto se tome con la cámara inclinada.
Resistencia a otras variaciones de la imagen#
Además del tamaño y la rotación, las imágenes también pueden cambiar de otras formas, como por variaciones en la iluminación. La iluminación de un objeto puede pasar de intensa a tenue, el ángulo de la cámara puede variar ligeramente o la imagen puede estar desenfocada o contener ruido.
SIFT está diseñado para gestionar este tipo de variaciones. Lo hace centrándose en puntos clave distintivos y de alto contraste, ya que estas características se ven menos afectadas por los cambios de iluminación o por pequeños desplazamientos del punto de vista. Como resultado, SIFT suele ser más fiable que los métodos sencillos de detección de bordes o esquinas, que a menudo fallan cuando cambian las condiciones.

Fig. 1. Puntos clave de SIFT extraídos de (a) una imagen lluviosa y (b) su correspondiente imagen de entrada sin lluvia. (Fuente)
Piensa en un cuadro de una galería. Puede seguir reconociéndose tanto si se fotografía con una suave luz natural, bajo focos artificiales intensos o incluso con un ligero desenfoque de movimiento provocado por una cámara sujetada con la mano. Los puntos clave permanecen lo bastante estables como para permitir una correspondencia precisa pese a estas diferencias.
Cómo funciona el algoritmo de Transformada de características invariantes a la escala (SIFT)#
A continuación, veremos cómo funciona el algoritmo SIFT. Este proceso puede dividirse en cuatro pasos principales: detección de puntos clave, localización de puntos clave, asignación de orientación y descripción de puntos clave.
Paso 1: detección de extremos en el espacio de escalas#
El primer paso consiste en encontrar y detectar puntos clave, que son zonas distintivas de la imagen, como esquinas o cambios bruscos de textura, que ayudan a seguir o reconocer un objeto.
Para garantizar que estos posibles puntos clave puedan reconocerse con cualquier tamaño, SIFT crea lo que se denomina un espacio de escalas. Se trata de un conjunto de imágenes creado desenfocando gradualmente la imagen original con un filtro gaussiano, una técnica de suavizado, y agrupando los resultados en capas llamadas octavas. Cada octava contiene la misma imagen con niveles de desenfoque crecientes, mientras que la octava siguiente es una versión más pequeña de la imagen.
Al restar una imagen desenfocada de otra, SIFT calcula la Diferencia de gaussianas (DoG), que resalta las zonas donde el brillo cambia bruscamente. Estas zonas se eligen como puntos clave candidatos porque mantienen su coherencia cuando la imagen se amplía o se reduce.

Fig. 2. DoG resalta las estructuras principales al restar imágenes desenfocadas en distintos niveles. (Fuente)
Paso 2: localización de puntos clave#
No todos los puntos clave candidatos son útiles, ya que algunos pueden ser débiles o inestables. Para perfeccionarlos, SIFT utiliza un método matemático llamado expansión en serie de Taylor, que ayuda a estimar con mayor precisión la posición exacta de un punto clave.
Durante este paso se eliminan los puntos poco fiables. Se descartan los puntos clave con bajo contraste, que se confunden con el entorno, así como los que se encuentran directamente sobre bordes, ya que pueden desplazarse con demasiada facilidad. Este filtrado deja únicamente los puntos clave más estables y distintivos.
Paso 3: asignación de orientación#
Una vez identificados los puntos clave estables, SIFT los hace invariantes a la rotación, lo que significa que pueden seguir correspondiéndose aunque la imagen se gire de lado o boca abajo. Para ello, SIFT analiza cómo cambia el brillo alrededor de cada punto clave, lo que se conoce como gradiente. Los gradientes muestran tanto la dirección como la intensidad del cambio en la intensidad de los píxeles y, en conjunto, capturan la estructura local alrededor del punto.
Para cada punto clave, SIFT tiene en cuenta los gradientes de una región circundante y los agrupa en un histograma de orientaciones. El pico más alto de este histograma indica la dirección dominante del cambio de intensidad, que se asigna como orientación del punto clave. Para construir este histograma se utilizan tanto las direcciones de los gradientes, que muestran dónde cambia la intensidad, como sus magnitudes, que indican la intensidad de dicho cambio.
Si hay otros picos casi igual de intensos, SIFT asigna varias orientaciones al mismo punto clave. Esto evita que se pierdan características importantes cuando los objetos aparecen desde ángulos inusuales. Al alinear cada punto clave con su orientación, SIFT garantiza que los descriptores generados en el paso siguiente sigan siendo coherentes.
En otras palabras, aunque dos imágenes del mismo objeto estén giradas de forma diferente, los puntos clave alineados con la orientación seguirán coincidiendo correctamente. Este paso es el que proporciona a SIFT su gran capacidad para gestionar la rotación y lo hace mucho más robusto que los métodos anteriores de detección de características.

Fig. 3. Vista más detallada del paso 3 del algoritmo SIFT (Fuente)
Paso 4: descriptor de puntos clave#
El último paso de SIFT consiste en crear una descripción de cada punto clave para que pueda reconocerse en otras imágenes.
SIFT lo consigue examinando un pequeño recuadro cuadrado alrededor de cada punto clave, de unos 16 por 16 píxeles. Primero, este recuadro se alinea con la orientación del punto clave para que la rotación no le afecte. Después, el recuadro se divide en una cuadrícula de 4 por 4 cuadrados más pequeños.
En cada cuadrado pequeño, SIFT mide cómo cambia el brillo en distintas direcciones. Estos cambios se almacenan en algo llamado histograma, que funciona como un gráfico que muestra qué direcciones son más frecuentes. Cada cuadrado tiene su propio histograma y, en conjunto, los 16 cuadrados producen 16 histogramas.
Por último, estos histogramas se combinan en una única lista de números, 128 en total. Esta lista se denomina vector de características y actúa como una huella digital del punto clave. Como captura la textura y la estructura únicas alrededor del punto, esta huella permite hacer corresponder el mismo punto clave entre distintas imágenes, aunque se hayan redimensionado, girado o iluminado de forma diferente.

Fig. 4. Resumen del funcionamiento de SIFT (Fuente)
Principales aplicaciones de SIFT en visión artificial#
Ahora que entendemos mejor qué es SIFT y cómo funciona, veamos algunas de sus aplicaciones reales en visión artificial.
Reconocimiento y detección de objetos#
Uno de los principales usos de SIFT es el reconocimiento y la detección de objetos. Esto consiste en enseñar a un ordenador a reconocer y localizar objetos en imágenes, aunque no siempre tengan el mismo aspecto. Por ejemplo, SIFT puede detectar un libro tanto si está cerca de la cámara como si está más lejos o girado en un ángulo.
Esto funciona porque SIFT extrae puntos clave muy distintivos y estables. Cuando estos puntos clave se combinan con descriptores SIFT, forman características SIFT, que ofrecen una forma fiable de hacer corresponder el mismo objeto entre distintas imágenes. Estas características capturan detalles únicos del objeto que permanecen coherentes, lo que permite hacer corresponder características de forma fiable entre imágenes aunque cambien el tamaño, la posición o la orientación del objeto.

Fig. 5. Uso de SIFT para reconocer la portada de un libro en una nueva imagen tomada desde una orientación diferente a la original. Imagen del autor.
Antes de que se popularizara el aprendizaje profundo, SIFT era uno de los métodos más fiables para crear sistemas de reconocimiento de objetos. Se utilizaba ampliamente en investigaciones y aplicaciones que requerían hacer corresponder objetos entre grandes conjuntos de datos de imágenes, aunque a menudo exigía importantes recursos computacionales.
Unión de imágenes y creación de panoramas#
SIFT también puede utilizarse para crear imágenes panorámicas, es decir, fotos amplias creadas uniendo varias imágenes. Con SIFT, se encuentran puntos clave distintivos en las partes solapadas de distintas imágenes y después se hacen corresponder entre sí. Estas correspondencias actúan como anclajes y guían el proceso de unión para indicar cómo deben alinearse las fotos.
Una vez completada la correspondencia, pueden utilizarse algoritmos de unión para calcular la alineación correcta, normalmente mediante transformaciones geométricas que proyectan una imagen sobre otra. Después, las imágenes se fusionan para que desaparezcan las uniones. El resultado final es un panorama uniforme que parece una única foto panorámica, aunque se haya creado a partir de varias tomas.
Reconstrucción 3D y robótica#
Otra aplicación interesante de SIFT es la reconstrucción 3D, en la que se combinan varias fotos 2D tomadas desde distintos ángulos para crear un modelo tridimensional. SIFT funciona encontrando y haciendo corresponder los mismos puntos en estas imágenes.
Una vez establecidas las correspondencias, las posiciones 3D de esos puntos pueden estimarse mediante triangulación, un método que calcula la profundidad desde distintos puntos de vista. Este proceso forma parte de la estructura a partir del movimiento (SfM), una técnica que utiliza varias imágenes superpuestas para estimar la forma 3D de una escena junto con las posiciones de las cámaras que tomaron las fotos.
El resultado suele ser una nube de puntos 3D, un conjunto de puntos en el espacio que delimita el objeto o el entorno. SIFT fue una de las primeras herramientas que hicieron práctica la estructura a partir del movimiento. Aunque las técnicas más recientes son hoy más rápidas y habituales, SIFT sigue aplicándose cuando la precisión es más importante que la velocidad.
SIFT también se ha utilizado en robótica, especialmente en SLAM visual (localización y mapeo simultáneos). SLAM permite que un robot averigüe dónde está mientras crea al mismo tiempo un mapa de su entorno.
Los puntos clave de SIFT actúan como referencias fiables que un robot puede reconocer entre fotogramas, incluso cuando cambian la iluminación o los ángulos. Al seguir estas referencias, el robot puede estimar su posición y actualizar su mapa sobre la marcha. Aunque hoy en día se utilizan con más frecuencia detectores de características más rápidos en robótica, SIFT desempeñó un papel importante en los primeros sistemas SLAM y sigue siendo fundamental cuando la robustez es más importante que la velocidad.
Ventajas y consideraciones de SIFT#
Aunque el algoritmo SIFT se ha utilizado ampliamente en visión artificial y es conocido por ser un método fiable, también implica ciertas contrapartidas. Por eso es importante sopesar sus ventajas e inconvenientes antes de decidir si encaja en un proyecto. A continuación, repasaremos sus principales puntos fuertes y limitaciones.
Principales ventajas de SIFT#
Estas son algunas de las ventajas de utilizar el algoritmo SIFT:
- Invariancia a la escala y la rotación: SIFT proporciona puntos clave invariantes a la escala que permanecen relativamente estables cuando los objetos aparecen con distintos tamaños u orientaciones, lo que supone un avance significativo respecto a los detectores de características anteriores.
- Robustez moderada frente a cambios de iluminación y punto de vista: SIFT puede gestionar cambios de brillo, contraste o pequeños desplazamientos del punto de vista, aunque es menos fiable en condiciones más extremas.
- Capacidad para trabajar en escenas desordenadas o parcialmente ocultas: Como SIFT detecta muchos puntos clave locales, a menudo puede seguir identificando un objeto aunque parte de él esté cubierta o el fondo sea complejo.
Consideraciones sobre el rendimiento y alternativas#
Estos son algunos de los inconvenientes de utilizar el algoritmo SIFT:
- Coste computacional elevado: El proceso de varios pasos de SIFT y sus descriptores detallados lo hacen más lento y exigente en recursos que los detectores de características modernos. Para mejorarlo, los investigadores desarrollaron el algoritmo SURF (características robustas aceleradas), que utiliza cálculos más rápidos para encontrar y describir características. SURF es menos preciso que SIFT en algunos casos, pero se ejecuta mucho más rápido, lo que lo hace más práctico para tareas en las que el tiempo es importante.
- No es ideal para uso en tiempo real: Debido a su coste computacional, SIFT tiene dificultades en aplicaciones en las que la velocidad es crítica, como el seguimiento en tiempo real o la robótica móvil.
- Versatilidad limitada: Aunque es robusto en muchos casos, SIFT es menos eficaz ante cambios extremos de iluminación, grandes variaciones del punto de vista o escenas muy dinámicas en las que los algoritmos más recientes o los métodos de aprendizaje automático ofrecen mejores resultados.
Al analizar las ventajas y los inconvenientes de SIFT, quizá observes que muchas de sus limitaciones allanaron el camino para técnicas más avanzadas. En concreto, las redes neuronales convolucionales (CNNs) surgieron como una alternativa potente.
Una CNN es un tipo de modelo de aprendizaje profundo inspirado en el funcionamiento del sistema visual humano. Procesa una imagen por capas, empezando por patrones sencillos como bordes y texturas y construyendo gradualmente formas y objetos más complejos. A diferencia de las reglas de características diseñadas manualmente de SIFT, las CNN aprenden las representaciones de características directamente de los datos.
Este aprendizaje basado en datos permite a las CNN superar a SIFT en tareas de correspondencia de descriptores y clasificación. Las CNN también son más expresivas y robustas, y se adaptan mejor a la variabilidad y complejidad de los datos visuales.
Por ejemplo, los modelos basados en CNN han logrado resultados revolucionarios en ImageNet, un enorme conjunto de datos de referencia que contiene millones de imágenes etiquetadas de miles de categorías. Diseñado para comprobar hasta qué punto los algoritmos pueden reconocer y clasificar objetos, ImageNet permite destacar la diferencia entre los métodos de características antiguos y el aprendizaje profundo.
Las CNN superaron rápidamente a SIFT al aprender representaciones mucho más completas y flexibles, lo que les permite reconocer objetos con cambios de iluminación, desde distintos puntos de vista e incluso parcialmente ocultos, situaciones en las que SIFT suele tener dificultades.
Conclusiones clave#
El algoritmo de Transformada de características invariantes a la escala ocupa un lugar importante en la historia de la visión artificial. Proporcionó una forma fiable de detectar características incluso en entornos cambiantes e influyó en muchos de los métodos que se utilizan actualmente.
Aunque las técnicas más recientes son más rápidas y eficientes, SIFT sentó las bases para su desarrollo. SIFT muestra dónde comenzó el progreso actual de la visión artificial y destaca cuánto han avanzado los sistemas de IA más punteros.
Únete a nuestra comunidad global y consulta nuestro repositorio de GitHub para obtener más información sobre visión artificial. Explora nuestras páginas de soluciones para descubrir innovaciones como la IA en la agricultura y la visión artificial en el comercio minorista. Consulta nuestras opciones de licencia y empieza a crear tu propio modelo de visión artificial.









