Utilizar el aprendizaje autosupervisado para eliminar el ruido de las imágenes
Descubre cómo el aprendizaje autosupervisado elimina el ruido de las imágenes y mejora su nitidez utilizando técnicas de AI para la fotografía, la medicina y los sistemas de visión.

Las imágenes forman parte de nuestra vida diaria, desde las fotos que hacemos hasta los vídeos grabados por cámaras en lugares públicos. Contienen información valiosa, y la tecnología más avanzada permite analizar e interpretar estos datos.
En particular, la visión por ordenador, una rama de la inteligencia artificial (IA), permite a las máquinas procesar información visual y entender lo que ven, de forma muy similar a los seres humanos. Sin embargo, en las aplicaciones del mundo real, las imágenes distan mucho de ser perfectas.
El ruido de las imágenes causado por la lluvia, el polvo, la poca luz o las limitaciones del sensor puede ocultar detalles importantes, lo que dificulta que los modelos de IA de visión detecten objetos o interpreten escenas con precisión. La eliminación de ruido de imágenes ayuda a reducirlo, lo que permite que los modelos de IA de visión vean los detalles con mayor claridad y hagan predicciones más precisas.

Fig. 1. Un ejemplo de eliminación de ruido de una imagen. (Fuente)
Tradicionalmente, la eliminación de ruido de imágenes se ha basado en el aprendizaje supervisado, en el que los modelos se entrenan con pares de imágenes ruidosas y limpias para aprender a eliminar el ruido. Sin embargo, recopilar imágenes de referencia perfectamente limpias no siempre resulta práctico.
Para abordar este reto, los investigadores han desarrollado eliminadores de ruido de imágenes autosupervisados. Su objetivo es entrenar modelos de IA para que aprendan directamente de los datos, generando sus propias señales de aprendizaje para eliminar el ruido y conservar los detalles importantes sin necesitar imágenes de referencia limpias.
En este artículo analizaremos más de cerca los eliminadores de ruido de imágenes autosupervisados, cómo funcionan, las técnicas clave en las que se basan y sus aplicaciones en el mundo real. ¡Empecemos!
¿Qué es la eliminación de ruido de imágenes autosupervisada?#
Las imágenes ruidosas pueden dificultar que los modelos de IA de visión interpreten lo que aparece en una imagen. Por ejemplo, una foto tomada en condiciones de poca luz puede verse granulada o borrosa, ocultando rasgos sutiles que ayudan a un modelo a identificar objetos con precisión.
En la eliminación de ruido basada en el aprendizaje supervisado, los modelos se entrenan con pares de imágenes, una ruidosa y otra limpia, para aprender a eliminar el ruido no deseado. Aunque este enfoque funciona bien, recopilar datos de referencia perfectamente limpios suele llevar mucho tiempo y resultar difícil en situaciones del mundo real.
Por eso los investigadores han recurrido a la eliminación de ruido de imágenes autosupervisada. La eliminación de ruido de imágenes autosupervisada se basa en el concepto de aprendizaje autosupervisado, en el que los modelos se enseñan a sí mismos al crear sus propias señales de aprendizaje a partir de los datos.
Como este método no depende de grandes conjuntos de datos etiquetados, la eliminación de ruido autosupervisada es más rápida, escalable y fácil de aplicar en ámbitos como la fotografía con poca luz, la imagen médica y el análisis de imágenes por satélite, donde a menudo no hay imágenes de referencia limpias disponibles.
En lugar de depender de imágenes de referencia limpias, este enfoque se entrena directamente con datos ruidosos prediciendo píxeles enmascarados o reconstruyendo partes que faltan. Mediante este proceso, el modelo aprende a distinguir entre los detalles significativos de la imagen y el ruido aleatorio, lo que da lugar a resultados más claros y precisos.
Aunque pueda parecer similar al aprendizaje no supervisado, el aprendizaje autosupervisado es en realidad un caso especial de este. La diferencia clave es que, en el aprendizaje autosupervisado, el modelo crea sus propias etiquetas o señales de entrenamiento a partir de los datos para aprender una tarea específica. En cambio, el aprendizaje no supervisado se centra en encontrar patrones o estructuras ocultos en los datos sin una tarea explícita ni un objetivo predefinido.
Estrategias de aprendizaje en la eliminación de ruido autosupervisada#
En lo que respecta a la eliminación de ruido autosupervisada, el aprendizaje puede producirse de varias formas. Algunos modelos de eliminación de ruido autosupervisados completan píxeles enmascarados o ausentes, mientras que otros comparan varias versiones ruidosas de la misma imagen para encontrar detalles coherentes.
Por ejemplo, un método popular conocido como aprendizaje de punto ciego se centra en entrenar el modelo eliminador de ruido para que ignore el píxel que está reconstruyendo y se base en su contexto circundante. Con el tiempo, el modelo reconstruye imágenes de alta calidad conservando las texturas, los bordes y los colores esenciales.
Cómo funciona el aprendizaje autosupervisado para eliminar el ruido#
A continuación, exploraremos el proceso mediante el que el aprendizaje autosupervisado elimina el ruido.
El proceso de eliminación de ruido autosupervisada suele comenzar introduciendo imágenes ruidosas en el modelo eliminador de ruido. El modelo analiza los píxeles cercanos para estimar cómo debería ser cada píxel confuso o enmascarado y aprende gradualmente a distinguir entre el ruido y los detalles visuales reales.
Piensa en una imagen de un cielo oscuro y granulado. El modelo observa las estrellas cercanas y los patrones circundantes para predecir cómo debería ser cada zona ruidosa sin ruido. Al repetir este proceso en toda la imagen, aprende a separar el ruido aleatorio de las características significativas y produce un resultado más claro y preciso.
En otras palabras, el modelo predice una versión más limpia de la imagen basándose en el contexto, sin necesitar nunca una referencia perfectamente limpia. Este proceso puede implementarse con distintos tipos de modelos, cada uno con ventajas específicas para gestionar el ruido.
Tipos de modelos utilizados para reducir el ruido de imágenes de forma autosupervisada#
A continuación, se ofrece un breve resumen de los tipos de modelos utilizados habitualmente para la eliminación de ruido de imágenes autosupervisada:
- Redes neuronales convolucionales (CNNs): Las CNNs son modelos de aprendizaje profundo diseñados para reconocer patrones en regiones pequeñas de una imagen. Analizan las imágenes mediante filtros para detectar bordes, formas y texturas. En la eliminación de ruido autosupervisada, suelen utilizar técnicas de punto ciego, en las que el píxel objetivo se excluye de la entrada para que el modelo prediga su valor basándose únicamente en los píxeles circundantes. Esto ayuda al modelo a evitar copiar el ruido y, en su lugar, inferir detalles más limpios.
- Autoencoders: Los autoencoders son redes neuronales que aprenden a comprimir y reconstruir datos. Primero reducen una imagen a una representación más pequeña (codificación) y después la reconstruyen (decodificación). Durante el proceso, aprenden a captar características visuales importantes, como formas y texturas, mientras filtran el ruido aleatorio y los detalles irrelevantes.
- Modelos basados en Transformer: Los Transformer son modelos desarrollados originalmente para el procesamiento del lenguaje natural, pero actualmente se utilizan ampliamente en tareas de visión. Procesan toda la imagen de una vez y aprenden cómo se relacionan entre sí sus distintas regiones. Esta perspectiva global les permite conservar los detalles finos y la coherencia estructural, incluso en imágenes complejas o de alta resolución.

Fig. 2. Una vista de una arquitectura basada en CNN utilizada para la eliminación de ruido de imágenes autosupervisada. (Fuente)
Entrenar estos modelos con imágenes tomadas con distintas condiciones de iluminación y valores ISO les ayuda a funcionar bien en muchas situaciones del mundo real. En las cámaras digitales, los valores ISO controlan cuánto ilumina la cámara la imagen al amplificar la señal que recibe.
Un ISO más alto hace que las fotos sean más luminosas en lugares oscuros, pero también aumenta el ruido y reduce el nivel de detalle. Al aprender de imágenes tomadas con distintos niveles ISO, los modelos mejoran su capacidad para distinguir los detalles reales del ruido, lo que produce resultados más claros y precisos.
¿Cómo aprende un eliminador de ruido qué es ruido y qué es real?#
Los eliminadores de ruido aprenden a distinguir el ruido de los detalles reales de las imágenes mediante distintas técnicas de entrenamiento, independientes de los tipos de modelos utilizados para eliminar el ruido. Los tipos de modelos, como las CNNs, los autoencoders y los Transformer, describen la estructura de la red y cómo procesa la información visual.
Por otro lado, las técnicas de entrenamiento definen cómo aprende el modelo. Algunos métodos utilizan la predicción basada en el contexto, en la que el modelo completa píxeles ausentes o enmascarados usando información de las zonas cercanas.
Otros utilizan el aprendizaje basado en la reconstrucción, en el que el modelo comprime una imagen en una forma más sencilla y después la reconstruye, lo que le ayuda a reconocer estructuras significativas, como bordes y texturas, mientras filtra el ruido aleatorio.
En conjunto, el tipo de modelo y la técnica de entrenamiento determinan la eficacia con la que un eliminador de ruido puede limpiar las imágenes. Al combinar la arquitectura adecuada con el enfoque de aprendizaje correcto, los eliminadores de ruido autosupervisados pueden adaptarse a muchos tipos de ruido y producir imágenes más claras y precisas incluso sin datos de referencia limpios.
Técnicas clave para la eliminación autosupervisada del ruido en imágenes mediante IA#
Estas son algunas de las técnicas de entrenamiento más utilizadas que permiten realizar una eliminación de ruido de imágenes autosupervisada eficaz:
- Noise2Noise: Este método entrena un modelo utilizando dos versiones ruidosas de la misma imagen. Como el ruido de cada versión es aleatorio, el modelo aprende a centrarse en los detalles coherentes que representan la imagen real e ignorar el ruido. Funciona mejor cuando hay varias capturas ruidosas de la misma escena, como en la fotografía en ráfaga o en la obtención de imágenes médicas y científicas.
- Noise2Void o Noise2Self: Estas técnicas se entrenan con una única imagen ruidosa ocultando (enmascarando) un píxel y pidiendo al modelo que prediga su valor basándose en los píxeles circundantes. Esto impide que el modelo se limite a copiar datos ruidosos y le ayuda a aprender la estructura natural de las imágenes. Son especialmente útiles cuando solo hay una imagen ruidosa disponible, como en la microscopía, la astronomía o la fotografía con poca luz.
- Redes de punto ciego: Están diseñadas específicamente para que el modelo no pueda ver el píxel que está reconstruyendo. En su lugar, se basa en la información de la zona circundante para estimar cómo debería ser ese píxel. Esto hace que la eliminación del ruido sea más precisa e imparcial, y estas redes suelen combinarse con los métodos Noise2Void o Noise2Self en tareas de eliminación de ruido píxel a píxel.
- Autoencoders enmascarados (MAE): En este enfoque, se ocultan partes de una imagen y el modelo aprende a reconstruir las zonas ausentes. Al hacerlo, aprende tanto los detalles finos como la estructura general, lo que le ayuda a distinguir el contenido real del ruido. Los autoencoders enmascarados son especialmente eficaces para imágenes de alta resolución o complejas, en las que comprender el contexto general mejora la restauración.
Evaluación de sistemas eliminadores de ruido de imágenes#
La eliminación de ruido de imágenes requiere un equilibrio cuidadoso entre dos objetivos: reducir el ruido y mantener intactos los detalles finos. Eliminar demasiado ruido puede hacer que una imagen parezca suave o borrosa, mientras que eliminar demasiado poco puede dejar granulado o artefactos no deseados.
Para comprender hasta qué punto un modelo logra este equilibrio, los investigadores utilizan métricas de evaluación que miden tanto la claridad de la imagen como la conservación de los detalles. Estas métricas muestran cómo de bien limpia un modelo una imagen sin perder información visual importante.
Estas son algunas métricas de evaluación habituales que ayudan a medir la calidad de la imagen y el rendimiento de la eliminación de ruido:
- Error cuadrático medio (MSE): Mide la diferencia cuadrática media entre las imágenes original y eliminada del ruido. Indica hasta qué punto la salida se aproxima a la original a nivel de píxel. Los valores más bajos de MSE significan menos errores y un resultado más preciso.
- Relación señal/ruido de pico (PSNR): Esta métrica compara la intensidad de la señal de la imagen original con el ruido restante, expresada en decibelios. Se utiliza para comprobar cuánto detalle original se ha conservado tras eliminar el ruido. Los valores más altos de PSNR indican imágenes más claras y de mayor calidad.
- Índice de similitud estructural (SSIM): SSIM evalúa la estructura, el brillo y el contraste para medir la similitud entre la imagen sin ruido y la original. Se centra en cómo ven las imágenes los seres humanos, no solo en los números sin procesar. Las puntuaciones más altas de SSIM significan que la imagen parece más natural y fiel a la original.
- Métricas perceptuales: Estas métricas utilizan modelos de aprendizaje profundo para evaluar hasta qué punto una imagen parece realista y natural. En lugar de comparar píxeles individuales, se centran en el aspecto general, la textura y la similitud visual. En la mayoría de los casos, las puntuaciones más bajas significan que la imagen se parece más a la original y resulta más agradable visualmente para las personas.
Aplicaciones de la eliminación de ruido autosupervisada#
Ahora que entendemos mejor en qué consiste la eliminación de ruido, exploremos cómo se aplica la eliminación de ruido de imágenes autosupervisada en situaciones del mundo real.
Uso de la eliminación de ruido autosupervisada en astrofotografía#
Hacer fotos nítidas de estrellas y galaxias no es fácil. El cielo nocturno es oscuro, por lo que las cámaras suelen necesitar tiempos de exposición largos, que pueden introducir ruido no deseado. Este ruido puede difuminar los detalles cósmicos finos y dificultar la detección de señales débiles.
Las herramientas tradicionales de eliminación de ruido pueden ayudar a reducirlo, pero a menudo también eliminan detalles importantes. La eliminación de ruido autosupervisada ofrece una alternativa más inteligente. Al aprender directamente de imágenes ruidosas, el modelo de IA puede reconocer patrones que representan características reales y separarlas del ruido aleatorio.
El resultado son imágenes mucho más claras de objetos celestes como estrellas, galaxias y el Sol, que revelan detalles débiles que de otro modo podrían pasar desapercibidos. También puede mejorar características astronómicas sutiles, aumentando la claridad de las imágenes y haciendo que los datos sean más útiles para la investigación científica.

Fig. 3. La eliminación de ruido de imágenes puede mejorar las imágenes de astrofotografía. (Fuente)
Eliminación de ruido autosupervisada para imágenes médicas#
Las exploraciones médicas, como las imágenes de resonancia magnética, las tomografías computarizadas y las imágenes microscópicas, suelen captar ruido que puede dificultar la visualización de pequeños detalles. Esto puede ser problemático cuando los médicos necesitan detectar signos tempranos de una enfermedad o realizar un seguimiento de los cambios a lo largo del tiempo.
El ruido de las imágenes puede deberse al movimiento del paciente, a una baja intensidad de señal o a las limitaciones en la cantidad de radiación que se puede utilizar. Para hacer más claras las exploraciones médicas, los investigadores han estudiado métodos de eliminación de ruido autosupervisada como Noise2Self y otros enfoques similares.
Estos modelos se entrenan directamente con imágenes ruidosas de resonancia magnética cerebral, aprenden por sí solos los patrones de ruido y los limpian sin necesitar ejemplos perfectamente nítidos. Las imágenes procesadas mostraron texturas más nítidas y un contraste mejor, lo que facilitó la identificación de estructuras finas. Estos eliminadores de ruido basados en IA agilizan el flujo de trabajo en el diagnóstico por imagen y mejoran la eficiencia del análisis en tiempo real.

Fig. 4. Uso de distintas técnicas de eliminación de ruido autosupervisada en exploraciones de resonancia magnética cerebral. (Fuente)
Mejora de los sistemas de visión mediante la eliminación de ruido autosupervisada#
En la mayoría de los casos, la eliminación de ruido tiene un impacto significativo en una amplia variedad de aplicaciones de visión por ordenador. Al eliminar el ruido y las distorsiones no deseados, produce datos de entrada más limpios y coherentes para que los modelos de IA de visión los procesen.
Las imágenes más claras mejoran el rendimiento en tareas de visión por ordenador, como la detección de objetos, la segmentación de instancias y el reconocimiento de imágenes. Estos son algunos ejemplos de aplicaciones en las que los modelos de IA de visión, como Ultralytics YOLO11 y Ultralytics YOLO26, pueden beneficiarse de la eliminación de ruido:
- Inspección industrial: La eliminación de ruido permite detectar con mayor precisión defectos o anomalías superficiales en entornos de fabricación, lo que mejora el control de calidad.
- Conducción autónoma y navegación: Mejora la detección de objetos y obstáculos en condiciones difíciles, como poca luz, lluvia o niebla, y aumenta la seguridad y la fiabilidad generales.
- Vigilancia y seguridad: La eliminación de ruido mejora la calidad de imagen en transmisiones de vídeo con poca luz o alta compresión, lo que permite identificar y realizar un seguimiento más precisos de objetos o personas.
- Imágenes subacuáticas: La eliminación de ruido reduce la dispersión y la distorsión de la luz, y mejora la visibilidad y el reconocimiento de objetos en condiciones subacuáticas turbias.
Ventajas e inconvenientes de la eliminación de ruido autosupervisada#
Estas son algunas ventajas clave de utilizar la eliminación de ruido autosupervisada en sistemas de obtención de imágenes:
- Adaptabilidad al ruido: Los métodos de eliminación de ruido autosupervisada pueden aprender directamente de datos ruidosos sin necesitar referencias limpias emparejadas. Esto los hace muy adaptables a una amplia variedad de niveles y tipos de ruido del mundo real, como el ruido del sensor, el desenfoque por movimiento o las interferencias ambientales.
- Conservación de detalles: Cuando están bien diseñados, estos modelos conservan las texturas finas y los bordes esenciales para interpretar imágenes con precisión. Los enfoques como las redes de punto ciego y el aprendizaje basado en máscaras ayudan a mantener la información estructural al tiempo que reducen el ruido.
- Menos preprocesamiento: Al aprender a transformar entradas ruidosas en representaciones limpias utilizando únicamente los datos disponibles, el modelo minimiza la necesidad de aplicar filtros manuales, algoritmos de eliminación de ruido diseñados a mano o conjuntos de datos de entrenamiento seleccionados.
A pesar de sus ventajas, la eliminación de ruido autosupervisada también presenta ciertas limitaciones. Estos son algunos factores que debes tener en cuenta:
- Requisitos computacionales: Las arquitecturas neuronales profundas utilizadas para la eliminación de ruido autosupervisada, especialmente los modelos basados en Transformer, pueden requerir una potencia computacional y unos recursos de memoria considerables en comparación con las técnicas de filtrado tradicionales.
- Complejidad del diseño del modelo: Para obtener resultados óptimos es necesario seleccionar cuidadosamente los ajustes del modelo, como la estrategia de enmascaramiento y la función de pérdida, que pueden variar según los distintos tipos de ruido.
- Dificultades de evaluación: Las métricas habituales de calidad de imagen no siempre coinciden con el aspecto natural o realista de una imagen a la que se ha eliminado el ruido, por lo que a menudo son necesarias comprobaciones visuales o específicas de la tarea.
Conclusiones clave#
La eliminación de ruido autosupervisada ayuda a los modelos de IA a aprender directamente de imágenes ruidosas y producir resultados más claros conservando los detalles finos. Funciona eficazmente en diversas situaciones complejas, como condiciones de poca luz, valores ISO altos e imágenes detalladas. A medida que la IA siga evolucionando, es probable que estas técnicas desempeñen un papel fundamental en distintas aplicaciones de visión por ordenador.
Únete a nuestra comunidad y explora nuestro repositorio de GitHub para descubrir más sobre la IA. Si quieres crear tu propio proyecto de IA de visión, consulta nuestras opciones de licencia. Descubre más sobre aplicaciones como la IA en la atención sanitaria y la IA de visión en el comercio minorista visitando nuestras páginas de soluciones.









