Fiabilidad entre evaluadores: definición, ejemplos y cálculos
Comprende la fiabilidad entre evaluadores, la kappa de Cohen, el ICC, la formación de evaluadores y el porcentaje de acuerdo. Descubre cómo estas medidas estadísticas garantizan la coherencia y el acuerdo entre observadores en la investigación y el análisis de datos.

Cuando estás desarrollando un modelo de IA, la calidad de tus datos es tan importante como los algoritmos que lo sustentan. Siempre que varias personas etiquetan o revisan los mismos datos, es inevitable que surjan desacuerdos. Esto ocurre en muchos ámbitos, como la investigación, la sanidad y la educación.
En particular, en la visión por ordenador, una rama de la IA que implica entrenar modelos como Ultralytics YOLO11 para interpretar datos visuales como imágenes o vídeos, los ejemplos etiquetados desempeñan un papel fundamental. Si esas etiquetas son incoherentes, los modelos de visión por ordenador pueden tener dificultades para aprender los patrones correctos.
La fiabilidad entre evaluadores (IRR) mide hasta qué punto coinciden de forma coherente distintas personas, o etiquetadores, en una tarea. Ayuda a controlar la coherencia e identificar carencias en la formación, las directrices o la interpretación. Esto es especialmente importante en el entrenamiento de modelos personalizados, en el que los modelos de IA se crean utilizando datos específicos para un propósito concreto.
En este artículo veremos qué es la fiabilidad entre evaluadores, cómo medirla y cómo mejorarla en proyectos del mundo real. ¡Empecemos!
¿Qué es la fiabilidad entre evaluadores?#
La fiabilidad entre evaluadores mide con qué frecuencia dos o más personas (también conocidas como evaluadores) coinciden al etiquetar, puntuar o revisar el mismo contenido. Se utiliza para comprobar hasta qué punto distintos evaluadores aplican de forma coherente unos criterios determinados. Un alto nivel de acuerdo entre evaluadores significa que una tarea está bien definida y se entiende con claridad.
Este concepto se utiliza en distintos ámbitos. Según el campo, recibe nombres diferentes, como acuerdo entre evaluadores, fiabilidad interobservador o fiabilidad entre codificadores. Sin embargo, el principio subyacente sigue siendo el mismo.
En la IA de visión, la fiabilidad entre evaluadores es una parte fundamental del proceso de etiquetado de datos. El entrenamiento de modelos de visión por ordenador suele requerir etiquetar conjuntos de datos masivos de imágenes o fotogramas de vídeo, por lo que varios desarrolladores de IA trabajan juntos con los mismos datos.
Para obtener resultados precisos, deben seguir las mismas directrices de etiquetado. Por ejemplo, al etiquetar animales, todos deben acordar claramente qué se considera un perro, cómo dibujar el cuadro delimitador a su alrededor y si deben etiquetar u omitir los objetos borrosos.

Fig. 1. Comprender la fiabilidad entre evaluadores (imagen del autor)
Fiabilidad entre evaluadores, intraevaluador y test-retest#
Cuando las personas participan en el etiquetado o la puntuación de datos, hay tres tipos principales de fiabilidad que deben tenerse en cuenta. Cada uno tiene un propósito distinto a la hora de medir la coherencia de los resultados. Veamos cada uno con más detalle:
-
Fiabilidad entre evaluadores: La fiabilidad entre evaluadores analiza el grado de acuerdo entre distintas personas que realizan la misma tarea. Es especialmente útil cuando participan varios anotadores en proyectos como el etiquetado de imágenes, el análisis de sentimientos o las revisiones médicas.
-
Fiabilidad intraevaluador: Centra la atención en una sola persona. La fiabilidad intraevaluador comprueba si el evaluador mantiene la coherencia al repetir la misma tarea en distintos momentos. Si las etiquetas cambian demasiado, puede deberse a unas directrices poco claras o a una falta de claridad en la tarea.
-
Fiabilidad test-retest: La fiabilidad test-retest no se centra en el anotador, sino en la herramienta o el método utilizado. Mide si se obtiene el mismo resultado al repetir la prueba en condiciones similares. Si el resultado se mantiene coherente, se considera que el método es fiable.
En conjunto, estas medidas ayudan a confirmar que tanto las personas como los procesos producen resultados estables y fiables.

Fig. 2. Descripción general de la fiabilidad entre evaluadores, intraevaluador y test-retest (imagen del autor)
¿Por qué es importante la fiabilidad entre evaluadores?#
En los proyectos de IA de visión a gran escala, la calidad de los datos etiquetados afecta directamente al rendimiento del modelo. Incluso pequeñas diferencias en la forma en que los anotadores aplican las directrices pueden introducir incoherencias que confundan al modelo durante el entrenamiento. Con el tiempo, esto puede dar lugar a predicciones inexactas, un desperdicio de recursos y la necesidad de volver a etiquetar los datos, con el consiguiente coste.
Medir la fiabilidad entre evaluadores ayuda a detectar estos problemas en una fase temprana. Un alto nivel de acuerdo significa que los anotadores están alineados y producen conjuntos de datos más limpios y fiables. Un bajo nivel de acuerdo indica que puede ser necesario perfeccionar las instrucciones, los ejemplos o la formación antes de continuar con el proyecto. Al garantizar que los etiquetadores trabajan de forma coordinada, los equipos pueden crear modelos de IA que aprendan con mayor eficacia y ofrezcan mejores resultados en aplicaciones del mundo real.
Consideraciones prácticas sobre la fiabilidad entre evaluadores#
Estas son algunas consideraciones prácticas clave que debes tener en cuenta al trabajar con varios evaluadores y tratar de mantener una alta fiabilidad entre ellos:
- Tareas ambiguas o subjetivas: Cuando el etiquetado implica interpretación, como decidir si un objeto borroso es un peatón o juzgar la calidad de una imagen, contar con varios evaluadores ayuda a garantizar que las decisiones sean coherentes y no estén excesivamente influidas por el sesgo individual.
- Tareas sencillas y objetivas: Las tareas directas, como contar el número de coches de una imagen o confirmar si hay un objeto presente, suelen requerir un solo evaluador bien formado, ya que el acuerdo suele ser alto una vez que el proceso está claramente definido.
- Directrices de etiquetado claras: Unas instrucciones detalladas y fáciles de seguir reducen la incertidumbre sobre cómo se aplican las etiquetas, lo que mejora el acuerdo entre evaluadores. Las directrices deben abordar explícitamente los casos límite para evitar interpretaciones incoherentes.
- Formación y calibración periódicas: Incluso los evaluadores con experiencia pueden cambiar gradualmente su criterio con el tiempo. Las sesiones de formación periódicas y las comprobaciones de calibración ayudan a mantener la coherencia y minimizar el sesgo del experimentador.
Medidas de la fiabilidad entre evaluadores#
Hay varias formas de medir la fiabilidad entre evaluadores, y la mejor opción depende del tipo de datos y de la tarea. Algunos métodos funcionan bien con un solo evaluador que responde a preguntas sencillas de sí o no, mientras que otros están diseñados para situaciones en las que participan varios evaluadores.
Entre los enfoques habituales se incluyen el porcentaje de acuerdo, la kappa de Cohen, la kappa de Fleiss y el coeficiente de correlación intraclase. Cada método mide el nivel de acuerdo entre evaluadores y tiene en cuenta la posibilidad de que parte de ese acuerdo se produzca por azar.
Kappa de Cohen y kappa de Fleiss#
La kappa de Cohen es un método muy utilizado para medir la fiabilidad entre dos evaluadores. Calcula con qué frecuencia coinciden en una tarea y ajusta el resultado teniendo en cuenta la posibilidad de que parte del acuerdo se produzca por azar. Las puntuaciones oscilan entre -1 y 1: 1 indica un acuerdo perfecto y 0 significa que el acuerdo no es mejor que una elección aleatoria.
Del mismo modo, la kappa de Fleiss se utiliza cuando participan más de dos evaluadores. Proporciona una puntuación global que muestra hasta qué punto es coherente el grupo. Ambos métodos se utilizan en tareas con categorías definidas, como etiquetar imágenes o asignar etiquetas a emociones. Son fáciles de calcular y la mayoría de las herramientas de anotación los admiten.
Porcentaje de acuerdo y coeficiente de correlación intraclase (ICC)#
Otra forma de medir la fiabilidad entre evaluadores es el porcentaje de acuerdo, que calcula el porcentaje de veces que los evaluadores toman la misma decisión. Aunque es sencillo de utilizar, no tiene en cuenta el acuerdo que podría producirse por azar.
Por su parte, el coeficiente de correlación intraclase es un método más avanzado que se utiliza con datos continuos o basados en escalas. Mide la coherencia de las valoraciones entre varios evaluadores y suele aplicarse en investigaciones que incluyen puntuaciones, mediciones u otros tipos de datos más allá de las categorías fijas.
Ejemplos y aplicaciones de la fiabilidad entre evaluadores#
Ahora que entendemos mejor cómo medir la fiabilidad entre evaluadores, veamos cómo pueden utilizarse estos métodos en aplicaciones del mundo real.
Fiabilidad entre evaluadores en la anotación de imágenes médicas#
En el ámbito de las imágenes médicas, incluso pequeñas diferencias de interpretación pueden provocar cambios importantes en los resultados. Por ejemplo, a menudo se pide a los radiólogos que identifiquen patrones sutiles, ambiguos o difíciles de definir. Cuando esos patrones se convierten en datos de entrenamiento para sistemas de IA, las consecuencias son mayores. Si los expertos etiquetan de forma diferente la misma exploración, el modelo puede aprender patrones incorrectos o no aprenderlos en absoluto.
La fiabilidad entre evaluadores ayuda a los equipos que trabajan con este tipo de datos a evaluar hasta qué punto son coherentes realmente los juicios de los expertos. Por ejemplo, en un estudio reciente centrado en exploraciones OCT de retina, dos evaluadores etiquetaron 500 imágenes.
El acuerdo fue alto para características claras, como las drusas (depósitos amarillos bajo la retina), con una puntuación kappa de 0,87. Sin embargo, para elementos más difíciles de definir, como los focos hiperreflectivos (pequeños puntos brillantes observados en las exploraciones de retina), la puntuación bajó a 0,33. Esto demuestra que las características más claras y mejor definidas suelen producir juicios de expertos más coherentes, mientras que las ambiguas dejan más margen a la interpretación.

Fig. 3. Ejemplos de etiquetas para distintas características relacionadas con enfermedades de la retina (Fuente)
Conjuntos de datos de vehículos autónomos y fiabilidad entre evaluadores#
El entrenamiento de modelos de IA para un sistema de conducción autónoma depende de contar con etiquetas precisas y coherentes en una amplia variedad de condiciones de la carretera. Normalmente, se pide a los anotadores que trabajan en estos proyectos que identifiquen peatones, vehículos, señales de tráfico y marcas viales, a menudo con poca iluminación o en escenas abarrotadas.
Estas decisiones determinan cómo aprende el modelo a responder en entornos reales exigentes. La fiabilidad entre evaluadores permite a los equipos comprobar si esas etiquetas se aplican de la misma manera entre los distintos anotadores.

Fig. 4. Un vistazo a los desacuerdos en la anotación (Fuente)
Más allá de la fiabilidad entre evaluadores: otras medidas de garantía de calidad#
Aunque medir la fiabilidad entre evaluadores es un paso crucial para crear una solución de IA, forma parte de un proceso más amplio de garantía de calidad. Estas son otras prácticas que pueden ayudar a mejorar la calidad de los datos en distintos equipos y proyectos:
- Directrices de anotación claras: Las instrucciones deben explicar exactamente cómo aplicar las etiquetas para que todos trabajen conforme al mismo estándar.
- Formación y calibración: Las sesiones periódicas ayudan a los anotadores a mantenerse alineados y les ofrecen un espacio para plantear preguntas y adaptarse a los casos límite.
- Comprobaciones de calidad continuas: Las revisiones puntuales y los ejemplos de referencia pueden detectar errores pronto y mantener un alto nivel de calidad a medida que el proyecto crece.
- Resolución de desacuerdos: Cuando los anotadores no están de acuerdo, debe existir un proceso claro para revisar esos casos y tomar decisiones definitivas.
- Grupo diverso de anotadores: Involucrar a personas con distintos perfiles puede reducir el sesgo y mejorar la representación de la variabilidad del mundo real en el conjunto de datos.
Conclusiones clave#
La fiabilidad entre evaluadores mide hasta qué punto las personas aplican las etiquetas o toman decisiones de forma coherente. Métodos como la kappa de Cohen, la kappa de Fleiss y el ICC ayudan a cuantificar ese acuerdo. Con directrices claras, formación y control del sesgo, las anotaciones fiables dan lugar a datos más sólidos y a mejores resultados de los modelos.
Únete a nuestra comunidad y explora nuestro repositorio de GitHub para descubrir más sobre la IA. Si quieres iniciar tu propio proyecto de IA de visión, consulta nuestras opciones de licencia. También puedes descubrir cómo la IA en la sanidad y la IA de visión en el comercio minorista están generando un impacto visitando nuestras páginas de soluciones.









