YOLO Vision 2026:
Guias

Fiabilidade entre avaliadores: definição, exemplos e cálculos

Compreenda a fiabilidade entre avaliadores, o Kappa de Cohen, o ICC, a formação de avaliadores e a concordância percentual. Saiba como estas medidas estatísticas asseguram consistência e concordância entre observadores na investigação e na análise de dados.

ABAbirami Vina5 min read
Compreender a fiabilidade entre avaliadores na anotação de dados

Ao desenvolver um modelo de IA, a qualidade dos teus dados é tão importante quanto os algoritmos subjacentes. Sempre que várias pessoas anotam ou revêm os mesmos dados, é inevitável que surjam divergências. Isto acontece em muitas áreas, incluindo investigação, saúde e educação.

Em particular, na visão computacional, um ramo da IA que envolve o treino de modelos como o Ultralytics YOLO11 para interpretar dados visuais, como imagens ou vídeos, os exemplos anotados desempenham um papel fundamental. Se essas anotações forem inconsistentes, os modelos de visão computacional podem ter dificuldade em aprender os padrões corretos.

A fiabilidade entre avaliadores (IRR) mede a consistência com que diferentes pessoas, ou anotadores, concordam numa tarefa. Ajuda a monitorizar a consistência e a identificar lacunas na formação, nas orientações ou na interpretação. Isto é especialmente importante no treino de modelos personalizados, em que os modelos de IA são desenvolvidos com dados específicos para uma finalidade particular.

Neste artigo, vamos explorar o que é a fiabilidade entre avaliadores, como medi-la e como melhorá-la em projetos do mundo real. Vamos começar!

O que é a fiabilidade entre avaliadores?#

A fiabilidade entre avaliadores mede a frequência com que duas ou mais pessoas (também conhecidas como avaliadores) concordam ao anotar, classificar ou rever o mesmo conteúdo. É utilizada para verificar a consistência com que diferentes avaliadores aplicam determinados critérios. Um elevado grau de concordância entre avaliadores significa que uma tarefa está bem definida e é claramente compreendida.

Este conceito é utilizado em diferentes áreas. Dependendo do campo, é conhecido por diferentes nomes, como concordância entre avaliadores, fiabilidade entre observadores ou fiabilidade entre codificadores. No entanto, o princípio subjacente mantém-se igual.

Na IA de visão, a fiabilidade entre avaliadores é uma parte essencial do processo de anotação de dados. O treino de modelos de visão computacional exige frequentemente a anotação de enormes conjuntos de dados de imagens ou fotogramas de vídeo, pelo que vários programadores de IA trabalham em conjunto nos mesmos dados.

Para obter resultados precisos, têm de seguir as mesmas orientações de anotação. Por exemplo, ao anotar animais, todos precisam de concordar claramente sobre o que conta como um cão, como desenhar a caixa delimitadora à sua volta e se devem anotar ou ignorar objetos desfocados.

Compreender a fiabilidade entre avaliadores

Fig. 1. Compreender a fiabilidade entre avaliadores (Imagem do autor)

Fiabilidade entre avaliadores vs. fiabilidade intra-avaliador e fiabilidade teste-reteste#

Quando há pessoas envolvidas na anotação ou pontuação de dados, existem três tipos principais de fiabilidade a considerar. Cada um tem uma finalidade diferente na medição da consistência dos resultados. Vejamos cada um deles com mais detalhe:

  • Fiabilidade entre avaliadores: A fiabilidade entre avaliadores analisa o grau de concordância entre diferentes pessoas que executam a mesma tarefa. É especialmente útil quando estão envolvidos vários anotadores em projetos como anotação de imagens, análise de sentimentos ou revisões médicas.

  • Fiabilidade intra-avaliador: O foco passa para uma única pessoa. A fiabilidade intra-avaliador verifica se o avaliador se mantém consistente ao repetir a mesma tarefa em diferentes momentos. Se as anotações mudarem demasiado, isso pode resultar de orientações pouco claras ou de falta de clareza sobre a tarefa.

  • Fiabilidade teste-reteste: A fiabilidade teste-reteste não se concentra no anotador, mas na ferramenta ou no método utilizado. Mede se o mesmo resultado surge quando o teste é repetido em condições semelhantes. Se o resultado permanecer consistente, o método é considerado fiável.

Em conjunto, estas medidas ajudam a confirmar que tanto as pessoas como os processos estão a produzir resultados estáveis e fiáveis.

Visão geral da fiabilidade entre avaliadores, intra-avaliador e teste-reteste

Fig. 2. Visão geral da fiabilidade entre avaliadores, intra-avaliador e teste-reteste (Imagem do autor)

Por que razão é importante a fiabilidade entre avaliadores?#

Em projetos de IA de visão de grande escala, a qualidade dos dados anotados afeta diretamente o desempenho de um modelo. Mesmo pequenas diferenças na forma como os anotadores aplicam as orientações podem introduzir inconsistências que confundem o modelo durante o treino. Com o tempo, isto pode levar a previsões imprecisas, desperdício de recursos e à necessidade de voltar a anotar os dados a um custo elevado.

Medir a fiabilidade entre avaliadores ajuda a detetar estes problemas numa fase inicial. Uma elevada concordância significa que os anotadores estão alinhados, produzindo conjuntos de dados mais limpos e fiáveis. Uma baixa concordância indica que as instruções, os exemplos ou a formação podem precisar de ser aperfeiçoados antes de o projeto avançar. Ao garantir que os anotadores trabalham de forma sincronizada, as equipas podem criar modelos de IA que aprendem de forma mais eficaz e oferecem melhores resultados em aplicações do mundo real.

Considerações práticas sobre a fiabilidade entre avaliadores#

Eis algumas considerações práticas importantes a ter em mente ao trabalhar com vários avaliadores e procurar manter uma elevada fiabilidade entre avaliadores:

  • Tarefas ambíguas ou subjetivas: Quando a anotação envolve interpretação, como decidir se um objeto desfocado é um peão ou avaliar a qualidade de uma imagem, vários avaliadores ajudam a garantir que as decisões são consistentes e não são excessivamente influenciadas pelo viés individual.
  • Tarefas simples e objetivas: Tarefas diretas, como contar o número de carros numa imagem ou confirmar se um objeto está presente, exigem frequentemente apenas um avaliador bem treinado, uma vez que a concordância é normalmente elevada quando o processo está claramente definido.
  • Orientações de anotação claras: Instruções detalhadas e fáceis de seguir reduzem a incerteza na aplicação das anotações, melhorando a concordância entre avaliadores. As orientações devem abranger explicitamente os casos-limite para evitar interpretações inconsistentes.
  • Formação e calibração periódicas: Mesmo avaliadores experientes podem alterar gradualmente os seus critérios ao longo do tempo. Sessões regulares de formação e verificações de calibração ajudam a manter a consistência e a minimizar o viés do experimentador.

Medidas de fiabilidade entre avaliadores#

Existem várias formas de medir a fiabilidade entre avaliadores, e a melhor escolha depende do tipo de dados e da tarefa. Alguns métodos funcionam bem para avaliadores individuais que tratam de perguntas simples de sim ou não, enquanto outros foram concebidos para situações que envolvem vários avaliadores.

As abordagens comuns incluem a percentagem de concordância, o Kappa de Cohen, o Kappa de Fleiss e o coeficiente de correlação intraclasse. Cada método mede o nível de concordância entre avaliadores e tem em conta a possibilidade de parte dessa concordância ocorrer por acaso.

Kappa de Cohen e Kappa de Fleiss#

O Kappa de Cohen é um método amplamente utilizado para medir a fiabilidade entre dois avaliadores. Calcula a frequência com que concordam numa tarefa, ajustando simultaneamente para a possibilidade de parte dessa concordância ocorrer por acaso. As pontuações variam entre -1 e 1, sendo que 1 indica concordância perfeita e 0 significa que a concordância não é melhor do que uma estimativa aleatória.

De forma semelhante, o Kappa de Fleiss é utilizado quando estão envolvidos mais de dois avaliadores. Fornece uma pontuação geral que mostra o grau de consistência do grupo. Ambos os métodos são utilizados em tarefas com categorias predefinidas, como anotar imagens ou etiquetar emoções. São fáceis de calcular e são suportados pela maioria das ferramentas de anotação.

Percentagem de concordância e coeficiente de correlação intraclasse (ICC)#

Outra forma de medir a fiabilidade entre avaliadores é a percentagem de concordância, que calcula a percentagem de vezes que os avaliadores tomam a mesma decisão. Embora seja simples de utilizar, não tem em conta a concordância que possa ocorrer por acaso.

Entretanto, o coeficiente de correlação intraclasse é um método mais avançado, utilizado para dados contínuos ou baseados em escalas. Mede a consistência das classificações entre vários avaliadores e é frequentemente aplicado em investigação que envolve pontuações, medições ou outros tipos de dados para além de categorias fixas.

Exemplos e aplicações da fiabilidade entre avaliadores#

Agora que compreendemos melhor como medir a fiabilidade entre avaliadores, vejamos como estes métodos podem ser utilizados em aplicações do mundo real.

Fiabilidade entre avaliadores na anotação de imagens médicas#

No que diz respeito à imagética médica, mesmo pequenas diferenças de interpretação podem provocar alterações significativas nos resultados. Por exemplo, é frequentemente pedido aos radiologistas que identifiquem padrões subtis, ambíguos ou difíceis de definir. Quando esses padrões se tornam dados de treino para sistemas de IA, os riscos são maiores. Se os especialistas anotarem a mesma imagem de forma diferente, o modelo pode aprender os padrões errados ou não conseguir aprender de todo.

A fiabilidade entre avaliadores ajuda as equipas que trabalham com este tipo de dados a avaliar o grau de consistência real das decisões dos especialistas. Por exemplo, num estudo recente centrado em exames OCT da retina, dois avaliadores anotaram 500 imagens.

A concordância foi elevada para características claras, como drusas (depósitos amarelos sob a retina), com uma pontuação kappa de 0,87. No entanto, para elementos mais difíceis de definir, como focos hiper-refletivos (pequenos pontos brilhantes observados em exames da retina), a pontuação desceu para 0,33. Isto mostra que características mais claras e bem definidas tendem a produzir decisões de especialistas mais consistentes, enquanto as características ambíguas deixam mais margem para interpretação.

Exemplos de anotações para diferentes características relacionadas com doenças da retina

Fig. 3. Exemplos de anotações para diferentes características relacionadas com doenças da retina (Fonte)

Conjuntos de dados de veículos autónomos e fiabilidade entre avaliadores#

O treino de modelos de IA para um sistema de condução autónoma depende de anotações precisas e consistentes numa grande variedade de condições rodoviárias. Normalmente, os anotadores que trabalham nestes projetos têm de identificar peões, veículos, sinais de trânsito e marcações das faixas de rodagem, muitas vezes em condições de pouca luz ou em cenários movimentados.

Estas decisões moldam a forma como o modelo aprende a responder em ambientes reais adversos. A fiabilidade entre avaliadores permite às equipas verificar se essas anotações estão a ser aplicadas da mesma forma por todos os anotadores.

Uma análise das divergências nas anotações

Fig. 4. Uma análise das divergências nas anotações (Fonte)

Para além da fiabilidade entre avaliadores: outras medidas de garantia da qualidade#

Embora medir a fiabilidade entre avaliadores seja um passo crucial na criação de uma solução de IA, é apenas uma parte de um processo mais abrangente de garantia da qualidade. Eis outras práticas que podem ajudar a melhorar a qualidade dos dados em diferentes equipas e projetos:

  • Orientações de anotação claras: As instruções devem explicar exatamente como aplicar as anotações, para que todos trabalhem segundo o mesmo padrão.
  • Formação e calibração: Sessões regulares ajudam os anotadores a manterem-se alinhados e dão-lhes espaço para fazer perguntas e se adaptarem aos casos-limite.
  • Verificações contínuas da qualidade: Verificações pontuais e exemplos de referência podem detetar erros numa fase inicial e manter a qualidade elevada à medida que o projeto cresce.
  • Resolução de divergências: Quando os anotadores discordam, deve existir um processo claro para rever esses casos e tomar decisões finais.
  • Grupo diversificado de anotadores: Envolver pessoas com diferentes origens pode reduzir o viés e melhorar a forma como o conjunto de dados representa a diversidade do mundo real.

Principais conclusões#

A fiabilidade entre avaliadores mede a consistência com que as pessoas aplicam anotações ou tomam decisões. Métodos como o Kappa de Cohen, o Kappa de Fleiss e o ICC ajudam a quantificar essa concordância. Com orientações claras, formação e controlo do viés, anotações fiáveis conduzem a dados mais sólidos e a melhores resultados dos modelos.

Participa na nossa comunidade e explora o nosso repositório do GitHub para descobrires mais sobre IA. Se procuras iniciar o teu próprio projeto de IA de visão, consulta as nossas opções de licenciamento. Também podes ver como a IA na área da saúde e a IA de visão no retalho estão a gerar impacto, visitando as nossas páginas de soluções.

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática