Ultralytics YOLO27:
IA para visão

Florence-2: o mais recente modelo de linguagem visual da Microsoft

Conhece o Florence-2, o modelo de linguagem visual da Microsoft que oferece deteção de objetos, segmentação e desempenho zero-shot melhorados com grande eficiência.

ABAbirami Vina9 min read
Modelo de linguagem visual Florence-2 da Microsoft

Em junho de 2024, a Microsoft apresentou o Florence-2, um modelo de linguagem visual multimodal (VLM) concebido para lidar com uma vasta gama de tarefas, incluindo deteção de objetos, segmentação, legendagem de imagens e grounding. O Florence-2 estabelece um novo padrão de desempenho zero-shot, o que significa que consegue executar tarefas sem treino específico prévio, e destaca-se por ter um tamanho de modelo menor do que outros modelos de linguagem visual de última geração.

É mais do que apenas outro modelo: a versatilidade e o desempenho melhorado do Florence-2 têm potencial para causar um impacto significativo em vários setores, melhorando a precisão e reduzindo a necessidade de treino extensivo. Neste artigo, vamos explorar as funcionalidades inovadoras do Florence-2, comparar o seu desempenho com outros VLMs e discutir as suas potenciais aplicações.

O que é o Florence-2?#

O Florence-2 consegue lidar com uma variedade de tarefas num único framework unificado. As impressionantes capacidades do modelo devem-se, em parte, ao seu enorme conjunto de dados de treino, denominado FLD-5B. O FLD-5B inclui 5,4 mil milhões de anotações distribuídas por 126 milhões de imagens. Este conjunto de dados abrangente foi criado especificamente para dotar o Florence-2 das capacidades necessárias para lidar com uma vasta gama de tarefas de visão computacional com elevada precisão e eficiência.

Vejamos mais de perto as tarefas suportadas pelo Florence-2:

  • Deteção de objetos: consegue identificar e localizar objetos em imagens com elevada precisão.
  • Segmentação: esta tarefa consiste em dividir uma imagem em segmentos significativos para facilitar a análise e a interpretação.
  • Legendagem de imagens: o Florence-2 consegue gerar legendas descritivas para imagens, fornecendo contexto e detalhes.
  • Grounding visual: o modelo consegue associar frases ou palavras específicas de uma legenda às regiões correspondentes da imagem.
  • Desempenho zero-shot: consegue executar tarefas sem treino específico.

Diagrama de como o Florence-2 foi treinado

Fig. 1 Compreender como o Florence-2 foi treinado.

O modelo suporta tarefas baseadas tanto em texto como em regiões. São adicionados tokens de localização especiais ao vocabulário do modelo para tarefas que envolvem regiões específicas de uma imagem. Estes tokens ajudam o modelo a compreender diferentes formas, como retângulos à volta de objetos (representação por caixa), formas de quatro lados (representação por caixa quadrilateral) e formas com vários lados (representação por polígono). O modelo é treinado através de um método denominado perda de entropia cruzada, que o ajuda a aprender comparando as suas previsões com as respostas corretas e ajustando os seus parâmetros internos em conformidade.

Criar o conjunto de dados FLD-5B#

O conjunto de dados FLD-5B inclui diferentes tipos de anotações: descrições de texto, pares de regiões e texto, e combinações de texto, frases e regiões. Foi criado através de um processo em duas etapas que envolveu a recolha e anotação de dados. As imagens foram obtidas a partir de conjuntos de dados populares, como ImageNet-22k, Object 365, Open Images, Conceptual Captions e LAION. As anotações no conjunto de dados FLD-5B são, na sua maioria, sintéticas, o que significa que foram geradas automaticamente em vez de anotadas manualmente.

Diagrama da criação do conjunto de dados FLD-5B

Fig. 2 Criar o conjunto de dados FLD-5B.

Inicialmente, modelos especializados e competentes em tarefas específicas, como deteção de objetos ou segmentação, criaram estas anotações. Em seguida, foi utilizado um processo de filtragem e melhoria para garantir que as anotações fossem detalhadas e precisas. Depois de remover qualquer ruído, o conjunto de dados passou por um refinamento iterativo, no qual os resultados do Florence-2 foram utilizados para atualizar e melhorar continuamente as anotações.

Compreender a arquitetura do modelo Florence-2#

A arquitetura do modelo Florence-2 segue uma abordagem de aprendizagem sequência-a-sequência. Isto significa que o modelo processa uma sequência de entrada (como uma imagem com um prompt de texto) e gera uma sequência de saída (como uma descrição ou uma etiqueta) passo a passo. No framework sequência-a-sequência, cada tarefa é tratada como um problema de tradução: o modelo recebe uma imagem de entrada e um prompt específico da tarefa e gera a saída correspondente.

Diagrama da arquitetura do modelo de linguagem visual Florence-2

Fig. 3 Arquitetura do modelo de linguagem visual Florence-2.

No centro da arquitetura do modelo encontra-se um transformer codificador-descodificador multimodal, que combina um codificador de imagens e um codificador-descodificador multimodal. O codificador de imagens, denominado DaViT (Data-efficient Vision Transformer), processa as imagens de entrada convertendo-as em embeddings de tokens visuais — representações compactas da imagem que capturam informação espacial (onde estão os elementos) e semântica (o que são os elementos). Estes tokens visuais são então combinados com embeddings de texto (representações do texto), permitindo ao modelo fundir dados textuais e visuais de forma integrada.

Comparar o Florence-2 com outros VLMs#

O Florence-2 distingue-se de outros modelos de linguagem visual pelas suas impressionantes capacidades zero-shot. Ao contrário de modelos como o PaliGemma, que dependem de um fine-tuning extensivo para se adaptarem a várias tarefas, o Florence-2 funciona bem imediatamente. Além disso, o Florence-2 consegue competir com modelos maiores, como o GPT-4V e o Flamingo, que frequentemente têm muitos mais parâmetros, mas nem sempre igualam o desempenho do Florence-2. Por exemplo, o Florence-2 obtém melhores resultados zero-shot do que o Kosmos-2, apesar de o Kosmos-2 ter mais do dobro de parâmetros.

Em testes de benchmark, o Florence-2 demonstrou um desempenho notável em tarefas como legendagem no COCO e compreensão de expressões referentes. Superou modelos como o PolyFormer e o UNINEXT em tarefas de deteção de objetos e segmentação no conjunto de dados COCO. É uma opção altamente competitiva para aplicações do mundo real em que tanto o desempenho como a eficiência dos recursos são cruciais.

Aplicações do Florence-2#

O Florence-2 pode ser utilizado em muitos setores diferentes, como entretenimento, acessibilidade, educação, entre outros. Vejamos alguns exemplos para compreender melhor.

Aplicações da legendagem de imagens#

Quando estás numa plataforma de streaming a tentar decidir o que ver, podes ler o resumo de um filme para te ajudar a escolher. E se a plataforma também pudesse fornecer uma descrição detalhada do cartaz do filme? O Florence-2 pode tornar isso possível através da legendagem de imagens, que gera texto descritivo para as imagens. O Florence-2 consegue gerar descrições detalhadas de cartazes de filmes, tornando as plataformas de streaming mais inclusivas para utilizadores com deficiência visual. Ao analisar os elementos visuais de um cartaz, como personagens, cenário e texto, o Florence-2 pode criar descrições detalhadas que transmitem o conteúdo e o ambiente do cartaz. A imagem abaixo mostra o nível de detalhe que o Florence-2 consegue fornecer na sua descrição.

Exemplo de uma legenda de imagem gerada pelo Florence-2

Fig. 4 Um exemplo de uma legenda de imagem gerada pelo Florence-2.

Eis alguns outros exemplos de situações em que a legendagem de imagens pode ser útil:

  • Comércio eletrónico: a legendagem de imagens pode fornecer descrições detalhadas de imagens de produtos, ajudando os clientes a compreender melhor as características e os detalhes dos produtos.
  • Viagens e turismo: pode fornecer descrições detalhadas de monumentos e atrações em guias de viagem e aplicações.
  • Educação: a legendagem de imagens pode identificar e descrever imagens e diagramas educativos, contribuindo para o ensino e a aprendizagem.
  • Imobiliário: pode fornecer descrições detalhadas de imagens de imóveis que realçam características e comodidades para potenciais compradores.

Utilizar grounding visual durante a preparação de refeições#

O Florence-2 também pode ser utilizado para enriquecer experiências culinárias. Por exemplo, um livro de receitas online poderia utilizar o Florence-2 para aplicar grounding visual e identificar partes de uma imagem de uma receita complexa. O grounding visual é útil neste caso porque liga partes específicas da imagem ao texto descritivo correspondente. Cada ingrediente e passo pode ser identificado e explicado com precisão, facilitando o seguimento da receita por cozinheiros amadores e a compreensão do papel de cada componente no prato.

Exemplo de grounding visual com o Florence-2

Fig. 5 Um exemplo de grounding visual com o Florence-2.

OCR baseado em regiões para documentos financeiros#

O OCR com processamento baseado em regiões, que se concentra na extração de texto de áreas específicas de um documento, pode ser útil em áreas como a contabilidade. As áreas designadas dos documentos financeiros podem ser analisadas para extrair automaticamente informações importantes, como detalhes de transações, números de conta e datas de vencimento. Ao reduzir a necessidade de introdução manual de dados, minimiza os erros e acelera os tempos de processamento. As instituições financeiras podem utilizá-lo para simplificar tarefas como o processamento de faturas, a reconciliação de recibos e a compensação de cheques, conduzindo a transações mais rápidas e a um melhor serviço ao cliente.

Exemplo de OCR com regiões utilizando o Florence-2

Fig. 6 Um exemplo de extração de OCR com regiões utilizando o Florence-2.

Segmentação baseada em regiões em aplicações industriais#

A segmentação baseada em regiões, que consiste em dividir uma imagem em partes significativas para uma análise direcionada e uma inspeção detalhada, pode impulsionar aplicações industriais que melhoram a precisão e a eficiência em vários processos. Ao concentrar-se em áreas específicas de uma imagem, esta tecnologia permite uma inspeção e análise detalhadas de componentes e produtos. No controlo de qualidade, pode identificar defeitos ou inconsistências nos materiais, como fissuras ou desalinhamentos, garantindo que apenas produtos da mais elevada qualidade chegam ao mercado.

Exemplo de segmentação baseada em regiões com o Florence-2

Fig. 7 Um exemplo de segmentação baseada em regiões com o Florence-2.

Também melhora as linhas de montagem automatizadas, orientando braços robóticos para peças específicas e otimizando a colocação e a montagem de componentes. Do mesmo modo, na gestão de inventário, ajuda a acompanhar e monitorizar o estado e a localização dos produtos, proporcionando uma logística mais eficiente e reduzindo o tempo de inatividade. De forma geral, a segmentação baseada em regiões aumenta a precisão e a produtividade, gerando poupanças de custos e uma maior qualidade dos produtos em ambientes industriais.

Principais conclusões#

Estamos a começar a observar uma tendência para modelos de IA mais leves, mantendo, ainda assim, um elevado desempenho. O Florence-2 representa um importante avanço no domínio dos modelos de linguagem visual. Consegue lidar com várias tarefas, como deteção de objetos, segmentação, legendagem de imagens e grounding, com um desempenho zero-shot impressionante. Apesar do seu tamanho menor, o Florence-2 é eficiente e multifuncional, o que o torna extremamente útil para aplicações em diferentes setores. Modelos como o Florence-2 estão a criar mais possibilidades e a expandir o potencial das inovações em IA.

Explora mais sobre IA visitando o nosso repositório no GitHub e juntando-te à nossa comunidade. Consulta as nossas páginas de soluções para saber mais sobre aplicações de IA na indústria transformadora e na agricultura. 🚀

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática