Ultralytics YOLO27:
Eventos

Impulsionar projetos de CV com as ferramentas de código aberto da Hugging Face

Junta-te a nós para rever uma palestra principal do YOLO Vision 2024, que se centra em explorar como as ferramentas de código aberto da Hugging Face estão a impulsionar o desenvolvimento de IA.

ABAbirami Vina10 min read
Impulsionar projetos de CV com ferramentas de código aberto da Hugging Face

Escolher os algoritmos certos é apenas uma parte da criação de soluções de visão computacional impactantes. Engenheiros de IA geralmente trabalham com grandes conjuntos de dados, ajustam modelos para tarefas específicas e otimizam sistemas de IA para obter desempenho no mundo real. À medida que as aplicações de IA são adotadas mais rapidamente, também cresce a necessidade de ferramentas que simplifiquem esses processos.

No YOLO Vision 2024 (YV24), o evento híbrido anual promovido pela Ultralytics, especialistas em IA e entusiastas de tecnologia se reuniram para explorar as últimas inovações em visão computacional. O evento gerou discussões sobre vários temas, como formas de acelerar o desenvolvimento de aplicações de IA.

Um dos principais destaques do evento foi uma palestra sobre a Hugging Face, uma plataforma de IA de código aberto que simplifica o treinamento, a otimização e a implantação de modelos. Pavel Iakubovskii, engenheiro de Machine Learning na Hugging Face, explicou como suas ferramentas aprimoram os fluxos de trabalho para tarefas de visão computacional, como detectar objetos em imagens, categorizar imagens em diferentes grupos e fazer previsões sem treinamento prévio em exemplos específicos (aprendizado zero-shot).

O Hugging Face Hub hospeda e oferece acesso a vários modelos de visão computacional, como o Ultralytics YOLO11. Neste artigo, vamos recapitular os principais pontos da palestra de Pavel e ver como os desenvolvedores podem usar as ferramentas de código aberto da Hugging Face para criar e implantar modelos de IA rapidamente.

Pavel no palco no YV24

Fig. 1. Pavel no palco no YV24.

O Hugging Face Hub permite um desenvolvimento de IA mais rápido#

Pavel iniciou sua palestra apresentando a Hugging Face como uma plataforma de IA de código aberto que oferece modelos pré-treinados para diversas aplicações. Esses modelos foram desenvolvidos para vários ramos da IA, incluindo processamento de linguagem natural (NLP), visão computacional e IA multimodal, permitindo que os sistemas processem diferentes tipos de dados, como texto, imagens e áudio.

Pavel mencionou que o Hugging Face Hub já hospedou mais de 1 milhão de modelos, e que os desenvolvedores podem encontrar facilmente modelos adequados aos seus projetos específicos. A Hugging Face busca simplificar o desenvolvimento de IA oferecendo ferramentas para treinamento, ajuste fino e implantação de modelos. Quando os desenvolvedores podem experimentar diferentes modelos, o processo de integração da IA em aplicações do mundo real se torna mais simples.

Embora a Hugging Face fosse inicialmente conhecida por NLP, desde então ela se expandiu para a visão computacional e a IA multimodal, permitindo que os desenvolvedores lidem com uma gama mais ampla de tarefas de IA. Ela também conta com uma comunidade forte, na qual os desenvolvedores podem colaborar, compartilhar conhecimentos e obter suporte por meio de fóruns, Discord e GitHub.

Explorando modelos da Hugging Face para aplicações de visão computacional#

Aprofundando o tema, Pavel explicou como as ferramentas da Hugging Face facilitam a criação de aplicações de visão computacional. Os desenvolvedores podem usá-las para tarefas como classificação de imagens, detecção de objetos e aplicações de visão e linguagem.

Ele também destacou que muitas dessas tarefas de visão computacional podem ser realizadas com modelos pré-treinados disponíveis no Hugging Face Hub, economizando tempo ao reduzir a necessidade de treinar modelos do zero. Na verdade, a Hugging Face oferece mais de 13.000 modelos pré-treinados para tarefas de classificação de imagens, incluindo modelos para classificação de alimentos, classificação de animais de estimação e detecção de emoções.

Ressaltando a acessibilidade desses modelos, ele disse: "Provavelmente, você nem precisa treinar um modelo para o seu projeto: talvez encontre um no Hub que já tenha sido treinado por alguém da comunidade."

Modelos da Hugging Face para detecção de objetos#

Dando outro exemplo, Pavel explicou como a Hugging Face pode ajudar na detecção de objetos, uma função essencial da visão computacional usada para identificar e localizar objetos em imagens. Mesmo com uma quantidade limitada de dados rotulados, os modelos pré-treinados disponíveis no Hugging Face Hub podem tornar a detecção de objetos mais eficiente.

Ele também apresentou uma breve visão geral de vários modelos desenvolvidos para essa tarefa que você pode encontrar na Hugging Face:

  • Modelos de detecção de objetos em tempo real: em ambientes dinâmicos, nos quais a velocidade é essencial, modelos como o Transformer de detecção (DETR) oferecem recursos de detecção de objetos em tempo real. O DETR é treinado no conjunto de dados COCO e foi desenvolvido para processar recursos multiescala com eficiência, tornando-o adequado para aplicações sensíveis ao tempo.
  • Modelos de visão e linguagem: esses modelos combinam o processamento de imagens e texto, permitindo que os sistemas de IA associem imagens a descrições ou reconheçam objetos além dos dados usados no treinamento. Exemplos incluem CLIP e SigLIP, que aprimoram a busca de imagens ao associar texto a elementos visuais e permitem que soluções de IA identifiquem novos objetos compreendendo o contexto deles.
  • Modelos de detecção de objetos zero-shot: eles podem identificar objetos que nunca viram antes ao compreender a relação entre imagens e texto. Exemplos incluem OwlVit, GroundingDINO e OmDet, que usam aprendizado zero-shot para detectar novos objetos sem precisar de dados de treinamento rotulados.

Como usar os modelos da Hugging Face#

Em seguida, Pavel direcionou o foco para a utilização prática dos modelos da Hugging Face, explicando três maneiras pelas quais os desenvolvedores podem aproveitá-los: explorar modelos, testá-los rapidamente e personalizá-los ainda mais.

Ele demonstrou como os desenvolvedores podem navegar pelos modelos diretamente no Hugging Face Hub sem escrever código, facilitando o teste imediato dos modelos por meio de uma interface interativa. "Você pode experimentá-lo sem escrever sequer uma linha de código ou baixar o modelo para o seu computador", acrescentou Pavel. Como alguns modelos são grandes, executá-los no Hub ajuda a evitar limitações de armazenamento e processamento.

Como usar os modelos da Hugging Face

Fig. 2. Como usar os modelos da Hugging Face.

Além disso, a API de inferência da Hugging Face permite que os desenvolvedores executem modelos de IA com chamadas de API simples. Ela é excelente para testes rápidos, projetos de prova de conceito e prototipagem ágil, sem a necessidade de uma configuração complexa.

Para casos de uso mais avançados, os desenvolvedores podem usar o framework Transformers da Hugging Face, uma ferramenta de código aberto que fornece modelos pré-treinados para tarefas de texto, visão e áudio, oferecendo suporte tanto a PyTorch quanto a TensorFlow. Pavel explicou que, com apenas duas linhas de código, os desenvolvedores podem obter um modelo do Hugging Face Hub e conectá-lo a uma ferramenta de pré-processamento, como um processador de imagens, para analisar dados de imagem em aplicações de Vision AI.

Otimizando fluxos de trabalho de IA com a Hugging Face#

Em seguida, Pavel explicou como a Hugging Face pode simplificar os fluxos de trabalho de IA. Um dos principais temas abordados foi a otimização do mecanismo de atenção nos Transformers, um recurso central dos modelos de deep learning que os ajuda a se concentrar nas partes mais relevantes dos dados de entrada. Isso melhora a precisão de tarefas envolvendo processamento de linguagem e visão computacional. No entanto, esse mecanismo pode consumir muitos recursos.

A otimização do mecanismo de atenção pode reduzir significativamente o uso de memória e, ao mesmo tempo, melhorar a velocidade. Pavel observou: "Por exemplo, ao mudar para uma implementação de atenção mais eficiente, você pode obter um desempenho até 1,8 vez mais rápido."

A Hugging Face oferece suporte integrado a implementações de atenção mais eficientes dentro do framework Transformers. Os desenvolvedores podem ativar essas otimizações simplesmente especificando uma implementação de atenção alternativa ao carregar um modelo.

Optimum e Torch Compile#

Ele também falou sobre quantização, uma técnica que torna os modelos de IA menores ao reduzir a precisão dos números que eles usam, sem afetar significativamente o desempenho. Isso ajuda os modelos a usar menos memória e executar mais rapidamente, tornando-os mais adequados para dispositivos com capacidade de processamento limitada, como smartphones e sistemas embarcados.

Para melhorar ainda mais a eficiência, Pavel apresentou a biblioteca Hugging Face Optimum, um conjunto de ferramentas desenvolvido para otimizar e implantar modelos. Com apenas algumas linhas de código, os desenvolvedores podem aplicar técnicas de quantização e converter modelos para formatos eficientes, como Intercâmbio de Redes Neurais Abertas (ONNX), permitindo que sejam executados sem problemas em diferentes tipos de hardware, incluindo servidores em nuvem e dispositivos de borda.

Pavel falando sobre a biblioteca Optimum e seus recursos

Fig. 3. Pavel falou sobre a biblioteca Optimum e seus recursos.

Por fim, Pavel mencionou os benefícios do Torch Compile, um recurso do PyTorch que otimiza a forma como os modelos de IA processam dados, fazendo com que executem de maneira mais rápida e eficiente. A Hugging Face integra o Torch Compile às bibliotecas Transformers e Optimum, permitindo que os desenvolvedores aproveitem essas melhorias de desempenho com alterações mínimas no código.

Ao otimizar a estrutura computacional do modelo, o Torch Compile pode acelerar os tempos de inferência e aumentar as taxas de quadros de 29 para 150 quadros por segundo, sem comprometer a precisão ou a qualidade.

Implantando modelos com as ferramentas da Hugging Face#

Dando continuidade, Pavel comentou brevemente como os desenvolvedores podem ampliar e implantar modelos de Vision AI usando as ferramentas da Hugging Face depois de selecionar o modelo certo e escolher a melhor abordagem para o desenvolvimento.

Por exemplo, os desenvolvedores podem implantar aplicações interativas de IA usando Gradio e Streamlit. O Gradio permite criar interfaces baseadas na web para modelos de machine learning, enquanto o Streamlit ajuda a criar aplicações de dados interativas com scripts simples em Python.

Pavel também destacou: “Você não precisa começar a escrever tudo do zero”, referindo-se aos guias, notebooks de treinamento e scripts de exemplo fornecidos pela Hugging Face. Esses recursos ajudam os desenvolvedores a começar rapidamente, sem precisar criar tudo desde o início.

Pavel discutindo os recursos da Hugging Face no YV24

Fig. 4. Pavel discutindo os recursos da Hugging Face no YV24.

Benefícios do Hugging Face Hub#

Encerrando sua palestra, Pavel resumiu as vantagens de usar o Hugging Face Hub. Ele enfatizou como a plataforma simplifica o gerenciamento e a colaboração em torno dos modelos. Também chamou a atenção para a disponibilidade de guias, notebooks e tutoriais, que podem ajudar iniciantes e especialistas a compreender e implementar modelos de IA.

"Já existem muitos espaços interessantes no Hub. Você pode encontrar outros semelhantes, clonar o código compartilhado, modificar algumas linhas, substituir o modelo pelo seu e enviá-lo de volta", explicou ele, incentivando os desenvolvedores a aproveitar a flexibilidade da plataforma.

Principais conclusões#

Durante sua palestra no YV24, Pavel compartilhou como a Hugging Face oferece ferramentas que apoiam o treinamento, a otimização e a implantação de modelos de IA. Por exemplo, inovações como Transformers, Optimum e Torch Compile podem ajudar os desenvolvedores a melhorar o desempenho dos modelos.

À medida que os modelos de IA se tornam mais eficientes, os avanços em quantização e implantação na borda estão facilitando sua execução em dispositivos com recursos limitados. Essas melhorias, combinadas com ferramentas como a Hugging Face e modelos avançados de visão computacional, como o Ultralytics YOLO11, são essenciais para criar aplicações de Vision AI escaláveis e de alto desempenho.

Junte-se à nossa comunidade em crescimento! Explore nosso repositório no GitHub para aprender sobre IA e confira nossas licenças do YOLO para começar seus projetos de Vision AI. Tem interesse em inovações como visão computacional na área da saúde ou visão computacional na agricultura? Visite nossas páginas de soluções para saber mais!

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática