Principais destaques da Ultralytics na YOLO Vision 2025 Shenzhen!
Revisite os principais momentos da YOLO Vision 2025 Shenzhen, onde a Ultralytics reuniu inovadores, parceiros e a comunidade de IA para um dia de inspiração.

No dia 26 de outubro, o YOLO Vision 2025 (YV25) fez a sua estreia na China no Edifício B10, no OCT Creative Culture Park, em Shenzhen. O evento de visão computacional híbrida da Ultralytics reuniu mais de 200 participantes presencialmente, com muitos outros a juntarem-se online através do YouTube e do Bilibili.
A transmissão em direto do YV25 Shenzhen já ultrapassou as 3.500 visualizações no YouTube e continua a ganhar destaque à medida que os melhores momentos do evento são partilhados pela comunidade. Foi um dia repleto de ideias, conversas e exploração prática sobre o rumo que a visão computacional está a tomar.
O dia começou com uma calorosa recepção da nossa anfitriã, Huang Xueying, que convidou todos a se conectarem, aprenderem e participarem das discussões ao longo do evento. Ela explicou que este foi o segundo YOLO Vision do ano, após a edição de Londres em setembro, e compartilhou o quão empolgante foi reunir a comunidade de visão computacional com IA novamente aqui em Shenzhen.
Neste artigo, revisitaremos os destaques do dia, incluindo as atualizações dos modelos, as sessões com os palestrantes, as demonstrações ao vivo e os momentos da comunidade que uniram todos. Vamos começar!
A jornada dos modelos Ultralytics YOLO até agora#
A primeira palestra principal do dia foi conduzida pelo Fundador e CEO da Ultralytics, Glenn Jocher, que partilhou como os modelos Ultralytics YOLO evoluíram de um avanço na investigação para alguns dos modelos de visão computacional mais utilizados no mundo. O Glenn explicou que o seu trabalho inicial se focou em tornar o YOLO mais fácil de usar.
Ele portou os modelos para PyTorch, melhorou a documentação e compartilhou tudo abertamente para que desenvolvedores de todo o mundo pudessem construir sobre isso. Como ele relembrou: “Mergulhei de cabeça em 2018. Decidi que era aqui que estava o meu futuro.” O que começou como um esforço pessoal rapidamente se tornou um movimento global de código aberto.

Fig 1. Glenn Jocher falando no palco no YOLO Vision 2025 Shenzhen.
Hoje, os modelos Ultralytics YOLO realizam bilhões de inferências todos os dias, e Glenn enfatizou que essa escala só foi possível por causa das pessoas que ajudaram a construí-la. Pesquisadores, engenheiros, estudantes, entusiastas e colaboradores de código aberto de todo o mundo transformaram o YOLO no que ele é hoje.
Como disse Glenn: “Há quase mil deles [colaboradores] por aí e somos muito gratos por isso. Não estaríamos onde estamos hoje sem essas pessoas.”
Atualizações sobre o Ultralytics YOLO26#
O primeiro olhar sobre o Ultralytics YOLO26 foi partilhado no início deste ano no evento YOLO Vision 2025 London, onde foi apresentado como o próximo grande passo na família de modelos Ultralytics YOLO. No YV25 Shenzhen, o Glenn deu uma atualização sobre o progresso desde esse anúncio e deu à comunidade de IA uma visão mais detalhada de como o modelo tem evoluído.
O Ultralytics YOLO26 foi concebido para ser mais pequeno, mais rápido e mais preciso, mantendo-se prático para a utilização no mundo real. O Glenn explicou que a equipa passou o último ano a aperfeiçoar a arquitetura, a avaliar o desempenho em vários dispositivos e a incorporar conhecimentos da investigação e do feedback da comunidade. O objetivo é oferecer um desempenho de ponta sem tornar os modelos mais difíceis de implementar.
O que esperar do Ultralytics YOLO26#
Uma das principais atualizações destacadas pelo Glenn é o facto de o Ultralytics YOLO26 vir acompanhado de uma campanha dedicada de afinação de hiperparâmetros, passando do treino inteiramente a partir do zero para a afinação fina em conjuntos de dados maiores. Explicou que esta abordagem está muito mais alinhada com os casos de utilização reais.
Aqui estão algumas das outras melhorias importantes compartilhadas no evento:
- Arquitetura simplificada: A camada Distribution Focal Loss (DFL) foi removida. Isso torna os modelos mais simples e rápidos de executar, mantendo o mesmo nível de precisão.
- Suporte de inferência de ponta a ponta: O Ultralytics YOLO26 é nativamente de ponta a ponta, o que significa que pode ser executado sem uma camada NMS separada. Isto torna a exportação para formatos como ONNX e TensorRT e a implementação em hardware edge muito mais fáceis.
- Melhor desempenho em pequenos objetos: Estratégias de perda atualizadas ajudam o modelo a detectar objetos minúsculos de forma mais confiável, o que tem sido um desafio persistente na visão computacional.
- Um novo otimizador híbrido: O YOLO26 inclui um novo otimizador inspirado em pesquisas recentes de treinamento de modelos de linguagem grande, que melhora a precisão do modelo e agora está integrado diretamente no pacote Python da Ultralytics.
O Ultralytics YOLO26 é o próximo passo na IA de visão prática#
Em conjunto, estas atualizações resultam em modelos até 43% mais rápidos em CPU, sendo também mais precisos do que o Ultralytics YOLO11, tornando o YOLO26 especialmente impactante para dispositivos embebidos, robótica e sistemas de edge.
O Ultralytics YOLO26 vai suportar todas as mesmas tarefas e tamanhos de modelo atualmente disponveis no YOLO11, resultando em 25 variantes de modelo em toda a famlia. Isso inclui modelos para dete�o, segmenta�o, estimativa de pose, caixas delimitadoras orientadas e classifica�o, variando de nano at extra grande.
A equipe também está trabalhando em cinco variantes de prompt. Esses são modelos que podem receber um prompt de texto e retornar caixas delimitadoras diretamente, sem a necessidade de treinamento.
É um passo inicial rumo a fluxos de trabalho de visão mais flexíveis e baseados em instruções, que são mais fáceis de adaptar a diferentes casos de utilização. Os modelos do Ultralytics YOLO26 ainda estão em desenvolvimento ativo, mas os resultados iniciais de desempenho são fortes e a equipa está a trabalhar no sentido de os lançar em breve.
Um olhar sobre a Plataforma Ultralytics#
Após a atualização do YOLO26, o Glenn deu as boas-vindas a Prateek Bhatnagar, o nosso Diretor de Engenharia de Produto, para fazer uma demonstração ao vivo da Ultralytics Platform. Esta plataforma está a ser desenvolvida para reunir as principais partes do fluxo de trabalho de visão computacional, incluindo a exploração de conjuntos de dados, a anotação de imagens, o treino de modelos e a comparação de resultados.

Fig 2. Prateek Bhatnagar demonstrando a Plataforma Ultralytics.
O Prateek salientou que a plataforma se mantém fiel às raízes de código aberto da Ultralytics, introduzindo dois espaços comunitários, uma comunidade de conjuntos de dados e uma comunidade de projetos, onde os programadores podem contribuir, reutilizar e melhorar o trabalho uns dos outros. Durante a demonstração, ele apresentou a anotação assistida por IA, o treino fácil na cloud e a capacidade de ajustar modelos diretamente a partir da comunidade, sem necessidade de recursos de GPU locais.
A plataforma está atualmente em desenvolvimento. Prateek incentivou o público a ficar atento aos anúncios e observou que a equipe está crescendo na China para apoiar o lançamento.
Vozes por trás do YOLO: O painel dos autores#
Com o ímpeto a crescer, o evento passou para um painel de discussão com vários dos investigadores por trás de diferentes modelos YOLO. O painel incluiu o Glenn Jocher, juntamente com Jing Qiu, a nossa Engenheira Sénior de Machine Learning; Chen Hui, um Engenheiro de Machine Learning na Meta e um dos autores do YOLOv10; e Bo Zhang, um Estrategista de Algoritmos na Meituan e um dos autores do YOLOv6.

Fig 3. Um painel sobre o desenvolvimento de modelos YOLO com Huang Xueying, Chen Hui, Bo Zhang, Jing Qiu e Glenn Jocher.
A discussão focou em como o YOLO continua a evoluir através do uso no mundo real. Os palestrantes abordaram como o progresso é frequentemente impulsionado por desafios práticos de implantação, como executar eficientemente em dispositivos de borda, melhorar a detecção de pequenos objetos e simplificar a exportação de modelos.
Em vez de apenas perseguir a precisão, o painel observou a importância de equilibrar velocidade, usabilidade e confiabilidade em ambientes de produção. Outra conclusão compartilhada foi o valor da iteração e do feedback da comunidade.
Aqui estão alguns outros insights interessantes da conversa:
- A detecção de vocabulário aberto está ganhando força no ecossistema YOLO: Modelos mais recentes mostram como o alinhamento visão-linguagem e fluxos de trabalho baseados em prompts podem detectar objetos além de categorias fixas.
- A atenção leve está em alta: O painel discutiu como a utilização de mecanismos de atenção eficientes, em vez de atenção total em todo o lado, pode aumentar a precisão, mantendo a inferência suficientemente leve para dispositivos de edge.
- Itere cedo e com frequência com a comunidade: Os painelistas reforçaram uma mentalidade de construir-testar-melhorar, onde lançar modelos mais cedo e aprender com os usuários gera resultados mais fortes do que longos ciclos de desenvolvimento privado.
Líderes de pensamento definindo o futuro da IA e da visão#
Em seguida, vamos dar uma olhada mais de perto em algumas das palestras principais no YV25 Shenzhen, onde líderes de toda a comunidade de IA compartilharam como a visão computacional com IA está evoluindo, desde humanos digitais e robótica até raciocínio multimodal e implantação eficiente na borda.
Ensinando a IA a entender a experiência humana#
Em uma sessão perspicaz, o Dr. Peng Zhang do Alibaba Qwen Lab compartilhou como sua equipe está desenvolvendo grandes modelos de vídeo que podem gerar humanos digitais expressivos com movimento e controle mais naturais. Ele apresentou o Wan S2V e o Wan Animate, que usam referências de áudio ou movimento para produzir fala, gestos e animação realistas, abordando as limitações da geração puramente baseada em texto.

Fig 4. Peng Zhang explicando como grandes modelos de vídeo podem impulsionar humanos digitais.
O Dr. Zhang também falou sobre o progresso feito em direção a avatares interativos em tempo real, incluindo a clonagem zero-shot de aparência e movimento e modelos leves capazes de animar um rosto diretamente a partir de um feed de câmara ao vivo, aproximando os humanos digitais hiper-realistas de uma execução fluida em dispositivos comuns.
Da percepção à ação: A era da inteligência incorporada#
Um dos temas principais no YV25 Shenzhen foi a mudança de modelos de visão que simplesmente veem o mundo para sistemas que podem agir dentro dele. Em outras palavras, a percepção não é mais o fim do pipeline; ela está se tornando o início da ação.
Por exemplo, na sua apresentação principal, Hu Chunxu, da D-Robotics, descreveu como os seus kits de desenvolvimento e soluções SoC (system on a chip) integram deteção, controlo de movimento em tempo real e tomada de decisões numa pilha unificada de hardware e software. Ao tratar a perceção e a ação como um ciclo de feedback contínuo, em vez de etapas separadas, a sua abordagem suporta robôs capazes de se mover, adaptar e interagir de forma mais fiável em ambientes reais.

Fig 5. Demonstração da D-Robotics no YOLO Vision 2025 em Shenzhen, China.
Alex Zhang, da Baidu Paddle, ecoou esta ideia na sua palestra, explicando como o YOLO e o PaddleOCR trabalham em conjunto para detetar objetos e, em seguida, interpretar o texto e a estrutura à sua volta. Isto permite que os sistemas convertam imagens e documentos em informação estruturada e útil para tarefas como logística, inspeções e processamento automatizado.
Inteligência na borda: IA eficiente para todos os dispositivos#
Outro tópico interessante no YV25 Shenzhen foi a forma como a Vision AI se está a tornar mais eficiente e capaz em dispositivos de edge.
Paul Jung da DEEPX falou sobre a implantação de modelos YOLO diretamente em hardware embarcado, reduzindo a dependência da nuvem. Ao focar no baixo consumo de energia, inferência otimizada e ajuste de modelo consciente do hardware, a DEEPX permite a percepção em tempo real para drones, robôs móveis e sistemas industriais que operam em ambientes dinâmicos.
Da mesma forma, Liu Lingfei da Moore Threads compartilhou como a plataforma Moore Threads E300 integra computação de unidade central de processamento (CPU), unidade de processamento gráfico (GPU) e unidade de processamento neural (NPU) para fornecer inferência de visão de alta velocidade em dispositivos compactos.
A plataforma pode executar vários fluxos YOLO com altas taxas de quadros, e sua cadeia de ferramentas simplifica etapas como quantização, compilação estática e ajuste de desempenho. A Moore Threads também disponibilizou em código aberto uma ampla gama de modelos de visão computacional e exemplos de implantação para reduzir a barreira para os desenvolvedores.
Fundindo visão e linguagem para sistemas de IA mais inteligentes#
Até recentemente, construir um único modelo capaz tanto de compreender imagens quanto de interpretar linguagem exigia grandes arquiteturas transformer que eram dispendiosas de executar. No YV25 Shenzhen, Yue Ziyin, da Yuanshi Intelligence, deu uma visão geral do RWKV, uma arquitetura que combina as capacidades de raciocínio de contexto longo dos transformers com a eficiência dos modelos recorrentes.
Ele explicou como o Vision-RWKV aplica esse design à visão computacional ao processar imagens de uma forma que escala linearmente com a resolução. Isso o torna adequado para entradas de alta resolução e para dispositivos de borda onde a computação é limitada.
Yue também mostrou como o RWKV está sendo usado em sistemas de visão-linguagem, onde características da imagem são emparelhadas com a compreensão de texto para ir além da detecção de objetos, interpretando cenas, documentos e o contexto do mundo real.

Fig 6. Yue Ziyin falando sobre as aplicações do RWKV.
Estandes e demonstrações ao vivo que deram vida à visão computacional com IA#
Enquanto as palestras no palco olhavam para onde a visão computacional com IA está indo, os estandes no salão mostravam como ela já está sendo usada hoje. Os participantes puderam ver modelos rodando ao vivo, comparar opções de hardware e conversar diretamente com as equipes que constroem esses sistemas.
Aqui está um vislumbre da tecnologia que estava sendo exibida:
- Plataformas de desenvolvedor e prototipagem: Seeed, M5Stack e Infermove exibiram placas de desenvolvimento compactas e kits iniciais que facilitam a experimentação com aplicativos baseados em YOLO e a rápida transição de ideias para demonstrações funcionais.
- Hardware de borda de alto desempenho: Hailo, DEEPX, Intel e Moore Threads demonstraram chips e módulos construídos para uma inferência rápida e eficiente.
- Fluxos de trabalho de visão e linguagem: Baidu Paddle e RWKV destacaram pilhas de software que podem detectar objetos e também ler, interpretar e raciocinar sobre o que aparece em uma imagem ou documento.
- Open-source e ferramentas da comunidade: A Ultralytics e a Datawhale envolveram os programadores com demonstrações de modelos ao vivo, dicas de treino e orientação prática, reforçando como o conhecimento partilhado acelera a inovação.

Fig 7. Um olhar sobre o estande da M5Stack no YV25 Shenzhen.
Conectando-se com a comunidade de visão computacional com IA#
Além de toda a tecnologia empolgante, uma das melhores partes do YV25 Shenzhen foi reunir a comunidade de visão computacional e a equipe da Ultralytics novamente pessoalmente. Ao longo do dia, as pessoas se reuniram em torno de demonstrações, compartilharam ideias durante os intervalos para café e continuaram as conversas muito depois que as palestras terminaram.
Investigadores, engenheiros, estudantes e criadores trocaram notas, colocaram perguntas e partilharam experiências do mundo real, desde a implementação até ao treino de modelos. E graças a Cinco Jotas, do Grupo Osborne, trouxemos até um toque de cultura espanhola para o evento com presunto ibérico recém-cortado, criando um momento caloroso de convívio. Um espaço bonito, um público entusiasmado e um sentido partilhado de dinamismo tornaram o dia verdadeiramente especial.
Principais pontos#
Desde palestras inspiradoras até demonstrações práticas, o YOLO Vision 2025 Shenzhen capturou o espírito de inovação que define a comunidade Ultralytics. Ao longo do dia, palestrantes e participantes trocaram ideias, exploraram novas tecnologias e se conectaram por meio de uma visão compartilhada para o futuro da IA. Juntos, eles saíram energizados e prontos para o que vem a seguir com o Ultralytics YOLO.
Reimagina o que é possível com a IA e a visão computacional. Junta-te à nossa comunidade e ao nosso repositório do GitHub para descobrir mais. Sabe mais sobre aplicações como visão computacional na agricultura e IA no retalho. Explora as nossas opções de licenciamento e começa a usar a visão computacional hoje mesmo!






