2024 começa com uma onda de IA generativa
Um olhar sobre as emocionantes inovações em IA do primeiro trimestre de 2024. Abordaremos avanços como a IA Sora da OpenAI, o chip cerebral da Neuralink e os LLM mais recentes.

A comunidade de IA parece aparecer nas manchetes quase todos os dias. Os primeiros meses de 2024 foram entusiasmantes e repletos de novas inovações em IA. Desde novos e poderosos modelos de linguagem de grande escala até implantes no cérebro humano, 2024 está a revelar-se incrível.
Estamos a ver a IA transformar setores, tornar a informação mais acessível e até dar os primeiros passos rumo à fusão das nossas mentes com máquinas. Vamos recuar ao primeiro trimestre de 2024 e analisar mais de perto o progresso alcançado na IA em apenas alguns meses.
Os LLMs estão em alta#
Os modelos de linguagem de grande escala (LLMs), concebidos para compreender, gerar e manipular a linguagem humana com base em grandes volumes de dados de texto, estiveram no centro das atenções no primeiro trimestre de 2024. Muitas grandes empresas tecnológicas lançaram os seus próprios modelos LLM, cada um com capacidades únicas. O sucesso extraordinário de LLMs anteriores, como o GPT-3, inspirou esta tendência. Eis alguns dos lançamentos de LLM mais notáveis do início de 2024.
Claude 3 da Anthropic#
A Anthropic lançou o Claude 3 em 14 de março de 2024. O modelo Claude 3 está disponível em três versões: Opus, Sonnet e Haiku, cada uma destinada a diferentes mercados e finalidades. Haiku, o modelo mais rápido, está otimizado para respostas rápidas e básicas. Sonnet equilibra velocidade e inteligência e destina-se a aplicações empresariais. Opus, a versão mais avançada, oferece inteligência e capacidade de raciocínio incomparáveis, sendo ideal para tarefas complexas e para alcançar os melhores resultados em benchmarks.
O Claude 3 oferece muitas funcionalidades e melhorias avançadas:
- Conversas multilíngues melhoradas: capacidades aperfeiçoadas em idiomas como espanhol, japonês e francês.
- Funcionalidades avançadas de visão: capaz de processar vários formatos visuais.
- Recusas minimizadas: demonstra uma compreensão melhor, com menos recusas desnecessárias, indicando uma compreensão contextual aperfeiçoada.
- Janela de contexto ampliada: oferece uma janela de contexto de 200K, mas é capaz de processar entradas com mais de 1 milhão de tokens, de acordo com as necessidades dos clientes.

Fig. 1. O Claude 3 tem uma consciência contextual superior à das versões anteriores.
DBRX da Databricks#
O Databricks DBRX é um LLM aberto e de finalidade geral, lançado pela Databricks em 27 de março de 2024. O DBRX apresenta excelentes resultados em vários benchmarks, incluindo compreensão de linguagem, programação e matemática. Supera outros modelos estabelecidos, sendo aproximadamente 40% menor do que modelos semelhantes.

Fig. 2. Comparação do DBRX com outros modelos.
O DBRX foi treinado com previsão do token seguinte, utilizando uma arquitetura de mistura de especialistas (MoE) refinada, razão pela qual observamos melhorias significativas no desempenho do treino e da inferência. A sua arquitetura permite ao modelo prever a palavra seguinte de uma sequência com maior precisão, consultando um conjunto diversificado de submodelos especializados (os "especialistas"). Estes submodelos são bons a lidar com diferentes tipos de informação ou tarefas.
Gemini 1.5 da Google#
A Google apresentou o Gemini 1.5, um modelo de IA multimodal eficiente em termos computacionais, capaz de analisar grandes volumes de dados de texto, vídeo e áudio, em 15 de fevereiro de 2024. O modelo mais recente é mais avançado em termos de desempenho, eficiência e capacidades. Uma funcionalidade essencial do Gemini 1.5 é o seu avanço na compreensão de contextos longos. O modelo é capaz de processar consistentemente até 1 milhão de tokens. As capacidades do Gemini 1.5 também se devem a uma nova arquitetura baseada em MoE.

Fig. 3. Comparação dos comprimentos de contexto de LLMs populares
Eis algumas das funcionalidades mais interessantes do Gemini 1.5:
- Gestão de dados melhorada: permite carregar diretamente grandes PDFs, repositórios de código ou vídeos longos como prompts. O modelo consegue raciocinar entre modalidades e produzir texto.
- Carregamento e consulta de vários ficheiros: agora, os programadores podem carregar vários ficheiros e fazer perguntas.
- Pode ser utilizado para diferentes tarefas: está otimizado para escalar em diversas tarefas e apresenta melhorias em áreas como matemática, ciência, raciocínio, multilinguismo, compreensão de vídeo e código.
Imagens impressionantes geradas por IA#
O primeiro trimestre de 2024 revelou modelos de IA generativa capazes de criar imagens tão realistas que deram origem a debates sobre o futuro das redes sociais e o progresso da IA. Vamos conhecer os modelos que estão a gerar esta discussão.
Sora da OpenAI#
A OpenAI, criadora do ChatGPT, anunciou em 15 de fevereiro de 2024 um modelo de aprendizagem profunda de texto para vídeo de última geração chamado Sora. O Sora é um gerador de texto para vídeo capaz de gerar vídeos com a duração de um minuto e elevada qualidade visual, com base em prompts de texto fornecidos pelos utilizadores.
Por exemplo, observa o prompt seguinte.
“Um mundo de papel artisticamente elaborado, representando um recife de coral repleto de peixes coloridos e criaturas marinhas.”
Eis um frame do vídeo de saída.

Fig. 4. Um frame de um vídeo gerado pelo Sora.
A arquitetura do Sora torna isto possível ao combinar modelos de difusão para a geração de texturas com modelos Transformer para a coerência estrutural. Até agora, o acesso ao Sora foi concedido a red teamers e a um grupo selecionado de artistas visuais, designers e cineastas, para compreender os riscos e obter feedback.
Stable Diffusion 3 da Stability AI#
A Stability AI anunciou a chegada do Stable Diffusion 3, um modelo de geração de texto para imagem, em 22 de fevereiro de 2024. O modelo combina uma arquitetura Transformer de difusão com correspondência de fluxo. Ainda não foi publicado um artigo técnico, mas há algumas funcionalidades importantes a acompanhar.

Fig. 5. Imagem de saída baseada no prompt: “Uma obra de arte épica de anime com um feiticeiro no topo de uma montanha à noite, a lançar um feitiço cósmico no céu escuro que diz "Stable Diffusion 3", feito de energia colorida” (Fonte)
O modelo mais recente do Stable Diffusion oferece melhorias no desempenho, na qualidade da imagem e na precisão ao criar imagens com vários elementos. O Stable Diffusion 3 também disponibilizará vários modelos, com dimensões entre 800 milhões e 8 mil milhões de parâmetros. Isto permitirá aos utilizadores escolher com base nas suas necessidades específicas de escalabilidade e detalhe.
Lumiere da Google#
Em 23 de janeiro de 2024, a Google lançou o Lumiere, um modelo de difusão de texto para vídeo. O Lumiere utiliza uma arquitetura chamada Space-Time-U-Net, ou STUNet, abreviadamente. Isto ajuda o Lumiere a compreender onde estão os elementos e como se movem num vídeo. Dessa forma, consegue gerar vídeos suaves e realistas.

Fig. 6. Um frame de um vídeo gerado com base no prompt: “Panda a tocar ukulele em casa.”
Com a capacidade de gerar 80 frames por vídeo, o Lumiere está a ultrapassar limites e a estabelecer novos padrões para a qualidade de vídeo no setor da IA. Eis algumas das funcionalidades do Lumiere:
- Imagem para vídeo: a partir de uma imagem e de um prompt, o Lumiere pode animar imagens e transformá-las em vídeos.
- Geração estilizada: o Lumiere pode criar vídeos com estilos específicos utilizando uma única imagem de referência.
- Cinemagraphs: o Lumiere pode animar regiões específicas de uma imagem para criar cenas dinâmicas, como um determinado objeto em movimento enquanto o resto da cena permanece estático.
- Preenchimento de vídeo: pode modificar partes de um vídeo, como mudar a roupa das pessoas ou alterar detalhes do fundo.
O futuro parece já estar aqui#
O início de 2024 também trouxe muitas inovações em IA que parecem saídas de um filme de ficção científica. Coisas que antes consideraríamos impossíveis estão agora a ser desenvolvidas. O futuro não parece tão distante com as seguintes descobertas.
Neuralink de Elon Musk#
A Neuralink de Elon Musk implantou com sucesso o seu chip cerebral sem fios num ser humano em 29 de janeiro de 2024. Este é um enorme passo rumo à ligação dos cérebros humanos a computadores. Elon Musk partilhou que o primeiro produto da Neuralink, chamado ‘Telepathy’, está em desenvolvimento.

Fig. 7. O implante da Neuralink
O objetivo é permitir que os utilizadores, especialmente aqueles que perderam a funcionalidade dos membros, controlem dispositivos sem esforço através dos seus pensamentos. As potenciais aplicações vão além da conveniência. Elon Musk imagina um futuro em que pessoas com paralisia possam comunicar facilmente.
HoloTile Floor da Disney#
Em 18 de janeiro de 2024, a Walt Disney Imagineering apresentou o HoloTile Floor. Foi apelidado de primeiro piso de passadeira omnidirecional para várias pessoas do mundo.

Fig. 8. O Imagineer da Disney Lanny Smoot apresenta a sua mais recente inovação, o piso HoloTile.
O piso pode mover-se sob qualquer pessoa ou objeto, como se fosse telecinesia, proporcionando uma experiência imersiva de realidade virtual e aumentada. É possível caminhar em qualquer direção e evitar colisões enquanto se está sobre ele. O HoloTile Floor da Disney também pode ser instalado em palcos teatrais para dançar e mover-se de formas criativas.
Vision Pro da Apple#
Em 2 de fevereiro de 2024, os tão aguardados óculos Vision Pro da Apple chegaram ao mercado. Incluem várias funcionalidades e aplicações concebidas para redefinir a experiência de realidade virtual e aumentada. Os óculos Vision Pro destinam-se a um público diversificado, combinando entretenimento, produtividade e computação espacial. A Apple anunciou orgulhosamente que, no lançamento, mais de 600 aplicações, desde ferramentas de produtividade a jogos e serviços de entretenimento, estavam otimizadas para o Vision Pro.
Devin da Cognition#
Em 12 de março de 2024, a Cognition lançou um assistente de engenharia de software chamado Devin. O Devin é a primeira tentativa do mundo de criar um engenheiro de software de IA autónomo. Ao contrário dos assistentes de programação tradicionais, que oferecem sugestões ou concluem tarefas específicas, o Devin foi concebido para gerir projetos completos de desenvolvimento de software, desde o conceito inicial até à conclusão.
Consegue aprender novas tecnologias, criar e implementar aplicações completas, encontrar e corrigir erros, treinar os seus próprios modelos, contribuir para bases de código de código aberto e de produção e até assumir trabalhos reais de desenvolvimento em sites como o Upwork.

Fig. 9. Comparação do Devin com outros modelos.
O Devin foi avaliado no SWE-bench, um benchmark desafiante que pede aos agentes que resolvam problemas reais do GitHub encontrados em projetos de código aberto como Django e scikit-learn. Resolveu corretamente 13,86% dos problemas de ponta a ponta, em comparação com os 1,96% do anterior estado da arte.
Menções honrosas#
Aconteceram tantas coisas que não é possível abordar tudo neste artigo. Mas eis mais algumas menções honrosas.
- O LATTE3D da NVIDIA, anunciado em 21 de março de 2024, é um modelo de IA de texto para 3D que cria instantaneamente representações 3D a partir de prompts de texto.
- O novo gerador de texto para vídeo da Midjourney, anunciado pelo CEO David Holz, começou a ser treinado em janeiro e deverá ser lançado em breve.
- A Lenovo, contribuindo para o avanço da revolução dos PCs com IA, lançou o ThinkBook 13x com tecnologia E Ink Prism e portáteis de IA de alto desempenho em 8 de janeiro de 2024.
Mantém-te a par das tendências de IA connosco!#
O início de 2024 foi marcado por avanços revolucionários na IA e por muitos marcos tecnológicos importantes. Mas isto é apenas o início do que a IA pode fazer. Se quiseres saber mais sobre os desenvolvimentos mais recentes em IA, a Ultralytics pode ajudar-te.
Consulta o nosso repositório no GitHub para veres as nossas contribuições mais recentes em visão computacional e IA. Também podes consultar as nossas páginas de soluções para veres como a IA está a ser utilizada em setores como a indústria e a saúde.









