Large Language Model (LLM)
Explore os fundamentos dos Modelos de Linguagem Grandes (LLMs). Saiba mais sobre a arquitetura Transformer, a tokenização e como combinar LLMs com o Ultralytics YOLO26.
Um Modelo de Linguagem de Grande Escala (LLM) é um tipo sofisticado de Inteligência Artificial (AI) treinado com conjuntos de dados massivos para compreender, gerar e manipular a linguagem humana. Estes modelos representam uma evolução significativa na Aprendizagem Profunda (DL), utilizando redes neuronais com milhares de milhões de parâmetros para capturar padrões linguísticos complexos, gramática e relações semânticas. Na sua essência, a maioria dos LLM modernos depende da arquitetura Transformer, que lhes permite processar sequências de dados em paralelo, em vez de sequencialmente. Esta arquitetura utiliza um mecanismo de autoatenção, permitindo que o modelo pondere a importância de diferentes palavras numa frase em relação umas às outras, independentemente da distância entre elas no texto.
Mecanismos Essenciais dos LLM#
A funcionalidade de um LLM começa com a tokenização, um processo em que o texto bruto é dividido em unidades menores chamadas tokens (palavras ou subpalavras). Durante a fase de treino do modelo, o sistema analisa petabytes de texto da internet, de livros e de artigos. Este realiza aprendizagem não supervisionada para prever o token seguinte numa sequência, aprendendo efetivamente a estrutura estatística da linguagem.
Após este treino inicial, os programadores aplicam frequentemente o ajuste fino para especializar o modelo em tarefas distintas, como análise médica ou assistência à programação. Esta adaptabilidade explica por que motivo organizações como o Stanford Center for Research on Foundation Models os classificam como "modelos fundacionais" — bases amplas sobre as quais são criadas aplicações específicas.
Aplicações no mundo real#
Os LLM ultrapassaram a investigação teórica e chegaram a aplicações práticas de grande impacto em vários setores:
- Assistentes Virtuais Inteligentes: O atendimento ao cliente moderno depende fortemente de [chatbots](https://ultralytics-translation-0.invalid alimentados por LLM. Ao contrário dos sistemas mais antigos baseados em regras, estes agentes conseguem lidar com consultas complexas. Para melhorar a precisão e reduzir as alucinações, os programadores integram a Geração Aumentada por Recuperação (RAG), permitindo que o modelo consulte documentação empresarial externa e atualizada antes de responder.
- Sistemas Multimodais de Visão-Linguagem: A fronteira da AI liga texto a dados visuais. Os Modelos de Visão-Linguagem (VLMs) permitem que os utilizadores consultem imagens usando linguagem natural. Por exemplo, combinar uma interface linguística com um detetor robusto como o YOLO26 permite que os sistemas identifiquem e descrevam objetos em transmissões de vídeo em tempo real com base em comandos de voz.
Ligação entre Texto e Visão com Código#
Embora os LLM padrão processem texto, o setor está a avançar rumo à AI Multimodal. O exemplo seguinte demonstra como prompts linguísticos podem controlar tarefas de visão computacional usando o YOLO-World, um modelo que compreende descritores textuais para deteção de vocabulário aberto.
from ultralytics import YOLOWorld
# Load a model capable of understanding natural language prompts
model = YOLOWorld("yolov8s-world.pt")
# Define custom classes using text descriptions rather than fixed labels
model.set_classes(["person wearing a red helmet", "blue industrial machine"])
# Run inference to detect these specific text-defined objects
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Show results
results[0].show()Distinguir conceitos relacionados#
É importante distinguir os LLM de termos mais abrangentes ou relacionados:
- LLM vs. Processamento de Linguagem Natural (NLP): O NLP é o campo académico abrangente dedicado à interação entre computadores e a linguagem humana. Um LLM é uma ferramenta ou tecnologia específica utilizada nesse campo para alcançar resultados de vanguarda.
- LLM vs. AI Generativa: A AI Generativa é uma categoria que abrange qualquer AI capaz de criar conteúdo novo. Os LLM são o subconjunto baseado em texto desta categoria, enquanto modelos como o Stable Diffusion representam o subconjunto de geração de imagens.
Desafios e Perspetivas Futuras#
Apesar das suas capacidades, os LLM enfrentam desafios relacionados com o viés na AI, pois podem reproduzir inadvertidamente preconceitos presentes nos seus dados de treino. Além disso, o enorme poder computacional necessário para treinar modelos como o GPT-4 ou o Google Gemini suscita preocupações sobre o consumo de energia. Atualmente, a investigação concentra-se na quantização de modelos para tornar estes sistemas suficientemente eficientes para funcionarem em hardware de borda.
Para obter conhecimentos técnicos mais aprofundados, o artigo original Attention Is All You Need apresenta a teoria fundamental dos Transformers. Também podes explorar a forma como a NVIDIA está a otimizar o hardware para estas cargas de trabalho massivas.









