Token
Aprende como os tokens funcionam como unidades fundamentais de informação em IA. Explora o seu papel em NLP, visão computacional e deteção de vocabulário aberto com o YOLO26.
Na arquitetura sofisticada da moderna inteligência artificial, um token representa a unidade fundamental e atómica de informação que um modelo processa. Antes de um algoritmo poder interpretar uma frase, analisar um script de software ou reconhecer objetos numa imagem, os dados de entrada brutos têm de ser divididos nestes elementos discretos e padronizados. Esta segmentação é uma etapa fundamental no pré-processamento de dados, transformando entradas não estruturadas num formato numérico que as redes neuronais conseguem processar eficientemente. Enquanto os humanos percecionam a linguagem como um fluxo contínuo de pensamentos ou as imagens como cenas visuais contínuas, os modelos computacionais precisam destes blocos de construção granulares para realizar operações como o reconhecimento de padrões e a análise semântica.
Token vs. Tokenização#
Para compreender a mecânica da aprendizagem automática, é essencial distinguir entre a unidade de dados e o processo utilizado para a criar. Esta diferenciação evita confusões ao conceber pipelines de dados e preparar material de formação na Ultralytics Platform.
- Tokenização: Este é o processo algorítmico (o verbo) de dividir dados brutos em partes. No caso do texto, isto pode envolver a utilização de bibliotecas como o Kit de Ferramentas de Linguagem Natural (NLTK) para determinar onde termina uma unidade e começa outra.
- Token: Este é o resultado obtido (o substantivo). É o fragmento de dados propriamente dito — como uma palavra, um subsegmento de palavra ou um bloco de imagem — que acaba por ser mapeado para um vetor numérico conhecido como embedding.
Tokens em Diferentes Domínios de IA#
A natureza de um token varia significativamente consoante a modalidade dos dados que estão a ser processados, especialmente entre os domínios textual e visual.
Tokens de Texto em PLN#
No campo do Processamento de Linguagem Natural (NLP), os tokens são as entradas dos Modelos de Linguagem de Grande Dimensão (LLMs). As primeiras abordagens mapeavam estritamente palavras inteiras, mas as arquiteturas modernas utilizam algoritmos de subsegmentos de palavras, como a Codificação por Pares de Bytes (BPE). Este método permite que os modelos processem palavras raras, dividindo-as em sílabas significativas e equilibrando o tamanho do vocabulário com a cobertura semântica. Por exemplo, a palavra "unhappiness" pode ser tokenizada em "un", "happi" e "ness".
Tokens Visuais em Visão Computacional#
O conceito de tokenização expandiu-se para a visão computacional com o surgimento do Transformer de Visão (ViT). Ao contrário das redes convolucionais tradicionais, que processam píxeis em janelas deslizantes, os Transformers dividem uma imagem numa grelha de blocos de tamanho fixo (por exemplo, 16x16 píxeis). Cada bloco é convertido num vetor unidimensional e tratado como um token visual distinto. Esta abordagem permite que o modelo utilize mecanismos de autoatenção para compreender a relação entre partes distantes de uma imagem, de forma semelhante à aplicação original de Transformers ao texto pela Google Research.
Aplicações no mundo real#
Os tokens funcionam como uma ponte entre os dados humanos e a inteligência das máquinas em inúmeras aplicações.
-
Deteção de Objetos com Vocabulário Aberto: Modelos avançados como o YOLO-World utilizam uma abordagem multimodal na qual os tokens de texto interagem com características visuais. Um utilizador pode introduzir prompts de texto personalizados (por exemplo, "capacete azul"), que o modelo tokeniza e compara com os objetos da imagem. Isto permite a aprendizagem zero-shot, possibilitando a deteção de objetos com os quais o modelo não foi explicitamente treinado.
-
IA Generativa: Em sistemas de geração de texto, como os chatbots, a IA funciona prevendo a probabilidade do token seguinte numa sequência. Ao selecionar iterativamente o token subsequente mais provável, o sistema constrói frases e parágrafos coerentes, alimentando ferramentas que vão desde o apoio automatizado ao cliente até aos assistentes virtuais.
Exemplo em Python: Utilizar Tokens de Texto para Deteção#
O seguinte excerto de código demonstra como o pacote ultralytics utiliza tokens de texto para orientar a deteção de objetos. Embora o YOLO26, considerado o estado da arte, seja recomendado para inferência de alta velocidade com classes fixas, a arquitetura YOLO-World permite exclusivamente que os utilizadores definam classes como tokens de texto em tempo de execução.
from ultralytics import YOLO
# Load a pre-trained YOLO-World model capable of understanding text tokens
model = YOLO("yolov8s-world.pt")
# Define specific classes; these text strings are tokenized internally
# The model will look specifically for these "tokens" in the visual data
model.set_classes(["bus", "backpack"])
# Run prediction on an image using the defined tokens
results = model.predict("https://ultralytics.com/images/bus.jpg")
# Display the results showing only the tokenized classes
results[0].show()Compreender os tokens é fundamental para navegar pelo panorama da IA generativa e da análise avançada. Quer permitam a um chatbot conversar fluentemente, quer ajudem um sistema de visão a distinguir entre classes de objetos subtis, os tokens continuam a ser a moeda essencial da inteligência das máquinas utilizada por frameworks como o PyTorch e o TensorFlow.









