Ultralytics YOLO27:
IA para visão

As mais recentes atualizações da OpenAI: Canvas, Vision Fine-Tuning e mais

Junta-te a nós para analisarmos mais de perto as recentes atualizações do ChatGPT lançadas pela OpenAI. Vamos explorar o Canvas, o fine-tuning para capacidades de visão e a mais recente funcionalidade Search.

ABAbirami Vina4 min read
Uma visão geral das mais recentes atualizações do ChatGPT da OpenAI

Depois de analisarmos pela última vez os modelos o1 da OpenAI em setembro (concebidos para melhorar o raciocínio), foram adicionadas muitas funcionalidades novas e interessantes ao ChatGPT. Algumas destas versões destinam-se a programadores, enquanto outras foram concebidas para aperfeiçoar a experiência do utilizador. No geral, cada atualização ajuda a tornar as interações com o ChatGPT mais intuitivas e eficazes.

Atualizações como o Canvas, concebido para a escrita e programação colaborativas, e o ajuste fino das capacidades de visão, que melhora a forma como o ChatGPT trabalha com imagens, despertaram muito interesse e incentivaram os utilizadores a explorar possibilidades mais criativas. Entretanto, atualizações técnicas, como novas APIs e relatórios de testes de equidade, abordam aspetos como a integração de modelos e práticas de IA ética. Vamos analisar melhor as funcionalidades mais recentes do ChatGPT da OpenAI!

Uma visão geral da funcionalidade Canvas da OpenAI#

O Canvas é a primeira grande atualização da interface de utilizador (UI) do ChatGPT desde o seu lançamento. Trata-se de uma nova interface com um esquema de dois ecrãs, prompts na barra lateral esquerda e respostas na janela do lado direito. A nova UI elimina o fluxo de trabalho habitual de uma estrutura de ecrã único semelhante a um chat e adota um esquema de dois ecrãs adequado à realização de várias tarefas, para aumentar a produtividade.

O Canvas traz atualizações à UI do ChatGPT

Fig. 1 O Canvas traz atualizações à UI do ChatGPT.

Antes da introdução do Canvas, trabalhar com documentos longos no ChatGPT implicava percorrer bastante a página para cima e para baixo. No novo esquema, os prompts são apresentados na barra lateral esquerda, enquanto o documento de texto ou o trecho de código ocupa a maior parte do ecrã. Se necessário, pode até personalizar o tamanho da barra lateral esquerda e do ecrã de saída. Também pode selecionar uma parte do texto ou uma secção de código e editar essa secção específica sem alterar o documento inteiro.

Edição de secções específicas de texto com o Canvas

Fig. 2. Editar secções específicas de texto com o Canvas.

Se utilizar o Canvas, irá reparar que não existe nenhum botão ou controlo específico para o abrir na interface do ChatGPT. Em vez disso, quando estiver a trabalhar com o modelo GPT-4o, o Canvas abre automaticamente se detetar que está a editar, escrever ou programar. Para prompts mais simples, permanece inativo. Se quiser abri-lo manualmente, pode utilizar prompts como "Abrir o Canvas" ou "Mostrar-me o esquema do Canvas".

Atualmente, o Canvas está em versão beta e disponível apenas com o GPT-4o. No entanto, a OpenAI mencionou que o Canvas estará disponível para todos os utilizadores gratuitos quando sair da versão beta.

Atualizações da API do ChatGPT#

A OpenAI lançou três novas atualizações da API do ChatGPT destinadas a melhorar a eficiência, a escalabilidade e a versatilidade. Vamos analisar mais atentamente cada uma destas atualizações.

Destilação de modelos#

Com a funcionalidade Model Distillation através das APIs da OpenAI, os programadores podem utilizar as saídas de modelos avançados, como o GPT-4o ou o o1-preview, para melhorar o desempenho de modelos mais pequenos e económicos, como o GPT-4o mini. A destilação de modelos é um processo que envolve o treino de modelos mais pequenos para imitarem o comportamento de modelos mais avançados, tornando-os mais eficientes para tarefas específicas.

Antes da introdução desta funcionalidade, os programadores tinham de coordenar manualmente várias tarefas utilizando ferramentas diferentes. Estas tarefas incluíam gerar conjuntos de dados, medir o desempenho dos modelos e fazer o ajuste fino dos modelos, o que frequentemente tornava o processo complexo e propenso a erros. A atualização Model Distillation permite aos programadores utilizar Stored Completions, uma ferramenta que lhes permite gerar conjuntos de dados automaticamente, capturando e armazenando os pares de entrada-saída produzidos por modelos avançados através da API.

Outra funcionalidade do Model Distillation, Evals (atualmente em versão beta), ajuda a medir o desempenho de um modelo em tarefas específicas, sem ser necessário criar scripts de avaliação personalizados ou utilizar ferramentas separadas. Ao utilizar conjuntos de dados gerados com Stored Completions e avaliar o desempenho com Evals, os programadores podem fazer o ajuste fino dos seus próprios modelos GPT personalizados.

Utilização de Evals para medir o desempenho do modelo

Fig. 3 Pode utilizar Evals para medir o desempenho do modelo.

Armazenamento em cache de prompts#

Ao criar aplicações de IA, especialmente chatbots, é frequente utilizar repetidamente o mesmo contexto (as informações de base ou o histórico de conversas anterior necessários para compreender o pedido atual) em várias chamadas à API. O Prompt Caching permite aos programadores reutilizar tokens de entrada utilizados recentemente (segmentos de texto que o modelo processa para compreender o prompt e gerar uma resposta), ajudando a reduzir os custos e a latência.

Desde 1 de outubro, a OpenAI aplica automaticamente o Prompt Caching a modelos como GPT-4o, GPT-4o mini, o1-preview e o1-mini. Isto significa que, quando os programadores utilizam a API para interagir com um modelo com um prompt longo (com mais de 1 024 tokens), o sistema guarda as partes que já processou.

Desta forma, se forem utilizados novamente prompts iguais ou semelhantes, o sistema pode ignorar o recálculo dessas partes. O sistema coloca automaticamente em cache a parte mais longa do prompt que encontrou anteriormente, começando com 1 024 tokens e adicionando blocos de 128 tokens à medida que o prompt fica mais longo.

Realtime API#

A criação de um assistente de voz geralmente envolve transcrever áudio para texto, processar o texto e convertê-lo novamente em áudio para reproduzir a resposta. A Realtime API da OpenAI pretende tratar todo este processo com um único pedido à API. Ao simplificar o processo, a API permite conversas em tempo real com IA.

Por exemplo, um assistente de voz integrado com a Realtime API pode executar ações específicas, como fazer um pedido ou encontrar informações, com base nos pedidos dos utilizadores. A API torna o assistente de voz mais responsivo e capaz de se adaptar rapidamente às necessidades dos utilizadores. A Realtime API ficou disponível em versão beta pública a 1 de outubro, com seis vozes. A 30 de outubro, foram adicionadas mais cinco vozes, totalizando onze vozes disponíveis.

Utilização da Realtime API para praticar conversas numa nova língua

Fig. 4 Um exemplo da utilização da Realtime API para praticar conversas numa nova língua.

Ajuste fino do ChatGPT para tarefas de visão#

Originalmente, o modelo de linguagem e visão GPT-4o só podia ser ajustado e personalizado utilizando conjuntos de dados exclusivamente de texto. Agora, com o lançamento da API de ajuste fino de visão, os programadores podem treinar e personalizar o GPT-4o utilizando conjuntos de dados de imagens. Desde o seu lançamento, o ajuste fino de visão tornou-se um tema de grande interesse entre programadores e engenheiros de visão computacional.

Para fazer o ajuste fino das capacidades de visão do GPT-4o, os programadores podem utilizar conjuntos de dados de imagens que variam entre apenas 100 imagens e até 50 000 imagens. Depois de garantir que o conjunto de dados corresponde ao formato exigido pela OpenAI, este pode ser carregado para a plataforma da OpenAI e o modelo pode ser ajustado para aplicações específicas.

Por exemplo, a Automat, uma empresa de automação, utilizou um conjunto de dados de capturas de ecrã para treinar o GPT-4o, de modo a identificar elementos da UI num ecrã com base numa descrição. Isto ajuda a simplificar a Automação Robótica de Processos (RPA), facilitando a interação dos bots com interfaces de utilizador. Em vez de depender de coordenadas fixas ou de regras complexas de seleção, o modelo pode identificar elementos da UI com base em descrições simples, tornando as configurações de automação mais adaptáveis e fáceis de manter quando as interfaces sofrem alterações.

Utilização de um modelo GPT-4o ajustado para detetar elementos da UI

Fig. 5 Utilização de uma versão ajustada do modelo GPT-4o para detetar elementos da UI.

Deteção de equidade e preconceitos no ChatGPT#

As preocupações éticas relacionadas com aplicações de IA são um tema de conversa proeminente à medida que a IA se torna cada vez mais avançada. Como as respostas do ChatGPT se baseiam nos prompts fornecidos pelos utilizadores e nos dados disponíveis na Internet, pode ser difícil ajustar a sua linguagem para que seja sempre responsável. Os relatórios indicam que as respostas do ChatGPT são tendenciosas com base no nome, género e raça. Para resolver este problema, a equipa interna da OpenAI realizou um primeiro teste de equidade em primeira pessoa.

Os nomes frequentemente transmitem pistas subtis sobre a nossa cultura e fatores geográficos. Na maioria dos casos, o ChatGPT ignora as pistas subtis presentes nos nomes. No entanto, em alguns casos, nomes que refletem raça ou cultura conduzem a respostas diferentes do ChatGPT, sendo que cerca de 1% destas refletem linguagem prejudicial. Eliminar preconceitos e linguagem prejudicial é uma tarefa desafiante para um modelo de linguagem. Ainda assim, ao partilhar publicamente estas conclusões e reconhecer as limitações do modelo, a OpenAI ajuda os utilizadores a aperfeiçoar os seus prompts para obter respostas mais neutras e imparciais.

Um exemplo de respostas diferentes do ChatGPT devido ao nome do utilizador

Fig. 6 Um exemplo de respostas diferentes devido ao nome do utilizador.

Compreender a pesquisa do ChatGPT#

Quando o ChatGPT foi lançado pela primeira vez, houve discussões na comunidade de IA sobre a possibilidade de substituir a navegação tradicional na Web. Atualmente, muitos utilizadores usam o ChatGPT em vez da Pesquisa Google.

A nova atualização da OpenAI, a funcionalidade Search, leva este conceito um passo mais além. Com o Search, o ChatGPT gera respostas atualizadas e inclui ligações para fontes relevantes. Desde 31 de outubro, a funcionalidade Search está disponível para todos os utilizadores do ChatGPT Plus e Team, fazendo com que o ChatGPT funcione mais como um motor de pesquisa baseado em IA.

Um exemplo da utilização da nova funcionalidade Search do ChatGPT

Fig. 7 Um exemplo da utilização da nova funcionalidade Search do ChatGPT.

O caminho a seguir#

As atualizações recentes do ChatGPT centram-se em tornar a IA mais útil, flexível e justa. A nova funcionalidade Canvas ajuda os utilizadores a trabalhar de forma mais eficiente, enquanto o ajuste fino de visão permite aos programadores personalizar modelos para lidarem melhor com tarefas visuais. Abordar a equidade e reduzir os preconceitos também são prioridades fundamentais, garantindo que a IA funciona bem para todas as pessoas, independentemente de quem sejam. Quer seja um programador a ajustar modelos ou esteja simplesmente a utilizar as funcionalidades mais recentes, o ChatGPT está a evoluir para responder a uma vasta gama de necessidades. Com capacidades em tempo real, integração visual e um foco na utilização responsável, estas atualizações estão a criar uma experiência de IA mais confiável e fiável para todos.

Explore mais sobre IA visitando o nosso repositório no GitHub e juntando-se à nossa comunidade. Saiba mais sobre aplicações de IA em condução autónoma e cuidados de saúde.

Explore solutions

Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais
Visão computacional para imagens aéreas

Visão computacional para imagens aéreas

Transforma imagens de drones e aéreas em insights em tempo real para agricultura, aquicultura, monitoramento ambiental, conservação e análise geoespacial com Ultralytics YOLO.
Saiba mais
Visão computacional no setor aeroespacial

Visão computacional no setor aeroespacial

Leva a IA de visão para o monitoramento aéreo com os modelos do Ultralytics YOLO. Potencializa drones, fluxos de trabalho aeroespaciais, conservação ambiental e indústrias geoespaciais com soluções de visão computacional.
Saiba mais

Protege cada local com os modelos do Ultralytics YOLO. A IA de visão alimenta monitoramento de perímetro, detecção de ameaças, reconhecimento de placas e segurança no local de trabalho.
Saiba mais
Visão computacional na robótica

Visão computacional na robótica

Dê mais inteligência às suas máquinas com os modelos Ultralytics YOLO. A IA de visão na robótica permite a navegação autónoma, a perceção, o rastreamento de objetos e o controlo em tempo real.
Saiba mais
Visão computacional na logística

Visão computacional na logística

Simplifique a logística com os modelos Ultralytics YOLO. A IA de visão permite a inspeção de encomendas, a triagem, o rastreamento de veículos e a monitorização da segurança dos armazéns em tempo real.
Saiba mais
Visão computacional no retalho

Visão computacional no retalho

Reinvente o retalho com os modelos Ultralytics YOLO. A IA de visão permite o rastreamento do inventário, a monitorização de prateleiras, a gestão de filas e informações mais inteligentes sobre os clientes.
Saiba mais
Visão computacional na área da saúde

Visão computacional na área da saúde

Cria soluções de saúde com modelos Ultralytics YOLO. A Vision AI na área da saúde permite obter imagens médicas mais rapidamente, diagnósticos mais inteligentes e monitorização de pacientes.
Saiba mais
Visão computacional na produção

Visão computacional na produção

Otimiza a produção com modelos Ultralytics YOLO. A Vision AI impulsiona o controlo de qualidade, a deteção de defeitos, a conformidade com EPI e a automatização das linhas de montagem.
Saiba mais
Visão computacional no setor automóvel

Visão computacional no setor automóvel

Aplique visão computacional no setor automóvel com modelos Ultralytics YOLO. A IA de visão melhora a segurança rodoviária, a assistência ao condutor e a automatização de veículos para estradas mais inteligentes.
Saiba mais
Visão computacional na agricultura

Visão computacional na agricultura

Leve a IA de visão para a agricultura inteligente com modelos Ultralytics YOLO. Potencie a monitorização das culturas, o acompanhamento do gado e a agricultura de precisão para obter colheitas maiores e mais inteligentes.
Saiba mais

Vamos construir juntos o futuro da IA!

Começa a tua jornada com o futuro da aprendizagem automática