As mais recentes atualizações da OpenAI: Canvas, Vision Fine-Tuning e mais
Junta-te a nós para analisarmos mais de perto as recentes atualizações do ChatGPT lançadas pela OpenAI. Vamos explorar o Canvas, o fine-tuning para capacidades de visão e a mais recente funcionalidade Search.

Depois de analisarmos pela última vez os modelos o1 da OpenAI em setembro (concebidos para melhorar o raciocínio), foram adicionadas muitas funcionalidades novas e interessantes ao ChatGPT. Algumas destas versões destinam-se a programadores, enquanto outras foram concebidas para aperfeiçoar a experiência do utilizador. No geral, cada atualização ajuda a tornar as interações com o ChatGPT mais intuitivas e eficazes.
Atualizações como o Canvas, concebido para a escrita e programação colaborativas, e o ajuste fino das capacidades de visão, que melhora a forma como o ChatGPT trabalha com imagens, despertaram muito interesse e incentivaram os utilizadores a explorar possibilidades mais criativas. Entretanto, atualizações técnicas, como novas APIs e relatórios de testes de equidade, abordam aspetos como a integração de modelos e práticas de IA ética. Vamos analisar melhor as funcionalidades mais recentes do ChatGPT da OpenAI!
Uma visão geral da funcionalidade Canvas da OpenAI#
O Canvas é a primeira grande atualização da interface de utilizador (UI) do ChatGPT desde o seu lançamento. Trata-se de uma nova interface com um esquema de dois ecrãs, prompts na barra lateral esquerda e respostas na janela do lado direito. A nova UI elimina o fluxo de trabalho habitual de uma estrutura de ecrã único semelhante a um chat e adota um esquema de dois ecrãs adequado à realização de várias tarefas, para aumentar a produtividade.

Fig. 1 O Canvas traz atualizações à UI do ChatGPT.
Antes da introdução do Canvas, trabalhar com documentos longos no ChatGPT implicava percorrer bastante a página para cima e para baixo. No novo esquema, os prompts são apresentados na barra lateral esquerda, enquanto o documento de texto ou o trecho de código ocupa a maior parte do ecrã. Se necessário, pode até personalizar o tamanho da barra lateral esquerda e do ecrã de saída. Também pode selecionar uma parte do texto ou uma secção de código e editar essa secção específica sem alterar o documento inteiro.

Fig. 2. Editar secções específicas de texto com o Canvas.
Se utilizar o Canvas, irá reparar que não existe nenhum botão ou controlo específico para o abrir na interface do ChatGPT. Em vez disso, quando estiver a trabalhar com o modelo GPT-4o, o Canvas abre automaticamente se detetar que está a editar, escrever ou programar. Para prompts mais simples, permanece inativo. Se quiser abri-lo manualmente, pode utilizar prompts como "Abrir o Canvas" ou "Mostrar-me o esquema do Canvas".
Atualmente, o Canvas está em versão beta e disponível apenas com o GPT-4o. No entanto, a OpenAI mencionou que o Canvas estará disponível para todos os utilizadores gratuitos quando sair da versão beta.
Atualizações da API do ChatGPT#
A OpenAI lançou três novas atualizações da API do ChatGPT destinadas a melhorar a eficiência, a escalabilidade e a versatilidade. Vamos analisar mais atentamente cada uma destas atualizações.
Destilação de modelos#
Com a funcionalidade Model Distillation através das APIs da OpenAI, os programadores podem utilizar as saídas de modelos avançados, como o GPT-4o ou o o1-preview, para melhorar o desempenho de modelos mais pequenos e económicos, como o GPT-4o mini. A destilação de modelos é um processo que envolve o treino de modelos mais pequenos para imitarem o comportamento de modelos mais avançados, tornando-os mais eficientes para tarefas específicas.
Antes da introdução desta funcionalidade, os programadores tinham de coordenar manualmente várias tarefas utilizando ferramentas diferentes. Estas tarefas incluíam gerar conjuntos de dados, medir o desempenho dos modelos e fazer o ajuste fino dos modelos, o que frequentemente tornava o processo complexo e propenso a erros. A atualização Model Distillation permite aos programadores utilizar Stored Completions, uma ferramenta que lhes permite gerar conjuntos de dados automaticamente, capturando e armazenando os pares de entrada-saída produzidos por modelos avançados através da API.
Outra funcionalidade do Model Distillation, Evals (atualmente em versão beta), ajuda a medir o desempenho de um modelo em tarefas específicas, sem ser necessário criar scripts de avaliação personalizados ou utilizar ferramentas separadas. Ao utilizar conjuntos de dados gerados com Stored Completions e avaliar o desempenho com Evals, os programadores podem fazer o ajuste fino dos seus próprios modelos GPT personalizados.

Fig. 3 Pode utilizar Evals para medir o desempenho do modelo.
Armazenamento em cache de prompts#
Ao criar aplicações de IA, especialmente chatbots, é frequente utilizar repetidamente o mesmo contexto (as informações de base ou o histórico de conversas anterior necessários para compreender o pedido atual) em várias chamadas à API. O Prompt Caching permite aos programadores reutilizar tokens de entrada utilizados recentemente (segmentos de texto que o modelo processa para compreender o prompt e gerar uma resposta), ajudando a reduzir os custos e a latência.
Desde 1 de outubro, a OpenAI aplica automaticamente o Prompt Caching a modelos como GPT-4o, GPT-4o mini, o1-preview e o1-mini. Isto significa que, quando os programadores utilizam a API para interagir com um modelo com um prompt longo (com mais de 1 024 tokens), o sistema guarda as partes que já processou.
Desta forma, se forem utilizados novamente prompts iguais ou semelhantes, o sistema pode ignorar o recálculo dessas partes. O sistema coloca automaticamente em cache a parte mais longa do prompt que encontrou anteriormente, começando com 1 024 tokens e adicionando blocos de 128 tokens à medida que o prompt fica mais longo.
Realtime API#
A criação de um assistente de voz geralmente envolve transcrever áudio para texto, processar o texto e convertê-lo novamente em áudio para reproduzir a resposta. A Realtime API da OpenAI pretende tratar todo este processo com um único pedido à API. Ao simplificar o processo, a API permite conversas em tempo real com IA.
Por exemplo, um assistente de voz integrado com a Realtime API pode executar ações específicas, como fazer um pedido ou encontrar informações, com base nos pedidos dos utilizadores. A API torna o assistente de voz mais responsivo e capaz de se adaptar rapidamente às necessidades dos utilizadores. A Realtime API ficou disponível em versão beta pública a 1 de outubro, com seis vozes. A 30 de outubro, foram adicionadas mais cinco vozes, totalizando onze vozes disponíveis.

Fig. 4 Um exemplo da utilização da Realtime API para praticar conversas numa nova língua.
Ajuste fino do ChatGPT para tarefas de visão#
Originalmente, o modelo de linguagem e visão GPT-4o só podia ser ajustado e personalizado utilizando conjuntos de dados exclusivamente de texto. Agora, com o lançamento da API de ajuste fino de visão, os programadores podem treinar e personalizar o GPT-4o utilizando conjuntos de dados de imagens. Desde o seu lançamento, o ajuste fino de visão tornou-se um tema de grande interesse entre programadores e engenheiros de visão computacional.
Para fazer o ajuste fino das capacidades de visão do GPT-4o, os programadores podem utilizar conjuntos de dados de imagens que variam entre apenas 100 imagens e até 50 000 imagens. Depois de garantir que o conjunto de dados corresponde ao formato exigido pela OpenAI, este pode ser carregado para a plataforma da OpenAI e o modelo pode ser ajustado para aplicações específicas.
Por exemplo, a Automat, uma empresa de automação, utilizou um conjunto de dados de capturas de ecrã para treinar o GPT-4o, de modo a identificar elementos da UI num ecrã com base numa descrição. Isto ajuda a simplificar a Automação Robótica de Processos (RPA), facilitando a interação dos bots com interfaces de utilizador. Em vez de depender de coordenadas fixas ou de regras complexas de seleção, o modelo pode identificar elementos da UI com base em descrições simples, tornando as configurações de automação mais adaptáveis e fáceis de manter quando as interfaces sofrem alterações.

Fig. 5 Utilização de uma versão ajustada do modelo GPT-4o para detetar elementos da UI.
Deteção de equidade e preconceitos no ChatGPT#
As preocupações éticas relacionadas com aplicações de IA são um tema de conversa proeminente à medida que a IA se torna cada vez mais avançada. Como as respostas do ChatGPT se baseiam nos prompts fornecidos pelos utilizadores e nos dados disponíveis na Internet, pode ser difícil ajustar a sua linguagem para que seja sempre responsável. Os relatórios indicam que as respostas do ChatGPT são tendenciosas com base no nome, género e raça. Para resolver este problema, a equipa interna da OpenAI realizou um primeiro teste de equidade em primeira pessoa.
Os nomes frequentemente transmitem pistas subtis sobre a nossa cultura e fatores geográficos. Na maioria dos casos, o ChatGPT ignora as pistas subtis presentes nos nomes. No entanto, em alguns casos, nomes que refletem raça ou cultura conduzem a respostas diferentes do ChatGPT, sendo que cerca de 1% destas refletem linguagem prejudicial. Eliminar preconceitos e linguagem prejudicial é uma tarefa desafiante para um modelo de linguagem. Ainda assim, ao partilhar publicamente estas conclusões e reconhecer as limitações do modelo, a OpenAI ajuda os utilizadores a aperfeiçoar os seus prompts para obter respostas mais neutras e imparciais.

Fig. 6 Um exemplo de respostas diferentes devido ao nome do utilizador.
Compreender a pesquisa do ChatGPT#
Quando o ChatGPT foi lançado pela primeira vez, houve discussões na comunidade de IA sobre a possibilidade de substituir a navegação tradicional na Web. Atualmente, muitos utilizadores usam o ChatGPT em vez da Pesquisa Google.
A nova atualização da OpenAI, a funcionalidade Search, leva este conceito um passo mais além. Com o Search, o ChatGPT gera respostas atualizadas e inclui ligações para fontes relevantes. Desde 31 de outubro, a funcionalidade Search está disponível para todos os utilizadores do ChatGPT Plus e Team, fazendo com que o ChatGPT funcione mais como um motor de pesquisa baseado em IA.

Fig. 7 Um exemplo da utilização da nova funcionalidade Search do ChatGPT.
O caminho a seguir#
As atualizações recentes do ChatGPT centram-se em tornar a IA mais útil, flexível e justa. A nova funcionalidade Canvas ajuda os utilizadores a trabalhar de forma mais eficiente, enquanto o ajuste fino de visão permite aos programadores personalizar modelos para lidarem melhor com tarefas visuais. Abordar a equidade e reduzir os preconceitos também são prioridades fundamentais, garantindo que a IA funciona bem para todas as pessoas, independentemente de quem sejam. Quer seja um programador a ajustar modelos ou esteja simplesmente a utilizar as funcionalidades mais recentes, o ChatGPT está a evoluir para responder a uma vasta gama de necessidades. Com capacidades em tempo real, integração visual e um foco na utilização responsável, estas atualizações estão a criar uma experiência de IA mais confiável e fiável para todos.
Explore mais sobre IA visitando o nosso repositório no GitHub e juntando-se à nossa comunidade. Saiba mais sobre aplicações de IA em condução autónoma e cuidados de saúde.









