Последние обновления OpenAI: Canvas, дообучение для работы со зрением и многое другое
Присоединяйся к нам, чтобы подробнее рассмотреть недавние обновления ChatGPT, выпущенные OpenAI. Мы изучим Canvas, дообучение для визуальных возможностей и последнюю функцию поиска.

После того как в сентябре мы в последний раз рассмотрели модели o1 от OpenAI (которые были созданы для улучшения логического мышления), в ChatGPT появилось много новых и интересных функций. Некоторые из этих релизов ориентированы на разработчиков, а другие призваны улучшить пользовательский опыт. В целом каждое обновление делает взаимодействие с ChatGPT более интуитивным и эффективным.
Такие обновления, как Canvas, созданный для совместной работы над текстом и кодом, и тонкая настройка визуальных возможностей, которая улучшает работу ChatGPT с изображениями, вызвали большой интерес, побуждая пользователей исследовать новые творческие возможности. Тем временем технические усовершенствования, такие как новые API и отчеты о проверке на предвзятость, затрагивают такие аспекты, как интеграция моделей и методы этичного ИИ. Давай погрузимся в тему и получше разберем последние функции ChatGPT от OpenAI!
Обзор функции Canvas от OpenAI#
Canvas — это первое крупное обновление пользовательского интерфейса (UI) ChatGPT с момента его выпуска. Это новый интерфейс с двухэкранной компоновкой, промптами на левой боковой панели и ответами в окне справа. Новый UI устраняет привычный рабочий процесс со структурой чата на одном экране и переходит к двухэкранной компоновке, которая подходит для многозадачности, чтобы повысить продуктивность.

Рис. 1. Canvas добавляет обновления интерфейса в ChatGPT.
До появления Canvas работа с длинными документами в ChatGPT требовала довольно частой прокрутки вверх и вниз. В новом макете подсказки отображаются на левой боковой панели, а текстовый документ или фрагмент кода занимает большую часть экрана. При желании ты даже можешь настроить размер левой боковой панели и экрана вывода. Кроме того, ты можешь выделить часть текста или фрагмент кода и отредактировать конкретный раздел, не изменяя весь документ целиком.

Рис. 2. Редактирование определенных фрагментов текста с помощью Canvas.
Если ты используешь Canvas, то заметишь, что в интерфейсе ChatGPT нет специальной кнопки или переключателя для его открытия. Вместо этого при работе с моделью GPT-4o Canvas открывается автоматически, если обнаруживает, что ты редактируешь, пишешь или пишешь код. Для более простых промптов он остается неактивным. Если ты хочешь открыть его вручную, можешь использовать промпты вроде "Open the Canvas" или "Get me the Canvas layout."
В настоящее время Canvas находится в бета-версии и доступен только с GPT-4o. Однако OpenAI упомянула, что Canvas будет доступен всем бесплатным пользователям, когда выйдет из бета-версии.
Обновления API ChatGPT#
OpenAI выпустила три новых обновления API ChatGPT, направленных на повышение эффективности, масштабируемости и универсальности. Давай подробнее рассмотрим каждое из этих обновлений.
Дистилляция модели#
Используя функцию дистилляции моделей через API OpenAI, разработчики могут задействовать результаты работы продвинутых моделей, таких как GPT-4o или o1-preview, для повышения производительности более компактных и экономичных моделей, таких как GPT-4o mini. Дистилляция моделей — это процесс обучения небольших моделей имитировать поведение более продвинутых, что делает их эффективнее для решения конкретных задач.
До появления этой функции разработчикам приходилось вручную координировать различные задачи, используя разные инструменты. Эти задачи включали создание наборов данных, измерение производительности моделей и тонкую настройку моделей, что часто делало процесс сложным и подверженным ошибкам. Обновление Model Distillation позволяет разработчикам использовать сохраненные завершения (Stored Completions) — инструмент, который дает возможность автоматически создавать наборы данных путем захвата и сохранения пар «входные и выходные данные», создаваемых продвинутыми моделями через API.
Другая функция Model Distillation, Evals (находящаяся в настоящее время в стадии бета-тестирования), помогает измерять то, насколько хорошо модель справляется с конкретными задачами, без необходимости создавать пользовательские скрипты оценки или использовать отдельные инструменты. Используя наборы данных, созданные с помощью Stored Completions, и оценивая производительность с помощью Evals, разработчики могут настраивать свои собственные пользовательские модели GPT.

Рис. 3. Ты можешь использовать Evals для измерения производительности модели.
Кэширование промптов#
Зачастую при создании приложений ИИ, особенно чат-ботов, один и тот же контекст (исходная информация или история предыдущих разговоров, необходимые для понимания текущего запроса) используется повторно для нескольких вызовов API. Кэширование промптов позволяет разработчикам повторно использовать недавно задействованные входные токены (сегменты текста, которые модель обрабатывает для понимания промпта и генерации ответа), помогая снизить затраты и задержки.
С 1 октября OpenAI автоматически применяет кэширование промптов к своим моделям, таким как GPT-4o, GPT-4o mini, o1-preview и o1-mini. Это означает, что когда разработчики используют API для взаимодействия с моделью с длинным промптом (более 1024 токенов), система сохраняет уже обработанные части.
Таким образом, если те же или похожие промпты используются снова, можно пропустить пересчет этих частей. Система автоматически кэширует самую длинную часть промпта, с которой она ранее сталкивалась, начиная с 1024 токенов и добавляя порции по 128 токенов по мере удлинения промпта.
Realtime API#
Создание голосового помощника обычно предполагает необходимость преобразовывать аудио в текст, обрабатывать текст, а затем снова переводить его в аудио для воспроизведения ответа. Realtime API от OpenAI призван обрабатывать весь этот процесс с помощью одного запроса API. Упрощая этот процесс, API обеспечивает беседы с ИИ в реальном времени.
Например, голосовой помощник, интегрированный с Realtime API, может выполнять определенные действия, такие как оформление заказа или поиск информации на основе пользовательских запросов. Этот API делает голосового помощника более отзывчивым и способным быстро адаптироваться к потребностям пользователей. Realtime API стал доступен в публичной бета-версии 1 октября с шестью голосами. 30 октября были добавлены еще пять голосов, в результате чего общее количество доступных голосов достигло одиннадцати.

Рис. 4. Пример использования Realtime API для практики разговоров на новом языке.
Тонкая настройка ChatGPT для задач компьютерного зрения#
Изначально мультимодальная модель GPT-4o могла быть настроена и доработана только с использованием текстовых наборов данных. Теперь, с выпуском API для точной настройки зрения, разработчики могут обучать и кастомизировать GPT-4o с помощью наборов изображений. С момента своего выпуска тонкая настройка зрения стала главной темой интереса среди разработчиков и инженеров компьютерного зрения.
Для тонкой настройки возможностей зрения GPT-4o разработчики могут использовать наборы изображений объемом от 100 до 50 000 штук. Убедившись, что набор данных соответствует формату, требуемому OpenAI, его можно загрузить на платформу OpenAI, и модель можно будет настроить для конкретных приложений.
Например, компания Automat, занимающаяся автоматизацией, использовала набор данных со скриншотами для обучения GPT-4o распознаванию элементов пользовательского интерфейса на экране по описанию. Это помогает оптимизировать роботизированную автоматизацию процессов (RPA), упрощая ботам взаимодействие с пользовательскими интерфейсами. Вместо того чтобы полагаться на фиксированные координаты или сложные правила селекторов, модель может идентифицировать элементы интерфейса на основе простых описаний, делая настройки автоматизации более гибкими и простыми в обслуживании при изменении интерфейсов.

Рис. 5. Использование дообученной версии модели GPT-4o для обнаружения элементов пользовательского интерфейса.
ChatGPT: справедливость и обнаружение предвзятости#
Этические проблемы, связанные с приложениями ИИ, являются горячей темой для обсуждения по мере того, как ИИ становится все более продвинутым. Поскольку ответы ChatGPT основаны на предоставленных пользователем промптах и данных, доступных в Интернете, бывает сложно постоянно настраивать его язык так, чтобы он был ответственным. В отчетах говорится, что ответы ChatGPT предвзяты по отношению к имени, полу и расе. Чтобы решить эту проблему, собственная команда OpenAI провела собственную проверку на предвзятость.
Имена часто несут в себе тонкие намеки на нашу культуру и географические факторы. В большинстве случаев ChatGPT будет игнорировать тонкие подсказки в именах. Однако в некоторых случаях имена, отражающие расу или культуру, приводят к разным ответам от ChatGPT, причем примерно 1% из них содержит вредоносную лексику. Устранение предвзятости и вредоносных выражений — сложная задача для языковой модели. Тем не менее, открыто делясь этими результатами и признавая ограничения модели, OpenAI помогает пользователям уточнять свои промпты для получения более нейтральных и беспристрастных ответов.

Рис. 6. Пример различных ответов из-за имени пользователя.
Понимание поиска в ChatGPT#
Когда ChatGPT был впервые запущен, в ИИ-сообществе велись дискуссии о том, сможет ли он заменить традиционный веб-браузинг. Сейчас многие пользователи используют ChatGPT вместо Google Search.
Новое обновление от OpenAI, функция поиска, идет еще дальше. Благодаря поиску ChatGPT генерирует актуальные ответы и включает ссылки на соответствующие источники. По состоянию на 31 октября функция поиска доступна всем пользователям ChatGPT Plus и Team, благодаря чему ChatGPT функционирует больше как поисковая система на базе ИИ.

Рис. 7. Пример использования новой функции поиска в ChatGPT.
Дальнейший путь#
Последние обновления ChatGPT направлены на то, чтобы сделать ИИ более полезным, гибким и справедливым. Новая функция Canvas помогает пользователям работать эффективнее, а точная настройка зрения позволяет разработчикам настраивать модели для лучшего выполнения визуальных задач. Устранение несправедливости и снижение предвзятости также являются ключевыми приоритетами, гарантирующими, что ИИ хорошо работает для всех, независимо от того, кто они. Независимо от того, являешься ли ты разработчиком, настраивающим модели, или просто используешь новейшие функции, ChatGPT развивается, чтобы удовлетворить широкий спектр потребностей. Благодаря возможностям реального времени, визуальной интеграции и акценту на ответственном использовании, эти обновления создают более надежный и заслуживающий доверия ИИ-опыт для каждого.
Узнай больше об искусственном интеллекте, посетив наш репозиторий на GitHub и присоединившись к нашему сообществу. Узнай больше о применении ИИ в автономном вождении и здравоохранении.






