OpenAI o1: новая серия моделей OpenAI для рассуждения ИИ
Узнай о недавно запущенных моделях OpenAI o1 и о том, что делает их особенными. Мы также рассмотрим, как они работают и их влияние на будущее ИИ.

ИИ-сообщество гудит от спекуляций о следующем шаге для моделей GPT от OpenAI, причем многие называют его «проектом Клубника». Причина в том, что если ты задашь вопрос GPT-4o о том, сколько букв R в слове «strawberry», модель ответит, что в слове «strawberry» две буквы R. Это может показаться странным, учитывая всю мощь GPT-4o. Однако модель создана для обработки подтекста, а не точных слов. Ходили слухи, что новая модель будет направлена на решение этой проблемы. Сэм Альтман еще больше подогрел эти слухи, опубликовав фотографии клубники на своем аккаунте в X (ранее известном как Twitter).
После последнего анонса OpenAI в четверг, 12 сентября, у нас наконец-то есть ответ на эти спекуляции! Выпущен OpenAI o1 — новая серия ИИ-моделей, созданных для того, чтобы замедляться и думать перед ответом. Интересно, что OpenAI o1 умеет рассуждать лучше и правильно отвечает на вопрос о клубнике! В этой статье мы обсудим, что такое OpenAI o1, как она работает, где ее можно использовать и что это значит для будущего ИИ. Давай начнем!

Рис. 1. Пример запроса к OpenAI o1 о клубнике.
Новые достижения в области ИИ от OpenAI#
В июле 2024 года руководители OpenAI рассказали, что исследования компании приближаются к человеческому уровню решения задач, известному как 2-й уровень ИИ. Очевидно, что этот уровень сфокусирован на рассуждениях, так как OpenAI представляет свою новую серию моделей OpenAI o1 как думающую перед ответом. OpenAI o1 — это новая LLM (большая языковая модель), ИИ-модель, которая понимает и генерирует похожий на человеческий текст, обучаясь на закономерностях из огромных объемов текстовых данных. Она создана для решения сложных задач, требующих глубоких рассуждений.

Рис. 2. Взгляд OpenAI на этапы развития ИИ.
Модель была обучена с использованием обучения с подкреплением — метода, при котором модель учится принимать лучшие решения методом проб и ошибок, получая вознаграждения или штрафы за свои действия. Алгоритм обучения с подкреплением помогает модели думать более эффективно, следуя цепочке мыслей. OpenAI также сообщила, что производительность o1 продолжает расти благодаря дополнительному обучению с подкреплением в процессе тренировки и увеличению времени, затрачиваемого на «размышления» при решении задач, что показывает: как расширенное обучение, так и вдумчивая обработка помогают улучшить способности модели.
Хотя OpenAI o1 — значительный шаг вперед в области сложного логического мышления, это всё еще ранняя модель, которой не хватает некоторых функций, делающих ChatGPT удобным, таких как поиск в интернете или загрузка файлов и изображений. Для многих повседневных задач GPT-4o может оставаться более функциональным на текущий момент. Однако OpenAI o1 знаменует собой большой прогресс в способности ИИ к сложным рассуждениям, поэтому OpenAI начинает новую серию и называет её OpenAI o1.
Как новые модели OpenAI улучшают логическое мышление ИИ#
OpenAI o1 можно использовать для таких задач, как расшифровка шифров, решение задач по программированию, ответы на математические вопросы, разгадывание кроссвордов и даже решение сложных тем в области науки, безопасности и здравоохранения. Отдавая забавную дань уважения кодовому названию проекта, OpenAI продемонстрировала навыки рассуждения модели, взломав шифр, который раскрыл сообщение «THERE ARE THREE R’S IN STRAWBERRY» («В СЛОВЕ СТРАВБЕРИ ТРИ БУКВЫ Р»).
Помимо взлома шифров, OpenAI o1 также отлично справляется с написанием кода. Она хорошо показывает себя в соревновательных задачах по программированию, таких как на Codeforces — платформе, где программисты решают сложные задачи по кодингу в условиях ограниченного времени. В этих состязаниях модель достигает высоких рейтингов Elo (системы подсчета очков, измеряющей уровень навыков на основе выступлений против других конкурентов) и превосходит предыдущие модели. Она также превосходна в математике и хорошо справляется с экзаменами вроде Американского математического экзамена для приглашенных (AIME).

Рис. 3. Бенчмаркинг навыков программирования o1.
Эти достижения делают OpenAI o1 значительным обновлением по сравнению с более ранними моделями вроде GPT-4o. Она открывает новые возможности для ИИ в таких областях, как бизнес, разработка, исследования и здравоохранение. Например, в генетических исследованиях OpenAI o1 может быстро просматривать большое количество научных работ, выделяя ключевые открытия и связи между генетическими маркерами и заболеваниями. Она понимает сложный научный язык и может суммировать важные моменты, помогая исследователям сосредоточиться на наиболее релевантной информации.
Взгляд на «цепочку рассуждений»#
Ранее мы видели, что OpenAI o1 представляет процесс рассуждения «Цепочка мыслей» (Chain of Thought). Он позволяет модели решать сложные задачи способом, похожим на человеческие когнитивные стратегии. Модель может разбивать задачи на более мелкие, управляемые шаги и итеративно улучшать свой подход. В отличие от более ранних моделей, которые полагались на мгновенное распознавание образов, o1 оптимизирует принятие решений, исследуя несколько путей рассуждения и обучаясь как на успехах, так и на ошибках посредством обучения с подкреплением.
OpenAI решила скрыть эти сырые цепочки мыслей от пользователей, предлагая вместо них сводки, которые дают представление о рассуждениях модели без раскрытия каждого шага. Это решение помогает предотвратить неправомерное использование мыслительного процесса модели, позволяя разработчикам отслеживать и совершенствовать безопасность и согласованность ИИ. Наблюдая за скрытыми цепочками изнутри, разработчики могут гарантировать, что o1 следует этическим принципам и избегает вредного поведения.
Бенчмаркинг OpenAI o1#
OpenAI o1 демонстрирует серьезные улучшения по сравнению с GPT-4o в нескольких бенчмарках, тестирующих навыки рассуждения и решения задач. На Американском математическом экзамене для приглашенных (AIME) 2024 года, сложном экзамене по математике для лучших старшеклассников, o1 достигла точности в 74% всего с одним примером на задачу по сравнению с 12% у GPT-4o. При консенсусе по 64 примерам ее точность выросла до 83%, а с использованием усовершенствованного метода переранжирования с 1000 примеров она достигла 93%, войдя в число 500 лучших учеников страны.
Помимо математики, o1 также исключительно показала себя на бенчмарках, проверяющих научные знания, таких как GPQA Diamond, который охватывает вопросы уровня PhD по химии, физике и биологии. Удивительно, но o1 превзошла человеческих экспертов со степенями PhD в этом тесте, став первой моделью ИИ, которой это удалось. Она также превзошла GPT-4o по 54 из 57 категорий в бенчмарке MMLU, проверяющем понимание в самых разных предметах, включая историю, право и науку.

Рис. 4. Бенчмаркинг OpenAI o1.
Попробуй OpenAI o1 в работе#
OpenAI представила две новые модели в серии o1: o1-preview и o1-mini. Модель o1-preview создана для более глубокого обдумывания перед ответом, превосходно справляясь со сложными задачами в науке, кодинге и математике. Она предлагает продвинутые возможности решения задач для пользователей, занятых сложными проектами. В то же время o1-mini — это более компактная, быстрая и экономичная модель, оптимизированная специально для задач STEM, особенно математики и программирования. Хотя у неё менее обширные общие знания о мире, o1-mini почти достигает производительности o1-preview в ключевых тестах, таких как математическое соревнование AIME и задачи по программированию на Codeforces, при этом стоимость её использования на 80% ниже.

Рис. 5. Сравнение моделей OpenAI.
Ты можешь попробовать эти модели через различные платформы OpenAI. Пользователи ChatGPT Plus и Team могут получить доступ к обеим моделям, o1-preview и o1-mini, через переключатель моделей, ощутив улучшенные способности к рассуждению прямо в ChatGPT. Разработчики с доступом уровня 5 к API могут начать прототипирование на базе этих моделей, хотя некоторые продвинутые функции всё еще находятся в стадии разработки. OpenAI также планирует вскоре сделать o1-mini доступной для всех пользователей ChatGPT Free. Исследуя эти модели, ты сможешь лично убедиться в достижениях в области логического мышления ИИ и выбрать ту, которая лучше всего соответствует твоим потребностям.
Этические соображения OpenAI при разработке ИИ#
Компания OpenAI уделила особое внимание этике и безопасности при разработке серии моделей o1. Перед выпуском моделей o1-preview и o1-mini они провели тщательные оценки, включая внешние тесты и внутренние проверки на такие риски, как запрещенный контент, галлюцинации и предвзятость. Модели спроектированы с продвинутыми способностями рассуждения для лучшего понимания и соблюдения правил безопасности.
OpenAI также внедрила защитные меры, такие как черные списки и классификаторы безопасности, для управления рисками. Модель o1 имеет средний общий рейтинг риска. У нее низкие риски в таких областях, как кибербезопасность и автономность моделей, и средние риски в таких сферах, как материалы CBRN (химические, биологические, радиологические и ядерные) и убеждение. Консультативный комитет по безопасности и совет директоров OpenAI изучили эти меры безопасности, чтобы гарантировать безопасность и этичность использования модели.

Рис. 6. Карта показателей OpenAI o1.
От слухов к реальности: OpenAI o1 выходит на сцену#
OpenAI o1 — это большой шаг вперед в области логического мышления ИИ, превращающий ранние слухи в реальность. В отличие от GPT-4o, серия o1 мыслит глубже, используя подход «Chain of Thought», разбивая сложные задачи на более мелкие этапы для получения более качественных ответов. В настоящее время доступная в ранней версии для предварительного просмотра в ChatGPT и через API, OpenAI планирует добавить функции веб-серфинга, а также загрузки файлов и изображений. OpenAI также сообщила о намерении продолжать разработку и выпуск моделей серии GPT наряду с новой серией OpenAI o1. По мере эволюции ИИ такие достижения прокладывают путь к более мощным, интуитивно понятным и универсальным системам ИИ, которые смогут лучше помогать человеку и понимать его потребности.
Будь в курсе последних новостей в сфере ИИ, присоединяясь к нашему сообществу! Загляни в наш репозиторий на GitHub, чтобы увидеть, как мы внедряем новаторские ИИ-решения в таких секторах, как производство и здравоохранение. 🚀






