2024 год начинается с волны генеративного ИИ
Обзор захватывающих инноваций в области ИИ за первый квартал 2024 года. Мы рассмотрим такие прорывы, как ИИ Sora от OpenAI, мозговой чип Neuralink и новейшие LLM.

Кажется, что сообщество ИИ почти каждый день оказывается в заголовках новостей. Первые месяцы 2024 года были захватывающими и насыщенными новыми инновациями в области ИИ. От мощных новых больших языковых моделей до имплантов в человеческий мозг — 2024 год обещает быть удивительным.
Мы видим, как ИИ преобразует отрасли, делает информацию более доступной и даже делает первые шаги к объединению нашего разума с машинами. Давай вернёмся к первому кварталу 2024 года и внимательнее посмотрим на прогресс в области ИИ всего за несколько месяцев.
Большие языковые модели в тренде#
Большие языковые модели (LLMs), созданные для понимания, генерации и обработки человеческого языка на основе огромных объёмов текстовых данных, заняли центральное место в первом квартале 2024 года. Многие крупные технологические компании выпустили собственные модели LLM, каждая со своими уникальными возможностями. Невероятный успех предыдущих LLM, таких как GPT-3, вдохновил эту тенденцию. Вот некоторые из наиболее заметных релизов LLM начала 2024 года.
Claude 3 от Anthropic#
Anthropic выпустила Claude 3 14 марта 2024 года. Модель Claude 3 представлена в трёх версиях: Opus, Sonnet и Haiku, каждая из которых предназначена для разных рынков и задач. Haiku — самая быстрая модель, оптимизированная для быстрых и простых ответов. Sonnet сочетает скорость с интеллектом и ориентирована на корпоративные приложения. Opus, самая продвинутая версия, обеспечивает непревзойдённые возможности понимания и рассуждения и идеально подходит для сложных задач и достижения лучших результатов в бенчмарках.
Claude 3 предлагает множество продвинутых функций и улучшений:
- Расширенные многоязычные диалоги: улучшенные возможности работы с языками, включая испанский, японский и французский.
- Продвинутые возможности компьютерного зрения: поддержка различных визуальных форматов.
- Минимум необоснованных отказов: модель лучше понимает запросы и реже отказывается без необходимости, демонстрируя улучшенное понимание контекста.
- Расширенное контекстное окно: контекстное окно составляет 200K, но при необходимости заказчика модель способна обрабатывать входные данные объёмом более 1 миллиона токенов.

Рис. 1. Claude 3 лучше учитывает контекст, чем предыдущие версии.
DBRX от Databricks#
Databricks DBRX — открытая универсальная LLM, выпущенная Databricks 27 марта 2024 года. DBRX показывает отличные результаты в различных бенчмарках, включая понимание языка, программирование и математику. Она превосходит другие известные модели, будучи примерно на 40% меньше аналогичных моделей.

Рис. 2. Сравнение DBRX с другими моделями.
DBRX обучалась с использованием предсказания следующего токена и мелкодисперсной архитектуры смеси экспертов (MoE), поэтому мы видим значительные улучшения производительности обучения и инференса. Архитектура позволяет модели точнее предсказывать следующее слово в последовательности, обращаясь к разнообразному набору специализированных подмоделей — «экспертов». Эти подмодели хорошо справляются с разными типами информации и задачами.
Gemini 1.5 от Google#
15 февраля 2024 года Google представила Gemini 1.5 — мультимодальную модель ИИ с эффективным использованием вычислительных ресурсов, способную анализировать большие объёмы текстовых, видео- и аудиоданных. Новейшая модель более продвинута с точки зрения производительности, эффективности и возможностей. Ключевая особенность Gemini 1.5 — прорыв в понимании длинного контекста. Модель способна стабильно обрабатывать до 1 миллиона токенов. Возможности Gemini 1.5 также стали возможны благодаря новой архитектуре на основе MoE.

Рис. 3. Сравнение длин контекста популярных LLM
Вот некоторые из самых интересных возможностей Gemini 1.5:
- Улучшенная обработка данных: позволяет напрямую загружать большие PDF-файлы, репозитории кода или длинные видео в качестве промптов. Модель может рассуждать одновременно в разных модальностях и выдавать текст.
- Загрузка нескольких файлов и запросы: теперь разработчики могут загружать несколько файлов и задавать вопросы.
- Подходит для разных задач: модель оптимизирована для масштабирования на разнообразных задачах и демонстрирует улучшения в математике, естественных науках, рассуждении, работе с несколькими языками, понимании видео и коде.
Впечатляющие визуальные материалы от ИИ#
Первый квартал 2024 года представил генеративные модели ИИ, способные создавать настолько реалистичные изображения, что они вызвали дискуссии о будущем социальных сетей и развитии ИИ. Давай рассмотрим модели, которые подогревают эти обсуждения.
Sora от OpenAI#
OpenAI, создатель ChatGPT, 15 февраля 2024 года представила передовую модель глубокого обучения для преобразования текста в видео под названием Sora. Sora — генератор текста в видео, способный создавать видео продолжительностью до минуты с высоким качеством изображения на основе текстовых промптов пользователей.
Например, взгляни на следующий промпт.
«Великолепно прорисованный мир из бумаги с коралловым рифом, кишащим красочными рыбами и морскими существами».
А вот кадр из получившегося видео.

Рис. 4. Кадр из видео, сгенерированного Sora.
Архитектура Sora делает это возможным, объединяя диффузионные модели для генерации текстур и модели Transformer для структурной согласованности. Пока доступ к Sora получили специалисты красной команды и избранная группа художников, дизайнеров и кинематографистов, чтобы оценить риски и получить обратную связь.
Stable Diffusion 3 от Stability AI#
22 февраля 2024 года Stability AI объявила о выпуске Stable Diffusion 3 — модели для генерации изображений по тексту. Модель сочетает архитектуру диффузионного Transformer и сопоставление потоков. Техническая статья ещё не опубликована, но уже можно отметить несколько ключевых особенностей.

Рис. 5. Изображение, созданное на основе промпта: «Эпичная аниме-иллюстрация волшебника на вершине горы ночью, создающего космическое заклинание в тёмном небе, на котором написано "Stable Diffusion 3", составленное из разноцветной энергии» (Источник)
Новейшая модель Stable Diffusion обеспечивает улучшенные производительность, качество изображений и точность при создании изображений с несколькими объектами. Stable Diffusion 3 также будет доступна в виде набора моделей размером от 800 миллионов до 8 миллиардов параметров. Пользователи смогут выбирать модель в зависимости от своих потребностей в масштабируемости и детализации.
Lumiere от Google#
23 января 2024 года Google представила Lumiere — диффузионную модель для преобразования текста в видео. Lumiere использует архитектуру под названием пространственно-временной U-Net, или STUNet. Она помогает Lumiere понимать, где находятся объекты и как они движутся в видео. Благодаря этому модель может создавать плавные и реалистичные видео.

Рис. 6. Кадр из видео, созданного на основе промпта: «Панда играет на укулеле дома».
Способность генерировать 80 кадров на видео позволяет Lumiere раздвигать границы и устанавливать новые стандарты качества видео в сфере ИИ. Вот некоторые возможности Lumiere:
- Изображение в видео: начиная с изображения и промпта, Lumiere может превращать изображения в анимированные видео.
- Стилизованная генерация: Lumiere может создавать видео в определённых стилях, используя одно эталонное изображение.
- Синемаграфы: Lumiere может анимировать отдельные области изображения для создания динамичных сцен — например, когда движется определённый объект, а остальная часть сцены остаётся статичной.
- Видеоинпейтинг: модель может изменять отдельные части видео, например одежду людей или детали фона.
Будущее уже наступило#
Начало 2024 года также принесло множество инноваций в области ИИ, напоминающих сюжеты научно-фантастических фильмов. То, что раньше казалось невозможным, теперь активно разрабатывается. Благодаря следующим открытиям будущее уже не кажется таким далёким.
Neuralink Илона Маска#
Neuralink Илона Маска успешно имплантировала беспроводной чип в мозг человека 29 января 2024 года. Это огромный шаг к соединению человеческого мозга с компьютерами. Илон Маск сообщил, что первый продукт Neuralink под названием «Telepathy» уже находится в разработке.

Рис. 7. Имплант Neuralink
Цель — дать пользователям, особенно людям, утратившим функциональность конечностей, возможность легко управлять устройствами с помощью мыслей. Потенциальные применения выходят далеко за рамки удобства. Илон Маск представляет будущее, в котором люди с параличом смогут без труда общаться.
Пол HoloTile от Disney#
18 января 2024 года Walt Disney Imagineering представила пол HoloTile. Его назвали первой в мире всенаправленной беговой платформой для нескольких людей.

Рис. 8. Инженер Disney Лэнни Смут позирует на своей последней разработке — полу HoloTile.
Платформа может перемещаться под любым человеком или объектом, словно при телекинезе, создавая эффект полного погружения в виртуальную и дополненную реальность. На ней можно идти в любом направлении и избегать столкновений. Пол HoloTile от Disney также можно устанавливать на театральных сценах, чтобы танцевать и двигаться необычным образом.
Vision Pro от Apple#
2 февраля 2024 года долгожданная гарнитура Vision Pro от Apple поступила в продажу. Она предлагает множество функций и приложений, призванных переопределить возможности виртуальной и дополненной реальности. Гарнитура Vision Pro рассчитана на широкую аудиторию, сочетая развлечения, продуктивность и пространственные вычисления. Apple с гордостью сообщила, что к моменту запуска для Vision Pro были оптимизированы более 600 приложений — от инструментов для повышения продуктивности до игровых и развлекательных сервисов.
Devin от Cognition#
12 марта 2024 года Cognition выпустила помощника по разработке программного обеспечения под названием Devin. Devin — первая в мире попытка создать автономного ИИ-инженера по разработке ПО. В отличие от традиционных помощников для программирования, которые предлагают подсказки или выполняют отдельные задачи, Devin предназначен для управления целыми проектами разработки ПО — от первоначальной концепции до завершения.
Он может изучать новые технологии, создавать и развёртывать полноценные приложения, находить и исправлять ошибки, обучать собственные модели, вносить вклад в проекты с открытым исходным кодом и промышленные кодовые базы и даже брать на себя реальные задачи разработки с таких сайтов, как Upwork.

Рис. 9. Сравнение Devin с другими моделями.
Devin оценивали на SWE-bench — сложном бенчмарке, в котором агентам предлагается решать реальные задачи GitHub из проектов с открытым исходным кодом, таких как Django и scikit-learn. Модель успешно решила 13,86% задач от начала до конца по сравнению с предыдущим лучшим результатом в 1,96%.
Почётные упоминания#
Событий произошло так много, что охватить их все в этой статье невозможно. Но вот ещё несколько достойных упоминания проектов.
- LATTE3D от NVIDIA, представленный 21 марта 2024 года, — это модель ИИ для преобразования текста в 3D, которая мгновенно создаёт 3D-представления на основе текстовых промптов.
- Новый генератор текста в видео от Midjourney, о котором рассказал генеральный директор David Holz, начал обучение в январе и, как ожидается, скоро будет выпущен.
- Развивая революцию AI PC, Lenovo 8 января 2024 года выпустила ThinkBook 13x с технологией E Ink Prism и высокопроизводительные ноутбуки с ИИ.
Следи за тенденциями в области ИИ вместе с нами!#
Начало 2024 года ознаменовалось прорывными достижениями в области ИИ и множеством крупных технологических событий. Но это лишь начало того, на что способен ИИ. Если ты хочешь узнать больше о последних разработках в области ИИ, Ultralytics поможет тебе быть в курсе.
Загляни в наш репозиторий GitHub, чтобы ознакомиться с последними разработками в области компьютерного зрения и ИИ. Также можешь посетить страницы наших решений и узнать, как ИИ используется в таких отраслях, как производство и здравоохранение.









