Ultralytics YOLO27:
Компьютерное зрение на базе ИИ

2024 год начинается с волны генеративного ИИ

Обзор захватывающих инноваций в области ИИ за первый квартал 2024 года. Мы рассмотрим такие прорывы, как ИИ Sora от OpenAI, мозговой чип Neuralink и новейшие LLM.

ABAbirami Vina8 min read
Прорывы в генеративном ИИ в начале 2024 года

Кажется, что сообщество ИИ почти каждый день оказывается в заголовках новостей. Первые месяцы 2024 года были захватывающими и насыщенными новыми инновациями в области ИИ. От мощных новых больших языковых моделей до имплантов в человеческий мозг — 2024 год обещает быть удивительным.

Мы видим, как ИИ преобразует отрасли, делает информацию более доступной и даже делает первые шаги к объединению нашего разума с машинами. Давай вернёмся к первому кварталу 2024 года и внимательнее посмотрим на прогресс в области ИИ всего за несколько месяцев.

Большие языковые модели в тренде#

Большие языковые модели (LLMs), созданные для понимания, генерации и обработки человеческого языка на основе огромных объёмов текстовых данных, заняли центральное место в первом квартале 2024 года. Многие крупные технологические компании выпустили собственные модели LLM, каждая со своими уникальными возможностями. Невероятный успех предыдущих LLM, таких как GPT-3, вдохновил эту тенденцию. Вот некоторые из наиболее заметных релизов LLM начала 2024 года.

Claude 3 от Anthropic#

Anthropic выпустила Claude 3 14 марта 2024 года. Модель Claude 3 представлена в трёх версиях: Opus, Sonnet и Haiku, каждая из которых предназначена для разных рынков и задач. Haiku — самая быстрая модель, оптимизированная для быстрых и простых ответов. Sonnet сочетает скорость с интеллектом и ориентирована на корпоративные приложения. Opus, самая продвинутая версия, обеспечивает непревзойдённые возможности понимания и рассуждения и идеально подходит для сложных задач и достижения лучших результатов в бенчмарках.

Claude 3 предлагает множество продвинутых функций и улучшений:

  • Расширенные многоязычные диалоги: улучшенные возможности работы с языками, включая испанский, японский и французский.
  • Продвинутые возможности компьютерного зрения: поддержка различных визуальных форматов.
  • Минимум необоснованных отказов: модель лучше понимает запросы и реже отказывается без необходимости, демонстрируя улучшенное понимание контекста.
  • Расширенное контекстное окно: контекстное окно составляет 200K, но при необходимости заказчика модель способна обрабатывать входные данные объёмом более 1 миллиона токенов.

График, показывающий контекстную осведомлённость Claude 3 по сравнению с предыдущими версиями

Рис. 1. Claude 3 лучше учитывает контекст, чем предыдущие версии.

DBRX от Databricks#

Databricks DBRX — открытая универсальная LLM, выпущенная Databricks 27 марта 2024 года. DBRX показывает отличные результаты в различных бенчмарках, включая понимание языка, программирование и математику. Она превосходит другие известные модели, будучи примерно на 40% меньше аналогичных моделей.

Сравнение DBRX с другими моделями

Рис. 2. Сравнение DBRX с другими моделями.

DBRX обучалась с использованием предсказания следующего токена и мелкодисперсной архитектуры смеси экспертов (MoE), поэтому мы видим значительные улучшения производительности обучения и инференса. Архитектура позволяет модели точнее предсказывать следующее слово в последовательности, обращаясь к разнообразному набору специализированных подмоделей — «экспертов». Эти подмодели хорошо справляются с разными типами информации и задачами.

Gemini 1.5 от Google#

15 февраля 2024 года Google представила Gemini 1.5 — мультимодальную модель ИИ с эффективным использованием вычислительных ресурсов, способную анализировать большие объёмы текстовых, видео- и аудиоданных. Новейшая модель более продвинута с точки зрения производительности, эффективности и возможностей. Ключевая особенность Gemini 1.5 — прорыв в понимании длинного контекста. Модель способна стабильно обрабатывать до 1 миллиона токенов. Возможности Gemini 1.5 также стали возможны благодаря новой архитектуре на основе MoE.

Сравнение длин контекста популярных LLM

Рис. 3. Сравнение длин контекста популярных LLM

Вот некоторые из самых интересных возможностей Gemini 1.5:

  • Улучшенная обработка данных: позволяет напрямую загружать большие PDF-файлы, репозитории кода или длинные видео в качестве промптов. Модель может рассуждать одновременно в разных модальностях и выдавать текст.
  • Загрузка нескольких файлов и запросы: теперь разработчики могут загружать несколько файлов и задавать вопросы.
  • Подходит для разных задач: модель оптимизирована для масштабирования на разнообразных задачах и демонстрирует улучшения в математике, естественных науках, рассуждении, работе с несколькими языками, понимании видео и коде.

Впечатляющие визуальные материалы от ИИ#

Первый квартал 2024 года представил генеративные модели ИИ, способные создавать настолько реалистичные изображения, что они вызвали дискуссии о будущем социальных сетей и развитии ИИ. Давай рассмотрим модели, которые подогревают эти обсуждения.

Sora от OpenAI#

OpenAI, создатель ChatGPT, 15 февраля 2024 года представила передовую модель глубокого обучения для преобразования текста в видео под названием Sora. Sora — генератор текста в видео, способный создавать видео продолжительностью до минуты с высоким качеством изображения на основе текстовых промптов пользователей.

Например, взгляни на следующий промпт.

«Великолепно прорисованный мир из бумаги с коралловым рифом, кишащим красочными рыбами и морскими существами».

А вот кадр из получившегося видео.

Кадр из видео, сгенерированного OpenAI Sora

Рис. 4. Кадр из видео, сгенерированного Sora.

Архитектура Sora делает это возможным, объединяя диффузионные модели для генерации текстур и модели Transformer для структурной согласованности. Пока доступ к Sora получили специалисты красной команды и избранная группа художников, дизайнеров и кинематографистов, чтобы оценить риски и получить обратную связь.

Stable Diffusion 3 от Stability AI#

22 февраля 2024 года Stability AI объявила о выпуске Stable Diffusion 3 — модели для генерации изображений по тексту. Модель сочетает архитектуру диффузионного Transformer и сопоставление потоков. Техническая статья ещё не опубликована, но уже можно отметить несколько ключевых особенностей.

Изображение, сгенерированное Stable Diffusion 3, с волшебником, создающим космическое заклинание

Рис. 5. Изображение, созданное на основе промпта: «Эпичная аниме-иллюстрация волшебника на вершине горы ночью, создающего космическое заклинание в тёмном небе, на котором написано "Stable Diffusion 3", составленное из разноцветной энергии» (Источник)

Новейшая модель Stable Diffusion обеспечивает улучшенные производительность, качество изображений и точность при создании изображений с несколькими объектами. Stable Diffusion 3 также будет доступна в виде набора моделей размером от 800 миллионов до 8 миллиардов параметров. Пользователи смогут выбирать модель в зависимости от своих потребностей в масштабируемости и детализации.

Lumiere от Google#

23 января 2024 года Google представила Lumiere — диффузионную модель для преобразования текста в видео. Lumiere использует архитектуру под названием пространственно-временной U-Net, или STUNet. Она помогает Lumiere понимать, где находятся объекты и как они движутся в видео. Благодаря этому модель может создавать плавные и реалистичные видео.

Кадр из видео, сгенерированного Google Lumiere, с пандой, играющей на укулеле

Рис. 6. Кадр из видео, созданного на основе промпта: «Панда играет на укулеле дома».

Способность генерировать 80 кадров на видео позволяет Lumiere раздвигать границы и устанавливать новые стандарты качества видео в сфере ИИ. Вот некоторые возможности Lumiere:

  • Изображение в видео: начиная с изображения и промпта, Lumiere может превращать изображения в анимированные видео.
  • Стилизованная генерация: Lumiere может создавать видео в определённых стилях, используя одно эталонное изображение.
  • Синемаграфы: Lumiere может анимировать отдельные области изображения для создания динамичных сцен — например, когда движется определённый объект, а остальная часть сцены остаётся статичной.
  • Видеоинпейтинг: модель может изменять отдельные части видео, например одежду людей или детали фона.

Будущее уже наступило#

Начало 2024 года также принесло множество инноваций в области ИИ, напоминающих сюжеты научно-фантастических фильмов. То, что раньше казалось невозможным, теперь активно разрабатывается. Благодаря следующим открытиям будущее уже не кажется таким далёким.

Neuralink Илона Маска успешно имплантировала беспроводной чип в мозг человека 29 января 2024 года. Это огромный шаг к соединению человеческого мозга с компьютерами. Илон Маск сообщил, что первый продукт Neuralink под названием «Telepathy» уже находится в разработке.

Имплант Neuralink

Рис. 7. Имплант Neuralink

Цель — дать пользователям, особенно людям, утратившим функциональность конечностей, возможность легко управлять устройствами с помощью мыслей. Потенциальные применения выходят далеко за рамки удобства. Илон Маск представляет будущее, в котором люди с параличом смогут без труда общаться.

Пол HoloTile от Disney#

18 января 2024 года Walt Disney Imagineering представила пол HoloTile. Его назвали первой в мире всенаправленной беговой платформой для нескольких людей.

Инженер Disney Лэнни Смут на полу HoloTile

Рис. 8. Инженер Disney Лэнни Смут позирует на своей последней разработке — полу HoloTile.

Платформа может перемещаться под любым человеком или объектом, словно при телекинезе, создавая эффект полного погружения в виртуальную и дополненную реальность. На ней можно идти в любом направлении и избегать столкновений. Пол HoloTile от Disney также можно устанавливать на театральных сценах, чтобы танцевать и двигаться необычным образом.

Vision Pro от Apple#

2 февраля 2024 года долгожданная гарнитура Vision Pro от Apple поступила в продажу. Она предлагает множество функций и приложений, призванных переопределить возможности виртуальной и дополненной реальности. Гарнитура Vision Pro рассчитана на широкую аудиторию, сочетая развлечения, продуктивность и пространственные вычисления. Apple с гордостью сообщила, что к моменту запуска для Vision Pro были оптимизированы более 600 приложений — от инструментов для повышения продуктивности до игровых и развлекательных сервисов.

Devin от Cognition#

12 марта 2024 года Cognition выпустила помощника по разработке программного обеспечения под названием Devin. Devin — первая в мире попытка создать автономного ИИ-инженера по разработке ПО. В отличие от традиционных помощников для программирования, которые предлагают подсказки или выполняют отдельные задачи, Devin предназначен для управления целыми проектами разработки ПО — от первоначальной концепции до завершения.

Он может изучать новые технологии, создавать и развёртывать полноценные приложения, находить и исправлять ошибки, обучать собственные модели, вносить вклад в проекты с открытым исходным кодом и промышленные кодовые базы и даже брать на себя реальные задачи разработки с таких сайтов, как Upwork.

Сравнение Devin с другими моделями

Рис. 9. Сравнение Devin с другими моделями.

Devin оценивали на SWE-bench — сложном бенчмарке, в котором агентам предлагается решать реальные задачи GitHub из проектов с открытым исходным кодом, таких как Django и scikit-learn. Модель успешно решила 13,86% задач от начала до конца по сравнению с предыдущим лучшим результатом в 1,96%.

Почётные упоминания#

Событий произошло так много, что охватить их все в этой статье невозможно. Но вот ещё несколько достойных упоминания проектов.

  • LATTE3D от NVIDIA, представленный 21 марта 2024 года, — это модель ИИ для преобразования текста в 3D, которая мгновенно создаёт 3D-представления на основе текстовых промптов.
  • Новый генератор текста в видео от Midjourney, о котором рассказал генеральный директор David Holz, начал обучение в январе и, как ожидается, скоро будет выпущен.
  • Развивая революцию AI PC, Lenovo 8 января 2024 года выпустила ThinkBook 13x с технологией E Ink Prism и высокопроизводительные ноутбуки с ИИ.

Следи за тенденциями в области ИИ вместе с нами!#

Начало 2024 года ознаменовалось прорывными достижениями в области ИИ и множеством крупных технологических событий. Но это лишь начало того, на что способен ИИ. Если ты хочешь узнать больше о последних разработках в области ИИ, Ultralytics поможет тебе быть в курсе.

Загляни в наш репозиторий GitHub, чтобы ознакомиться с последними разработками в области компьютерного зрения и ИИ. Также можешь посетить страницы наших решений и узнать, как ИИ используется в таких отраслях, как производство и здравоохранение.

Explore solutions

Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше
Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше
Компьютерное зрение для аэрофотоснимков

Компьютерное зрение для аэрофотоснимков

Превращай кадры с дронов и аэрофотоснимки в аналитику в реальном времени для сельского хозяйства, аквакультуры, экологического мониторинга, охраны природы и геопространственного анализа с помощью Ultralytics YOLO.
Узнать больше
Компьютерное зрение в аэрокосмической отрасли

Компьютерное зрение в аэрокосмической отрасли

Внедри компьютерное зрение в воздушный мониторинг с моделями Ultralytics YOLO. Обеспечь дроны, аэрокосмические рабочие процессы, задачи охраны природы и геопространственные отрасли решениями на базе компьютерного зрения.
Узнать больше

Защити каждый объект с помощью моделей Ultralytics YOLO. Компьютерное зрение обеспечивает мониторинг периметра, обнаружение угроз, распознавание номерных знаков и безопасность на рабочем месте.
Узнать больше
Компьютерное зрение в робототехнике

Компьютерное зрение в робототехнике

Оснащай более умные машины моделями Ultralytics YOLO. Vision AI в робототехнике обеспечивает автономную навигацию, восприятие, отслеживание объектов и управление в реальном времени.
Узнать больше
Компьютерное зрение в логистике

Компьютерное зрение в логистике

Оптимизируй логистику с помощью моделей Ultralytics YOLO. Vision AI обеспечивает инспекцию посылок, сортировку, отслеживание транспорта и мониторинг безопасности на складах в реальном времени.
Узнать больше
Компьютерное зрение в розничной торговле

Компьютерное зрение в розничной торговле

Переосмысли розничную торговлю с помощью моделей Ultralytics YOLO. Vision AI обеспечивает отслеживание запасов, мониторинг полок, управление очередями и более глубокое понимание поведения клиентов.
Узнать больше
Компьютерное зрение в здравоохранении

Компьютерное зрение в здравоохранении

Создавай решения для здравоохранения с моделями Ultralytics YOLO. Vision AI в здравоохранении обеспечивает более быструю обработку медицинских изображений, более точную диагностику и интеллектуальный мониторинг пациентов.
Узнать больше
Компьютерное зрение в производстве

Компьютерное зрение в производстве

Оптимизируй производство с моделями Ultralytics YOLO. Vision AI обеспечивает контроль качества, обнаружение дефектов, соблюдение требований к PPE и автоматизацию сборочной линии.
Узнать больше
Компьютерное зрение в автомобильной отрасли

Компьютерное зрение в автомобильной отрасли

Применяй компьютерное зрение в автомобильной отрасли с моделями Ultralytics YOLO. Vision AI повышает безопасность дорог, эффективность систем помощи водителю и уровень автоматизации автомобилей, делая дороги умнее.
Узнать больше
Компьютерное зрение в сельском хозяйстве

Компьютерное зрение в сельском хозяйстве

Добавь Vision AI в умное сельское хозяйство с моделями Ultralytics YOLO. Оптимизируй мониторинг посевов, отслеживание поголовья и точное земледелие для более высоких и эффективных урожаев.
Узнать больше

Давай вместе создавать будущее AI!

Начни свой путь в будущее машинного обучения