Генеративный ИИ меняет будущее компьютерного зрения
Открой для себя интересные выводы из панельной дискуссии на YOLO Vision 2024. Узнай, как генеративный ИИ определяет будущее моделей Vision AI, работающих в реальном времени.

Генеративный ИИ — это отрасль искусственного интеллекта (ИИ), которая создает новый контент, например изображения, текст или аудио, обучаясь на закономерностях в существующих данных. Благодаря недавним достижениям он теперь может использоваться для создания высокореалистичного контента, который часто имитирует человеческое творчество.
Однако влияние генеративного искусственного интеллекта выходит далеко за рамки простого создания контента. По мере того как модели компьютерного зрения в реальном времени, такие как Ultralytics YOLO models, продолжают развиваться, генеративный искусственный интеллект также переопределяет способы обработки и дополнения визуальных данных, прокладывая путь к инновационным приложениям в реальных сценариях.
Этот новый технологический сдвиг стал интересной темой для разговора на YOLO Vision 2024 (YV24), ежегодном гибридном мероприятии, проводимом Ultralytics. На YV24 энтузиасты искусственного интеллекта и лидеры индустрии собрались вместе, чтобы обсудить последние прорывы в области computer vision. Мероприятие было посвящено инновациям, эффективности и будущему решений на базе искусственного интеллекта в реальном времени.
Одним из главных событий мероприятия стала панельная дискуссия на тему YOLO in the Age of Generative AI. В панельной дискуссии приняли участие Glenn Jocher, основатель и генеральный директор Ultralytics, Jing Qiu, старший инженер по машинному обучению в Ultralytics, и Ao Wang из Университета Цинхуа. Они обсудили, как генеративный искусственный интеллект влияет на компьютерное зрение и с какими трудностями приходится сталкиваться при создании практических моделей искусственного интеллекта.
В этой статье мы вернемся к ключевым идеям из их обсуждения и подробнее рассмотрим, как генеративный ИИ трансформирует Vision AI.
Разработка моделей Ultralytics YOLO#
Наряду с Glenn Jocher, многие квалифицированные инженеры сыграли жизненно важную роль в разработке моделей Ultralytics YOLO. Один из них, Jing Qiu, рассказал о своем неожиданном начале работы с YOLO. Он объяснил, что его страсть к ИИ началась еще в студенческие годы. Он тратил значительное количество времени на изучение этой области. Jing Qiu вспомнил, как он связался с Glenn Jocher на GitHub и принял участие в различных проектах в сфере ИИ.
Дополняя слова Jing Qiu, Glenn Jocher назвал GitHub «невероятным способом обмена знаниями, где люди, которых ты никогда не встречал, собираются вместе, чтобы помочь друг другу, внося вклад в общую работу. Это отличное сообщество и действительно замечательный способ начать путь в ИИ».

Рис 1. Glenn Jocher и Jing Qiu выступают на сцене YV24.
Интерес Цзин Цю к искусственному интеллекту и его работа над Ultralytics YOLOv5 помогли усовершенствовать модель. Позже он сыграл ключевую роль в разработке Ultralytics YOLOv8, которая привнесла дополнительные улучшения. Он назвал это невероятным путешествием. Сегодня Цзин Цю продолжает совершенствовать и работать над такими моделями, как Ultralytics YOLO11.
YOLOv10: оптимизировано для реальной производительности#
Присоединившись к панельной дискуссии удаленно из Китая, Ao Wang представился как аспирант. Изначально он изучал программную инженерию, но страсть к ИИ привела его к переходу в сторону компьютерного зрения и глубокого обучения.
Своё первое знакомство со знаменитой моделью YOLO он начал во время экспериментов с различными методами и моделями искусственного интеллекта. Его впечатлили её скорость и точность, что вдохновило его на более глубокое погружение в computer vision tasks, такие как обнаружение объектов. Недавно Ао Ван внес свой вклад в YOLOv10, последнюю версию модели YOLO. Его исследования были сосредоточены на оптимизации модели для повышения её скорости и точности.
Ключевое различие между генеративным ИИ и Vision AI#
Затем панель начала обсуждать генеративный ИИ, и Jing Qiu отметил, что генеративный ИИ и Vision AI имеют совершенно разные цели. Генеративный ИИ создает или генерирует такие вещи, как текст, изображения и видео, в то время как Vision AI анализирует то, что уже существует, главным образом изображения.
Glenn Jocher подчеркнул, что размер — это тоже огромное различие. Модели генеративного ИИ огромны, часто содержат миллиарды параметров — внутренних настроек, которые помогают модели учиться на данных. Модели компьютерного зрения намного меньше. Он сказал: «Самая маленькая модель YOLO, которая у нас есть, примерно в тысячу раз меньше, чем самая маленькая LLM [большая языковая модель]. То есть 3 миллиона параметров по сравнению с тремя миллиардами».

Рис 2. Панельная дискуссия о генеративном ИИ и Vision AI на YV24.
Цзин Цю добавил, что процессы training и развертывания генеративного искусственного интеллекта и компьютерного зрения также сильно различаются. Для работы генеративного искусственного интеллекта требуются огромные и мощные серверы. Модели YOLO, с другой стороны, созданы для эффективности и могут обучаться и развертываться на стандартном оборудовании. Это делает модели Ultralytics YOLO более практичными для реального использования.
Несмотря на то, что они разные, эти две области начинают переплетаться. Glenn Jocher пояснил, что генеративный ИИ привносит новые достижения в Vision AI, делая модели умнее и эффективнее.
Влияние генеративного ИИ на компьютерное зрение#
Генеративный ИИ быстро продвинулся вперед, и эти прорывы влияют на многие другие области искусственного интеллекта, включая компьютерное зрение. Далее давай пройдемся по нескольким интересным идеям с этой панели.
Аппаратные достижения способствуют инновациям в ИИ#
В начале дискуссии Glenn Jocher объяснил, что идеи машинного обучения существуют уже давно, но компьютеры не были достаточно мощными, чтобы воплотить их в жизнь. Идеи ИИ нуждались в более мощном оборудовании, чтобы стать реальностью.
Появление GPU (графических процессоров) за последние 20 лет с возможностями параллельной обработки изменило всё. Они сделали обучение моделей ИИ намного быстрее и эффективнее, что позволило глубокому обучению развиваться быстрыми темпами.
В настоящее время чипы искусственного интеллекта, такие как TPUs (Tensor Processing Units) и оптимизированные GPU, потребляют меньше энергии, обрабатывая при этом более крупные и сложные модели. Это сделало искусственный интеллект более доступным и полезным в реальных приложениях.
С каждым новым улучшением оборудования как генеративный ИИ, так и приложения компьютерного зрения становятся мощнее. Эти достижения делают ИИ реального времени быстрее, эффективнее и готовым к использованию во многих отраслях.
Как генеративный ИИ формирует модели обнаружения объектов#
Отвечая на вопрос о том, как генеративный искусственный интеллект влияет на компьютерное зрение, Цзин Цю отметил, что transformers — модели, помогающие искусственному интеллекту сосредоточиться на самых важных частях изображения — изменили то, как искусственный интеллект понимает и обрабатывает изображения. Первым большим шагом стал DETR (Detection Transformer), в котором использовался этот новый подход для обнаружения объектов. Он повысил точность, но имел проблемы с производительностью, из-за чего в некоторых случаях работал медленнее.
Чтобы решить эту проблему, исследователи создали гибридные модели, такие как RT-DETR. Эти модели сочетают в себе сверточные нейронные сети (CNN — модели глубокого обучения, которые автоматически изучают и извлекают признаки из изображений) и трансформеры, обеспечивая баланс между скоростью и точностью. Этот подход использует преимущества трансформеров, ускоряя обнаружение объектов.
Интересно, что YOLOv10 использует слои внимания на базе трансформеров (части модели, которые действуют как прожектор, выделяя самые важные области на изображении и игнорируя менее релевантные детали) для повышения своей производительности.
Ao Wang также упомянул, как генеративный ИИ меняет способы обучения моделей. Такие методы, как маскированное моделирование изображений (masked image modeling), помогают ИИ учиться на изображениях более эффективно, сокращая потребность в больших наборах данных с ручной разметкой. Это ускоряет обучение компьютерного зрения и делает его менее ресурсоемким.
Будущее генеративного ИИ и Vision AI#
Еще одна ключевая идея, которую обсуждала панель, заключалась в том, как генеративный ИИ и Vision AI могут объединиться для создания более мощных моделей. Glenn Jocher объяснил, что, хотя у этих двух подходов разные сильные стороны, их объединение может открыть новые возможности.
Например, модели Vision AI, такие как YOLO, часто разбивают изображение на сетку для идентификации объектов. Этот сеточный метод может помочь языковым моделям улучшить их способность как точно определять детали, так и описывать их — задача, с которой сегодня сталкиваются многие языковые модели. По сути, объединение этих методов может привести к созданию систем, которые способны точно обнаруживать и четко объяснять то, что они видят.

Рис 3. Будущее генеративного ИИ и Vision AI. Изображение от автора.
Основные выводы#
Генеративный ИИ и компьютерное зрение развиваются вместе. Хотя генеративный ИИ создает изображения и видео, он также улучшает анализ изображений и видео, привнося новые инновационные идеи, которые могут сделать модели Vision AI более точными и эффективными.
В этой проницательной панельной дискуссии на YV24 Glenn Jocher, Jing Qiu и Ao Wang поделились своими мыслями о том, как эти технологии формируют будущее. Благодаря более совершенному оборудованию для ИИ, генеративный ИИ и Vision AI будут продолжать развиваться, что приведет к еще большим инновациям. Эти две области работают вместе, чтобы создать более умный, быстрый и полезный ИИ для повседневной жизни.
Присоединяйся к our community и изучи наш GitHub repository, чтобы узнать больше о Vision AI. Ознакомься с our licensing options, чтобы запустить свои проекты по компьютерному зрению. Интересуешься такими инновациями, как AI in manufacturing или computer vision in self-driving? Посети страницы наших решений, чтобы узнать больше.






