Генеративный ИИ меняет дальнейшее развитие компьютерного зрения
Узнай интересные подробности панельной дискуссии на YOLO Vision 2024. Исследуй, как генеративный ИИ формирует дальнейшее развитие моделей Vision AI для работы в реальном времени.

Генеративный ИИ — это направление искусственного интеллекта (AI), которое создает новый контент, например изображения, текст или аудио, изучая закономерности в существующих данных. Благодаря последним достижениям теперь он может создавать чрезвычайно реалистичный контент, часто имитирующий человеческую креативность.
Однако влияние генеративного ИИ выходит далеко за рамки простого создания контента. По мере развития моделей компьютерного зрения, работающих в реальном времени, таких как модели Ultralytics YOLO, генеративный ИИ также переопределяет способы обработки и расширения визуальных данных, открывая путь для инновационных приложений в реальных сценариях.
Этот новый технологический сдвиг стал интересной темой обсуждения на YOLO Vision 2024 (YV24) — ежегодном гибридном мероприятии, организованном Ultralytics. YV24 объединило энтузиастов ИИ и лидеров отрасли, чтобы обсудить последние достижения в области компьютерного зрения. Мероприятие было посвящено инновациям, эффективности и будущему решений на базе ИИ, работающих в реальном времени.
Одним из ключевых событий мероприятия стала панельная дискуссия YOLO в эпоху генеративного ИИ. В дискуссии приняли участие Glenn Jocher, основатель и генеральный директор Ultralytics, Jing Qiu, ведущий инженер по машинному обучению в Ultralytics, и Ao Wang из Университета Цинхуа. Они обсудили влияние генеративного ИИ на компьютерное зрение и сложности создания практичных моделей ИИ.
В этой статье мы вновь рассмотрим ключевые выводы их обсуждения и подробнее разберем, как генеративный ИИ преобразует Vision AI.
Разработка моделей Ultralytics YOLO#
Наряду с Glenn Jocher, многие талантливые инженеры сыграли важную роль в разработке моделей Ultralytics YOLO. Один из них, Jing Qiu, рассказал о своем неожиданном знакомстве с YOLO. Он объяснил, что его интерес к ИИ возник еще в годы учебы в колледже. Он уделял много времени изучению этой области и погружению в нее. Jing Qiu вспомнил, как связался с Glenn Jocher через GitHub и начал участвовать в различных проектах в области ИИ.
Продолжая мысль Jing Qiu, Glenn Jocher назвал GitHub «невероятным способом делиться знаниями: люди, которые никогда раньше не встречались, объединяются, чтобы помогать друг другу и вносить вклад в работу друг друга. Это отличное сообщество и действительно прекрасный способ начать заниматься ИИ».

Рис. 1. Glenn Jocher и Jing Qiu выступают на сцене YV24.
Интерес Jing Qiu к ИИ и его работа над Ultralytics YOLOv5 помогли усовершенствовать модель. Позже он сыграл ключевую роль в разработке Ultralytics YOLOv8, которая принесла дальнейшие улучшения. Он назвал этот путь невероятным. Сегодня Jing Qiu продолжает совершенствовать такие модели, как Ultralytics YOLO11.
YOLOv10: оптимизация для работы в реальных условиях#
Присоединившись к панельной дискуссии удаленно из Китая, Ao Wang представился аспирантом. Сначала он изучал программную инженерию, но интерес к ИИ привел его к компьютерному зрению и глубокому обучению.
Впервые он столкнулся с известной моделью YOLO, экспериментируя с различными методами и моделями ИИ. Его впечатлили ее скорость и точность, что побудило его глубже погрузиться в такие задачи компьютерного зрения, как обнаружение объектов. Недавно Ao Wang внес вклад в разработку YOLOv10 — новой версии модели YOLO. Его исследование было сосредоточено на оптимизации модели для повышения скорости и точности.
Ключевое различие между генеративным ИИ и Vision AI#
Затем участники дискуссии перешли к обсуждению генеративного ИИ, и Jing Qiu отметил, что у генеративного ИИ и Vision AI совершенно разные задачи. Генеративный ИИ создает или генерирует такие объекты, как текст, изображения и видео, тогда как Vision AI анализирует уже существующие данные, главным образом изображения.
Glenn Jocher также подчеркнул, что размер — еще одно важное различие. Модели генеративного ИИ огромны и часто содержат миллиарды параметров — внутренних настроек, которые помогают модели обучаться на данных. Модели компьютерного зрения значительно меньше. Он сказал: «Самая маленькая модель YOLO, которая у нас есть, примерно в тысячу раз меньше самой маленькой LLM [большой языковой модели]. То есть 3 миллиона параметров против трех миллиардов».

Рис. 2. Панельная дискуссия о генеративном ИИ и Vision AI на YV24.
Jing Qiu добавил, что процессы обучения и развертывания генеративного ИИ и компьютерного зрения также сильно различаются. Для работы генеративному ИИ нужны огромные мощные серверы. Модели вроде YOLO, напротив, создаются с учетом эффективности и могут обучаться и разворачиваться на стандартном оборудовании. Благодаря этому модели Ultralytics YOLO более практичны для использования в реальных условиях.
Несмотря на различия, эти две области начинают переплетаться. Glenn Jocher пояснил, что генеративный ИИ привносит новые достижения в Vision AI, делая модели более умными и эффективными.
Влияние генеративного ИИ на компьютерное зрение#
Генеративный ИИ быстро развивается, и эти достижения влияют на многие другие области искусственного интеллекта, включая компьютерное зрение. Далее рассмотрим несколько интересных выводов участников дискуссии на эту тему.
Развитие оборудования открывает путь для инноваций в ИИ#
В начале дискуссии Glenn Jocher объяснил, что идеи машинного обучения существуют уже давно, но компьютеры не обладали достаточной мощностью для их реализации. Идеям ИИ требовалось более производительное оборудование, чтобы воплотиться в жизнь.
Появление GPU (графических процессоров) за последние 20 лет и их возможности параллельной обработки изменили все. Они сделали обучение моделей ИИ гораздо более быстрым и эффективным, что позволило глубокому обучению развиваться стремительными темпами.
Сегодня такие микросхемы для ИИ, как TPU (тензорные процессоры), и оптимизированные GPU потребляют меньше энергии, обрабатывая при этом более крупные и сложные модели. Благодаря этому ИИ стал доступнее и полезнее для приложений в реальных условиях.
С каждым новым улучшением оборудования приложения генеративного ИИ и компьютерного зрения становятся все мощнее. Эти достижения делают ИИ, работающий в реальном времени, быстрее и эффективнее, а также готовым к использованию в большем числе отраслей.
Как генеративный ИИ формирует модели обнаружения объектов#
Отвечая на вопрос о влиянии генеративного ИИ на компьютерное зрение, Jing Qiu сказал, что трансформеры — модели, помогающие ИИ сосредоточиться на наиболее важных частях изображения, — изменили способы понимания и обработки изображений ИИ. Первым крупным шагом стала DETR (модель обнаружения на основе Transformer), в которой этот новый подход применили к обнаружению объектов. Она повысила точность, но имела проблемы с производительностью, из-за чего в некоторых случаях работала медленнее.
Чтобы решить эту проблему, исследователи создали гибридные модели, такие как RT-DETR. Эти модели объединяют сверточные нейронные сети (CNN — модели глубокого обучения, которые автоматически изучают и извлекают признаки из изображений) и трансформеры, обеспечивая баланс между скоростью и точностью. Такой подход использует преимущества трансформеров и одновременно ускоряет обнаружение объектов.
Интересно, что в YOLOv10 используются слои внимания на основе Transformer — компоненты модели, работающие подобно прожектору: они выделяют наиболее важные области изображения и игнорируют менее значимые детали, — чтобы повысить ее производительность.
Ao Wang также отметил, что генеративный ИИ меняет подходы к обучению моделей. Такие методы, как моделирование изображений с маскированием, помогают ИИ эффективнее обучаться на изображениях, уменьшая потребность в больших наборах данных с ручной разметкой. Благодаря этому обучение моделей компьютерного зрения становится быстрее и требует меньше ресурсов.
Будущее генеративного ИИ и Vision AI#
Еще одной ключевой идеей, которую обсудили участники дискуссии, стало возможное объединение генеративного ИИ и Vision AI для создания более функциональных моделей. Glenn Jocher объяснил, что, хотя у этих двух подходов разные сильные стороны, их объединение может открыть новые возможности.
Например, модели Vision AI, такие как YOLO, часто разбивают изображение на сетку, чтобы находить объекты. Такой метод на основе сетки может помочь языковым моделям улучшить способность одновременно точно определять детали и описывать их — задачу, которая сегодня остается сложной для многих языковых моделей. Иными словами, объединение этих методов может привести к созданию систем, способных точно обнаруживать и понятно объяснять то, что они видят.

Рис. 3. Будущее генеративного ИИ и Vision AI. Изображение автора.
Основные выводы#
Генеративный ИИ и компьютерное зрение развиваются вместе. Генеративный ИИ не только создает изображения и видео, но и улучшает анализ изображений и видео, привнося новые инновационные идеи, которые могут сделать модели Vision AI более точными и эффективными.
В этой содержательной панельной дискуссии YV24 Glenn Jocher, Jing Qiu и Ao Wang поделились своими взглядами на то, как эти технологии формируют будущее. Благодаря более совершенному оборудованию для ИИ генеративный ИИ и Vision AI продолжат развиваться, приводя к еще более значительным инновациям. Эти две области работают вместе, создавая более умный, быстрый и полезный ИИ для повседневной жизни.
Присоединяйся к нашему сообществу и изучи наш репозиторий на GitHub, чтобы узнать больше о Vision AI. Ознакомься с нашими вариантами лицензирования, чтобы начать свои проекты в области компьютерного зрения. Интересуешься такими инновациями, как ИИ в производстве или компьютерное зрение в беспилотном вождении? Посети страницы наших решений, чтобы узнать больше.









