생성형 AI가 컴퓨터 비전의 미래를 바꾸고 있습니다
YOLO Vision 2024의 패널 토크에서 흥미로운 인사이트를 확인해 보세요. 생성형 AI가 실시간 Vision AI 모델의 향후 방향을 어떻게 형성하고 있는지 살펴봅니다.

생성형 AI는 기존 데이터에서 패턴을 학습하여 이미지, 텍스트 또는 오디오와 같은 새로운 콘텐츠를 생성하는 인공지능(AI)의 한 분야입니다. 최근의 발전 덕분에 이제는 인간의 창의성을 모방하는 경우가 많은 매우 사실적인 콘텐츠를 제작하는 데 사용할 수 있습니다.
그러나 생성형 AI의 영향력은 단순히 콘텐츠를 만드는 데 그치지 않습니다. Ultralytics YOLO models와 같은 실시간 컴퓨터 비전 모델이 계속 발전함에 따라 생성형 AI는 시각 데이터의 처리 및 증강 방식도 새롭게 정의하며, 실제 시나리오에서 혁신적인 애플리케이션을 구현할 수 있는 길을 열고 있습니다.
이러한 새로운 기술적 변화는 Ultralytics가 주최하는 연례 하이브리드 이벤트인 YOLO Vision 2024 (YV24)에서 흥미로운 대화 주제였습니다. YV24에는 AI 애호가와 업계 리더들이 모여 컴퓨터 비전의 최신 혁신을 논의했습니다. 이 이벤트는 혁신, 효율성, 그리고 실시간 AI 솔루션의 미래에 초점을 맞췄습니다.
이벤트의 주요 하이라이트 중 하나는 생성형 AI 시대의 YOLO를 주제로 한 패널 토론이었습니다. 패널에는 Ultralytics의 창립자 겸 CEO인 Glenn Jocher, Ultralytics의 시니어 머신러닝 엔지니어인 Jing Qiu, 그리고 칭화대학교의 Ao Wang이 참여했습니다. 이들은 생성형 AI가 컴퓨터 비전에 미치는 영향과 실용적인 AI 모델 구축의 과제를 살펴보았습니다.
이 글에서는 이들의 토론에서 얻은 주요 인사이트를 되짚어보고, 생성형 AI가 Vision AI를 어떻게 변화시키고 있는지 자세히 살펴보겠습니다.
Ultralytics YOLO models 개발#
Glenn Jocher와 함께 많은 숙련된 엔지니어가 Ultralytics YOLO models 개발에 중요한 역할을 해왔습니다. 그중 한 명인 Jing Qiu는 YOLO를 처음 접하게 된 예상 밖의 계기를 이야기했습니다. 그는 대학 시절 AI에 대한 열정이 시작되었다고 설명했습니다. 그는 이 분야를 탐구하고 학습하는 데 상당한 시간을 보냈습니다. Jing Qiu는 GitHub에서 Glenn Jocher와 인연을 맺고 다양한 AI 프로젝트에 참여하게 된 과정을 회상했습니다.
Glenn Jocher는 Jing Qiu의 말에 덧붙여 GitHub를 "한 번도 만난 적 없는 사람들이 서로 돕고 서로의 작업에 기여하며 함께하는, 공유를 위한 놀라운 방법입니다. 훌륭한 커뮤니티이며 AI를 시작하기에 정말 좋은 방법입니다."라고 설명했습니다.

그림 1. YV24 무대에서 발표 중인 Glenn Jocher와 Jing Qiu.
Jing Qiu의 AI에 대한 관심과 Ultralytics YOLOv5 작업은 모델을 개선하는 데 도움이 되었습니다. 이후 그는 추가적인 개선 사항을 도입한 Ultralytics YOLOv8 개발에서도 핵심적인 역할을 했습니다. 그는 이를 놀라운 여정이라고 표현했습니다. 현재도 Jing Qiu는 Ultralytics YOLO11과 같은 모델을 계속 개선하고 개발하고 있습니다.
YOLOv10: 실제 환경 성능에 최적화#
중국에서 원격으로 패널 토론에 참여한 Ao Wang은 자신을 박사 과정 학생이라고 소개했습니다. 처음에는 소프트웨어 공학을 공부했지만, AI에 대한 열정으로 컴퓨터 비전과 딥러닝 분야로 전향하게 되었습니다.
그는 다양한 AI 기법과 모델을 실험하던 중 유명한 YOLO 모델을 처음 접했습니다. YOLO의 속도와 정확도에 깊은 인상을 받은 그는 객체 감지와 같은 컴퓨터 비전 작업을 더 깊이 탐구하게 되었습니다. 최근 Ao Wang은 최신 YOLO 모델 버전인 YOLOv10 개발에 기여했습니다. 그의 연구는 모델을 더 빠르고 정확하게 최적화하는 데 중점을 두었습니다.
생성형 AI와 Vision AI의 주요 차이점#
이어서 패널에서는 생성형 AI에 대한 논의를 시작했고, Jing Qiu는 생성형 AI와 Vision AI의 목적이 매우 다르다는 점을 지적했습니다. 생성형 AI는 텍스트, 이미지, 동영상과 같은 것을 만들거나 생성하는 반면, Vision AI는 주로 이미지처럼 이미 존재하는 것을 분석합니다.
Glenn Jocher는 규모 역시 큰 차이점이라고 강조했습니다. 생성형 AI 모델은 방대한 규모이며, 데이터에서 모델이 학습하는 데 도움을 주는 내부 설정인 파라미터를 수십억 개 포함하는 경우가 많습니다. 컴퓨터 비전 모델은 훨씬 작습니다. 그는 “우리가 보유한 가장 작은 YOLO 모델은 가장 작은 LLM [대규모 언어 모델]보다 약 1,000배 작습니다. 즉, 300만 개의 파라미터와 30억 개의 파라미터를 비교하는 것입니다.”라고 말했습니다.

그림 2. YV24에서 진행된 생성형 AI와 Vision AI 패널 토론.
Jing Qiu는 생성형 AI와 컴퓨터 비전의 학습 및 배포 프로세스도 매우 다르다고 덧붙였습니다. 생성형 AI를 실행하려면 크고 강력한 서버가 필요합니다. 반면 YOLO와 같은 모델은 효율성을 고려해 구축되므로 표준 하드웨어에서 학습하고 배포할 수 있습니다. 따라서 Ultralytics YOLO models는 실제 환경에서 더욱 실용적입니다.
서로 다르지만 이 두 분야는 서로 융합되기 시작했습니다. Glenn Jocher는 생성형 AI가 Vision AI에 새로운 발전을 가져와 모델을 더욱 지능적이고 효율적으로 만들고 있다고 설명했습니다.
생성형 AI가 컴퓨터 비전에 미치는 영향#
생성형 AI는 빠르게 발전했으며, 이러한 혁신은 컴퓨터 비전을 비롯한 인공지능의 여러 분야에 영향을 미치고 있습니다. 이제 패널에서 논의한 흥미로운 인사이트를 몇 가지 살펴보겠습니다.
하드웨어의 발전이 AI 혁신을 가능하게 합니다#
패널 초반에 Glenn Jocher는 머신러닝 아이디어가 오래전부터 존재했지만 컴퓨터의 성능이 이를 구현할 만큼 강력하지 않았다고 설명했습니다. AI 아이디어를 현실로 만들기 위해서는 더 강력한 하드웨어가 필요했습니다.
지난 20년 동안 병렬 처리 기능을 갖춘 GPU(그래픽 처리 장치)가 부상하면서 모든 것이 바뀌었습니다. GPU는 AI 모델 학습을 훨씬 더 빠르고 효율적으로 만들었고, 이에 따라 딥러닝이 빠른 속도로 발전할 수 있었습니다.
오늘날 TPU(텐서 처리 장치)와 같은 AI 칩과 최적화된 GPU는 더 크고 복잡한 모델을 처리하면서도 전력은 더 적게 사용합니다. 이로 인해 실제 애플리케이션에서 AI에 더 쉽게 접근하고 이를 유용하게 활용할 수 있게 되었습니다.
새로운 하드웨어가 개선될 때마다 생성형 AI와 컴퓨터 비전 애플리케이션 모두 더욱 강력해지고 있습니다. 이러한 발전은 실시간 AI를 더 빠르고 효율적으로 만들며, 더 많은 산업에서 사용할 수 있도록 준비시키고 있습니다.
생성형 AI가 객체 감지 모델을 형성하는 방식#
생성형 AI가 컴퓨터 비전에 어떤 영향을 미치는지 질문받자 Jing Qiu는 트랜스포머가 AI가 이미지를 이해하고 처리하는 방식을 바꾸었다고 설명했습니다. 트랜스포머는 AI가 이미지에서 가장 중요한 부분에 집중하도록 돕는 모델입니다. 첫 번째 주요 단계는 DETR(Detection Transformer)로, 객체 감지에 이 새로운 접근 방식을 사용했습니다. 정확도는 향상되었지만 일부 경우 속도를 늦추는 성능 문제가 있었습니다.
이를 해결하기 위해 연구자들은 RT-DETR과 같은 하이브리드 모델을 개발했습니다. 이러한 모델은 합성곱 신경망(CNNs, 이미지에서 특징을 자동으로 학습하고 추출하는 딥러닝 모델)과 트랜스포머를 결합하여 속도와 정확도의 균형을 맞춥니다. 이 접근 방식은 트랜스포머의 이점을 활용하면서 객체 감지를 더 빠르게 합니다.
흥미롭게도 YOLOv10은 트랜스포머 기반 어텐션 레이어를 사용하여 성능을 향상합니다. 어텐션 레이어는 이미지에서 가장 중요한 영역을 집중 조명하고 관련성이 낮은 세부 정보는 무시하는 스포트라이트와 같은 역할을 하는 모델의 구성 요소입니다.
Ao Wang은 생성형 AI가 모델 학습 방식도 변화시키고 있다고 언급했습니다. 마스크 이미지 모델링과 같은 기법은 AI가 이미지에서 더 효율적으로 학습하도록 하여, 대규모 수동 라벨링 데이터 세트의 필요성을 줄입니다. 이를 통해 컴퓨터 비전 학습을 더 빠르고 적은 리소스로 수행할 수 있습니다.
생성형 AI와 Vision AI의 미래#
패널에서 논의한 또 다른 주요 아이디어는 생성형 AI와 Vision AI가 결합하여 더욱 뛰어난 모델을 구축할 수 있는 방식이었습니다. Glenn Jocher는 이 두 접근 방식이 서로 다른 강점을 지니지만, 이를 결합하면 새로운 가능성이 열릴 수 있다고 설명했습니다.
예를 들어 YOLO와 같은 Vision AI 모델은 객체를 식별하기 위해 이미지를 그리드로 나누는 경우가 많습니다. 이러한 그리드 기반 방식은 언어 모델이 세부 사항을 정확히 짚어내고 이를 설명하는 능력을 모두 향상하는 데 도움이 될 수 있으며, 이는 오늘날 많은 언어 모델이 직면한 과제입니다. 본질적으로 이러한 기법을 결합하면 보이는 것을 정확하게 감지하고 명확하게 설명할 수 있는 시스템으로 이어질 수 있습니다.

그림 3. 생성형 AI와 Vision AI의 미래. 이미지 제공: 저자.
핵심 요점#
생성형 AI와 컴퓨터 비전은 함께 발전하고 있습니다. 생성형 AI는 이미지와 동영상을 생성할 뿐만 아니라, Vision AI 모델을 더 정확하고 효율적으로 만들 수 있는 새롭고 혁신적인 아이디어를 제시하여 이미지와 동영상 분석도 개선합니다.
이 유익한 YV24 패널 토론에서 Glenn Jocher, Jing Qiu, Ao Wang은 이러한 기술이 미래를 어떻게 형성하고 있는지에 대한 생각을 공유했습니다. 더 나은 AI 하드웨어를 기반으로 생성형 AI와 Vision AI는 계속 발전하여 더욱 큰 혁신을 이끌어낼 것입니다. 이 두 분야는 협력하여 일상생활에 더 지능적이고 빠르며 유용한 AI를 만들고 있습니다.
Vision AI에 대해 자세히 알아보려면 저희 커뮤니티에 참여하고 GitHub 저장소를 살펴보세요. 컴퓨터 비전 프로젝트를 시작하려면 저희 라이선스 옵션을 확인하세요. 제조업의 AI 또는 자율주행의 컴퓨터 비전과 같은 혁신에 관심이 있으신가요? 솔루션 페이지를 방문하여 더 자세히 알아보세요.









