YOLO Vision 2025 Shenzhen에서 Ultralytics의 주요 하이라이트!
Ultralytics가 혁신가, 파트너 및 AI 커뮤니티를 한자리에 모아 영감을 나눈 YOLO Vision 2025 Shenzhen의 주요 순간을 다시 살펴보세요.

10월 26일, YOLO Vision 2025 (YV25)가 선전 OCT Creative Culture Park의 Building B10에서 중국에 처음으로 개최되었습니다. Ultralytics의 하이브리드 비전 AI 이벤트에는 200명 이상의 참석자가 현장에 모였으며, YouTube와 Bilibili를 통해 더 많은 사람들이 온라인으로 참여했습니다.
YV25 Shenzhen livestream은 이미 YouTube에서 조회수 3,500회를 넘어섰으며, 이벤트 하이라이트가 커뮤니티 전반에 공유되면서 계속 관심을 끌고 있습니다. 이날은 아이디어와 대화, 그리고 비전 AI가 앞으로 나아갈 방향을 직접 탐색하는 시간으로 가득했습니다.
이날은 호스트 Huang Xueying의 따뜻한 환영으로 시작되었습니다. Huang Xueying은 모든 참석자에게 교류하고 배우며 행사 전반의 논의에 참여해 달라고 초대했습니다. 또한 이번 행사가 올해 두 번째 YOLO Vision이며, 9월 런던 행사에 이어 선전에서 비전 AI 커뮤니티를 다시 한곳에 모을 수 있어 매우 뜻깊다고 설명했습니다.
이 글에서는 모델 업데이트, 발표 세션, 라이브 데모, 그리고 모두를 하나로 모은 커뮤니티의 순간을 포함해 이날의 하이라이트를 돌아봅니다. 시작해 보겠습니다!
지금까지의 Ultralytics YOLO 모델 여정#
이날 첫 번째 기조연설은 Ultralytics의 Founder & CEO인 Glenn Jocher가 진행했습니다. Glenn은 Ultralytics YOLO models이 연구 분야의 획기적인 성과에서 세계적으로 가장 널리 사용되는 비전 AI 모델 중 하나로 성장해 온 과정을 공유했습니다. Glenn은 초기 작업의 초점이 YOLO를 더 쉽게 사용할 수 있도록 만드는 데 있었다고 설명했습니다.
그는 모델을 PyTorch로 포팅하고 문서를 개선했으며, 전 세계 개발자들이 이를 기반으로 구축할 수 있도록 모든 것을 공개적으로 공유했습니다. 그는 당시를 회상하며 다음과 같이 말했습니다. “2018년에 저는 앞뒤 재지 않고 뛰어들었습니다. 이것이 제 미래가 될 곳이라고 결심했습니다.” 개인적인 노력으로 시작한 일은 빠르게 글로벌 오픈소스 운동으로 발전했습니다.

그림 1. YOLO Vision 2025 Shenzhen 무대에서 발표하는 Glenn Jocher.
오늘날 Ultralytics YOLO 모델은 매일 수십억 건의 inference를 처리하며, Glenn은 이러한 규모가 모델 구축에 기여한 사람들 덕분에 가능했다고 강조했습니다. 전 세계의 연구자, 엔지니어, 학생, 취미 개발자, 오픈소스 기여자들이 YOLO를 현재의 모습으로 발전시켰습니다.
Glenn은 다음과 같이 표현했습니다. “저 밖에 거의 1,000명의 [기여자]가 있으며, 우리는 그 점에 매우 감사하고 있습니다. 이 사람들이 없었다면 오늘날 우리가 있는 이곳에 도달하지 못했을 것입니다.”
Ultralytics YOLO26 업데이트#
Ultralytics YOLO26은 올해 초 YOLO Vision 2025 London 행사에서 처음 공개되었으며, 당시 Ultralytics YOLO 모델 제품군의 다음 주요 발전 단계로 소개되었습니다. YV25 Shenzhen에서 Glenn은 발표 이후의 진행 상황을 업데이트하고 모델이 어떻게 발전해 왔는지 AI 커뮤니티에 더 자세히 소개했습니다.
Ultralytics YOLO26은 실제 환경에서 실용적으로 사용할 수 있으면서도 더 작고 빠르며 정확하도록 설계되었습니다. Glenn은 팀이 지난 1년 동안 아키텍처를 개선하고, 다양한 디바이스에서 성능을 벤치마킹하며, 연구와 커뮤니티 피드백에서 얻은 인사이트를 반영하는 데 집중했다고 설명했습니다. 목표는 모델을 배포하기 어렵게 만들지 않으면서 최첨단 성능을 제공하는 것입니다.
Ultralytics YOLO26에서 기대할 수 있는 사항#
Glenn이 강조한 핵심 업데이트 중 하나는 Ultralytics YOLO26이 전용 하이퍼파라미터 튜닝 캠페인과 함께 제공된다는 점입니다. 완전히 처음부터 training하는 방식에서 더 큰 데이터셋을 활용한 파인튜닝으로 전환했습니다. 그는 이러한 접근 방식이 실제 사용 사례에 훨씬 더 부합한다고 설명했습니다.
행사에서 공유된 다른 주요 개선 사항은 다음과 같습니다.
- 간소화된 아키텍처: Distribution Focal Loss(DFL) 레이어를 제거했습니다. 이를 통해 동일한 수준의 정확도를 유지하면서 모델을 더 단순하고 빠르게 실행할 수 있습니다.
- 엔드투엔드 inference 지원: Ultralytics YOLO26은 기본적으로 엔드투엔드 방식이므로 별도의 NMS 레이어 없이 실행할 수 있습니다. 따라서 ONNX 및 TensorRT와 같은 형식으로 exporting하고 엣지 하드웨어에 배포하기가 훨씬 쉬워집니다.
- 향상된 소형 객체 성능: 업데이트된 loss 전략을 통해 모델이 매우 작은 객체를 더욱 안정적으로 탐지할 수 있습니다. 이는 computer vision 분야에서 오랫동안 해결하기 어려웠던 과제였습니다.
- 새로운 하이브리드 optimizer: YOLO26에는 최근 대규모 언어 모델 학습 연구에서 영감을 얻은 새로운 optimizer가 포함되어 있습니다. 이 optimizer는 모델 정확도를 향상하며 이제 Ultralytics Python 패키지에 직접 내장되어 있습니다.
실용적인 비전 AI를 위한 다음 단계, Ultralytics YOLO26#
이러한 업데이트를 통해 Ultralytics YOLO11보다 정확하면서 CPU에서 최대 43% 더 빠른 모델이 구현되었습니다. 따라서 YOLO26은 임베디드 디바이스, 로보틱스, 엣지 시스템에서 특히 큰 가치를 발휘합니다.
Ultralytics YOLO26은 현재 YOLO11에서 제공되는 모든 동일한 task와 model size를 지원하며, 제품군 전체에서 25개의 모델 variant를 제공합니다. 여기에는 detection, segmentation, pose estimation, oriented bounding box, classification용 모델이 포함되며, nano부터 extra large까지 다양한 크기로 제공됩니다.
팀은 또한 5개의 promptable variant를 개발하고 있습니다. 이러한 모델은 별도의 training 없이 텍스트 prompt를 입력받아 bounding box를 직접 반환할 수 있습니다.
이는 다양한 사용 사례에 더 쉽게 적용할 수 있는 유연한 instruction 기반 비전 workflow를 향한 초기 단계입니다. Ultralytics YOLO26 모델은 아직 활발히 개발 중이지만 초기 성능 결과는 뛰어나며, 팀은 조만간 출시하기 위해 작업하고 있습니다.
Ultralytics Platform 살펴보기#
YOLO26 업데이트 후 Glenn은 제품 엔지니어링 책임자인 Prateek Bhatnagar를 초대해 Ultralytics Platform의 라이브 데모를 진행했습니다. 이 플랫폼은 데이터셋 탐색, 이미지 annotation, 모델 training, 결과 비교 등 computer vision workflow의 핵심 요소를 한곳으로 통합하기 위해 개발되고 있습니다.

그림 2. Ultralytics Platform을 시연하는 Prateek Bhatnagar.
Prateek은 이 플랫폼이 Ultralytics의 오픈소스 정신을 충실히 이어 간다고 설명했습니다. 또한 개발자들이 서로의 작업에 기여하고, 재사용하고, 개선할 수 있는 두 개의 커뮤니티 공간인 데이터셋 커뮤니티와 프로젝트 커뮤니티를 소개했습니다. 데모에서는 AI 지원 annotation, 간편한 클라우드 training, 그리고 로컬 GPU 리소스 없이 커뮤니티에서 직접 모델을 파인튜닝하는 기능을 선보였습니다.
이 플랫폼은 현재 개발 중입니다. Prateek은 참석자들에게 관련 발표를 지켜봐 달라고 당부했으며, 출시를 지원하기 위해 중국 내 팀을 확대하고 있다고 밝혔습니다.
YOLO를 만든 사람들의 목소리: 저자 패널#
행사의 분위기가 고조되면서 여러 YOLO 모델을 개발한 연구자들이 참여하는 패널 토론이 진행되었습니다. 패널에는 Glenn Jocher와 함께 선임 Machine Learning Engineer인 Jing Qiu, Meta의 Machine Learning Engineer이자 YOLOv10 저자 중 한 명인 Chen Hui, Meituan의 Algorithm Strategist이자 YOLOv6 저자 중 한 명인 Bo Zhang이 참여했습니다.

그림 3. Huang Xueying, Chen Hui, Bo Zhang, Jing Qiu, Glenn Jocher가 참여한 YOLO 모델 개발 패널.
토론에서는 YOLO가 실제 사용을 통해 어떻게 계속 발전하는지에 초점을 맞췄습니다. 발표자들은 엣지 디바이스에서 효율적으로 실행하기, 소형 객체 detection 개선하기, 모델 export 간소화하기 등 실용적인 배포 과제가 발전을 이끄는 경우가 많다고 설명했습니다.
패널은 단순히 정확도만 추구하기보다 production 환경에서 속도, 사용성, reliability 사이의 균형을 맞추는 것이 중요하다고 강조했습니다. iteration과 커뮤니티 피드백의 가치도 공통된 핵심 내용으로 언급되었습니다.
대화에서 나온 다른 흥미로운 인사이트는 다음과 같습니다.
- YOLO 생태계에서 open-vocabulary detection이 주목받고 있습니다: 최신 모델은 vision-language alignment와 prompt 기반 workflow를 통해 고정된 카테고리를 넘어 객체를 detection할 수 있음을 보여줍니다.
- 경량 attention이 확산되고 있습니다: 패널에서는 모든 영역에 full attention을 적용하기보다 효율적인 attention mechanisms을 사용하면 정확도를 높이면서도 엣지 디바이스에서 실행할 수 있을 만큼 inference를 가볍게 유지할 수 있다고 논의했습니다.
- 커뮤니티와 함께 빠르고 지속적으로 iteration하기: 패널리스트들은 build–test–improve 방식의 중요성을 강조했습니다. 모델을 더 일찍 출시하고 사용자로부터 학습하는 것이 장기간의 비공개 개발 사이클보다 더 나은 결과를 이끌어 낸다는 의미입니다.
AI와 비전의 미래를 정의하는 오피니언 리더들#
이제 YV25 Shenzhen의 주요 기조연설을 자세히 살펴보겠습니다. 이 자리에서 AI 커뮤니티의 리더들은 디지털 휴먼과 로보틱스부터 멀티모달 reasoning과 효율적인 엣지 배포에 이르기까지 비전 AI가 어떻게 발전하고 있는지 공유했습니다.
AI가 인간의 경험을 이해하도록 가르치기#
통찰력 있는 세션에서 Alibaba Qwen Lab의 Peng Zhang 박사는 자신의 팀이 더 자연스러운 움직임과 제어 기능을 갖춘 표현력 있는 디지털 휴먼을 생성할 수 있는 대규모 video model을 개발하는 방법을 공유했습니다. 그는 오디오 또는 motion reference를 사용해 사실적인 speech, gesture, animation을 생성하는 Wan S2V와 Wan Animate를 소개하며, 순수한 텍스트 기반 생성의 한계를 설명했습니다.

그림 4. 대규모 video model이 디지털 휴먼을 구현하는 방식을 설명하는 Peng Zhang.
Zhang 박사는 또한 실시간 interactive avatar를 향한 발전에 대해 이야기했습니다. 여기에는 외모와 motion의 zero-shot cloning과 live camera feed에서 얼굴을 직접 animation할 수 있는 경량 모델이 포함됩니다. 이를 통해 생생한 디지털 휴먼을 일상적인 디바이스에서 원활하게 실행할 수 있는 시점에 한층 가까워지고 있습니다.
인식에서 행동으로: embodied intelligence의 시대#
YV25 Shenzhen의 핵심 주제 중 하나는 단순히 세상을 보는 vision model에서 세상 속에서 행동할 수 있는 system으로의 전환이었습니다. 다시 말해 perception은 더 이상 pipeline의 끝이 아니라 action의 시작점이 되고 있습니다.
예를 들어 D-Robotics의 Hu Chunxu는 기조연설에서 자사의 development kit와 SoC(시스템 온 칩) 솔루션이 통합된 hardware 및 software stack에서 sensing, 실시간 motion control, decision-making을 통합하는 방식을 설명했습니다. perception과 action을 서로 다른 단계가 아닌 연속적인 feedback loop로 처리함으로써, 이 접근 방식은 실제 환경에서 더욱 안정적으로 움직이고 적응하며 상호작용할 수 있는 robots를 지원합니다.

그림 5. 중국 선전에서 열린 YOLO Vision 2025의 D-Robotics 데모.
Baidu Paddle의 Alex Zhang은 발표에서 이 아이디어에 동의하며, YOLO와 PaddleOCR이 함께 작동해 객체를 detection한 다음 주변의 텍스트와 구조를 해석하는 방식을 설명했습니다. 이를 통해 system은 이미지와 문서를 물류, inspection, automated processing와 같은 task에 사용할 수 있는 구조화된 정보로 변환할 수 있습니다.
엣지에서의 intelligence: 모든 디바이스를 위한 효율적인 AI#
YV25 Shenzhen의 또 다른 흥미로운 주제는 edge devices에서 Vision AI가 더욱 효율적이고 강력해지는 방식이었습니다.
DEEPX의 Paul Jung은 클라우드 의존도를 낮추면서 YOLO 모델을 임베디드 하드웨어에서 직접 배포하는 방법을 설명했습니다. 낮은 전력 소비, 최적화된 inference, 하드웨어를 고려한 model tuning에 집중함으로써 DEEPX는 동적인 환경에서 작동하는 드론, mobile robot, 산업용 system에 실시간 perception을 제공합니다.
마찬가지로 Moore Threads의 Liu Lingfei는 Moore Threads E300 platform이 중앙 처리 장치(CPU), 그래픽 처리 장치(GPU), 신경망 처리 장치(NPU) computing을 통합해 소형 디바이스에서 고속 vision inference를 제공하는 방식을 공유했습니다.
이 platform은 높은 frame rate로 여러 YOLO stream을 실행할 수 있으며, toolchain은 quantization, static compilation, performance tuning과 같은 단계를 간소화합니다. Moore Threads는 개발자의 진입 장벽을 낮추기 위해 다양한 computer vision model과 deployment example도 오픈소스로 공개했습니다.
더욱 스마트한 AI system을 위한 vision과 language의 융합#
최근까지 이미지와 language를 모두 이해하고 해석할 수 있는 단일 model을 구축하려면 실행 비용이 높은 대규모 Transformer 아키텍처가 필요했습니다. YV25 Shenzhen에서 Yuanshi Intelligence의 Yue Ziyin은 Transformer의 긴 context reasoning 능력과 recurrent model의 효율성을 결합한 아키텍처인 RWKV를 소개했습니다.
그는 Vision-RWKV가 해상도에 따라 선형적으로 확장되는 방식으로 이미지를 처리함으로써 이 설계를 computer vision에 적용한다고 설명했습니다. 따라서 고해상도 입력과 computation이 제한된 edge device에 적합합니다.
Yue는 또한 RWKV가 vision-language system에서 사용되는 방식도 선보였습니다. 이 system에서는 이미지 feature와 text understanding을 결합해 object detection을 넘어 scene, document, 실제 context를 해석합니다.

그림 6. RWKV의 응용 분야를 설명하는 Yue Ziyin.
비전 AI를 현실로 구현한 부스와 라이브 데모#
무대 위 발표가 비전 AI가 향하는 미래를 조망했다면, 행사장 부스에서는 비전 AI가 이미 오늘날 어떻게 사용되고 있는지 확인할 수 있었습니다. 참석자들은 모델의 live 실행을 보고, 하드웨어 옵션을 비교하며, 이러한 system을 구축하는 팀과 직접 대화했습니다.
전시된 기술을 간단히 살펴보겠습니다.
- 개발자 및 prototyping platform: Seeed, M5Stack, Infermove는 YOLO 기반 애플리케이션을 쉽게 실험하고 아이디어를 빠르게 작동하는 데모로 발전시킬 수 있는 소형 개발 보드와 starter kit를 선보였습니다.
- 고성능 edge hardware: Hailo, DEEPX, Intel, Moore Threads는 빠르고 효율적인 inference를 위해 설계된 chip과 module을 시연했습니다.
- Vision 및 language workflow: Baidu Paddle과 RWKV는 객체를 detection할 뿐 아니라 이미지나 문서에 나타난 내용을 읽고, 해석하고, reasoning할 수 있는 software stack을 소개했습니다.
- 오픈소스 및 커뮤니티 tooling: Ultralytics와 Datawhale은 live model demo, training tip, 실습 중심 guidance를 통해 개발자와 소통하며, 지식 공유가 innovation을 어떻게 가속하는지 보여주었습니다.

그림 7. YV25 Shenzhen에서 M5Stack 부스 살펴보기.
비전 AI 커뮤니티와의 교류#
흥미로운 기술 외에도 YV25 Shenzhen의 가장 좋은 점 중 하나는 computer vision community와 Ultralytics team이 다시 현장에서 만났다는 것입니다. 하루 종일 사람들은 demo 주변에 모여들고, coffee break 동안 idea를 공유했으며, 발표가 끝난 후에도 대화를 이어 갔습니다.
연구자, engineer, 학생, builder들은 deployment부터 model training까지 각자의 실제 경험을 공유하고 질문을 주고받았습니다. 또한 Grupo Osborne의 Cinco Jotas 덕분에 갓 썰어낸 jamón으로 행사에 스페인 문화를 더하며 따뜻한 교류의 순간을 만들 수 있었습니다. 아름다운 venue, 열정적인 audience, 공동의 추진력이 어우러져 이날을 특별하게 만들었습니다.
핵심 요점#
영감을 주는 기조연설부터 실습 중심 demo까지, YOLO Vision 2025 Shenzhen은 Ultralytics community를 정의하는 innovation의 정신을 잘 보여주었습니다. 하루 동안 발표자와 참석자들은 idea를 나누고 새로운 technology를 탐색했으며, AI의 미래에 대한 공통된 vision을 중심으로 교류했습니다. 모두가 활기와 기대를 안고 Ultralytics YOLO의 다음 단계를 향해 나아갈 준비를 마쳤습니다.
AI와 computer vision으로 가능한 것의 범위를 새롭게 상상해 보십시오. community와 GitHub repository에 참여해 더 많은 내용을 확인해 보십시오. computer vision in agriculture, AI in retail과 같은 application에 대해 알아보십시오. our licensing 옵션을 살펴보고 지금 computer vision을 시작해 보십시오!









