YOLO Vision 2026:
비전 AI

자연어 처리와 컴퓨터 비전의 결합

자연어 처리(NLP)와 컴퓨터 비전(CV)이 어떻게 협력하여 더 스마트하고 교차 모달적인 AI 시스템으로 산업을 변화시킬 수 있는지 배우십시오.

ABAbirami Vina4 min read
자연어 처리와 컴퓨터 비전의 결합

Natural language processing (NLP)computer vision (CV)은 최근 몇 년 동안 큰 인기를 얻은 artificial intelligence (AI)의 두 가지 서로 다른 분야입니다. AI의 발전 덕분에 이 두 분야는 그 어느 때보다 긴밀하게 연결되어 있습니다.

이에 대한 좋은 예가 자동 image captioning입니다. Computer vision을 사용하여 이미지의 내용을 분석하고 이해할 수 있으며, 자연어 처리를 사용하여 이를 설명하는 캡션을 generate할 수 있습니다. 자동 이미지 캡셔닝은 social media 플랫폼에서 accessibility를 향상시키고, content 관리 시스템에서 이미지를 효율적으로 구성하고 tag images하는 데 널리 사용됩니다.

NLP와 Vision AI의 혁신은 다양한 산업에서 이러한 많은 사용 사례로 이어졌습니다. 이 글에서는 NLP와 computer vision을 더 자세히 살펴보고 두 기술이 작동하는 방식을 논의합니다. 또한 이 두 기술을 함께 사용하는 흥미로운 애플리케이션을 살펴봅니다. 시작하겠습니다!

NLP와 비전 AI 이해하기#

NLP는 컴퓨터와 인간 언어 간의 상호 작용에 중점을 둡니다. 기계가 의미 있는 방식으로 텍스트나 음성을 이해, 해석 및 generate text할 수 있도록 지원합니다. 번역, sentiment analysis 또는 summarization과 같은 작업을 수행하는 데 사용할 수 있습니다.

한편, 컴퓨터 비전은 기계가 이미지와 비디오를 분석하고 작업할 수 있도록 돕습니다. 사진 속 detecting objects, facial recognition, object tracking 또는 image classification과 같은 작업에 사용할 수 있습니다. Vision AI 기술을 통해 기계는 시각적 세계를 더 잘 이해하고 상호 작용할 수 있습니다.

An example of image classification

Fig 1. 이미지 분류의 예.

NLP는 computer vision과 통합될 때 텍스트와 이미지를 결합하여 visual data에 의미를 부여하고 더 깊은 이해를 가능하게 합니다. 속담에도 있듯이 "백문이 불여일견"이며, 텍스트와 결합하면 더욱 강력해져 더 풍부한 통찰력을 제공합니다.

NLP와 컴퓨터 비전이 함께 작동하는 사례#

You’ve probably seen NLP and computer vision working together in everyday tools without even noticing, like when your phone translates text from a picture.

실제로 Google Translate는 자연어 처리와 컴퓨터 비전을 모두 사용하여 이미지의 텍스트를 번역합니다. 다른 언어로 된 도로 표지판 사진을 찍으면 컴퓨터 비전이 텍스트를 식별하고 추출하며, NLP는 이를 선호하는 언어로 번역합니다.

NLP와 CV는 협력하여 프로세스를 원활하고 효율적으로 만들어, 사용자가 실시간으로 언어 장벽을 넘어 정보를 이해하고 소통할 수 있게 합니다. 이러한 기술의 매끄러운 통합은 의사소통의 장벽을 허뭅니다.

Google Translate feature translating text from an image

Fig 2. Google의 번역 기능.

NLP와 컴퓨터 비전이 함께 작동하는 다른 응용 분야는 다음과 같습니다.

  • Self-driving cars: CV는 도로 표지판, 차선 및 장애물을 감지하는 데 사용할 수 있으며, NLP는 음성 명령 또는 도로 표지판의 텍스트를 처리할 수 있습니다.
  • Document readers: Vision AI는 스캔한 문서나 손글씨에서 텍스트를 인식할 수 있으며, 자연어 처리는 정보를 해석하고 요약할 수 있습니다.
  • Visual search in shopping apps: 컴퓨터 비전은 사진에서 제품을 식별할 수 있으며, NLP는 검색어를 처리하여 추천을 개선합니다.
  • Educational tools: CV는 손으로 쓴 메모나 시각적 입력을 인식할 수 있으며, NLP는 콘텐츠를 기반으로 설명이나 피드백을 제공할 수 있습니다.

컴퓨터 비전과 NLP를 연결하는 핵심 개념#

이제 컴퓨터 비전과 자연어 처리가 어떻게 사용되는지 살펴보았으니, 이들이 어떻게 결합하여 교차 모달(Cross-modal) AI를 구현하는지 알아봅시다.

교차 모달 AI는 컴퓨터 비전의 시각적 이해와 NLP의 언어 이해를 결합하여 텍스트와 이미지 전반의 정보를 처리하고 연결합니다. 예를 들어 healthcare에서 교차 모달 AI는 X-ray를 분석하고 잠재적인 문제에 대한 명확하고 서면화된 요약을 생성하여 의사가 더 빠르고 정확한 결정을 내릴 수 있도록 지원합니다.

자연어 이해(NLU)#

Natural Language Understanding은 의도, 맥락, 의미론, 어조 및 구조를 분석하여 텍스트에서 의미를 해석하고 추출하는 데 중점을 두는 NLP의 특별한 하위 집합입니다. NLP가 원시 텍스트를 처리하는 반면, NLU는 기계가 인간의 언어를 보다 효과적으로 이해할 수 있도록 합니다. 예를 들어 구문 분석(parsing)은 작성된 텍스트를 기계가 이해할 수 있는 구조화된 형식으로 변환하는 NLU 기술입니다.

Diagram of the relationship between NLP and NLU

Fig 3. NLP와 NLU의 관계.

NLU는 시각적 데이터에 이해해야 할 텍스트가 포함되어 있을 때 컴퓨터 비전과 함께 작동합니다. 컴퓨터 비전은 optical character recognition (OCR)과 같은 기술을 사용하여 이미지, 문서 또는 비디오에서 텍스트를 추출합니다. 영수증 스캔, 표지판의 텍스트 읽기 또는 손으로 쓴 메모 디지털화와 같은 작업이 포함될 수 있습니다.

그 후 NLU는 추출된 텍스트를 처리하여 의미, 맥락 및 의도를 파악합니다. 이러한 조합은 시스템이 단순히 텍스트를 인식하는 것을 넘어 더 많은 작업을 수행할 수 있게 합니다. 시스템은 영수증에서 비용 항목을 분류하거나 어조와 감정을 분석할 수 있습니다. 컴퓨터 비전과 NLU는 시각적 텍스트를 의미 있고 실행 가능한 정보로 전환합니다.

프롬프트 엔지니어링#

Prompt engineering은 대규모 언어 모델(LLM) 및 비전-언어 모델(VLM)과 같은 생성형 AI 시스템이 원하는 출력을 생성하도록 안내하기 위해 명확하고 정확하며 상세한 입력 프롬프트를 설계하는 프로세스입니다. 이러한 프롬프트는 AI 모델이 사용자의 의도를 이해하는 데 도움이 되는 지침 역할을 합니다.

효과적인 프롬프트 엔지니어링에는 모델의 기능을 이해하고 정확하고 창의적이며 통찰력 있는 응답을 생성하는 능력을 극대화하는 입력을 제작하는 것이 필요합니다. 이는 텍스트와 이미지 모두를 처리하는 AI models와 관련하여 특히 중요합니다.

OpenAI's DALL·E 모델을 예로 들어 보겠습니다. "우주비행사가 말을 타고 있는 실사 같은 이미지"를 만들어 달라고 요청하면 설명에 따라 정확하게 생성할 수 있습니다. 이 기술은 graphic design 같은 분야에서 매우 유용하며, 전문가가 텍스트 아이디어를 시각적 목업으로 빠르게 전환하여 시간을 절약하고 생산성을 높일 수 있습니다.

An image created using OpenAI’s DALL-E

Fig 4. OpenAI의 DALL-E를 사용하여 생성된 이미지.

이것이 컴퓨터 비전과 어떻게 연결되는지 궁금할 수 있습니다. 이것은 그냥 generative AI가 아닌가요? 두 개념은 실제로 밀접하게 연관되어 있습니다. 생성형 AI는 컴퓨터 비전의 기반을 바탕으로 완전히 새로운 시각적 출력을 생성합니다.

텍스트 프롬프트에서 이미지를 생성하는 Generative AI models은 텍스트 설명과 쌍을 이룬 대규모 이미지 데이터셋으로 학습됩니다. 이를 통해 언어와 객체, 텍스처, 공간 관계와 같은 시각적 개념 간의 관계를 학습할 수 있습니다.

이 모델들은 실제 이미지에서 recognizing objects하는 것과 같은 전통적인 컴퓨터 비전 시스템과 동일한 방식으로 시각적 데이터를 해석하지 않습니다. 대신, 이러한 개념에 대해 학습된 이해를 사용하여 프롬프트를 기반으로 새로운 시각 자료를 생성합니다. 이 지식과 잘 작성된 프롬프트를 결합하여 생성형 AI는 사용자의 입력과 일치하는 사실적이고 상세한 이미지를 생성할 수 있습니다.

질의응답(QA)#

Question-answering 시스템은 자연어 질문을 이해하고 정확하고 관련성 있는 답변을 제공하도록 설계되었습니다. 정보 검색, 의미론적 이해, 딥러닝 등의 기술을 사용하여 쿼리를 해석하고 응답합니다.

OpenAI’s GPT-4o와 같은 고급 모델은 시각적 질의응답(VQA)을 처리할 수 있으므로 이미지에 대한 질문을 분석하고 답변할 수 있습니다. 그러나 GPT-4o가 직접 computer vision tasks를 수행하는 것은 아닙니다. 대신 특화된 이미지 인코더를 사용하여 이미지를 처리하고, extract features한 후, 이를 언어 이해와 결합하여 답변을 제공합니다.

ChatGPT’s visual question-answering capability

그림 5. ChatGPT의 시각적 질의응답 기능. 이미지 제공: 저자.

다른 시스템은 computer vision capabilities를 완전히 통합하여 한 단계 더 나아갈 수 있습니다. 이 시스템은 이미지나 비디오를 직접 분석하여 객체, 장면 또는 텍스트를 식별할 수 있습니다. 자연어 처리와 결합할 때 시각적 콘텐츠에 대한 더 복잡한 질문을 처리할 수 있습니다. 예를 들어, 시각적 요소를 감지하고 해석하여 "이 이미지에는 어떤 객체가 있습니까?" 또는 "이 영상에는 누가 있습니까?"와 같은 질문에 답변할 수 있습니다.

제로샷 학습(ZSL)#

제로샷 학습 (ZSL)은 AI 모델이 구체적으로 학습되지 않은 새롭고 본 적 없는 작업을 처리할 수 있게 해주는 머신러닝 방식입니다. 설명이나 의미론적 관계와 같은 추가 정보를 사용하여 모델이 이미 알고 있는 내용(학습된 클래스)을 새롭고 본 적 없는 범주에 연결하는 방식으로 작동합니다.

자연어 처리에서 ZSL은 단어와 개념 간의 관계에 의존하여 모델이 학습되지 않은 주제를 이해하고 작업할 수 있도록 돕습니다. 마찬가지로 컴퓨터 비전에서 ZSL은 날개나 깃털 같은 시각적 특징을 birds 같은 알려진 개념에 연결하여 모델이 이전에 접한 적이 없는 객체나 장면을 recognize objects할 수 있게 해줍니다.

ZSL은 언어 이해와 시각적 인식을 결합하여 NLP와 CV를 연결하며, 두 분야를 모두 포함하는 작업에 특히 유용합니다. 예를 들어 시각적 질의응답에서 모델은 이미지를 분석하는 동시에 관련 질문을 이해하여 정확한 응답을 제공할 수 있습니다. 또한 이미지 캡셔닝과 같은 작업에도 유용합니다.

핵심 요약#

자연어 처리와 컴퓨터 비전을 결합함으로써 텍스트와 이미지 모두를 이해할 수 있는 AI 시스템이 탄생했습니다. 이 조합은 자율주행차가 도로 표지판을 읽도록 돕는 것부터 의료 진단을 개선하고 소셜 미디어를 더 안전하게 만드는 것에 이르기까지 많은 산업에서 사용되고 있습니다. 이러한 기술이 발전함에 따라 삶이 더욱 편리해지고 다양한 분야에서 새로운 기회가 열릴 것입니다. 자세한 내용을 알아보려면 GitHub repository를 방문하고 community에 참여해 보세요. 솔루션 페이지에서 self-driving carsagriculture 분야의 AI 애플리케이션을 살펴보세요. 🚀

Explore solutions

Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기

미래의 AI를 함께 구축합시다!

머신 러닝의 미래와 함께 여정을 시작하십시오.