YOLO Vision 2026:
비전 AI

OpenAI의 최신 업데이트: Canvas, 비전 파인튜닝 등

OpenAI가 최근 발표한 ChatGPT 업데이트를 자세히 살펴보겠습니다. Canvas, 비전 기능에 대한 파인튜닝, 그리고 최신 검색 기능을 탐색할 것입니다.

ABAbirami Vina4 min read
OpenAI의 최신 ChatGPT 업데이트 개요

지난 9월 OpenAI's o1 models을 살펴본 이후(추론 능력을 향상시키도록 설계됨), ChatGPT에 새롭고 흥미로운 기능들이 많이 추가되었습니다. 이러한 출시 기능 중 일부는 개발자를 대상으로 하며, 다른 기능들은 사용자 경험을 개선하도록 설계되었습니다. 전반적으로 각 업그레이드는 ChatGPT와의 상호작용을 더욱 직관적이고 효과적으로 만들어 줍니다.

협업형 writing and coding을 위해 설계된 Canvas와, ChatGPT가 images를 처리하는 방식을 개선하여 vision capabilities를 향상시키는 fine-tuning 같은 업데이트는 큰 관심을 불러일으키며 사용자들이 더 창의적인 가능성을 탐색하도록 장려하고 있습니다. 한편, 새로운 API 및 공정성 테스트 보고서와 같은 기술적 업그레이드는 모델 integrationethical AI 관행과 같은 측면을 다룹니다. 자, 이제 본격적으로 OpenAI의 최신 ChatGPT 기능을 더 자세히 살펴보겠습니다!

OpenAI의 Canvas 기능 개요#

Canvas는 출시 이후 ChatGPT 사용자 인터페이스(UI)에 대한 첫 번째 주요 업데이트입니다. 이는 왼쪽 사이드바에 프롬프트가 있고 오른쪽 창에 응답이 표시되는 2화면 레이아웃의 새로운 인터페이스입니다. 새로운 UI는 일반적인 챗봇 형태의 단일 화면 구조를 벗어나 생산성 향상을 위해 멀티태스킹 목적에 적합한 2화면 레이아웃으로 전환되었습니다.

Canvas brings UI updates to ChatGPT

Fig 1. Canvas가 ChatGPT에 UI 업데이트를 제공합니다.

Canvas가 도입되기 전에는 ChatGPT에서 긴 documents를 작업할 때 위아래로 꽤 많이 스크롤해야 했습니다. 새로운 레이아웃에서는 왼쪽에 프롬프트가 표시되고, 텍스트 문서나 code 스니펫이 화면의 대부분을 차지합니다. 필요한 경우 왼쪽 사이드바와 출력 화면의 크기를 직접 조정할 수도 있습니다. 또한 텍스트의 일부분이나 코드 섹션을 선택하여 전체 문서를 변경하지 않고 해당 특정 섹션만 편집할 수 있습니다.

Editing specific sections of text using Canvas

그림 2. Canvas를 사용하여 텍스트의 특정 섹션 편집.

Canvas를 사용해 보면 ChatGPT 인터페이스에 이를 열기 위한 특정 버튼이나 토글이 없다는 것을 알 수 있습니다. 대신 GPT-4o 모델을 사용할 때 Canvas는 사용자가 editing, writing 또는 coding 작업을 하고 있음을 감지하면 자동으로 열립니다. 더 간단한 프롬프트의 경우 비활성화된 상태로 유지됩니다. 수동으로 열고 싶다면 "Open the Canvas" 또는 "Get me the Canvas layout."과 같은 프롬프트를 사용할 수 있습니다.

현재 Canvas는 베타 버전이며 GPT-4o에서만 사용할 수 있습니다. 그러나 OpenAI는 베타 기간이 종료되면 모든 무료 사용자에게 Canvas가 제공될 것이라고 언급했습니다.

ChatGPT API 업데이트#

OpenAI는 효율성, 확장성 및 범용성을 개선하기 위해 3가지 새로운 ChatGPT API 업데이트를 출시했습니다. 각 업데이트를 자세히 살펴보겠습니다.

모델 증류(Model distillation)#

개발자는 OpenAI API를 통한 Model Distillation 기능을 사용하여 GPT-4o 또는 o1-preview 같은 advanced models의 출력을 활용함으로써 GPT-4o mini와 같은 더 작고 비용 효율적인 모델의 performance를 향상시킬 수 있습니다. 모델 증류는 더 고급 모델의 동작을 모방하도록 소형 모델을 training하는 프로세스로, specific tasks에 대해 더욱 효율적으로 작동하도록 만듭니다.

이 기능이 도입되기 전에는 개발자들이 다양한 도구를 사용하여 다양한 작업을 수동으로 조정해야 했습니다. 이러한 작업에는 datasets 생성, model performance 측정, 모델 fine-tuning이 포함되며, 이는 종종 프로세스를 복잡하고 오류가 발생하기 쉽게 만들었습니다. 모델 증류 업데이트를 통해 개발자는 API를 통해 고급 모델이 생성한 입력-출력 쌍을 캡처하고 저장하여 자동으로 generate datasets할 수 있는 도구인 Stored Completions를 사용할 수 있습니다.

현재 베타 버전인 모델 증류의 또 다른 기능인 Evals는 맞춤형 evaluation 스크립트를 작성하거나 별도의 도구를 사용하지 않고도 model performs가 특정 작업에서 얼마나 잘 수행되는지 측정하는 데 도움을 줍니다. Stored Completions로 generated된 데이터셋을 사용하고 Evals로 evaluating performance를 평가함으로써, 개발자는 자신만의 맞춤형 GPT 모델을 미세 조정할 수 있습니다.

Using Evals to measure model performance

Fig 3. Evals를 사용하여 모델 성능을 측정할 수 있습니다.

프롬프트 캐싱(Prompt caching)#

AI applications, 특히 chatbots을 구축할 때 종종 동일한 context(현재 요청을 이해하는 데 필요한 배경 정보 또는 이전 대화 기록)가 여러 API 호출에 걸쳐 반복해서 사용됩니다. Prompt Caching을 사용하면 개발자가 최근에 사용한 input tokens(모델이 프롬프트를 이해하고 응답을 생성하기 위해 처리하는 텍스트 조각)를 재사용할 수 있어 비용과 지연 시간을 줄이는 데 도움이 됩니다.

10월 1일부터 OpenAI는 GPT-4o, GPT-4o mini, o1-preview, o1-mini 같은 모델에 Prompt Caching을 자동으로 적용했습니다. 즉, 개발자가 API를 사용하여 긴 prompt(1,024 토큰 초과)가 포함된 모델과 상호작용할 때 시스템이 이미 처리한 부분을 저장합니다.

이러한 방식으로 동일하거나 유사한 프롬프트가 다시 사용되면 해당 부분을 다시 계산하는 과정을 건너뛸 수 있습니다. 시스템은 이전에 접한 프롬프트의 가장 긴 부분을 자동으로 캐싱하며, 1,024 토큰부터 시작하여 프롬프트가 길어짐에 따라 128 토큰 단위로 추가합니다.

Realtime API#

voice assistant를 만들려면 일반적으로 audio to text로 변환하고, 텍스트를 처리한 다음, 응답을 재생하기 위해 다시 audio to play로 변환하는 작업이 필요합니다. OpenAI의 Realtime API는 단일 API 요청으로 이 전체 프로세스를 처리하는 것을 목표로 합니다. 이 API는 프로세스를 단순화하여 AI와의 실시간 대화를 가능하게 합니다.

예를 들어, Realtime API와 통합된 음성 비서는 사용자의 요청에 따라 placing an order 또는 finding information과 같은 특정 작업을 수행할 수 있습니다. 이 API는 음성 비서의 응답성을 높이고 사용자의 요구에 신속하게 적응할 수 있도록 합니다. Realtime API는 10월 1일 공개 베타를 통해 6개의 음성으로 제공되기 시작했습니다. 10월 30일에는 5개의 음성이 추가되어 총 11개의 음성을 사용할 수 있게 되었습니다.

Using the Realtime API to practice conversations in a new language

Fig 4. 새로운 언어로 대화를 연습하기 위해 Realtime API를 사용하는 예시.

비전 작업을 위한 ChatGPT 파인튜닝#

원래 GPT-4o 비전 언어 모델은 텍스트 전용 데이터셋으로만 파인튜닝하고 커스터마이징할 수 있었습니다. 이제 비전 파인튜닝 API 출시로 개발자들은 이미지 데이터셋을 사용하여 GPT-4o를 학습시키고 커스터마이징할 수 있게 되었습니다. 출시 이후 비전 파인튜닝은 개발자들과 컴퓨터 비전 엔지니어들 사이에서 주요 관심사가 되었습니다.

GPT-4o의 비전 기능을 파인튜닝하기 위해 개발자는 100개에서 50,000개에 이르는 이미지 데이터셋을 사용할 수 있습니다. 데이터셋이 OpenAI에서 요구하는 형식과 일치하는지 확인한 후 OpenAI 플랫폼에 업로드하면 특정 애플리케이션을 위해 모델을 파인튜닝할 수 있습니다.

예를 들어 자동화 기업인 Automat은 스크린샷 데이터셋을 사용하여 train GPT-4o를 훈련시킴으로써 설명을 기반으로 화면의 UI 요소를 식별할 수 있도록 했습니다. 이는 봇이 사용자 인터페이스와 상호작용하기 쉽게 만들어 로봇 프로세스 자동화(RPA)를 간소화하는 데 도움을 줍니다. 고정된 좌표나 복잡한 셀렉터 규칙에 의존하는 대신, 모델은 간단한 설명을 기반으로 UI 요소를 식별할 수 있으므로 인터페이스가 변경될 때 자동화 설정을 더욱 유연하고 쉽게 유지 관리할 수 있습니다.

Using a fine-tuned GPT-4o model to detect UI elements

Fig 5. 미세 조정된 GPT-4o 모델 버전을 사용하여 UI 요소를 감지하는 모습.

ChatGPT 공정성 및 편향 감지#

AI가 점점 더 발전함에 따라 AI applications을 둘러싼 Ethical concerns는 중요한 대화 주제가 되고 있습니다. ChatGPT의 응답은 사용자가 제공한 프롬프트와 인터넷에서 이용 가능한 데이터를 기반으로 하기 때문에, 항상 책임감 있게 언어를 구사하도록 미세 조정하는 것은 어려울 수 있습니다. 보고서에 따르면 ChatGPT’s answers are biased는 이름, 성별, 인종에 따라 편향되어 있다고 합니다. 이 문제를 해결하기 위해 OpenAI의 사내 팀은 1인칭 공정성 테스트를 수행했습니다.

이름에는 종종 our culture 및 지리적 요인에 대한 미묘한 단서가 담겨 있습니다. 대부분의 경우 ChatGPT는 이름에 담긴 미묘한 단서를 무시합니다. 그러나 인종이나 문화를 반영하는 이름이 ChatGPT로부터 다른 응답을 유도하는 경우도 있으며, 이 중 약 1%는 harmful language를 반영합니다. 편견과 유해한 언어를 없애는 것은 language model에게 어려운 과제입니다. 그러나 OpenAI는 이러한 연구 결과를 공개하고 모델의 한계를 인정함으로써 사용자가 보다 중립적이고 편향되지 않은 답변을 얻을 수 있도록 프롬프트를 개선하는 데 도움을 줍니다.

An example of differing ChatGPT responses due to the user's name

Fig 6. 사용자의 이름으로 인해 응답이 달라지는 예시.

ChatGPT 검색 이해하기#

ChatGPT가 처음 출시되었을 때, AI 커뮤니티에서는 기존의 웹 브라우징을 대체할 수 있을지에 대한 논의가 있었습니다. 이제 많은 사용자가 Google 검색 대신 ChatGPT를 사용하고 있습니다.

OpenAI의 새로운 업데이트인 검색 기능은 이를 한 단계 더 발전시켰습니다. 검색을 통해 ChatGPT는 최신 응답을 생성하고 관련 출처에 대한 링크를 포함합니다. 10월 31일 기준으로 검색 기능은 모든 ChatGPT Plus 및 Team 사용자에게 제공되며, ChatGPT가 AI 기반 검색 엔진처럼 기능하게 합니다.

An example of using ChatGPT's new Search feature

Fig 7. ChatGPT의 새로운 검색(Search) 기능을 사용하는 예시.

앞으로의 방향#

ChatGPT의 최근 업데이트는 AI를 더욱 유용하고 유연하며 공정하게 만드는 데 중점을 두고 있습니다. 새로운 Canvas 기능은 사용자가 더 효율적으로 작업할 수 있도록 돕고, 비전 파인튜닝은 개발자가 시각적 작업을 더 잘 처리하도록 모델을 커스터마이징할 수 있게 합니다. 공정성 해결 및 편향 감소 또한 핵심 우선순위이며, 누구나 어떤 배경을 가지고 있든 관계없이 AI가 잘 작동하도록 보장합니다. 모델을 파인튜닝하는 개발자이든 단순히 최신 기능을 사용하는 사용자이든 상관없이, ChatGPT는 광범위한 요구를 충족하기 위해 진화하고 있습니다. 실시간 기능, 시각적 통합, 그리고 책임감 있는 사용에 초점을 맞춘 이러한 업데이트는 모두를 위해 더욱 신뢰할 수 있고 안정적인 AI 경험을 구축하고 있습니다.

GitHub repository를 방문하고 community에 가입하여 AI에 대해 자세히 알아보세요. self-drivinghealthcare에서의 AI 응용 프로그램에 대해 자세히 알아보세요.

Explore solutions

Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기
Real-time AI that works with your team

로봇 공학에서의 AI

Ultralytics YOLO 모델로 더 스마트한 기기를 구동하십시오. 로봇 공학의 비전 AI는 자율 주행, 인식, 객체 추적 및 실시간 제어를 촉진합니다.
더 알아보기
Real-time AI that works with your team

물류 분야의 AI

Ultralytics YOLO 모델로 물류 프로세스를 간소화하십시오. 비전 AI를 통해 패키지 검사, 분류, 차량 추적 및 실시간 창고 안전 모니터링이 가능합니다.
더 알아보기
Real-time AI that works with your team

소매업에서의 AI

Ultralytics YOLO 모델로 소매업을 재구상하십시오. 비전 AI는 재고 추적, 선반 모니터링, 대기열 관리 및 더 스마트한 고객 인사이트를 지원합니다.
더 알아보기
Real-time AI that works with your team

의료 분야의 AI

Ultralytics YOLO 모델로 의료 솔루션을 구축하십시오. 의료 분야의 비전 AI는 더 빠른 의료 영상 분석, 더 스마트한 진단 및 환자 모니터링을 지원합니다.
더 알아보기
Real-time AI that works with your team

제조 분야의 AI

Ultralytics YOLO 모델로 제조 공정을 최적화하십시오. 비전 AI는 품질 관리, 결함 탐지, PPE 규정 준수 및 조립 라인 자동화를 주도합니다.
더 알아보기
Real-time AI that works with your operation

자동차 분야의 AI

Ultralytics YOLO 모델을 통해 자동차 분야에 컴퓨터 비전을 적용하십시오. 비전 AI는 도로 안전, 운전자 보조 및 차량 자동화를 향상하여 더 스마트한 도로를 만듭니다.
더 알아보기
Real-time AI tailored to your operation

농업 분야의 AI

Ultralytics YOLO 모델을 통해 스마트 농업에 비전 AI를 도입하십시오. 작물 모니터링, 가축 추적 및 정밀 농업을 강화하여 더 높고 스마트한 생산량을 달성하십시오.
더 알아보기

미래의 AI를 함께 구축합시다!

머신 러닝의 미래와 함께 여정을 시작하십시오.