OpenAI’s GPT-4o가 AI의 잠재력을 보여줍니다.
생생한 상호작용을 지원하는 고급 AI를 탑재한 OpenAI의 새로운 GPT-4o를 살펴보고, 기술과 소통하는 방식을 어떻게 바꾸는지 알아보세요. 획기적인 기능을 확인해 보세요!

2024년 5월 13일 월요일, OpenAI는 새로운 플래그십 모델인 GPT-4o의 출시를 발표했으며, 여기서 'o'는 'omni'를 의미합니다. GPT-4o는 실시간 텍스트, 오디오, 비전 상호작용을 지원하는 고급 멀티모달 AI 모델로, 더 빠른 처리 속도, 다국어 지원, 향상된 안전성을 제공합니다.
GPT-4o는 이전에는 볼 수 없었던 생성형 AI 기능을 선보입니다. ChatGPT의 대화 기능을 기반으로 한 GPT-4o의 기능은 사람들이 AI를 인식하는 방식에서 큰 진전을 보여줍니다. 이제 GPT-4o와 실제 사람과 대화하듯 이야기할 수 있습니다. GPT-4o가 정확히 무엇을 할 수 있는지 자세히 살펴보겠습니다!
GPT-4o 알아보기#
OpenAI의 봄 업데이트에서 GPT-4o가 GPT-4만큼 지능적이면서도 데이터를 더 빠르게 처리하고 텍스트, 비전, 오디오를 더 효과적으로 다룰 수 있다는 사실이 공개되었습니다. 모델을 더 똑똑하게 만드는 데 초점을 맞췄던 이전 릴리스와 달리, 이번 릴리스는 일반 대중이 AI를 더 쉽게 사용할 수 있어야 한다는 점을 고려해 개발되었습니다.

그림 1. OpenAI의 봄 업데이트
지난해 말 출시된 ChatGPT의 음성 모드는 음성 입력을 텍스트로 변환하고, 서면 답변을 이해하고 생성하며, 사용자가 답변을 들을 수 있도록 텍스트를 음성으로 변환하는 세 가지 모델을 결합했습니다. 이 모드는 지연 시간 문제를 해결하지 못했고 매우 자연스럽게 느껴지지도 않았습니다. GPT-4o는 텍스트, 비전, 오디오를 한 번에 기본적으로 처리하여 사용자가 자연스러운 대화에 참여하고 있다는 느낌을 줍니다.
또한 음성 모드와 달리 이제 GPT-4o가 말하는 중에도 중단할 수 있으며, GPT-4o는 실제 사람처럼 반응합니다. 잠시 멈추고 이야기를 들은 다음, 사용자가 말한 내용을 바탕으로 실시간 답변을 제공합니다. 음성을 통해 감정을 표현할 수도 있으며 사용자의 말투도 이해합니다.
GPT-4o의 흥미로운 기능#
GPT-4o의 모델 평가 결과는 이 모델이 얼마나 발전했는지를 잘 보여줍니다. 가장 흥미로운 결과 중 하나는 GPT-4o가 모든 언어에서 Whisper-v3에 비해 음성 인식 성능을 크게 향상했다는 점이며, 특히 사용 빈도가 낮은 언어에서 두드러졌습니다.
오디오 ASR(자동 음성 인식) 성능은 모델이 음성을 텍스트로 얼마나 정확하게 변환하는지를 측정합니다. GPT-4o의 성능은 잘못 변환된 단어의 비율을 나타내는 단어 오류율(WER)로 추적하며, WER이 낮을수록 품질이 더 우수합니다. 아래 차트는 다양한 지역에서 GPT-4o의 더 낮은 WER을 보여주며, 자원이 부족한 언어의 음성 인식 개선에 대한 GPT-4o의 효과를 입증합니다.

그림 2. 여러 언어에서 뛰어난 음성 인식 성능을 보이는 GPT-4o
GPT-4o의 고유한 기능을 몇 가지 더 살펴보겠습니다.
- 더 빠른 속도 - GPT-4 Turbo보다 두 배 빠릅니다. 오디오 입력에 232밀리초 만에 응답할 수 있어 사람의 대화 응답 시간과 비슷합니다.
- 비용 효율성 - GPT-4o의 API 버전은 GPT-4 Turbo보다 50% 저렴합니다.
- 메모리 - GPT-4o는 서로 다른 대화에서도 맥락을 유지할 수 있습니다. 여러 채팅에서 사용자가 무엇에 대해 이야기하고 있는지 기억할 수 있습니다.
- 다국어 지원 - GPT-4o는 50개 언어에서 속도와 품질이 향상되도록 학습되었습니다.
GPT-4o의 활용 사례#
이제 휴대폰에서 GPT-4o를 실행하고 카메라를 켠 다음, 친구에게 하듯 GPT-4o에게 얼굴 표정을 바탕으로 기분을 추측해 달라고 요청할 수 있습니다. GPT-4o는 카메라를 통해 사용자를 보고 답변할 수 있습니다.

그림 3. 동영상을 통해 사람의 기분을 이해하는 GPT-4o
동영상을 통해 사용자가 쓰고 있는 내용을 GPT-4o에 보여주면 수학 문제를 푸는 데 도움을 받을 수도 있습니다. 또는 화면을 공유하여 GPT-4o를 유용한 Khan Academy 튜터로 활용할 수 있으며, 아래와 같이 기하학에서 삼각형의 여러 부분을 가리켜 보라고 요청할 수도 있습니다.

그림 4. Khan Academy에서 튜터 역할을 하는 GPT-4o
아이들의 수학 학습을 돕는 것 외에도 개발자는 GPT-4o와 대화하며 코드를 디버깅할 수 있습니다. 이는 ChatGPT가 데스크톱 앱으로 출시되었기 때문에 가능합니다. 데스크톱 GPT-4o 음성 앱과 대화하면서 CTRL “C”를 사용해 코드를 강조 표시하고 복사하면 앱이 코드를 읽을 수 있습니다. 또는 서로 다른 언어를 사용하는 개발자 간의 대화를 번역하는 데 활용할 수도 있습니다.
GPT-4o의 가능성은 무궁무진해 보입니다. OpenAI가 선보인 가장 흥미로운 데모 중 하나에서는 두 대의 휴대폰을 사용해 GPT-4o가 서로 다른 GPT-4o 인스턴스와 대화하고 함께 노래하는 모습을 보여주었습니다.

그림 5. AI와 대화하고 노래하는 AI
GPT-4o의 활용 분야#
데모에서 볼 수 있듯이 GPT-4o는 시각 장애가 있는 사람들의 세상에 대한 접근성을 높일 수 있습니다. 더 안전하고 독립적으로 상호작용하고 이동할 수 있도록 도와줍니다. 예를 들어 사용자는 동영상을 켜고 GPT-4o에 거리의 모습을 보여줄 수 있습니다. 그러면 GPT-4o는 장애물을 식별하거나, 도로 표지판을 읽거나, 특정 위치로 안내하는 등 주변 환경을 실시간으로 설명할 수 있습니다. 택시가 approaching할 때 알려 주어 택시를 잡는 데 도움을 줄 수도 있습니다.

그림 6. 택시의 접근을 알려주는 GPT-4o
마찬가지로 GPT-4o는 고급 기능을 통해 다양한 산업을 변화시킬 수 있습니다. 소매업에서는 실시간 지원을 제공하고 문의에 답변하며 온라인과 매장에서 고객이 제품을 찾도록 도와 고객 서비스를 개선할 수 있습니다. 제품이 진열된 선반을 보고도 원하는 제품을 찾지 못하는 상황을 예로 들어 보겠습니다. GPT-4o가 도움을 줄 수 있습니다.
의료 분야에서 GPT-4o는 환자 데이터를 분석하고 증상을 바탕으로 가능한 질환을 제안하며 치료 옵션에 대한 지침을 제공하여 진단을 지원할 수 있습니다. 또한 환자 기록을 요약하고, 의학 문헌에 빠르게 접근하도록 하며, 서로 다른 언어를 사용하는 환자와 소통할 수 있도록 실시간 언어 번역을 제공하는 등 의료 전문가를 지원할 수도 있습니다. 이는 몇 가지 예에 불과합니다. GPT-4o의 애플리케이션은 맞춤형 맥락 인식 지원을 제공하고 정보와 커뮤니케이션의 장벽을 낮춰 일상생활을 더 편리하게 만듭니다.
GPT-4o와 모델 안전성#
수억 명의 삶에 영향을 미친 이전 GPT 버전과 마찬가지로 GPT-4o도 전 세계에서 실시간 오디오와 비디오를 다루게 될 가능성이 높으므로, 이러한 애플리케이션에서 안전성은 매우 중요한 요소입니다. OpenAI는 잠재적인 위험을 완화하는 데 중점을 두고 GPT-4o를 개발하기 위해 매우 신중하게 접근했습니다.
안전성과 신뢰성을 보장하기 위해 OpenAI는 엄격한 안전 조치를 도입했습니다. 여기에는 학습 데이터 필터링, 학습 후 모델 동작 개선, 음성 출력을 관리하는 새로운 안전 시스템 도입이 포함됩니다. 또한 GPT-4o는 사회심리학, 편향 및 공정성, 허위 정보와 같은 분야의 외부 전문가 70명 이상을 통해 광범위한 테스트를 거쳤습니다. 외부 테스트를 통해 새로운 기능으로 인해 새롭게 발생하거나 증폭된 위험을 식별하고 해결할 수 있습니다.
높은 안전 기준을 유지하기 위해 OpenAI는 앞으로 몇 주에 걸쳐 GPT-4o의 기능을 단계적으로 출시합니다. 단계적 출시는 OpenAI가 성능을 모니터링하고 문제를 해결하며 사용자 피드백을 수집할 수 있도록 합니다. 신중한 접근 방식을 통해 GPT-4o는 최고 수준의 안전성과 윤리적 사용 기준을 유지하면서 고급 기능을 제공할 수 있습니다.
직접 GPT-4o 사용해 보기#
GPT-4o는 무료로 사용할 수 있습니다. 위에서 언급한 실시간 대화 기능을 사용해 보려면 ChatGPT 앱을 Google Play Store 또는 Apple App Store에서 휴대폰으로 직접 다운로드하면 됩니다.
로그인한 후 화면 오른쪽 상단 모서리에 있는 점 세 개를 탭하면 표시되는 목록에서 GPT-4o를 선택할 수 있습니다. GPT-4o가 활성화된 채팅으로 이동한 다음 화면 왼쪽 하단 모서리의 더하기 기호를 탭하면 여러 입력 옵션이 표시됩니다. 화면 오른쪽 하단 모서리에는 헤드폰 아이콘이 있습니다. 헤드폰 아이콘을 선택하면 핸즈프리 버전의 GPT-4o를 사용해 보겠냐는 메시지가 표시됩니다. 동의하면 아래와 같이 GPT-4o를 사용해 볼 수 있습니다.

그림 7. ChatGPT 모바일 앱에서 GPT-4o 사용해 보기
GPT-4o의 고급 기능을 자체 프로젝트에 통합하려는 경우 개발자용 API로 사용할 수 있습니다. 이 API를 사용하면 GPT-4o의 강력한 음성 인식, 다국어 지원, 실시간 대화 기능을 애플리케이션에 통합할 수 있습니다. API를 활용하면 사용자 경험을 향상하고, 더 스마트한 앱을 구축하며, 다양한 분야에 최첨단 AI 기술을 적용할 수 있습니다.
GPT-4o: 아직은 완전히 인간답지 않음#
GPT-4o가 이전 AI 모델보다 훨씬 발전했지만, GPT-4o에도 고유한 한계가 있다는 점을 기억하는 것이 중요합니다. OpenAI에 따르면 GPT-4o는 대화 중 영어에서 프랑스어로 전환하는 등 때때로 무작위로 언어를 바꿀 수 있습니다. 또한 GPT-4o가 언어 간 번역을 잘못하는 경우도 확인되었습니다. 더 많은 사람이 모델을 사용해 보면 GPT-4o가 어떤 부분에서 뛰어나고 어떤 부분을 더 개선해야 하는지 파악할 수 있을 것입니다.
핵심 요약#
OpenAI의 GPT-4o는 고급 텍스트, 비전, 오디오 처리 기능을 통해 AI의 새로운 가능성을 열고 자연스럽고 인간과 유사한 상호작용을 제공합니다. 속도, 비용 효율성, 다국어 지원 측면에서 뛰어난 성능을 보입니다. GPT-4o는 교육, 접근성, 실시간 지원을 위한 다재다능한 도구입니다. 사용자가 GPT-4o의 기능을 탐색함에 따라 피드백이 GPT-4o의 발전을 이끌 것입니다. GPT-4o는 AI가 실제로 세상을 변화시키고 우리의 일상생활의 일부가 되고 있음을 보여줍니다.
GitHub 저장소를 살펴보고 커뮤니티에 참여하여 AI를 더 깊이 탐구해 보세요. 솔루션 페이지를 방문하여 AI가 제조업 및 농업과 같은 산업을 어떻게 변화시키고 있는지 확인해 보세요.









