2024년, 생성형 AI의 물결과 함께 시작되다
2024년 1분기의 흥미로운 AI 혁신을 살펴봅니다. OpenAI의 Sora AI, Neuralink의 뇌 칩, 최신 LLM 등의 획기적인 발전을 다룹니다.

AI 커뮤니티는 거의 매일 헤드라인을 장식하는 듯합니다. 2024년의 첫 몇 달은 흥미진진했으며 새로운 AI 혁신으로 가득했습니다. 강력한 새로운 대규모 언어 모델부터 인간의 뇌 임플란트에 이르기까지, 2024년은 놀라운 한 해가 될 전망입니다.
AI가 산업을 변화시키고 정보를 더 쉽게 이용할 수 있도록 하며, 우리의 정신과 기계를 결합하는 첫걸음까지 내딛는 모습을 보고 있습니다. 2024년 1분기를 되돌아보며, 불과 몇 달 동안 AI 분야에서 이룬 발전을 자세히 살펴보겠습니다.
LLM이 대세가 되었습니다#
방대한 텍스트 데이터를 바탕으로 인간의 언어를 이해하고 생성하며 조작하도록 설계된 대규모 언어 모델(LLMs)이 2024년 1분기의 중심에 섰습니다. 많은 주요 기술 기업이 각기 고유한 기능을 갖춘 자체 LLM 모델을 출시했습니다. GPT-3와 같은 이전 LLM의 놀라운 성공이 이러한 흐름에 영감을 주었습니다. 다음은 2024년 초에 출시된 주목할 만한 LLM입니다.
Anthropic의 Claude 3#
Anthropic은 2024년 3월 14일 Claude 3를 출시했습니다. Claude 3 모델은 Opus, Sonnet, Haiku의 세 가지 버전으로 제공되며, 각각 서로 다른 시장과 목적을 대상으로 합니다. 가장 빠른 모델인 Haiku는 빠르고 기본적인 응답에 최적화되어 있습니다. Sonnet은 속도와 지능의 균형을 이루며 엔터프라이즈 애플리케이션을 대상으로 합니다. 가장 발전된 버전인 Opus는 탁월한 지능과 추론 능력을 제공하며, 복잡한 작업과 최고 수준의 벤치마크 달성에 적합합니다.
Claude 3는 다음과 같은 다양한 고급 기능과 개선 사항을 제공합니다.
- 향상된 다국어 대화: 스페인어, 일본어, 프랑스어를 비롯한 여러 언어에서 능력이 개선되었습니다.
- 고급 비전 기능: 다양한 시각적 형식을 처리할 수 있습니다.
- 거부 응답 최소화: 불필요한 거부 응답이 줄고 이해도가 높아져 맥락 파악 능력이 개선되었음을 보여줍니다.
- 확장된 컨텍스트 윈도우: 200K 컨텍스트 윈도우를 제공하며, 고객의 요구에 따라 100만 개가 넘는 토큰을 처리할 수 있습니다.

그림 1. Claude 3는 이전 버전보다 맥락을 더 잘 인식합니다.
Databricks의 DBRX#
Databricks DBRX는 Databricks가 2024년 3월 27일 출시한 개방형 범용 LLM입니다. DBRX는 언어 이해, 프로그래밍, 수학을 비롯한 다양한 벤치마크에서 뛰어난 성능을 보입니다. 또한 유사한 모델보다 약 40% 작으면서도 기존의 다른 모델을 능가합니다.

그림 2. 다른 모델과 DBRX 비교
DBRX는 세밀한 전문가 혼합(MoE) 아키텍처를 사용한 다음 토큰 예측 방식으로 학습되었으며, 이것이 학습 및 추론 성능이 크게 향상된 이유입니다. 이 아키텍처를 통해 모델은 다양한 전문 하위 모델(‘전문가’)을 참조하여 시퀀스의 다음 단어를 더 정확하게 예측할 수 있습니다. 이러한 하위 모델은 서로 다른 유형의 정보나 작업을 처리하는 데 특화되어 있습니다.
Google의 Gemini 1.5#
Google은 2024년 2월 15일 광범위한 텍스트, 비디오, 오디오 데이터를 분석할 수 있는 컴퓨팅 효율적인 멀티모달 AI 모델 Gemini 1.5를 발표했습니다. 최신 모델은 성능, 효율성 및 기능 측면에서 더욱 발전했습니다. Gemini 1.5의 주요 특징은 긴 컨텍스트 이해에서 이룬 획기적인 발전입니다. 이 모델은 최대 100만 개의 토큰을 일관되게 처리할 수 있습니다. Gemini 1.5의 기능은 새로운 MoE 기반 아키텍처 덕분이기도 합니다.

그림 3. 인기 LLM의 컨텍스트 길이 비교
다음은 Gemini 1.5의 가장 흥미로운 기능입니다.
- 향상된 데이터 처리: 대용량 PDF, 코드 저장소 또는 긴 비디오를 프롬프트로 직접 업로드할 수 있습니다. 모델은 여러 모달리티에 걸쳐 추론하고 텍스트를 출력할 수 있습니다.
- 여러 파일 업로드 및 질의: 이제 개발자는 여러 파일을 업로드하고 질문할 수 있습니다.
- 다양한 작업에 사용 가능: 다양한 작업에 맞춰 확장되도록 최적화되었으며, 수학, 과학, 추론, 다국어 처리, 비디오 이해 및 코드와 같은 영역에서 개선된 성능을 보여줍니다.
AI가 만들어내는 놀라운 시각적 결과#
2024년 1분기에는 매우 사실적인 시각적 결과를 생성할 수 있는 생성형 AI 모델이 등장했으며, 이는 소셜 미디어의 미래와 AI의 발전에 대한 논쟁을 촉발했습니다. 이러한 논의를 불러일으키는 모델을 자세히 살펴보겠습니다.
OpenAI의 Sora#
ChatGPT를 만든 OpenAI는 2024년 2월 15일 Sora라는 최첨단 텍스트-비디오 딥러닝 모델을 발표했습니다. Sora는 사용자의 텍스트 프롬프트를 기반으로 시각적 품질이 높은 1분 길이의 비디오를 생성할 수 있는 텍스트-비디오 생성기입니다.
예를 들어 다음 프롬프트를 살펴보겠습니다.
“알록달록한 물고기와 바다 생물로 가득한 산호초의 아름답게 렌더링된 종이 공예 세계.”
그리고 다음은 출력 비디오의 한 프레임입니다.

그림 4. Sora가 생성한 비디오의 한 프레임
Sora의 아키텍처는 텍스처 생성을 위한 diffusion 모델과 구조적 일관성을 위한 Transformer 모델을 결합하여 이를 가능하게 합니다. 현재까지 Sora에 대한 액세스 권한은 위험을 파악하고 피드백을 받기 위해 레드팀 담당자와 일부 시각 예술가, 디자이너 및 영화 제작자에게 제공되었습니다.
Stability AI의 Stable Diffusion 3#
Stability AI는 2024년 2월 22일 텍스트-이미지 생성 모델인 Stable Diffusion 3의 출시를 발표했습니다. 이 모델은 diffusion Transformer 아키텍처와 flow matching을 결합합니다. 아직 기술 논문은 공개되지 않았지만, 주목할 만한 몇 가지 주요 기능이 있습니다.

그림 5. 다음 프롬프트를 기반으로 한 출력 이미지: “밤에 산 정상에서 어두운 하늘을 향해 ‘Stable Diffusion 3’이라고 쓰인 우주 마법을 시전하는 마법사의 장대한 애니메이션 작품” (출처)
Stable Diffusion의 최신 모델은 여러 피사체가 있는 이미지를 생성할 때 성능, 이미지 품질 및 정확도가 향상되었습니다. Stable Diffusion 3는 8억 개에서 80억 개의 파라미터에 이르는 다양한 모델도 제공할 예정입니다. 사용자는 확장성과 세부 수준에 대한 구체적인 요구에 따라 모델을 선택할 수 있습니다.
Google의 Lumiere#
Google은 2024년 1월 23일 텍스트-비디오 diffusion 모델인 Lumiere를 출시했습니다. Lumiere는 Space-Time-U-Net 또는 줄여서 STUNet이라고 하는 아키텍처를 사용합니다. 이 아키텍처는 Lumiere가 비디오에서 사물이 어디에 있고 어떻게 움직이는지 이해하도록 돕습니다. 이를 통해 매끄럽고 생생한 비디오를 생성할 수 있습니다.

그림 6. 다음 프롬프트를 기반으로 생성된 비디오의 한 프레임: “집에서 우쿨렐레를 연주하는 판다.”
Lumiere는 비디오당 80개의 프레임을 생성할 수 있어 AI 분야의 한계를 넓히고 비디오 품질에 대한 새로운 기준을 세우고 있습니다. Lumiere의 기능은 다음과 같습니다.
- 이미지-비디오: 이미지와 프롬프트로 시작하여 Lumiere가 이미지를 비디오로 애니메이션화할 수 있습니다.
- 스타일화된 생성: Lumiere는 하나의 참조 이미지를 사용하여 특정 스타일의 비디오를 만들 수 있습니다.
- 시네마그래프: Lumiere는 이미지 내 특정 영역을 애니메이션화하여 나머지 장면은 정적으로 유지하면서 특정 물체가 움직이는 것과 같은 역동적인 장면을 만들 수 있습니다.
- 비디오 인페인팅: 비디오 속 사람의 의상을 바꾸거나 배경 세부 사항을 수정하는 등 비디오의 일부를 변경할 수 있습니다.
미래가 현실이 된 듯합니다#
2024년 초에는 공상과학 영화에 나올 법한 AI 혁신도 많이 등장했습니다. 이전에는 불가능하다고 말했을 일들이 이제 실제로 연구되고 있습니다. 다음과 같은 발견을 보면 미래가 그리 멀게 느껴지지 않습니다.
Elon Musk의 Neuralink#
Elon Musk의 Neuralink는 2024년 1월 29일 인간의 뇌에 무선 뇌 칩을 성공적으로 이식했습니다. 이는 인간의 뇌를 컴퓨터에 연결하기 위한 중요한 진전입니다. Elon Musk는 Neuralink의 첫 번째 제품인 ‘Telepathy’가 개발 중이라고 밝혔습니다.

그림 7. Neuralink 임플란트
목표는 특히 사지 기능을 잃은 사용자가 생각만으로 기기를 손쉽게 제어할 수 있도록 하는 것입니다. 잠재적인 응용 분야는 편의성을 넘어섭니다. Elon Musk는 마비 환자도 쉽게 소통할 수 있는 미래를 그리고 있습니다.
Disney의 HoloTile Floor#
Walt Disney Imagineering은 2024년 1월 18일 HoloTile Floor를 공개했습니다. 이는 세계 최초의 다인용 전방향 트레드밀 바닥으로 불립니다.

그림 8. Disney Imagineer Lanny Smoot가 최신 혁신 제품인 HoloTile 바닥 위에서 포즈를 취하고 있습니다.
이 장치는 몰입형 가상 현실 및 증강 현실 경험을 위해 염동력처럼 사람이나 물체 아래에서 어느 방향으로든 움직일 수 있습니다. 어느 방향으로든 걸을 수 있으며 그 위에서 충돌을 피할 수 있습니다. Disney의 HoloTile Floor는 공연 무대에 설치하여 창의적인 방식으로 춤추고 움직이게 할 수도 있습니다.
Apple의 Vision Pro#
2024년 2월 2일, 많은 기대를 모은 Apple의 Vision Pro 헤드셋이 시장에 출시되었습니다. 이 제품에는 가상 현실 및 증강 현실 경험을 새롭게 정의하도록 설계된 다양한 기능과 애플리케이션이 포함되어 있습니다. Vision Pro 헤드셋은 엔터테인먼트, 생산성 및 공간 컴퓨팅을 결합하여 다양한 사용자층을 대상으로 합니다. Apple은 출시 당시 생산성 도구부터 게임 및 엔터테인먼트 서비스에 이르기까지 600개가 넘는 앱이 Vision Pro에 최적화되었다고 발표했습니다.
Cognition의 Devin#
Cognition은 2024년 3월 12일 Devin이라는 소프트웨어 엔지니어링 어시스턴트를 출시했습니다. Devin은 세계 최초의 자율형 AI 소프트웨어 엔지니어 시도입니다. 제안하거나 특정 작업을 완료하는 기존 코딩 어시스턴트와 달리, Devin은 초기 개념 수립부터 완료까지 전체 소프트웨어 개발 프로젝트를 처리하도록 설계되었습니다.
새로운 기술을 학습하고, 완전한 앱을 구축 및 배포하며, 버그를 찾고 수정하고, 자체 모델을 학습시키고, 오픈 소스 및 프로덕션 코드베이스에 기여하며, Upwork와 같은 사이트에서 실제 개발 업무를 맡을 수도 있습니다.

그림 9. 다른 모델과 Devin 비교
Devin은 Django 및 scikit-learn과 같은 오픈 소스 프로젝트에서 발견되는 실제 GitHub 이슈를 에이전트가 해결하도록 요구하는 까다로운 벤치마크인 SWE-bench에서 평가되었습니다. 이전 최첨단 성능인 1.96%와 비교하여, 전체 과정에서 이슈의 13.86%를 정확하게 해결했습니다.
특별히 언급할 만한 소식#
많은 일이 일어나고 있어 이 글에서 모든 내용을 다루기는 어렵습니다. 하지만 특별히 언급할 만한 소식을 몇 가지 더 소개하겠습니다.
- 3월 21일 발표된 NVIDIA의 LATTE3D는 텍스트 프롬프트에서 3D 표현을 즉시 생성하는 텍스트-3D AI 모델입니다.
- CEO David Holz가 예고한 Midjourney의 새로운 텍스트-비디오 생성기는 1월에 학습을 시작했으며 곧 출시될 예정입니다.
- Lenovo는 AI PC 혁명을 발전시키기 위해 2024년 1월 8일 E Ink Prism 기술과 고성능 AI 노트북을 탑재한 ThinkBook 13x를 출시했습니다.
저희와 함께 AI 트렌드를 최신 상태로 확인하세요!#
2024년 초에는 AI 분야에서 획기적인 발전과 많은 주요 기술적 이정표가 나타났습니다. 하지만 이는 AI가 할 수 있는 일의 시작에 불과합니다. 최신 AI 개발 동향을 더 자세히 알고 싶다면 Ultralytics가 도와드리겠습니다.
최신 컴퓨터 비전 및 AI 기여 내용을 확인하려면 GitHub 저장소를 살펴보세요. 또한 제조 및 의료와 같은 산업에서 AI가 어떻게 사용되는지 확인하려면 솔루션 페이지를 방문해 보세요.









