OpenAI o1: AI 추론을 위한 새로운 OpenAI 모델 시리즈
새롭게 출시된 OpenAI o1 모델과 그 차별점에 대해 알아봅니다. 또한 작동 방식과 AI의 미래에 미칠 영향도 살펴봅니다.

AI 커뮤니티에서는 다음 OpenAI GPT 모델의 단계에 대한 추측이 무성했으며, 많은 사람이 이를 “Project Strawberry”라고 불렀습니다. 그 이유는 GPT-4o에 프롬프트를 입력해 "strawberry"라는 단어에 R이 몇 개인지 물으면, 해당 단어에 R이 두 개 있다고 답하기 때문입니다(strawberry). GPT-4o가 얼마나 강력한지를 고려하면 이상하게 보일 수 있습니다. 그러나 이 모델은 정확한 단어가 아니라 행간의 의미를 처리하도록 설계되었습니다. 다음 모델이 이 문제를 해결하는 것을 목표로 한다는 소문이 있었습니다. Sam Altman은 자신의 X(이전 명칭 Twitter) 계정에 딸기 사진을 게시하며 이러한 소문에 더욱 불을 지폈습니다.
9월 12일 목요일 OpenAI의 최신 발표를 통해 마침내 이 추측에 대한 답을 얻었습니다! 응답하기 전에 속도를 늦추고 생각하도록 설계된 새로운 AI 모델 시리즈 OpenAI o1이 출시되었습니다. 흥미롭게도 OpenAI o1은 더 뛰어난 추론 능력을 바탕으로 딸기에 관한 질문에도 정확하게 답할 수 있습니다! 이 글에서는 OpenAI o1이 무엇인지, 어떻게 작동하는지, 어디에 사용할 수 있는지, 그리고 AI의 미래에 어떤 의미를 갖는지 살펴보겠습니다. 시작하겠습니다!

그림 1. 딸기에 관해 OpenAI o1에 프롬프트를 입력하는 예시입니다.
OpenAI의 새로운 AI 발전#
2024년 7월, OpenAI의 경영진은 OpenAI의 연구가 AI의 2단계라고 불리는 인간 수준의 문제 해결 능력에 가까워지고 있다고 밝혔습니다. OpenAI가 새로운 모델 시리즈인 OpenAI o1을 답변하기 전에 생각하는 모델로 소개한 점에서, 이 단계가 추론에 중점을 둔다는 것은 분명합니다. OpenAI o1은 LLM(대규모 언어 모델)으로, 방대한 언어 데이터에서 패턴을 학습하여 인간과 유사한 텍스트를 이해하고 생성하는 AI 모델입니다. 심층적인 추론이 필요한 복잡한 문제를 처리하도록 설계되었습니다.

그림 2. AI 단계에 대한 OpenAI의 관점입니다.
이 모델은 강화 학습을 사용해 훈련되었습니다. 강화 학습은 모델이 자신의 행동에 대해 보상이나 페널티를 받으며 시행착오를 통해 더 나은 결정을 내리는 방법을 학습하는 기법입니다. 강화 학습 알고리즘은 사고의 연쇄를 따르도록 하여 모델이 더욱 효과적으로 생각하도록 돕습니다. OpenAI는 또한 학습 중 강화 학습을 더 많이 수행하고 문제를 해결할 때 "생각하는" 시간을 더 많이 사용할수록 o1의 성능이 계속 향상된다고 밝혔습니다. 이는 학습 시간을 늘리고 신중하게 처리하는 것이 모두 모델의 능력을 높이는 데 도움이 된다는 것을 보여줍니다.
OpenAI o1은 복잡한 추론 분야에서 크게 발전했지만 아직 초기 모델이며, 웹 검색이나 파일 및 이미지 업로드처럼 ChatGPT를 유용하게 만드는 일부 기능이 없습니다. 많은 일반적인 작업에서는 현재로서는 GPT-4o가 여전히 더 뛰어날 수 있습니다. 그러나 OpenAI o1은 복잡한 추론을 처리하는 AI의 능력을 크게 발전시켰으며, 이것이 OpenAI가 새로운 시리즈를 시작하고 이를 OpenAI o1이라고 부르는 이유입니다.
새로운 OpenAI 모델이 AI 추론을 향상하는 방식#
OpenAI o1은 암호 해독, 프로그래밍 과제 해결, 수학 문제 답변, 십자말풀이 해결은 물론 과학, 안전, 의료의 복잡한 주제를 다루는 작업에도 사용할 수 있습니다. 프로젝트의 코드명에 대한 재미있는 암시로, OpenAI는 "THERE ARE THREE R’S IN STRAWBERRY."라는 메시지를 드러내는 암호를 해독하게 하여 모델의 추론 능력을 보여주었습니다.
암호 해독을 넘어 OpenAI o1은 코딩에도 능숙합니다. 프로그래머가 제한된 시간 내에 복잡한 코딩 문제를 해결하는 플랫폼인 Codeforces와 같은 경쟁 프로그래밍 과제에서 뛰어난 성능을 보입니다. 이러한 과제에서 모델은 높은 Elo 평점(다른 참가자와의 대결 성과를 바탕으로 실력 수준을 측정하는 점수 체계)을 기록하며 이전 모델보다 우수한 성능을 냅니다. 또한 수학에서도 뛰어난 성과를 보이며, 미국 초청 수학 시험(AIME)과 같은 시험에서도 좋은 결과를 냅니다.

그림 3. o1의 코딩 능력 벤치마킹입니다.
이러한 발전으로 OpenAI o1은 GPT-4o와 같은 이전 모델에서 크게 향상된 모델이 되었습니다. 비즈니스, 개발, 연구, 의료 등의 분야에서 AI의 새로운 가능성을 열어 줍니다. 예를 들어 유전학 연구에서 OpenAI o1은 방대한 연구 논문을 빠르게 검토하여 핵심적인 발견과 유전 표지와 질병 간의 연관성을 찾아낼 수 있습니다. 복잡한 과학 언어를 이해하고 중요한 요점을 요약할 수 있어 연구자들이 가장 관련성 높은 정보에 집중하도록 돕습니다.
사고의 연쇄 자세히 살펴보기#
앞서 OpenAI o1이 "사고의 연쇄" 추론 프로세스를 도입한다는 점을 살펴보았습니다. 이를 통해 모델은 인간의 인지 전략과 유사한 방식으로 복잡한 문제에 접근할 수 있습니다. 모델은 과제를 더 작고 관리하기 쉬운 단계로 나누고, 접근 방식을 반복적으로 개선할 수 있습니다. 즉각적인 패턴 인식에 의존했던 이전 모델과 달리, o1은 여러 추론 경로를 탐색하고 강화 학습을 통해 성공과 실수 모두에서 학습함으로써 의사 결정을 최적화합니다.
OpenAI는 사용자가 원시 사고의 연쇄를 볼 수 없도록 숨기고, 모든 단계를 노출하지 않으면서 모델의 추론을 파악할 수 있는 요약을 제공하기로 했습니다. 이러한 결정은 모델의 사고 과정을 오용하는 것을 방지하는 동시에 개발자가 AI의 안전성과 정렬을 모니터링하고 개선할 수 있도록 돕습니다. 개발자는 내부적으로 숨겨진 사고의 연쇄를 관찰하여 o1이 윤리 지침을 준수하고 유해한 행동을 피하도록 할 수 있습니다.
OpenAI o1 벤치마킹#
OpenAI o1은 추론 및 문제 해결 능력을 테스트하는 여러 벤치마크에서 GPT-4o보다 크게 향상된 결과를 보입니다. 우수한 고등학생을 대상으로 하는 난이도 높은 수학 시험인 2024년 미국 초청 수학 시험(AIME)에서 o1은 문제당 단 하나의 샘플만 사용했을 때 74%의 정확도를 기록한 반면, GPT-4o는 12%에 그쳤습니다. 64개 샘플의 합의를 사용하자 정확도는 83%로 높아졌고, 1,000개 샘플을 사용한 정교한 재순위 지정 방법으로는 93%에 도달하여 전국 상위 500명의 학생에 해당하는 수준을 기록했습니다.
수학을 넘어 o1은 화학, 물리학, 생물학의 박사 수준 문제를 다루는 GPQA Diamond와 같이 과학 지식을 테스트하는 벤치마크에서도 뛰어난 성과를 냈습니다. 놀랍게도 o1은 이 테스트에서 박사 학위를 보유한 인간 전문가를 능가하여 이를 달성한 최초의 AI 모델이 되었습니다. 또한 다양한 과목에 대한 이해도를 테스트하는 MMLU 벤치마크의 57개 범주 중 54개에서 GPT-4o를 앞섰으며, 여기에는 역사, 법률, 과학 등이 포함됩니다.

그림 4. OpenAI o1 벤치마킹입니다.
OpenAI o1 직접 사용해 보기#
OpenAI는 o1 시리즈에 두 가지 새로운 AI 모델인 o1-preview와 o1-mini를 선보였습니다. o1-preview 모델은 응답하기 전에 더 깊이 생각하도록 설계되었으며, 과학, 코딩, 수학 분야의 복잡한 추론 작업에서 뛰어난 성능을 발휘합니다. 난이도 높은 프로젝트를 수행하는 사용자를 위해 고급 문제 해결 기능을 제공합니다. 반면 o1-mini는 STEM 추론, 특히 수학과 코딩에 특화되도록 최적화된 더 작고 빠르며 비용 효율적인 모델입니다. 광범위한 세상 지식은 부족할 수 있지만, o1-mini는 AIME 수학 대회 및 Codeforces 코딩 과제와 같은 주요 평가에서 o1-preview의 성능에 거의 근접하면서도 비용은 80% 더 저렴합니다.

그림 5. OpenAI 모델 비교입니다.
다양한 OpenAI 플랫폼을 통해 이 모델들을 사용해 볼 수 있습니다. ChatGPT Plus 및 Team 사용자는 모델 선택기를 통해 o1-preview와 o1-mini를 모두 이용하고 ChatGPT에서 향상된 추론 기능을 직접 경험할 수 있습니다. API 사용 등급 5에 액세스할 수 있는 개발자는 이러한 모델로 프로토타이핑을 시작할 수 있지만, 일부 고급 기능은 아직 개발 중입니다. OpenAI는 곧 모든 ChatGPT Free 사용자에게 o1-mini를 제공할 계획이기도 합니다. 이러한 모델을 살펴보면 AI 추론의 발전을 직접 경험하고 자신의 요구에 가장 적합한 모델을 선택할 수 있습니다.
OpenAI가 고려한 윤리적 AI#
OpenAI는 o1 모델 시리즈를 개발하는 동안 윤리와 안전에 중점을 두었습니다. o1-preview와 o1-mini 모델을 출시하기 전에 외부 테스트와 허용되지 않는 콘텐츠, 환각, 편향 등의 위험에 대한 내부 점검을 포함한 철저한 평가를 수행했습니다. 모델은 안전 규칙을 더 잘 이해하고 따르도록 고급 추론 능력을 갖추어 설계되었습니다.
OpenAI는 위험을 관리하기 위해 차단 목록과 안전성 분류기 같은 보호 장치도 구현했습니다. o1 모델의 전반적인 위험 등급은 중간입니다. 사이버 보안 및 모델 자율성과 같은 영역에서는 위험이 낮고, CBRN(화학, 생물학, 방사선 및 핵) 콘텐츠와 설득 등의 영역에서는 위험이 중간 수준입니다. OpenAI의 안전 자문 그룹과 이사회는 모델이 안전하고 윤리적으로 사용될 수 있도록 이러한 안전 조치를 검토했습니다.

그림 6. OpenAI o1 스코어카드입니다.
소문에서 현실로: OpenAI o1의 등장#
OpenAI o1은 AI 추론의 큰 도약으로, 초기의 일부 소문을 현실로 만들었습니다. GPT-4o와 달리 o1 시리즈는 "사고의 연쇄" 접근 방식을 사용하여 복잡한 문제를 더 작은 단계로 나누고 더 나은 응답을 생성하기 위해 깊이 생각합니다. 현재 ChatGPT와 API에서 초기 프리뷰로 제공되며, OpenAI는 웹 검색과 파일 및 이미지 업로드 같은 기능을 추가할 계획입니다. OpenAI는 새로운 OpenAI o1 시리즈와 함께 GPT 시리즈의 모델도 계속 개발하고 출시할 계획이라고 밝혔습니다. AI가 계속 발전함에 따라 이러한 발전은 인간의 요구를 더 잘 지원하고 이해할 수 있는 강력하고 직관적이며 다재다능한 AI 시스템을 향한 길을 열고 있습니다.
저희 커뮤니티에 참여하여 AI의 최신 소식을 확인해 보세요! GitHub 저장소를 방문하여 제조 및 의료와 같은 분야에서 AI 솔루션을 어떻게 개척하고 있는지 확인해 보세요. 🚀









