Semantic Chunking
semantic chunking이 데이터 컨텍스트를 보존하여 AI와 RAG 정확도를 높이는 방식을 알아봅니다. Ultralytics YOLO26을 사용해 시각적 청크를 추출하는 방법을 살펴봅니다.
시맨틱 청킹은 머신 러닝(ML)과 인공지능(AI)에서 대규모 데이터셋을 더 작고 의미 있는 세그먼트로 나누는 데 사용되는 고급 데이터 전처리 기법입니다. AI의 맥락에서 "청킹이란 무엇인가"가 궁금하다면, 이는 문서, 동영상 또는 오디오와 같은 긴 비정형 데이터 시퀀스를 관리 가능한 조각 또는 세그먼트로 나누는 프로세스입니다. 표준적인 청킹 정의에는 흔히 고정된 문자 수 또는 시간 간격에 따라 데이터를 분할하는 작업이 포함됩니다. 그러나 "의미 기반 청킹" 또는 시맨틱 청킹은 컨텍스트를 분석하고 관련 정보를 함께 그룹화하여 한 단계 더 나아갑니다. 이를 통해 핵심 메시지를 온전히 유지하고, 임의 분할 방식에서 자주 발생하는 컨텍스트 손실을 방지할 수 있습니다.
시맨틱 청킹은 어떻게 작동하나요?#
시맨틱 청킹을 수행하는 방법을 이해하려면 최신 생성형 파이프라인에서 시맨틱 청킹이 어떤 역할을 하는지 살펴보는 것이 도움이 됩니다. 그렇다면 RAG에서 시맨틱 청킹이란 무엇일까요? 벡터 데이터베이스를 위한 데이터를 준비할 때 임베딩 모델은 인접한 문장이나 시각적 요소를 분석하고 이들의 관계를 계산합니다. 코사인 유사도와 같은 통계적 지표를 사용하여 시스템은 주제가 전환되는 지점을 식별하고—이를 흔히 브레이크포인트라고 합니다—해당 지점에서 데이터를 분할합니다. 이를 통해 쿼리 중 대규모 언어 모델(LLM)이 검색하는 데이터 청크가 완전하고 일관된 생각을 담도록 하여 생성된 응답의 정확도를 크게 향상합니다. RAPTOR 및 적응형 그래프 클러스터링에 관한 최근 연구는 이러한 컨텍스트 인식 전략이 고정 크기 분할보다 뛰어난 성능을 보인다는 점을 강조합니다.
컴퓨터 비전에서의 시맨틱 청킹#
시맨틱 청킹은 전통적으로 자연어 처리(NLP)와 연관되어 왔지만, 컴퓨터 비전 및 멀티모달 AI에서도 매우 관련성이 높습니다. 예를 들어 문서 분석에서는 시각적 시맨틱 청크가 엄격한 페이지 경계를 기준으로 차트와 설명 캡션을 분리하는 대신 이들을 함께 유지할 수 있습니다. 고급 클라우드 제공업체와 API 도구는 이러한 복잡한 데이터 유형을 관리하기 위한 전문 시맨틱 청킹 구성을 제공합니다.
개발자는 Ultralytics YOLO26 모델을 활용하여 이러한 시각적 청크의 추출을 자동화할 수 있습니다. 이미지 또는 동영상 내 객체를 감지하여 장면의 핵심 내용을 나타내는 의미의 지역화된 세그먼트를 생성할 수 있습니다.
from ultralytics import YOLO
# Load an Ultralytics YOLO26 model to extract visual semantics
model = YOLO("yolo26n.pt")
# Run inference to detect objects within a visual scene
results = model("scene.jpg")
# Group detected object classes to form a semantic visual chunk
visual_chunk = [model.names[int(cls)] for cls in results[0].boxes.cls]
print(f"Semantic visual chunk elements: {visual_chunk}")실제 적용 사례#
시맨틱 청킹은 다양한 AI 워크플로 전반의 중요한 문제를 해결합니다. 다음은 두 가지 구체적인 예입니다:
- 문서 AI를 위한 멀티모달 RAG: 재무 보고서와 같은 복잡한 PDF를 파싱할 때 시각적 청킹을 사용하면 표 주변의 바운딩 박스를 해당 텍스트 요약과 함께 그룹화할 수 있습니다. 이를 통해 AI 어시스턴트는 수치 컨텍스트를 놓치지 않고 매우 구체적인 질문에 정확하게 답변할 수 있습니다.
- 자동 동영상 요약: 보안 및 감시 분야에서는 감지된 이벤트(예: 제한 구역에 사람이 진입하는 상황)를 기준으로 연속 동영상 스트림을 시맨틱 청킹합니다. 객체 추적을 사용하면 시스템은 무작위로 10초 구간을 반환하는 대신 관련 프레임을 실행 가능한 동영상 클립으로 그룹화합니다. 이러한 대규모 데이터셋을 관리하는 팀은 복잡한 이벤트 기반 파이프라인에 주석을 추가하고, 이를 학습시키며, 배포하기 위해 Ultralytics Platform에 의존하는 경우가 많습니다.
관련 개념#
이 기법을 유사한 AI 용어와 구분하는 것이 중요합니다:









