Semantic Chunking
Descubre cómo el segmentado semántico conserva el contexto de los datos para mejorar la precisión de la IA y RAG. Aprende a extraer fragmentos visuales con Ultralytics YOLO26.
La fragmentación semántica es una técnica avanzada de preprocesamiento de datos que se utiliza en el aprendizaje automático (ML) y la inteligencia artificial (AI) para dividir grandes conjuntos de datos en segmentos más pequeños y significativos. Si te preguntas «qué es la fragmentación» en el contexto de la IA, es el proceso de dividir secuencias largas de datos no estructurados, como documentos, vídeos o audio, en piezas o segmentos manejables. La definición estándar de fragmentación suele consistir en dividir los datos según un número fijo de caracteres o un intervalo de tiempo. Sin embargo, la «fragmentación por significado» o fragmentación semántica va más allá, ya que analiza el contexto y agrupa la información relacionada. Esto garantiza que el mensaje principal permanezca intacto y evita la pérdida de contexto que suele afectar a los métodos de división arbitraria.
¿Cómo funciona la fragmentación semántica?#
Para entender cómo realizar una fragmentación semántica, resulta útil observar su función en las modernas canalizaciones generativas. Entonces, ¿qué es la fragmentación semántica en RAG? Al preparar datos para una base de datos vectorial, un modelo de embeddings analiza las frases adyacentes o los elementos visuales y calcula su relación. Mediante métricas estadísticas como la similitud coseno, el sistema identifica los puntos en los que cambia el tema, que suelen denominarse puntos de corte, y divide los datos en ellos. Esto garantiza que los fragmentos de datos que recupera un modelo de lenguaje grande (LLM) durante una consulta contengan ideas completas y coherentes, lo que mejora enormemente la precisión de la respuesta generada. Estudios recientes sobre RAPTOR y la agrupación adaptativa de grafos destacan cómo esta estrategia basada en el contexto supera a la división en tamaños fijos.
Fragmentación semántica en visión artificial#
Aunque tradicionalmente se ha asociado al procesamiento del lenguaje natural (NLP), la fragmentación semántica también es muy relevante en la visión artificial y la IA multimodal. En el análisis de documentos, por ejemplo, un fragmento semántico visual puede mantener juntos un gráfico y su pie explicativo en lugar de separarlos según unos límites de página estrictos. Los proveedores de servicios en la nube avanzados y las herramientas de API ofrecen configuraciones de fragmentación semántica especializadas para gestionar estos complejos tipos de datos.
Los desarrolladores pueden aprovechar el modelo Ultralytics YOLO26 para automatizar la extracción de estos fragmentos visuales. Al detectar objetos dentro de una imagen o un vídeo, puedes crear segmentos localizados de significado que representen el contenido principal de la escena.
from ultralytics import YOLO
# Load an Ultralytics YOLO26 model to extract visual semantics
model = YOLO("yolo26n.pt")
# Run inference to detect objects within a visual scene
results = model("scene.jpg")
# Group detected object classes to form a semantic visual chunk
visual_chunk = [model.names[int(cls)] for cls in results[0].boxes.cls]
print(f"Semantic visual chunk elements: {visual_chunk}")Aplicaciones en el mundo real#
La fragmentación semántica resuelve desafíos críticos en diversos flujos de trabajo de IA. Estos son dos ejemplos concretos:
- RAG multimodal para IA documental: Al analizar PDF complejos, como informes financieros, la fragmentación visual garantiza que los cuadros delimitadores que rodean las tablas se agrupen con sus correspondientes resúmenes de texto. Esto permite que los asistentes de IA respondan con precisión a preguntas muy específicas sin perder el contexto numérico.
- Resumen automatizado de vídeos: En los ámbitos de la seguridad y la vigilancia, los flujos de vídeo continuos se fragmentan semánticamente en función de los eventos detectados, como la entrada de una persona en una zona restringida. Mediante el seguimiento de objetos, el sistema agrupa los fotogramas relevantes en un clip de vídeo útil para la acción, en lugar de devolver un fragmento aleatorio de 10 segundos. Los equipos que gestionan estos enormes conjuntos de datos suelen confiar en la Ultralytics Platform para anotar, entrenar y desplegar sin complicaciones estas complejas canalizaciones basadas en eventos.
Conceptos relacionados#
Es importante diferenciar esta técnica de términos de IA similares:
- Fragmentación de acciones: Mientras que la fragmentación semántica agrupa los datos por significado para optimizar su recuperación, la fragmentación de acciones agrupa secuencias de movimientos físicos, como la trayectoria del brazo robótico, en acciones ejecutables individuales en robótica.
- Búsqueda semántica: La fragmentación semántica es la fase esencial de preparación de datos que hace posible recuperar información con precisión, mientras que la búsqueda semántica es el proceso de consulta propiamente dicho que obtiene esos fragmentos preparados en función de la intención del usuario.









