Gestión inteligente de conjuntos de datos de visión artificial con Ultralytics Platform
Descubre cómo usar Ultralytics Platform para mejorar la gestión de conjuntos de datos en tus proyectos de visión artificial. Haz un seguimiento, compara y mejora tus conjuntos de datos fácilmente.

La IA visual, o la visión artificial, ha avanzado mucho desde sus inicios y ha evolucionado de ser un área de investigación experimental a convertirse en una tecnología clave que impulsa aplicaciones del mundo real. Hoy en día, los entusiastas de la IA pueden crear modelos potentes para tareas como la detección de objetos y la segmentación de instancias con herramientas y frameworks accesibles.
Sin embargo, a medida que estas aplicaciones pasan de la experimentación a la producción, la gestión de conjuntos de datos sigue siendo un reto fundamental que a menudo se pasa por alto. A medida que los conjuntos de datos de visión artificial aumentan en tamaño y complejidad, los equipos suelen tener dificultades para mantener anotaciones coherentes, hacer un seguimiento de los cambios entre versiones y garantizar la calidad general de los datos.
Incluso los modelos más avanzados pueden rendir por debajo de lo esperado en entornos reales si los datos con los que se entrenan están incompletos, desequilibrados o mal gestionados. Esta brecha cada vez mayor entre el rendimiento durante el desarrollo y la fiabilidad en el mundo real hace necesario adoptar un enfoque más estructurado para gestionar los conjuntos de datos.
Otra limitación habitual es que la recopilación, anotación y entrenamiento de datos suelen realizarse con herramientas independientes. Un flujo de trabajo fragmentado dificulta la gestión eficiente de los conjuntos de datos, aumenta el riesgo de incoherencias y ralentiza las iteraciones.
Para resolver los cuellos de botella de la IA visual, como la gestión de conjuntos de datos y los flujos de trabajo fragmentados, hace poco lanzamos Ultralytics Platform. Es un espacio de trabajo integral que reúne la gestión de conjuntos de datos, la anotación, el entrenamiento, la implementación y la supervisión en un único flujo de trabajo unificado.
Al conectar cada etapa del ciclo de vida de la visión artificial, resulta más fácil hacer un seguimiento de los cambios en los conjuntos de datos, comparar el rendimiento entre versiones y perfeccionar continuamente los datos para obtener mejores resultados.

Fig. 1. Ejemplo de visualización de las imágenes de tu conjunto de datos en Ultralytics Platform (Fuente)
En este artículo veremos cómo Ultralytics Platform te ayuda a hacer un seguimiento de tus conjuntos de datos, compararlos y mejorarlos para crear modelos de visión artificial más fiables. ¡Empecemos!
La importancia de gestionar conjuntos de datos en visión artificial#
El rendimiento de un modelo de visión artificial está estrechamente relacionado con los datos con los que se entrena. La precisión del modelo, es decir, la frecuencia con la que sus predicciones son correctas, no depende solo del algoritmo, sino también de hasta qué punto el conjunto de datos representa las condiciones del mundo real.
En pocas palabras, un modelo aprende patrones directamente de los datos, por lo que cualquier laguna, sesgo o incoherencia en el conjunto de datos puede influir en sus predicciones. Es decir, los datos de baja calidad, las anotaciones incorrectas o la cobertura limitada de las variaciones reales de las imágenes —como las distintas condiciones de iluminación, los ángulos de los objetos, los fondos o los niveles de oclusión— pueden reducir considerablemente la precisión, aunque la arquitectura del modelo sea sólida.
Esto también se aplica al ajuste fino de un modelo, en el que se sigue entrenando un modelo preentrenado con datos nuevos o actualizados para adaptarlo mejor a un caso de uso o entorno específico. Como la precisión del modelo depende tanto de los datos, es fundamental gestionarlos correctamente.
La gestión de conjuntos de datos incluye organizar, etiquetar y actualizar los datos de forma continua para que sigan siendo precisos y pertinentes. Esto facilita mejorar el rendimiento con el tiempo, sobre todo al volver a entrenar o ajustar modelos con datos nuevos.
Cómo afecta la calidad de los conjuntos de datos a la fiabilidad en el mundo real#
Los casos de uso de visión artificial, como los sistemas de vigilancia de seguridad, son un excelente ejemplo de por qué es fundamental gestionar bien los datos. Estos sistemas deben funcionar de forma fiable en diversas condiciones reales, como distintos entornos de iluminación, ángulos de cámara, niveles de aglomeración y oclusiones parciales.
Si los datos de entrenamiento no abarcan estas variaciones o carecen de diversidad en la apariencia de los objetos en distintas escenas y condiciones, es posible que el modelo tenga dificultades para detectarlos con precisión. Por ejemplo, un modelo entrenado principalmente con escenas bien iluminadas y despejadas puede rendir mal en entornos con poca luz o muy concurridos. En los sistemas de seguridad, esto puede provocar que se pasen por alto incidentes o que se generen falsas alertas.
Para evitarlo, es importante mantener conjuntos de datos que no solo estén limpios y correctamente etiquetados, sino que también estén bien equilibrados y se actualicen continuamente. Esto implica detectar lagunas en los datos, añadir ejemplos nuevos cuando cambien las condiciones y asegurarse de que las distintas clases y entornos estén representados de forma equilibrada.
Con un conjunto de datos más completo y estructurado, los modelos están mejor preparados para gestionar la variabilidad del mundo real y generar predicciones más fiables.
Aspectos clave de la gestión de conjuntos de datos#
Entonces, ¿en qué consiste realmente la gestión de conjuntos de datos? Consiste en organizar, etiquetar y mantener los datos para poder utilizarlos eficazmente durante todo el proceso de desarrollo del modelo.
Por ejemplo, organizar los datos incluye estructurar el conjunto de datos y dividirlo en conjuntos de entrenamiento, validación y prueba. El conjunto de entrenamiento se utiliza para enseñar al modelo; el conjunto de validación, para supervisar el rendimiento y orientar los ajustes durante el desarrollo; y el conjunto de prueba, para evaluar el rendimiento del modelo final con datos que no ha visto nunca.
Por su parte, el etiquetado consiste en anotar las imágenes con información como las etiquetas de clase, los cuadros delimitadores o las máscaras de segmentación. Como el modelo aprende de estas anotaciones, la precisión y la coherencia son fundamentales para ayudarlo a aprender patrones significativos y generar predicciones fiables.
Además, mantener el conjunto de datos implica revisar y actualizar los datos con el tiempo. Esto puede incluir corregir errores de anotación, eliminar datos de baja calidad o duplicados y añadir ejemplos nuevos para cubrir casos que faltan o condiciones cambiantes.
En términos generales, la gestión de conjuntos de datos es un proceso continuo. A medida que se evalúan los modelos y se recopilan datos nuevos, hay que actualizar los conjuntos de datos para reflejar las condiciones del mundo real y los casos límite. Hacer un seguimiento de estas actualizaciones y comparar distintas versiones ayuda a los equipos a entender qué mejoras aumentan el rendimiento y dónde hacen falta más cambios.
Gestión de conjuntos de datos con Ultralytics Platform#
Ultralytics Platform ofrece un flujo de trabajo estructurado para gestionar conjuntos de datos en un único entorno, desde la preparación de datos hasta la exportación. Está diseñado para desarrolladores individuales y equipos, y facilita la gestión coherente de los conjuntos de datos, tanto si trabajas por tu cuenta como si colaboras en distintos proyectos.
Cada etapa está diseñada para simplificar la organización, el procesamiento y el uso de los conjuntos de datos durante todo el ciclo de desarrollo del modelo. Al reunir estos pasos en un mismo lugar, la plataforma reduce la fragmentación y facilita mantener la coherencia entre los flujos de trabajo.
A continuación, repasaremos los pasos clave y veremos cómo la plataforma facilita cada uno de ellos.
Carga de conjuntos de datos en Ultralytics Platform#
Empezar a trabajar con conjuntos de datos en la plataforma es sencillo y flexible, con varias formas de importar o reutilizar datos. Puedes subir tus propios datos o empezar más rápido con los conjuntos de datos públicos disponibles en la plataforma. También puedes clonar conjuntos de datos existentes que haya compartido la comunidad y ampliarlos.
Las funciones para la comunidad de la plataforma facilitan la exploración y reutilización del trabajo existente. Al poder acceder a conjuntos de datos creados por otros usuarios, con millones de imágenes y anotaciones, puedes empezar rápidamente sin tener que recopilarlo y etiquetarlo todo por tu cuenta. Al clonar un conjunto de datos, se crea una copia en tu espacio de trabajo que puedes modificar y ampliar sin alterar el original.
Para las cargas, la plataforma admite imágenes individuales, vídeos y archivos comprimidos de conjuntos de datos, como ZIP, TAR o GZ. También admite formatos de conjuntos de datos muy utilizados, como YOLO y COCO, lo que facilita importar conjuntos de datos y anotaciones existentes sin conversiones adicionales. Además, puedes subir un conjunto de datos mediante un archivo NDJSON exportado desde la plataforma, lo que permite recrear o reutilizar fácilmente conjuntos de datos en distintos proyectos.
Una vez cargados los datos, la plataforma los procesa mediante una canalización estructurada. Esto incluye validar los formatos y tamaños de los archivos, cambiar el tamaño de las imágenes cuando sea necesario, analizar las anotaciones y generar estadísticas del conjunto de datos.
Por ejemplo, los vídeos se convierten en fotogramas para poder utilizarlos en el entrenamiento, mientras que las imágenes se optimizan y preparan para facilitar su exploración y análisis. Una vez procesados, los conjuntos de datos están listos para anotarlos, analizarlos y entrenar modelos en la plataforma.
Anotación de datos en Ultralytics Platform#
Una vez cargados, puedes revisar y anotar los conjuntos de datos directamente en la plataforma. La plataforma incluye herramientas integradas de anotación de imágenes para diversas tareas de visión artificial, como la detección de objetos, la segmentación de instancias, la estimación de pose, la detección con cuadro delimitador orientado (OBB) y la clasificación de imágenes.

Fig. 2. Etiquetado de datos con Ultralytics Platform (Fuente)
Puedes crear anotaciones manualmente con estas herramientas o agilizar el proceso con funciones asistidas por IA, como la anotación inteligente basada en SAM. Con SAM, puedes generar máscaras, cuadros delimitadores o cuadros orientados interactuando con la imagen, lo que ayuda a acelerar el etiquetado sin perder precisión.
Análisis de la calidad de los conjuntos de datos con Ultralytics Platform#
Además de preparar y anotar los datos, entender la calidad del conjunto de datos es fundamental para crear modelos de visión artificial fiables. Si no tienes una visión clara de factores como la distribución de clases, la calidad de las anotaciones, las divisiones del conjunto de datos y la representación de los datos en distintas condiciones, puede resultar difícil detectar problemas que afecten al rendimiento del modelo.
Ultralytics Platform incluye funciones integradas que ayudan a analizar conjuntos de datos de forma más eficaz. Puedes consultar esta información directamente en la interfaz del conjunto de datos, en pestañas como Images, Classes y Charts.
En la pestaña Charts, puedes ver estadísticas del conjunto de datos, como la distribución de las divisiones (entrenamiento, validación y prueba), la frecuencia de las clases y mapas de calor de anotaciones que muestran dónde aparecen los objetos en las imágenes.
La pestaña Classes ofrece un desglose del número de anotaciones por clase, lo que facilita detectar desequilibrios entre clases. Por su parte, la pestaña Images muestra detalles de cada imagen, como sus dimensiones, el número de anotaciones y la distribución de las etiquetas en las imágenes individuales.
Esta información facilita la detección de problemas como el desequilibrio entre clases, la falta de escenarios o una distribución desigual de los datos. Por ejemplo, puedes detectar que ciertas clases tienen muy pocos ejemplos o que la mayoría de las anotaciones se concentran en zonas específicas de una imagen.
Además del análisis de datos, la plataforma permite seleccionar y aumentar conjuntos de datos; es decir, perfeccionarlos corrigiendo o eliminando datos problemáticos y creando variaciones de los datos existentes para mejorar el rendimiento del modelo. Puedes aplicar estas mejoras directamente en la plataforma actualizando anotaciones, añadiendo datos nuevos o reorganizando las divisiones del conjunto de datos a partir de la información del análisis.
Exportación de conjuntos de datos desde Ultralytics Platform#
Una vez preparado y validado un conjunto de datos, puedes exportarlo para utilizarlo en distintos entornos. Así puedes usar tus datos de visión artificial donde prefieras, ya sea para entrenar modelos en local, en la nube o con otras herramientas y flujos de trabajo.
Ultralytics Platform admite varios formatos de exportación, como YOLO, COCO y NDJSON, lo que facilita integrar conjuntos de datos en distintas herramientas y flujos de trabajo de entrenamiento.

Fig. 3. Exportación de un conjunto de datos desde Ultralytics Platform (Fuente)
Al exportar un conjunto de datos, se crea una instantánea fija de los datos en un momento concreto, incluidas sus imágenes, anotaciones y estructura. Esto resulta útil porque los conjuntos de datos suelen cambiar al añadir datos nuevos, actualizar anotaciones o ajustar las divisiones. Al exportar una instantánea, puedes conservar exactamente la versión del conjunto de datos que se utilizó en una ejecución de entrenamiento concreta.
Así resulta más sencillo reproducir los resultados más adelante, ya que puedes volver a entrenar un modelo con la misma configuración de datos y comparar el rendimiento entre distintas versiones del conjunto de datos. Por ejemplo, puedes evaluar si añadir imágenes nuevas o corregir anotaciones mejora realmente la precisión del modelo, en lugar de limitarte a adivinar qué ha cambiado.
Las exportaciones se procesan de forma asíncrona y, cuando están listas, puedes descargar los conjuntos de datos y utilizarlos en entornos de entrenamiento locales, en la nube o sin conexión.
Mejora de la calidad de los conjuntos de datos mediante iteraciones en Ultralytics Platform#
En los flujos de trabajo de aprendizaje automático y aprendizaje profundo, la gestión de los conjuntos de datos continúa incluso después de la implementación, porque los datos del mundo real suelen diferir de los utilizados durante el entrenamiento.
Cuando los modelos reciben entradas nuevas, las lagunas del conjunto de datos —como la falta de condiciones de poca luz, distintos ángulos de cámara, oclusiones o escenas concurridas— y los errores de anotación se hacen más evidentes, por lo que es necesario perfeccionar los datos con el tiempo.
Hay varias formas de mejorar un conjunto de datos. Puedes añadir imágenes o vídeos nuevos que cubran condiciones ausentes, como entornos con poca luz, distintos ángulos de cámara, oclusiones o escenas concurridas, y así reducir los puntos ciegos de los datos.
Al mismo tiempo, asegurarte de que las anotaciones sean precisas y coherentes —por ejemplo, con objetos correctamente etiquetados y cuadros delimitadores o máscaras precisos— ayuda al modelo a aprender patrones más fiables.
Este proceso suele seguir un ciclo sencillo: entrena el modelo, evalúa los resultados, detecta errores, mejora el conjunto de datos y vuelve a entrenar. Cada paso ayuda a señalar problemas como anotaciones incorrectas, datos que faltan o casos infrarrepresentados.
Imagina que trabajas en un sistema de supervisión en tiempo real de estanterías de tiendas para detectar productos. Es posible que las primeras versiones del conjunto de datos no incluyan ciertos tipos de productos, condiciones de iluminación o distribuciones de estanterías abarrotadas. Durante la evaluación, puede que observes que al modelo le cuesta detectar artículos en esas situaciones.
Para mejorar el rendimiento, puedes recopilar imágenes nuevas que abarquen esos escenarios que faltan y actualizar las anotaciones cuando sea necesario. Con el tiempo, repetir este proceso ayuda al modelo a ser más preciso y fiable en condiciones reales.
Ultralytics Platform facilita este flujo de trabajo al conectar las actualizaciones de los conjuntos de datos con el entrenamiento y la evaluación. Gracias al seguimiento integrado de experimentos y a las métricas de rendimiento, resulta más fácil supervisar los avances y mejorar continuamente los conjuntos de datos con el tiempo.
Seguimiento de los cambios en los conjuntos de datos con Ultralytics Platform#
Ya hemos comentado brevemente cómo evolucionan los conjuntos de datos con el tiempo durante el proceso de desarrollo de modelos. A medida que se añaden datos, se perfeccionan anotaciones y se actualizan clases, hacer un seguimiento de estos cambios se vuelve fundamental para mantener la calidad de los datos y garantizar un rendimiento coherente de los modelos.
Estas son algunas de las funciones clave de Ultralytics Platform para hacer un seguimiento de los conjuntos de datos y controlar sus versiones:
- Control de versiones de conjuntos de datos: Puedes crear versiones fijas de los conjuntos de datos como instantáneas NDJSON. Cada versión registra detalles clave, como el número de imágenes, clases y anotaciones, así como el tamaño del conjunto de datos en un momento concreto. Estas versiones se almacenan y se pueden descargar más adelante, lo que facilita reproducir experimentos y comparar resultados entre distintos estados del conjunto de datos.
- Pestaña Versions: Todas las versiones de los conjuntos de datos se organizan en la pestaña Versions, donde puedes consultar el historial de versiones, añadir descripciones de los cambios y hacer un seguimiento de la evolución del conjunto de datos.
- Vinculación con modelos: La pestaña Models muestra todos los modelos entrenados con un conjunto de datos, incluidas métricas como mAP y detalles del entrenamiento. Las versiones de los conjuntos de datos están vinculadas a las ejecuciones de entrenamiento, lo que te ayuda a entender cómo afectan los cambios en los datos al rendimiento del modelo.
- Pestaña Errors: La pestaña Errors destaca los archivos cuyo procesamiento ha fallado, junto con los detalles del error y sugerencias. Así puedes detectar y solucionar problemas como archivos dañados o formatos no compatibles antes del entrenamiento.
- Interfaz del conjunto de datos (pestañas Images y Classes): Estas vistas te permiten explorar imágenes, revisar anotaciones, gestionar etiquetas de clase y analizar la distribución de clases. Funciones como el filtrado, la ordenación y la identificación de imágenes sin anotar facilitan la supervisión de la calidad del conjunto de datos con el tiempo.
- Estadísticas y gráficos: Las visualizaciones de datos integradas, como la distribución de las divisiones, la frecuencia de las clases y los mapas de calor de anotaciones, ayudan a seguir los cambios en la distribución de los datos y a detectar desequilibrios a medida que evoluciona el conjunto de datos.

Fig. 4. Ejemplo de análisis de la distribución de clases de un conjunto de datos en Ultralytics Platform (Fuente)
Conexión de los conjuntos de datos con el entrenamiento y la implementación en Ultralytics Platform#
Ultralytics Platform conecta distintas etapas del desarrollo de modelos de IA en una sola canalización. Esto agiliza el proceso que va desde los datos sin procesar hasta las aplicaciones de IA visual listas para producción.
Una vez preparados y anotados, puedes utilizar los conjuntos de datos para entrenar modelos de visión artificial, como Ultralytics YOLO26, directamente en la plataforma. Durante el entrenamiento, puedes supervisar las métricas de rendimiento, hacer un seguimiento de los experimentos y evaluar cuánto aprende el modelo mediante los paneles integrados.

Fig. 5. Vista de las métricas de entrenamiento del modelo en Ultralytics Platform (Fuente)
Después del entrenamiento, puedes probar los modelos con imágenes nuevas directamente en el navegador para evaluar las predicciones y detectar aspectos que mejorar antes de la implementación. Cuando el modelo funcione bien, podrás implementarlo en producción.
La plataforma permite exportar modelos a varios formatos o implementarlos mediante servicios de inferencia y puntos de conexión específicos, para que puedan funcionar en distintos entornos.
Una vez implementados, las herramientas de supervisión integradas ayudan a hacer un seguimiento del rendimiento del sistema con el tiempo, incluidas las métricas relacionadas con el uso y el comportamiento del modelo. Esto facilita el mantenimiento y la mejora de los sistemas de IA visual en aplicaciones del mundo real.
Prácticas recomendadas para gestionar conjuntos de datos con Ultralytics Platform#
Estos son algunos factores clave que debes tener en cuenta al gestionar tus conjuntos de datos con Ultralytics Platform:
- Usa filtros para detectar lagunas: Identifica los datos sin etiquetar o infrarrepresentados con las herramientas de filtrado. Así podrás completar las anotaciones y mejorar la cobertura con mayor facilidad.
- Corrige los errores cuanto antes: Utiliza la pestaña Errors para controlar la calidad y detectar cargas fallidas, archivos dañados o formatos no compatibles antes del entrenamiento.
- Actualiza los conjuntos de datos continuamente: Añade datos nuevos, corrige anotaciones e incorpora casos límite a medida que aparezcan. Esto ayuda a mejorar la cobertura y garantiza que los modelos funcionen de forma fiable en situaciones reales.
- Gestiona con cuidado las divisiones de los conjuntos de datos: Asegúrate de que los conjuntos de entrenamiento, validación y prueba estén bien equilibrados. Puedes reorganizar las divisiones manualmente o utilizar la redistribución automática cuando sea necesario.
Para obtener más información sobre Ultralytics Platform, consulta la documentación oficial de Ultralytics.
Conclusiones clave#
A medida que crecen los proyectos de visión artificial, gestionar los conjuntos de datos de forma eficaz se vuelve tan importante como desarrollar los modelos. Un enfoque estructurado para gestionar los conjuntos de datos ayuda a mejorar la calidad de los datos, agilizar los flujos de trabajo y favorecer un mejor rendimiento de los modelos con el tiempo.
Ultralytics Platform simplifica este proceso al reunir la gestión de conjuntos de datos, el entrenamiento y la implementación en un único flujo de trabajo. Al adoptar un enfoque estructurado para gestionar los conjuntos de datos, los equipos pueden reducir la complejidad, mejorar la eficiencia y crear sistemas de visión artificial más escalables y fiables.
Únete a nuestra creciente comunidad y explora nuestro repositorio de GitHub para acceder a recursos de IA. Para empezar a crear con IA visual hoy mismo, consulta nuestras opciones de licencia. Descubre cómo la IA en la agricultura está transformando el sector agrícola y cómo la IA visual en la atención sanitaria está dando forma al futuro en nuestras páginas de soluciones.









