Florence-2: el último modelo de lenguaje visual de Microsoft
Conoce Florence-2, el modelo de lenguaje visual de Microsoft que ofrece una detección de objetos, segmentación y rendimiento zero-shot mejorados con gran eficiencia.

En junio de 2024, Microsoft presentó Florence-2, un modelo de lenguaje visual multimodal (VLM) diseñado para abordar una amplia variedad de tareas, como la detección de objetos, la segmentación, la generación de descripciones de imágenes y el anclaje visual. Florence-2 establece un nuevo referente en rendimiento de aprendizaje sin ejemplos, lo que significa que puede realizar tareas sin entrenamiento específico previo, y cuenta con un tamaño de modelo menor que otros modelos de lenguaje visual de última generación.
Es más que otro modelo: la versatilidad y el rendimiento mejorado de Florence-2 pueden tener un impacto significativo en diversos sectores al mejorar la precisión y reducir la necesidad de un entrenamiento exhaustivo. En este artículo, exploraremos las funciones innovadoras de Florence-2, compararemos su rendimiento con el de otros VLM y analizaremos sus posibles aplicaciones.
¿Qué es Florence-2?#
Florence-2 puede abordar una gran variedad de tareas dentro de un único marco unificado. Sus impresionantes capacidades se deben, en parte, a su enorme conjunto de datos de entrenamiento, denominado FLD-5B. FLD-5B incluye 5,4 mil millones de anotaciones en 126 millones de imágenes. Este completo conjunto de datos se creó específicamente para proporcionar a Florence-2 las capacidades necesarias para abordar una amplia variedad de tareas de visión con gran precisión y eficiencia.
Estas son las tareas compatibles con Florence-2:
- Detección de objetos: puede identificar y localizar objetos en imágenes con gran precisión.
- Segmentación: esta tarea consiste en dividir una imagen en segmentos significativos para facilitar su análisis e interpretación.
- Generación de descripciones de imágenes: Florence-2 puede generar descripciones detalladas de imágenes que aportan contexto e información.
- Anclaje visual: el modelo puede asociar frases o palabras concretas de una descripción con las regiones correspondientes de la imagen.
- Rendimiento de aprendizaje sin ejemplos: puede realizar tareas sin entrenamiento específico.

Fig. 1 Comprender el entrenamiento de Florence-2.
El modelo es compatible tanto con tareas basadas en texto como con tareas basadas en regiones. Para las tareas que implican regiones específicas de una imagen, se añaden tokens de ubicación especiales al vocabulario del modelo. Estos tokens ayudan al modelo a comprender distintas formas, como rectángulos alrededor de objetos (representación mediante cuadros), formas de cuatro lados (representación mediante cuadriláteros) y formas con muchos lados (representación mediante polígonos). El modelo se entrena mediante un método denominado pérdida de entropía cruzada, que le ayuda a aprender comparando sus predicciones con las respuestas correctas y ajustando sus parámetros internos en consecuencia.
Creación del conjunto de datos FLD-5B#
El conjunto de datos FLD-5B incluye distintos tipos de anotaciones: descripciones de texto, pares de regiones y texto, y combinaciones de texto, frases y regiones. Se creó mediante un proceso en dos pasos que incluía la recopilación y anotación de datos. Las imágenes procedían de conjuntos de datos populares como ImageNet-22k, Object 365, Open Images, Conceptual Captions y LAION. Las anotaciones del conjunto de datos FLD-5B son principalmente sintéticas, es decir, se generaron automáticamente en lugar de etiquetarse manualmente.

Fig. 2 Creación del conjunto de datos FLD-5B.
Inicialmente, modelos especializados en tareas concretas, como la detección de objetos o la segmentación, crearon estas anotaciones. Después, se utilizó un proceso de filtrado y mejora para garantizar que las anotaciones fueran detalladas y precisas. Tras eliminar el ruido, el conjunto de datos se sometió a un refinamiento iterativo en el que las salidas de Florence-2 se utilizaron para actualizar y mejorar continuamente las anotaciones.
Arquitectura del modelo Florence-2#
La arquitectura del modelo Florence-2 sigue un enfoque de aprendizaje secuencia a secuencia. Esto significa que el modelo procesa una secuencia de entrada (como una imagen con una instrucción de texto) y genera una secuencia de salida (como una descripción o una etiqueta) paso a paso. En el marco de secuencia a secuencia, cada tarea se trata como un problema de traducción: el modelo recibe una imagen de entrada y una instrucción específica de la tarea, y genera la salida correspondiente.

Fig. 3 Arquitectura del modelo de lenguaje visual Florence-2.
En el núcleo de la arquitectura del modelo se encuentra un transformador codificador-decodificador multimodal, que combina un codificador de imágenes y un codificador-decodificador multimodal. El codificador de imágenes, denominado DaViT (transformador de visión eficiente en datos), procesa las imágenes de entrada convirtiéndolas en embeddings de tokens visuales: representaciones compactas de la imagen que capturan información tanto espacial (dónde están las cosas) como semántica (qué son las cosas). A continuación, estos tokens visuales se combinan con embeddings de texto (representaciones del texto), lo que permite al modelo fusionar datos textuales y visuales de forma fluida.
Comparación de Florence-2 con otros VLM#
Florence-2 destaca frente a otros modelos de lenguaje visual por sus impresionantes capacidades de aprendizaje sin ejemplos. A diferencia de modelos como PaliGemma, que dependen de un ajuste fino exhaustivo para adaptarse a distintas tareas, Florence-2 funciona correctamente desde el primer momento. Además, Florence-2 puede competir con modelos más grandes como GPT-4V y Flamingo, que a menudo tienen muchos más parámetros, pero no siempre igualan el rendimiento de Florence-2. Por ejemplo, Florence-2 obtiene mejores resultados sin ejemplos que Kosmos-2, a pesar de que Kosmos-2 tiene más del doble de parámetros.
En las pruebas de referencia, Florence-2 ha mostrado un rendimiento extraordinario en tareas como la generación de descripciones en COCO y la comprensión de expresiones referenciales. Superó a modelos como PolyFormer y UNINEXT en tareas de detección de objetos y segmentación en el conjunto de datos COCO. Es una opción muy competitiva para aplicaciones reales en las que tanto el rendimiento como la eficiencia de los recursos son fundamentales.
Aplicaciones de Florence-2#
Florence-2 puede utilizarse en muchos sectores diferentes, como el entretenimiento, la accesibilidad, la educación, etc. Veamos algunos ejemplos para comprenderlo mejor.
Aplicaciones de la generación de descripciones de imágenes#
Cuando estás en una plataforma de streaming intentando decidir qué ver, es posible que leas el resumen de una película para ayudarte a elegir. ¿Y si la plataforma también pudiera ofrecer una descripción detallada del cartel de la película? Florence-2 puede hacerlo mediante la generación de descripciones de imágenes, que produce texto descriptivo para las imágenes. Florence-2 puede generar descripciones detalladas de carteles de películas, haciendo que las plataformas de streaming sean más inclusivas para las personas con discapacidad visual. Al analizar los elementos visuales de un cartel, como los personajes, el escenario y el texto, Florence-2 puede crear descripciones detalladas que transmiten su contenido y ambiente. La imagen siguiente muestra el nivel de detalle que Florence-2 puede ofrecer en su descripción.

Fig. 4 Ejemplo de una descripción de imagen generada por Florence-2.
Estos son otros ejemplos de situaciones en las que la generación de descripciones de imágenes puede resultar útil:
- Comercio electrónico: la generación de descripciones de imágenes puede proporcionar descripciones detalladas de imágenes de productos, ayudando a los clientes a comprender mejor sus características y detalles.
- Viajes y turismo: puede proporcionar descripciones detalladas de lugares emblemáticos y atracciones en guías y aplicaciones de viajes.
- Educación: la generación de descripciones de imágenes puede etiquetar y describir imágenes y diagramas educativos, facilitando la enseñanza y el aprendizaje.
- Inmobiliario: puede proporcionar descripciones detalladas de imágenes de inmuebles que destaquen sus características y servicios para posibles compradores.
Uso del anclaje visual al cocinar#
Florence-2 también puede utilizarse para enriquecer las experiencias culinarias. Por ejemplo, un libro de cocina en línea podría utilizar Florence-2 para anclar visualmente y etiquetar partes de la imagen de una receta compleja. El anclaje visual resulta útil al vincular partes concretas de la imagen con el texto descriptivo correspondiente. Cada ingrediente y paso puede etiquetarse y explicarse con precisión, lo que facilita que los cocineros aficionados sigan la receta y comprendan el papel de cada componente en el plato.

Fig. 5 Ejemplo de anclaje visual con Florence-2.
OCR basado en regiones para documentos financieros#
El OCR con procesamiento basado en regiones, que se centra en extraer texto de áreas específicas de un documento, puede resultar útil en ámbitos como la contabilidad. Las áreas designadas de los documentos financieros pueden analizarse para extraer automáticamente información importante, como datos de transacciones, números de cuenta y fechas de vencimiento. Al reducir la necesidad de introducir datos manualmente, minimiza los errores y acelera los tiempos de procesamiento. Las instituciones financieras pueden utilizarlo para agilizar tareas como el procesamiento de facturas, la conciliación de recibos y la compensación de cheques, lo que se traduce en transacciones más rápidas y un mejor servicio al cliente.

Fig. 6 Ejemplo de extracción de OCR con regiones mediante Florence-2.
Segmentación basada en regiones en aplicaciones industriales#
La segmentación basada en regiones, que consiste en dividir una imagen en partes significativas para realizar análisis específicos e inspecciones detalladas, puede impulsar aplicaciones industriales que mejoren la precisión y la eficiencia de diversos procesos. Al centrarse en áreas concretas de una imagen, esta tecnología permite inspeccionar y analizar detalladamente componentes y productos. En lo que respecta al control de calidad, puede identificar defectos o incoherencias en los materiales, como grietas o desalineaciones, garantizando que solo los productos de máxima calidad lleguen al mercado.

Fig. 7 Ejemplo de segmentación basada en regiones mediante Florence-2.
También mejora las líneas de montaje automatizadas al guiar brazos robóticos hacia piezas concretas y optimizar la colocación y el ensamblaje de componentes. Del mismo modo, en la gestión de inventario, ayuda a realizar un seguimiento y supervisar el estado y la ubicación de las mercancías, lo que permite una logística más eficiente y reduce los tiempos de inactividad. En general, la segmentación basada en regiones aumenta la precisión y la productividad, lo que se traduce en un ahorro de costes y una mayor calidad de los productos en entornos industriales.
Conclusiones clave#
Estamos empezando a observar una tendencia en la que los modelos de IA son cada vez más ligeros sin dejar de mantener un alto rendimiento. Florence-2 supone un gran avance en el ámbito de los modelos de lenguaje visual. Puede abordar tareas diversas, como la detección de objetos, la segmentación, la generación de descripciones de imágenes y el anclaje visual, con un rendimiento de aprendizaje sin ejemplos impresionante. A pesar de su menor tamaño, Florence-2 es eficiente y multifuncional, lo que lo hace extremadamente útil para aplicaciones en distintos sectores. Modelos como Florence-2 abren nuevas posibilidades y amplían el potencial de las innovaciones en IA.
Descubre más sobre la IA visitando nuestro repositorio de GitHub y uniéndote a nuestra comunidad. Visita nuestras páginas de soluciones para informarte sobre las aplicaciones de la IA en la fabricación y la agricultura. 🚀









