Named Entity Recognition (NER)
Explora el reconocimiento de entidades con nombre (NER) en NLP. Aprende a identificar y clasificar entidades de texto, como nombres y fechas, para obtener información con IA y Ultralytics YOLO26.
El reconocimiento de entidades nombradas (NER) es una subtarea fundamental del procesamiento del lenguaje natural (NLP) que consiste en identificar y clasificar información clave dentro de texto no estructurado. En un flujo de trabajo típico, un modelo de NER analiza un documento para localizar «entidades» —palabras o frases específicas que representan objetos del mundo real— y las asigna a categorías predefinidas, como nombres de personas, organizaciones, ubicaciones, fechas o códigos médicos. Este proceso es esencial para transformar datos sin procesar y no estructurados, como correos electrónicos, reseñas de clientes y artículos de noticias, en formatos estructurados que las máquinas puedan procesar y analizar. Al responder al «quién, qué y dónde» de un texto, el NER permite a los sistemas de inteligencia artificial (AI) extraer automáticamente información relevante de grandes volúmenes de datos.
Cómo funciona el NER#
Los sistemas modernos de NER aprovechan modelos estadísticos avanzados y técnicas de aprendizaje profundo (DL) para comprender el contexto que rodea a una palabra. El proceso comienza con la tokenización, en la que una frase se divide en unidades individuales llamadas tokens. A continuación, arquitecturas sofisticadas, como el Transformer, analizan las relaciones entre estos tokens para determinar su significado según el uso.
Por ejemplo, la palabra «Apple» puede referirse a una fruta o a una empresa tecnológica, dependiendo de la frase. Mediante mecanismos como la autoatención, un modelo de NER distingue que «Apple ha lanzado un teléfono nuevo» se refiere a una organización, mientras que «Me he comido una manzana» se refiere a un objeto genérico. El rendimiento de estos modelos depende en gran medida de la calidad de los datos de entrenamiento y de la precisión de la anotación de datos. En aplicaciones multimodales, el NER suele combinarse con el reconocimiento óptico de caracteres (OCR) para extraer texto de imágenes antes de procesarlo.
Aplicaciones en el mundo real#
El NER es una tecnología fundamental para muchas herramientas de automatización inteligente utilizadas en diversos sectores.
- AI en sanidad: Las instituciones médicas utilizan NER para extraer datos críticos de las historias clínicas electrónicas. Al extraer entidades como síntomas, nombres de medicamentos y dosis de las notas clínicas, los investigadores pueden acelerar el descubrimiento de fármacos y mejorar la atención al paciente.
- Atención al cliente inteligente: Las empresas emplean chatbots equipados con NER para clasificar automáticamente las reclamaciones de los clientes. Si un usuario escribe «La pantalla de mi portátil está rota», el sistema identifica «portátil» como un producto y «pantalla rota» como un defecto, y deriva el ticket al equipo de soporte técnico inmediatamente.
- Recomendación de contenido: Los servicios de streaming y los agregadores de noticias utilizan NER para etiquetar el contenido con entidades relevantes (por ejemplo, actores, géneros y ubicaciones). A continuación, los sistemas de recomendación utilizan estas etiquetas para sugerir nuevas películas o artículos que coincidan con los intereses del usuario.
- Análisis financiero: Las empresas de inversión utilizan NER para analizar a diario miles de informes financieros y artículos de noticias. Al extraer nombres de empresas y valores monetarios, pueden realizar modelos predictivos para prever las tendencias del mercado.
Diferencias entre el NER y conceptos relacionados#
Es útil diferenciar el NER de otras tareas de interpretación para comprender su función específica en un flujo de trabajo de AI.
- Detección de objetos: Mientras que el NER identifica entidades en texto, la detección de objetos identifica entidades en imágenes. Por ejemplo, un modelo visual como YOLO26 detecta coches y peatones en secuencias de vídeo, mientras que el NER detecta «Ford» y «conductor» en informes escritos. Ambas tareas buscan localizar y clasificar elementos de interés dentro de sus respectivas modalidades de datos.
- Análisis de sentimientos: Esta tarea determina el tono emocional (positivo, negativo o neutro) de un texto. El NER extrae qué se está tratando (por ejemplo, «El iPhone 16»), mientras que el análisis de sentimientos determina cómo se siente el usuario al respecto (por ejemplo, «es increíble»).
- Comprensión del lenguaje natural (NLU): NLU es un término general más amplio para la comprensión lectora automática. El NER es un componente específico de NLU que a menudo trabaja junto con la clasificación de intenciones para comprender plenamente el significado de la entrada de un usuario.
- Extracción de palabras clave: A diferencia del NER, que clasifica las palabras en categorías semánticas (por ejemplo, persona o fecha), la extracción de palabras clave simplemente identifica los términos más frecuentes o relevantes de un documento sin comprender su tipo de entidad.
Combinar NER con visión artificial#
La convergencia del texto y la visión es una tendencia creciente en el aprendizaje multimodal. Los modelos como YOLO-World tienden un puente entre ambos ámbitos mediante el uso de indicaciones de texto para guiar la detección de objetos. En este flujo de trabajo, el codificador de texto actúa de forma similar a un sistema de NER, interpretando el significado semántico de los nombres de clase (entidades) proporcionados por el usuario para encontrar los objetos visuales correspondientes.
El siguiente ejemplo en Python muestra cómo utilizar la biblioteca ultralytics para detectar objetos a partir de descripciones de texto personalizadas, vinculando eficazmente las entidades del lenguaje natural con datos visuales.
from ultralytics import YOLOWorld
# Load a YOLO-World model capable of understanding text-based entities
model = YOLOWorld("yolov8s-world.pt")
# Define custom entities to search for in the image
# The model interprets these text strings to identify visual matches
model.set_classes(["red backpack", "person wearing hat", "dog"])
# Run inference on an image to localize these entities
results = model.predict("park_scene.jpg")
# Display the results with bounding boxes around detected entities
results[0].show()Herramientas e implementación#
Los desarrolladores tienen acceso a un sólido ecosistema de herramientas para implementar NER. Bibliotecas populares de código abierto como spaCy y NLTK proporcionan pipelines preentrenados para su uso inmediato. Para aplicaciones a escala empresarial, servicios en la nube como Google Cloud Natural Language ofrecen API gestionadas que escalan según la demanda.
Gestionar el ciclo de vida de estos modelos de AI —ya se utilicen para texto o para visión— requiere operaciones eficientes. La plataforma de Ultralytics simplifica estos procesos de MLOps al ofrecer un entorno unificado para gestionar conjuntos de datos, entrenar modelos e implementar soluciones. Esto garantiza que los proyectos de AI sigan siendo escalables y estén listos para producción, y permite mejorar continuamente modelos como YOLO26 para lograr un rendimiento de vanguardia.









