Named Entity Recognition (NER)
Entdecke die Erkennung benannter Entitäten (NER) in der NLP. Erfahre, wie du Textentitäten wie Namen und Datumsangaben identifizierst und klassifizierst, um mit KI und Ultralytics YOLO26 Erkenntnisse zu gewinnen.
Die Named-Entity-Erkennung (NER) ist eine zentrale Teilaufgabe der Verarbeitung natürlicher Sprache (NLP), bei der wichtige Informationen in unstrukturierten Texten identifiziert und klassifiziert werden. In einem typischen Arbeitsablauf durchsucht ein NER-Modell ein Dokument nach „Entitäten“ – bestimmten Wörtern oder Wortgruppen, die reale Objekte darstellen –, und ordnet sie vordefinierten Kategorien wie Personennamen, Organisationen, Orten, Datumsangaben oder medizinischen Codes zu. Dieser Prozess ist entscheidend, um Rohdaten wie E-Mails, Kundenrezensionen und Nachrichtenartikel, also unstrukturierte Daten, in strukturierte Formate umzuwandeln, die Maschinen verarbeiten und analysieren können. Indem NER die Fragen „wer, was und wo“ eines Textes beantwortet, ermöglicht es Systemen der Künstlichen Intelligenz (AI), automatisch aussagekräftige Erkenntnisse aus großen Informationsmengen zu gewinnen.
So funktioniert NER#
Moderne NER-Systeme nutzen fortschrittliche statistische Modelle und Techniken des Deep Learning (DL), um den Kontext eines Wortes zu verstehen. Der Prozess beginnt mit der Tokenisierung, bei der ein Satz in einzelne Einheiten, sogenannte Token, zerlegt wird. Fortschrittliche Architekturen wie der Transformer analysieren anschließend die Beziehungen zwischen diesen Token, um ihre Bedeutung anhand ihrer Verwendung zu bestimmen.
Beispielsweise kann sich das Wort „Apple“ je nach Satz auf eine Frucht oder ein Technologieunternehmen beziehen. Mithilfe von Mechanismen wie der Self-Attention erkennt ein NER-Modell, dass sich „Apple released a new phone“ auf eine Organisation bezieht, während „I ate an apple“ ein allgemeines Objekt bezeichnet. Die Leistung dieser Modelle hängt stark von hochwertigen Trainingsdaten und einer präzisen Datenannotation ab. In multimodalen Anwendungen wird NER häufig mit der optischen Zeichenerkennung (OCR) kombiniert, um Text aus Bildern zu extrahieren, bevor er verarbeitet wird.
Anwendungen in der Praxis#
NER ist eine grundlegende Technologie für viele intelligente Automatisierungswerkzeuge, die in verschiedensten Branchen eingesetzt werden.
- AI im Gesundheitswesen: Medizinische Einrichtungen nutzen NER, um elektronische Gesundheitsakten nach wichtigen Daten zu durchsuchen. Durch das Extrahieren von Entitäten wie Symptomen, Arzneimittelnamen und Dosierungen aus klinischen Notizen können Forschende die Arzneimittelentwicklung beschleunigen und die Patientenversorgung verbessern.
- Intelligenter Kundensupport: Unternehmen setzen mit NER ausgestattete Chatbots ein, um Kundenbeschwerden automatisch zu klassifizieren. Wenn ein Benutzer die Nachricht „My laptop screen is broken“ sendet, identifiziert das System „laptop“ als Produkt und „screen is broken“ als Defekt und leitet das Ticket sofort an das technische Supportteam weiter.
- Inhaltsempfehlungen: Streamingdienste und Nachrichtenaggregatoren verwenden NER, um Inhalte mit relevanten Entitäten zu versehen (z. B. Schauspieler, Genres und Orte). Empfehlungssysteme nutzen diese Tags anschließend, um neue Filme oder Artikel vorzuschlagen, die den Interessen eines Benutzers entsprechen.
- Finanzanalyse: Investmentgesellschaften setzen NER ein, um täglich Tausende von Finanzberichten und Nachrichtenartikeln zu durchsuchen. Durch das Extrahieren von Unternehmensnamen und Geldbeträgen können sie prädiktive Modelle erstellen, um Markttrends vorherzusagen.
Abgrenzung von NER gegenüber verwandten Konzepten#
Um die spezifische Rolle von NER in einer AI-Pipeline zu verstehen, ist es hilfreich, NER von anderen Interpretationsaufgaben zu unterscheiden.
- Objekterkennung: Während NER Entitäten in Texten identifiziert, erkennt die Objekterkennung Entitäten in Bildern. Beispielsweise erkennt ein visuelles Modell wie YOLO26 Autos und Fußgänger in Videostreams, während NER „Ford“ und „driver“ in schriftlichen Berichten erkennt. Beide Aufgaben zielen darauf ab, interessante Elemente innerhalb ihrer jeweiligen Datenmodalität zu lokalisieren und zu klassifizieren.
- Sentimentanalyse: Bei dieser Aufgabe wird die emotionale Tonalität eines Textes bestimmt (positiv, negativ oder neutral). NER extrahiert, worüber gesprochen wird (z. B. „The iPhone 16“), während die Sentimentanalyse bestimmt, wie der Benutzer dies empfindet (z. B. „is amazing“).
- Verstehen natürlicher Sprache (NLU): NLU ist ein übergeordneter Sammelbegriff für das maschinelle Leseverständnis. NER ist eine spezifische Komponente von NLU, die häufig gemeinsam mit der Absichtsklassifizierung eingesetzt wird, um die Bedeutung einer Benutzereingabe vollständig zu erfassen.
- Schlüsselwortextraktion: Im Gegensatz zu NER, das Wörter semantischen Kategorien (z. B. Person, Datum) zuordnet, identifiziert die Schlüsselwortextraktion lediglich die häufigsten oder relevantesten Begriffe in einem Dokument, ohne deren Entitätstyp zu verstehen.
NER mit Computer Vision kombinieren#
Die Verbindung von Text und visuellen Daten ist ein wachsender Trend beim multimodalen Lernen. Modelle wie YOLO-World schließen diese Lücke, indem sie Text-Prompts zur Steuerung der Objekterkennung verwenden. In diesem Arbeitsablauf fungiert der Text-Encoder ähnlich wie ein NER-System: Er interpretiert die semantische Bedeutung der vom Benutzer vorgegebenen Klassennamen (Entitäten), um die entsprechenden visuellen Objekte zu finden.
Das folgende Python-Beispiel zeigt, wie du die Bibliothek ultralytics verwenden kannst, um Objekte anhand benutzerdefinierter Textbeschreibungen zu erkennen und so Entitäten aus natürlicher Sprache mit visuellen Daten zu verknüpfen.
from ultralytics import YOLOWorld
# Load a YOLO-World model capable of understanding text-based entities
model = YOLOWorld("yolov8s-world.pt")
# Define custom entities to search for in the image
# The model interprets these text strings to identify visual matches
model.set_classes(["red backpack", "person wearing hat", "dog"])
# Run inference on an image to localize these entities
results = model.predict("park_scene.jpg")
# Display the results with bounding boxes around detected entities
results[0].show()Werkzeuge und Implementierung#
Entwicklern steht ein robustes Ökosystem von Werkzeugen zur Implementierung von NER zur Verfügung. Beliebte Open-Source-Bibliotheken wie spaCy und NLTK stellen vortrainierte Pipelines zur sofortigen Nutzung bereit. Für Anwendungen im Unternehmensmaßstab bieten Cloud-Dienste wie Google Cloud Natural Language verwaltete APIs, die sich an den Bedarf anpassen.
Die Verwaltung des Lebenszyklus dieser AI-Modelle – unabhängig davon, ob sie für Text oder visuelle Daten eingesetzt werden – erfordert effiziente Abläufe. Die Ultralytics Platform vereinfacht diese MLOps-Prozesse und bietet eine einheitliche Umgebung zur Verwaltung von Datensätzen, zum Trainieren von Modellen und zum Bereitstellen von Lösungen. Dadurch bleiben AI-Projekte skalierbar und produktionsbereit, während Modelle wie YOLO26 kontinuierlich verbessert werden können, um Spitzenleistung zu erzielen.









