Named Entity Recognition (NER)
Khám phá Named Entity Recognition (NER) trong NLP. Tìm hiểu cách xác định và phân loại các thực thể trong text như tên và ngày tháng để thu được insight bằng AI và Ultralytics YOLO26.
Nhận dạng thực thể có tên (NER) là một bài toán con cốt lõi của Xử lý ngôn ngữ tự nhiên (NLP), bao gồm việc xác định và phân loại thông tin quan trọng trong văn bản phi cấu trúc. Trong một quy trình điển hình, model NER quét một tài liệu để tìm các "thực thể"—những từ hoặc cụm từ cụ thể đại diện cho các đối tượng trong thế giới thực—và gán chúng vào các danh mục được định nghĩa trước, chẳng hạn như tên người, tổ chức, địa điểm, ngày tháng hoặc mã y tế. Quy trình này rất cần thiết để chuyển đổi dữ liệu phi cấu trúc thô như email, đánh giá của khách hàng và bài báo thành các định dạng có cấu trúc mà máy có thể xử lý và phân tích. Bằng cách trả lời các câu hỏi "ai, cái gì và ở đâu" trong văn bản, NER cho phép các hệ thống Trí tuệ nhân tạo (AI) tự động trích xuất thông tin có ý nghĩa từ khối lượng thông tin khổng lồ.
Cách NER hoạt động#
Các hệ thống NER hiện đại tận dụng những model thống kê tiên tiến và các kỹ thuật Học sâu (DL) để hiểu ngữ cảnh xung quanh một từ. Quy trình bắt đầu bằng tokenization, trong đó một câu được chia thành các đơn vị riêng lẻ gọi là token. Sau đó, các kiến trúc tinh vi như Transformer phân tích mối quan hệ giữa các token này để xác định ý nghĩa của chúng dựa trên cách sử dụng.
Ví dụ, từ "Apple" có thể chỉ một loại trái cây hoặc một công ty công nghệ, tùy thuộc vào câu. Thông qua các cơ chế như self-attention, model NER nhận biết rằng "Apple released a new phone" đề cập đến một Tổ chức, trong khi "I ate an apple" đề cập đến một đối tượng chung. Hiệu suất của các model này phụ thuộc rất nhiều vào dữ liệu huấn luyện chất lượng cao và gán nhãn dữ liệu chính xác. Trong các ứng dụng đa phương thức, NER thường được kết hợp với Nhận dạng ký tự quang học (OCR) để trích xuất văn bản từ hình ảnh trước khi xử lý.
Các ứng dụng trong thực tế#
NER là công nghệ nền tảng cho nhiều công cụ tự động hóa thông minh được sử dụng trong nhiều ngành khác nhau.
- AI trong lĩnh vực chăm sóc sức khỏe: Các cơ sở y tế sử dụng NER để khai thác dữ liệu quan trọng từ hồ sơ sức khỏe điện tử. Bằng cách trích xuất các thực thể như triệu chứng, tên thuốc và liều lượng từ ghi chú lâm sàng, các nhà nghiên cứu có thể đẩy nhanh quá trình khám phá thuốc và cải thiện chăm sóc bệnh nhân.
- Hỗ trợ khách hàng thông minh: Các công ty triển khai chatbot được trang bị NER để tự động phân loại khiếu nại của khách hàng. Nếu người dùng nhắn, "My laptop screen is broken," hệ thống xác định "laptop" là một Sản phẩm và "screen is broken" là một Lỗi, sau đó ngay lập tức chuyển ticket đến đội ngũ hỗ trợ kỹ thuật.
- Đề xuất nội dung: Các dịch vụ phát trực tuyến và trình tổng hợp tin tức sử dụng NER để gắn thẻ nội dung bằng các thực thể liên quan (ví dụ: diễn viên, thể loại, địa điểm). Sau đó, các hệ thống đề xuất sử dụng những thẻ này để gợi ý các bộ phim hoặc bài viết mới phù hợp với mối quan tâm của người dùng.
- Phân tích tài chính: Các công ty đầu tư sử dụng NER để quét hàng nghìn báo cáo tài chính và bài báo mỗi ngày. Bằng cách trích xuất tên công ty và giá trị tiền tệ, họ có thể thực hiện mô hình hóa dự báo để dự đoán xu hướng thị trường.
Phân biệt NER với các khái niệm liên quan#
Việc phân biệt NER với các tác vụ diễn giải khác sẽ giúp làm rõ vai trò cụ thể của công nghệ này trong một pipeline AI.
- Nhận dạng đối tượng: Trong khi NER xác định các thực thể trong văn bản, nhận dạng đối tượng xác định các thực thể trong hình ảnh. Ví dụ, một model thị giác như YOLO26 phát hiện ô tô và người đi bộ trong luồng video, còn NER phát hiện "Ford" và "driver" trong các báo cáo dạng văn bản. Cả hai tác vụ đều nhằm định vị và phân loại các mục cần quan tâm trong những phương thức dữ liệu tương ứng.
- Phân tích cảm xúc: Tác vụ này xác định sắc thái cảm xúc (tích cực, tiêu cực hoặc trung tính) của một văn bản. NER trích xuất nội dung đang được đề cập (ví dụ: "The iPhone 16"), trong khi phân tích cảm xúc xác định cảm nhận của người dùng về nội dung đó (ví dụ: "is amazing").
- Hiểu ngôn ngữ tự nhiên (NLU): NLU là thuật ngữ bao quát hơn về khả năng đọc hiểu của máy. NER là một thành phần cụ thể của NLU, thường hoạt động cùng với phân loại ý định để nắm bắt đầy đủ ý nghĩa trong nội dung đầu vào của người dùng.
- Trích xuất từ khóa: Không giống NER, vốn phân loại các từ vào những danh mục ngữ nghĩa (ví dụ: Người, Ngày tháng), trích xuất từ khóa chỉ xác định các thuật ngữ xuất hiện thường xuyên nhất hoặc có liên quan nhất trong một tài liệu mà không hiểu loại thực thể của chúng.
Kết hợp NER với Thị giác máy tính#
Sự hội tụ giữa văn bản và thị giác là một xu hướng đang phát triển trong Học đa phương thức. Các model như YOLO-World thu hẹp khoảng cách này bằng cách sử dụng prompt văn bản để định hướng quá trình nhận dạng đối tượng. Trong quy trình này, bộ mã hóa văn bản hoạt động tương tự một hệ thống NER, diễn giải ý nghĩa ngữ nghĩa của tên lớp (các thực thể) do người dùng cung cấp để tìm các đối tượng trực quan tương ứng.
Ví dụ Python sau đây minh họa cách sử dụng thư viện ultralytics để phát hiện đối tượng dựa trên các mô tả văn bản tùy chỉnh, qua đó liên kết hiệu quả các thực thể ngôn ngữ tự nhiên với dữ liệu trực quan.
from ultralytics import YOLOWorld
# Load a YOLO-World model capable of understanding text-based entities
model = YOLOWorld("yolov8s-world.pt")
# Define custom entities to search for in the image
# The model interprets these text strings to identify visual matches
model.set_classes(["red backpack", "person wearing hat", "dog"])
# Run inference on an image to localize these entities
results = model.predict("park_scene.jpg")
# Display the results with bounding boxes around detected entities
results[0].show()Công cụ và triển khai#
Các nhà phát triển có thể sử dụng một hệ sinh thái công cụ mạnh mẽ để triển khai NER. Các thư viện nguồn mở phổ biến như spaCy và NLTK cung cấp các pipeline được huấn luyện trước để sử dụng ngay. Đối với các ứng dụng quy mô doanh nghiệp, các dịch vụ đám mây như Google Cloud Natural Language cung cấp các API được quản lý có khả năng mở rộng theo nhu cầu.
Việc quản lý vòng đời của các model AI—dù dành cho văn bản hay thị giác—đòi hỏi hoạt động vận hành hiệu quả. Ultralytics Platform đơn giản hóa các quy trình MLOps này bằng cách cung cấp một môi trường thống nhất để quản lý dataset, huấn luyện model và triển khai giải pháp. Điều này đảm bảo các dự án AI có thể mở rộng và sẵn sàng cho môi trường production, đồng thời hỗ trợ việc liên tục cải thiện các model như YOLO26 để đạt hiệu suất tiên tiến.









