Ultralytics YOLO27:
Sự kiện

Thúc đẩy các dự án CV bằng công cụ nguồn mở của Hugging Face

Hãy cùng xem lại bài keynote từ YOLO Vision 2024, tập trung khám phá cách các công cụ nguồn mở của Hugging Face đang thúc đẩy phát triển AI.

ABAbirami Vina12 min read
Thúc đẩy các dự án CV bằng công cụ nguồn mở của Hugging Face

Lựa chọn đúng các thuật toán chỉ là một phần trong việc xây dựng các giải pháp computer vision tạo ra tác động thực tế. Các kỹ sư AI thường làm việc với những dataset lớn, fine-tune model cho các tác vụ cụ thể và tối ưu hệ thống AI để đạt hiệu suất trong thế giới thực. Khi các ứng dụng AI được áp dụng nhanh chóng hơn, nhu cầu về những công cụ giúp đơn giản hóa các quy trình này cũng ngày càng tăng.

Tại YOLO Vision 2024 (YV24), sự kiện hybrid thường niên do Ultralytics tổ chức, các chuyên gia AI và những người đam mê công nghệ đã cùng nhau khám phá những đổi mới mới nhất trong computer vision. Sự kiện đã khơi dậy các cuộc thảo luận về nhiều chủ đề, chẳng hạn như các phương pháp tăng tốc quá trình phát triển ứng dụng AI.

Một điểm nhấn quan trọng của sự kiện là bài keynote về Hugging Face, một nền tảng AI mã nguồn mở giúp tinh gọn quá trình training, tối ưu hóa và triển khai model. Pavel Iakubovskii, Kỹ sư Machine Learning tại Hugging Face, đã chia sẻ cách các công cụ của nền tảng này cải thiện workflow cho những tác vụ computer vision như phát hiện đối tượng trong ảnh, phân loại ảnh thành các nhóm khác nhau và đưa ra dự đoán mà không cần training trước trên các ví dụ cụ thể (zero-shot learning).

Hugging Face Hub lưu trữ và cung cấp quyền truy cập vào nhiều model computer vision AI khác nhau, chẳng hạn như Ultralytics YOLO11. Trong bài viết này, chúng ta sẽ tổng hợp những điểm chính từ bài nói chuyện của Pavel và tìm hiểu cách các developer có thể sử dụng các công cụ mã nguồn mở của Hugging Face để nhanh chóng xây dựng và triển khai model AI.

Pavel trên sân khấu tại YV24

Hình 1. Pavel trên sân khấu tại YV24.

Hugging Face Hub hỗ trợ phát triển AI nhanh hơn#

Pavel bắt đầu bài nói chuyện bằng việc giới thiệu Hugging Face là một nền tảng AI mã nguồn mở cung cấp các model đã được pre-train cho nhiều ứng dụng khác nhau. Các model này được thiết kế cho nhiều nhánh AI, bao gồm xử lý ngôn ngữ tự nhiên (NLP), computer vision và AI đa phương thức, cho phép hệ thống xử lý nhiều loại dữ liệu khác nhau như văn bản, hình ảnh và âm thanh.

Pavel cho biết Hugging Face Hub hiện đã lưu trữ hơn 1 triệu model và developer có thể dễ dàng tìm thấy các model phù hợp với dự án cụ thể của mình. Hugging Face hướng đến việc đơn giản hóa quá trình phát triển AI bằng cách cung cấp các công cụ cho training, fine-tuning và triển khai model. Khi developer có thể thử nghiệm nhiều model khác nhau, quá trình tích hợp AI vào các ứng dụng thực tế sẽ trở nên đơn giản hơn.

Mặc dù ban đầu được biết đến với NLP, Hugging Face sau đó đã mở rộng sang computer vision và AI đa phương thức, cho phép developer giải quyết nhiều loại tác vụ AI hơn. Nền tảng này cũng có một cộng đồng năng động, nơi developer có thể cộng tác, chia sẻ kiến thức và nhận hỗ trợ thông qua forum, Discord và GitHub.

Khám phá các model Hugging Face cho ứng dụng computer vision#

Đi sâu hơn vào chi tiết, Pavel giải thích cách các công cụ của Hugging Face giúp xây dựng ứng dụng computer vision dễ dàng hơn. Developer có thể sử dụng chúng cho các tác vụ như phân loại ảnh, phát hiện đối tượng và các ứng dụng vision-language.

Ông cũng chỉ ra rằng nhiều tác vụ computer vision có thể được xử lý bằng các model đã được pre-train có sẵn trên Hugging Face Hub, giúp tiết kiệm thời gian do giảm nhu cầu training từ đầu. Trên thực tế, Hugging Face cung cấp hơn 13.000 model đã được pre-train cho các tác vụ phân loại ảnh, bao gồm phân loại thực phẩm, phân loại thú cưng và phát hiện cảm xúc.

Nhấn mạnh khả năng tiếp cận của các model này, ông nói: "Có lẽ bạn thậm chí không cần train model cho dự án của mình - bạn có thể tìm thấy một model trên Hub đã được một thành viên trong cộng đồng training sẵn."

Các model Hugging Face cho phát hiện đối tượng#

Đưa ra một ví dụ khác, Pavel giải thích chi tiết cách Hugging Face có thể hỗ trợ phát hiện đối tượng, một chức năng quan trọng trong computer vision được sử dụng để xác định và định vị đối tượng trong ảnh. Ngay cả khi dữ liệu đã gắn nhãn bị hạn chế, các model đã được pre-train có sẵn trên Hugging Face Hub vẫn có thể giúp việc phát hiện đối tượng trở nên hiệu quả hơn.

Ông cũng giới thiệu nhanh một số model được xây dựng cho tác vụ này mà bạn có thể tìm thấy trên Hugging Face:

  • Các model phát hiện đối tượng theo thời gian thực: Đối với những môi trường năng động, nơi tốc độ đóng vai trò then chốt, các model như Detection Transformer (DETR) cung cấp khả năng phát hiện đối tượng theo thời gian thực. DETR được training trên dataset COCO và được thiết kế để xử lý hiệu quả các đặc trưng đa tỷ lệ, phù hợp với những ứng dụng yêu cầu phản hồi nhanh.
  • Các model vision-language: Các model này kết hợp xử lý hình ảnh và văn bản, giúp hệ thống AI có thể đối chiếu hình ảnh với mô tả hoặc nhận diện các đối tượng nằm ngoài dữ liệu training. Các ví dụ bao gồm CLIP và SigLIP, giúp cải thiện tìm kiếm hình ảnh bằng cách liên kết văn bản với hình ảnh và cho phép các giải pháp AI xác định đối tượng mới thông qua việc hiểu ngữ cảnh của chúng.
  • Các model phát hiện đối tượng zero-shot: Chúng có thể xác định những đối tượng chưa từng thấy bằng cách hiểu mối quan hệ giữa hình ảnh và văn bản. Các ví dụ bao gồm OwlVit, GroundingDINO và OmDet, sử dụng zero-shot learning để phát hiện đối tượng mới mà không cần dữ liệu training đã gắn nhãn.

Cách sử dụng các model Hugging Face#

Sau đó, Pavel chuyển sang hướng dẫn thực hành với các model Hugging Face, giải thích ba cách developer có thể tận dụng chúng: khám phá model, nhanh chóng kiểm thử model và tùy chỉnh chúng sâu hơn.

Ông trình diễn cách developer có thể duyệt trực tiếp các model trên Hugging Face Hub mà không cần viết code, giúp dễ dàng kiểm thử model ngay lập tức thông qua một interface tương tác. Pavel nói thêm: "Bạn có thể thử mà không cần viết dù chỉ một dòng code hoặc tải model xuống máy tính." Vì một số model có kích thước lớn, việc chạy chúng trên Hub giúp tránh các hạn chế về dung lượng lưu trữ và khả năng xử lý.

Cách sử dụng các model Hugging Face

Hình 2. Cách sử dụng các model Hugging Face.

Ngoài ra, Hugging Face Inference API cho phép developer chạy các model AI bằng những lệnh gọi API đơn giản. Đây là lựa chọn phù hợp để kiểm thử nhanh, xây dựng dự án proof-of-concept và rapid prototyping mà không cần thiết lập phức tạp.

Đối với các trường hợp sử dụng nâng cao hơn, developer có thể sử dụng framework Hugging Face Transformers, một công cụ mã nguồn mở cung cấp các model đã được pre-train cho các tác vụ văn bản, thị giác và âm thanh, đồng thời hỗ trợ cả PyTorch và TensorFlow. Pavel giải thích rằng chỉ với hai dòng code, developer có thể lấy một model từ Hugging Face Hub và liên kết model đó với một công cụ preprocessing, chẳng hạn như image processor, để phân tích dữ liệu hình ảnh cho các ứng dụng Vision AI.

Tối ưu workflow AI với Hugging Face#

Tiếp theo, Pavel giải thích cách Hugging Face có thể tinh gọn workflow AI. Một chủ đề quan trọng được ông đề cập là tối ưu cơ chế attention trong Transformers, một tính năng cốt lõi của các model deep learning giúp model tập trung vào những phần liên quan nhất của dữ liệu đầu vào. Điều này cải thiện độ chính xác của các tác vụ liên quan đến xử lý ngôn ngữ và computer vision. Tuy nhiên, cơ chế này có thể tiêu tốn nhiều tài nguyên.

Tối ưu cơ chế attention có thể giảm đáng kể mức sử dụng bộ nhớ đồng thời cải thiện tốc độ. Pavel chỉ ra rằng: "Ví dụ, bằng cách chuyển sang một implementation attention hiệu quả hơn, bạn có thể đạt hiệu suất nhanh hơn tới 1,8 lần."

Hugging Face cung cấp hỗ trợ tích hợp cho các implementation attention hiệu quả hơn trong framework Transformers. Developer có thể bật những tối ưu hóa này bằng cách chỉ định một implementation attention thay thế khi load model.

Optimum và Torch Compile#

Ông cũng đề cập đến quantization, một kỹ thuật làm giảm kích thước model AI bằng cách giảm độ chính xác của các giá trị số mà model sử dụng mà không ảnh hưởng quá nhiều đến hiệu suất. Kỹ thuật này giúp model sử dụng ít bộ nhớ hơn và chạy nhanh hơn, khiến chúng phù hợp hơn với các thiết bị có năng lực xử lý hạn chế như smartphone và hệ thống nhúng.

Để tiếp tục cải thiện hiệu quả, Pavel giới thiệu thư viện Hugging Face Optimum, một bộ công cụ được thiết kế để tối ưu hóa và triển khai model. Chỉ với vài dòng code, developer có thể áp dụng các kỹ thuật quantization và chuyển đổi model sang những format hiệu quả như ONNX (Trao đổi Mạng Nơ-ron Mở), cho phép model chạy mượt mà trên nhiều loại phần cứng khác nhau, bao gồm cloud server và edge device.

Pavel trình bày về thư viện Optimum và các tính năng của thư viện

Hình 3. Pavel trình bày về thư viện Optimum và các tính năng của thư viện.

Cuối cùng, Pavel đề cập đến lợi ích của Torch Compile, một tính năng trong PyTorch giúp tối ưu cách model AI xử lý dữ liệu, khiến model chạy nhanh hơn và hiệu quả hơn. Hugging Face tích hợp Torch Compile trong các thư viện Transformers và Optimum, cho phép developer tận dụng những cải thiện về hiệu suất này với rất ít thay đổi trong code.

Bằng cách tối ưu cấu trúc tính toán của model, Torch Compile có thể tăng tốc thời gian inference và nâng tốc độ khung hình từ 29 lên 150 khung hình mỗi giây mà không ảnh hưởng đến độ chính xác hoặc chất lượng.

Triển khai model bằng các công cụ Hugging Face#

Tiếp tục, Pavel đề cập ngắn gọn đến cách developer có thể mở rộng và triển khai các model Vision AI bằng công cụ Hugging Face sau khi chọn đúng model và phương pháp phát triển phù hợp nhất.

Chẳng hạn, developer có thể triển khai các ứng dụng AI tương tác bằng Gradio và Streamlit. Gradio cho phép developer tạo interface dựa trên web cho các model machine learning, trong khi Streamlit hỗ trợ xây dựng các ứng dụng dữ liệu tương tác bằng những script Python đơn giản.

Pavel cũng chỉ ra rằng: “Bạn không cần bắt đầu viết mọi thứ từ đầu,” khi đề cập đến các guide, notebook training và script ví dụ do Hugging Face cung cấp. Những tài nguyên này giúp developer nhanh chóng bắt đầu mà không phải tự xây dựng mọi thứ từ đầu.

Pavel thảo luận về các khả năng của Hugging Face tại YV24

Hình 4. Pavel thảo luận về các khả năng của Hugging Face tại YV24.

Lợi ích của Hugging Face Hub#

Khép lại bài keynote, Pavel tổng kết những lợi thế của việc sử dụng Hugging Face Hub. Ông nhấn mạnh cách nền tảng này đơn giản hóa việc quản lý model và cộng tác. Ông cũng chú ý đến sự sẵn có của các guide, notebook và tutorial, giúp cả người mới bắt đầu lẫn chuyên gia hiểu và triển khai các model AI.

"Trên Hub đã có rất nhiều space thú vị. Bạn có thể tìm những space tương tự, clone code được chia sẻ, sửa đổi vài dòng, thay model bằng model của riêng mình rồi push trở lại," ông giải thích, khuyến khích developer tận dụng tính linh hoạt của nền tảng.

Những điểm chính#

Trong bài nói chuyện tại YV24, Pavel chia sẻ cách Hugging Face cung cấp các công cụ hỗ trợ training, tối ưu hóa và triển khai model AI. Ví dụ, những đổi mới như Transformers, Optimum và Torch Compile có thể giúp developer nâng cao hiệu suất model.

Khi các model AI trở nên hiệu quả hơn, những tiến bộ trong quantization và triển khai edge đang giúp việc chạy chúng trên các thiết bị có tài nguyên hạn chế trở nên dễ dàng hơn. Những cải tiến này, kết hợp với các công cụ như Hugging Face và các model computer vision tiên tiến như Ultralytics YOLO11, là yếu tố then chốt để xây dựng các ứng dụng Vision AI có khả năng mở rộng và hiệu suất cao.

Hãy tham gia cộng đồng đang phát triển của chúng tôi! Khám phá repository GitHub để tìm hiểu về AI và xem giấy phép YOLO để bắt đầu các dự án Vision AI của bạn. Bạn quan tâm đến những đổi mới như computer vision trong y tế hoặc computer vision trong nông nghiệp? Hãy truy cập các trang giải pháp của chúng tôi để khám phá thêm!

Explore solutions

Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning