Tìm hiểu hậu trường của Vision AI trong phát trực tuyến
Khám phá cách thị giác máy tính nâng cao các nền tảng phát trực tuyến với các đề xuất được cá nhân hóa và phân tích nội dung theo thời gian thực nhằm mang lại trải nghiệm người dùng tốt hơn.

Bạn đã bao giờ tự hỏi làm thế nào các nền tảng phát trực tuyến giúp việc xem các chương trình yêu thích trở nên dễ dàng như vậy chưa? Chưa lâu trước đây, entertainment rất khác biệt. Lịch phát sóng TV được cố định và người xem thường xem những gì đang phát sóng. Các dịch vụ phát trực tuyến đã thay đổi mô hình này. Các khảo sát cho thấy thị trường global video streaming đạt định giá 106,83 tỷ USD vào năm 2023 và dự kiến sẽ đạt 865,85 tỷ USD vào năm 2034.
Artificial intelligence (AI) đóng vai trò then chốt trong sự tiến hóa này. Cụ thể, chúng ta đang chứng kiến sự gia tăng của các đổi mới về computer vision trong lĩnh vực này. Vision AI cho phép các nền tảng phát trực tuyến hiểu và diễn giải nội dung video bằng cách phân tích các khung hình và nhận diện các mẫu.
Bằng cách xử lý visual data, computer vision giúp các nền tảng tạo ra các đề xuất thông minh hơn, cải thiện việc tổ chức nội dung và thậm chí nâng cao các tính năng tương tác. Trong bài viết này, chúng ta sẽ khám phá cách computer vision giúp các nền tảng phát trực tuyến cải thiện việc phân phối nội dung, tinh chỉnh mức độ tương tác của người dùng và đơn giản hóa việc khám phá nội dung. Hãy cùng bắt đầu nhé!

Fig 1. Thị trường phát trực tuyến video toàn cầu.
Khám phá thị giác máy tính và các nền tảng phát trực tuyến#
Khi nói đến các nền tảng phát trực tuyến, computer vision có thể giúp phân tách video thành các khung hình riêng lẻ và phân tích chúng bằng các model như Ultralytics YOLO11. YOLO11 có thể được huấn luyện tùy chỉnh trên các tập dữ liệu lớn gồm các ví dụ được gán nhãn. Các ví dụ được gán nhãn là hình ảnh hoặc khung hình video được đính kèm chi tiết như các đối tượng chúng chứa, các hành động đang diễn ra hoặc loại bối cảnh. Điều này giúp model học cách nhận diện các mẫu tương tự. Các model này có thể phát hiện đối tượng, classify scenes và nhận diện các mẫu trong thời gian thực, cung cấp những thông tin chi tiết có giá trị về nội dung.
Để hiểu rõ hơn cách thức hoạt động này, hãy xem qua một số ví dụ về cách thị giác máy tính được áp dụng trong các nền tảng phát trực tuyến nhằm tối ưu hóa trải nghiệm người dùng và giúp nội dung dễ tiếp cận hơn.
Nhận dạng cảnh để đưa ra các đề xuất được cá nhân hóa#
Nhận diện bối cảnh là một computer vision technique phân loại hình ảnh hoặc khung hình video dựa trên nội dung trực quan và chủ đề của chúng. Có thể coi đây là một hình thức phân loại hình ảnh chuyên biệt, trong đó trọng tâm là xác định bối cảnh tổng thể hoặc bầu không khí của một cảnh thay vì các đối tượng riêng lẻ.
Ví dụ, một hệ thống nhận dạng cảnh có thể nhóm các cảnh thành các danh mục như "phòng ngủ phụ", "lối đi trong rừng" hoặc "bờ biển đá" bằng cách phân tích các đặc điểm như màu sắc, kết cấu, ánh sáng và đối tượng. Nhận dạng cảnh cho phép các nền tảng phát trực tuyến gắn thẻ và tổ chức nội dung một cách hiệu quả.

Fig 2. Phân loại cảnh sử dụng AI.
Nó đóng vai trò cốt lõi trong personalized recommendations. Nếu người dùng thường xuyên xem nội dung có bối cảnh ngoài trời yên tĩnh như "bờ biển đầy nắng" hoặc nội thất hợp thời trang như "phòng bếp phong cách", nền tảng có thể đề xuất các chương trình hoặc phim có hình ảnh tương tự. Nhận diện bối cảnh giúp đơn giản hóa việc khám phá nội dung và mang đến cho người dùng các đề xuất phù hợp với sở thích xem của họ.
Tạo hình ảnh và hình thu nhỏ (thumbnail)#
Image and thumbnail generation là quá trình tạo các bản xem trước trực quan cho video nhằm thu hút người xem và làm nổi bật các khoảnh khắc quan trọng. AI và computer vision có thể tự động hóa quá trình này để đảm bảo thumbnail mang tính liên quan và bắt mắt.
Quy trình này hoạt động như sau:
- Phân tích khung hình: Hệ thống thị giác máy tính có thể bắt đầu bằng việc quét hàng ngàn khung hình video để xác định những khoảnh khắc nổi bật. Đó có thể là biểu cảm cảm xúc, các hành động chính hoặc các cảnh ấn tượng về mặt hình ảnh đại diện tốt nhất cho nội dung video.
- Phân tích chuyển động: Sau khi các khung hình tiềm năng được chọn, AI thị giác có thể được sử dụng để kiểm tra xem chúng có sắc nét và không bị mờ hay không, giúp tăng chất lượng hình ảnh tổng thể của hình thu nhỏ.
- Object Detection và Phân tích cảnh: Bằng cách sử dụng các model như YOLO11 (hỗ trợ các tác vụ computer vision như phát hiện đối tượng và phân đoạn cá thể), hệ thống có thể phát hiện các yếu tố quan trọng trong khung hình, chẳng hạn như đối tượng, nhân vật hoặc bối cảnh. Bước này tái xác nhận rằng thumbnail phản ánh chính xác bản chất của video.
- Tinh chỉnh hình ảnh: Các khung hình được chọn sau đó sẽ được tinh chỉnh bằng cách xem xét các yếu tố như góc camera, ánh sáng và bố cục.
- Cá nhân hóa: Cuối cùng, các thuật toán machine learning có thể được sử dụng để cá nhân hóa thumbnail dựa trên sở thích và lịch sử xem của người dùng. Làm như vậy sẽ điều chỉnh hình ảnh phù hợp với thị hiếu cá nhân, giúp chúng có nhiều khả năng thu hút sự chú ý và thúc đẩy tương tác hơn.
Một ví dụ điển hình về ứng dụng thực tế tương tự là Netflix’s use of computer vision để tự động tạo thumbnail. Bằng cách phân tích các khung hình để phát hiện cảm xúc, bối cảnh và chi tiết điện ảnh, Netflix tạo ra các thumbnail cộng hưởng với sở thích của từng người xem. Ví dụ, những người dùng thích phim hài lãng mạn có thể thấy thumbnail làm nổi bật khoảnh khắc vui tươi, trong khi những người hâm mộ phim hành động có thể được giới thiệu một cảnh quay căng thẳng, năng lượng cao.

Hình 3. Hình thu nhỏ của chương trình truyền hình có thể được tùy chỉnh để phù hợp với sở thích của người xem.
Xem trước nội dung tự động#
Khi bạn cuộn qua một nền tảng phát trực tuyến, các đoạn xem trước ngắn và eye-catching previews mà bạn thấy không phải là ngẫu nhiên. Chúng được tạo ra một cách cẩn thận bằng các công nghệ như computer vision để thu hút sự chú ý và làm nổi bật những khoảnh khắc hấp dẫn nhất của video. Khi những khoảnh khắc đẹp nhất được chọn, chúng sẽ được ghép lại với nhau thành một bản xem trước mượt mà, thu hút.
Quy trình đằng sau việc chọn những khoảnh khắc đó bao gồm một số bước chính:
- Phân đoạn cảnh: Video được chia thành các phần nhỏ hơn dựa trên các chuyển đổi tự nhiên, chẳng hạn như thay đổi về ánh sáng, góc camera hoặc hình ảnh.
- Phát hiện chuyển động: Những khoảnh khắc năng động, đầy hành động được xác định để đảm bảo bản xem trước thu hút sự chú ý.
- Model nổi bật (Saliency models): Các đặc điểm hình ảnh như màu sắc, độ sáng và độ tương phản được phân tích để xác định các phần bắt mắt nhất của một cảnh.
- Facial Expression Analysis: Những khoảnh khắc có biểu cảm cảm xúc mạnh mẽ được chọn để tạo sự kết nối sâu sắc hơn với người xem.
Phân loại và gắn thẻ nội dung#
Khả năng duyệt movies theo thể loại, tâm trạng hoặc các chủ đề cụ thể phụ thuộc vào việc phân loại và gán nhãn nội dung chính xác. Các nền tảng phát trực tuyến phổ biến sử dụng computer vision để tự động hóa quy trình này bằng cách phân tích video để tìm các đối tượng, hành động, bối cảnh hoặc cảm xúc, sau đó gán các nhãn có liên quan. Điều này giúp tổ chức các thư viện phương tiện lớn và làm cho các đề xuất cá nhân hóa trở nên chính xác hơn bằng cách khớp nội dung với sở thích của người xem.
Các kỹ thuật Vision AI như phân đoạn cảnh, phát hiện đối tượng và activity recognition có thể được sử dụng để gán nhãn nội dung hiệu quả. Bằng cách xác định các yếu tố chính như đối tượng, tông màu cảm xúc và hành động, chúng tạo ra siêu dữ liệu chi tiết cho từng tựa đề. Siêu dữ liệu này sau đó có thể được phân tích bằng machine learning để tạo ra các danh mục giúp người dùng dễ dàng tìm thấy những gì họ đang tìm kiếm hơn và cải thiện trải nghiệm duyệt web tổng thể.

Hình 4. Một ví dụ về phân loại nội dung tự động cho các đề xuất phát trực tuyến được cá nhân hóa.
Lợi ích và thách thức của các nền tảng phát trực tuyến hỗ trợ AI#
Thị giác máy tính đang cải thiện các nền tảng phát trực tuyến với các tính năng sáng tạo giúp nâng cao trải nghiệm người dùng. Dưới đây là một số lợi ích độc đáo cần xem xét:
- Chất lượng phát trực tuyến thích ứng: Thị giác máy tính có thể phân tích các cảnh video để phát hiện những khoảnh khắc chuyển động cao hoặc chi tiết cần chất lượng cao hơn. Những thông tin chi tiết này sau đó có thể được sử dụng để điều chỉnh chất lượng phát trực tuyến cho phù hợp với thiết bị và tốc độ internet của người dùng.
- Giám sát hành vi thời gian thực: AI có thể được sử dụng để giám sát các luồng trực tiếp nhằm phát hiện vi phạm bản quyền trong thời gian thực. Nó cũng có thể xác định các hành động trái phép như thêm lớp phủ (ví dụ: logo hoặc quảng cáo) hoặc phát lại luồng sang các nền tảng khác.
- Phân phối nội dung tiết kiệm năng lượng: các thông tin chi tiết từ vision AI có thể tối ưu hóa việc phân phối nội dung bằng cách phân tích nhu cầu của người dùng và các mẫu xem. Việc lưu đệm nội dung phổ biến cục bộ và điều chỉnh chất lượng video giúp giảm việc sử dụng băng thông và tiêu thụ năng lượng, làm cho việc phát streaming trở nên sustainable hơn.
Mặc dù có nhiều ưu điểm, vẫn có một số hạn chế cần lưu ý khi triển khai các cải tiến này:
-
High Computational Demands: Các thuật toán computer vision yêu cầu năng lực tính toán lớn để xử lý và phân tích nội dung video, và điều này có thể dẫn đến tăng chi phí và mức tiêu thụ năng lượng.
-
Data Privacy Concerns: Vì computer vision dựa vào các tập dữ liệu lớn về các tương tác và nội dung của người dùng, nó có thể làm dấy lên những lo ngại về quyền riêng tư và bảo mật dữ liệu.
-
Data Bias: Các model computer vision có thể phản ánh các sai lệch trong dữ liệu huấn luyện của chúng. Điều này có thể khiến chúng ưu tiên một số loại nội dung nhất định và làm giảm sự đa dạng trong các đề xuất.
Tương lai của AI trong các nền tảng phát trực tuyến#
Các đổi mới như edge computing và công nghệ 3D đang góp phần định hình tương lai trải nghiệm giải trí của chúng ta. Edge computing có thể được sử dụng để xử lý video gần hơn với nơi chúng được phát trực tuyến. Nó reduces delays và tiết kiệm băng thông, điều này đặc biệt quan trọng đối với phát trực tuyến trực tiếp và nội dung tương tác. Thời gian phản hồi nhanh hơn có nghĩa là trải nghiệm mượt mà và hấp dẫn hơn cho người xem.
Đồng thời, công nghệ 3D đang bổ sung thêm chiều sâu và tính chân thực cho các chương trình, phim ảnh và tính năng tương tác. Những tiến bộ này cũng mở ra cánh cửa cho các khả năng mới như augmented reality (AR) và thực tế ảo (VR). Với các thiết bị như kính VR, người xem có thể bước vào các môi trường hoàn toàn đắm chìm. Ranh giới giữa thế giới kỹ thuật số và thế giới thực có thể được làm mờ để tạo ra một cấp độ tương tác hoàn toàn mới.

Fig 5. Định hình lại việc phát trực tuyến với các trải nghiệm tương tác điều khiển bằng VR.
Các điểm chính cần lưu ý#
Thị giác máy tính đang định nghĩa lại các nền tảng phát trực tuyến bằng cách làm cho việc phân tích video trở nên thông minh hơn, phân loại nội dung nhanh hơn và đề xuất được cá nhân hóa hơn. Với các model như Ultralytics YOLO11, các nền tảng có thể phát hiện đối tượng và phân loại cảnh trong thời gian thực. Điều này giúp việc gắn thẻ nội dung trở nên dễ dàng hơn và cải thiện cách các chương trình và bộ phim được gợi ý.
Các nền tảng phát trực tuyến được tích hợp với AI thị giác mang đến những trải nghiệm hấp dẫn hơn cho người xem đồng thời đảm bảo các hoạt động nền tảng mượt mà và hiệu quả hơn. Khi công nghệ tiến bộ, các dịch vụ phát trực tuyến có khả năng sẽ trở nên tương tác nhiều hơn, cung cấp những trải nghiệm giải trí phong phú và nhập vai hơn.
Bạn tò mò về AI? Hãy truy cập GitHub repository của chúng tôi để khám phá thêm và kết nối với community của chúng tôi. Khám phá các ứng dụng khác nhau của AI in healthcare và computer vision in agriculture.






