AI Video Editing
Khám phá cách chỉnh sửa video bằng AI sử dụng nhận dạng giọng nói, phát hiện đối tượng, theo dõi và phân đoạn để tinh giản thao tác cắt, định khung lại cảnh quay, thêm phụ đề và làm mờ người.
Chỉnh sửa video bằng AI sử dụng machine learning để hỗ trợ chọn, sắp xếp hoặc chỉnh sửa cảnh quay hiện có. Thay vì phải xác định thủ công vị trí của từng người nói, theo dõi một chủ thể đang di chuyển qua từng khung hình hoặc tìm từng điểm kết thúc của một cảnh quay, biên tập viên có thể dùng AI để nhận diện những yếu tố đó và đề xuất hoặc thực hiện thay đổi. Kết quả có thể là bản dựng thô, clip đã chỉnh lại khung hình, phụ đề hoặc hiệu ứng hình ảnh có mục tiêu cụ thể. Phán đoán của con người vẫn quyết định liệu bản chỉnh sửa có truyền tải chính xác câu chuyện dự định hay không.
Cách chỉnh sửa video bằng AI hoạt động#
Biên tập viên video làm việc với dòng thời gian gồm các clip, âm thanh và hiệu ứng. AI bổ sung thông tin về những gì diễn ra trong dòng thời gian đó. Hệ thống có thể dùng nhận dạng giọng nói để chuyển lời thoại thành văn bản được căn chỉnh theo thời gian, sau đó cho phép biên tập viên tìm một câu trích dẫn hoặc cắt đoạn ngừng bằng cách chỉnh sửa bản chép lời. Chỉnh sửa dựa trên văn bản trong Adobe Premiere minh họa mối liên hệ giữa lời nói và cảnh quay này.
Để thực hiện các thay đổi về hình ảnh, phát hiện đối tượng xác định vị trí các chủ thể trong từng khung hình, thường bằng các hộp giới hạn hình chữ nhật. Theo dõi đối tượng liên kết các đối tượng được phát hiện qua nhiều khung hình để hiệu ứng có thể bám theo cùng một chủ thể khi chủ thể di chuyển. Khi cần đường viền của chủ thể thay vì hình chữ nhật, phân đoạn đối tượng cung cấp mặt nạ ở cấp độ pixel. Riêng phát hiện thay đổi cảnh quay có thể đánh dấu các điểm chuyển tiếp giữa những cảnh quay từ camera, giúp việc xem lại các bản ghi dài trở nên dễ dàng hơn.
Những kỹ thuật này đóng góp các phần khác nhau cho một bản chỉnh sửa: phát hiện cho biết một vật thể nằm ở đâu, theo dõi giúp xác định đó là đối tượng nào theo thời gian, còn mặt nạ xác định những pixel nào cần thay đổi. Tự thân chúng không quyết định những khoảnh khắc nào nên được đưa vào bản dựng cuối cùng.
Điểm khác biệt so với các thuật ngữ liên quan#
Hiểu video mô tả việc diễn giải nội dung hoặc sự kiện trong một clip; chỉnh sửa sử dụng cách diễn giải đó để thay đổi cách trình bày cảnh quay. Tạo video tạo ra cảnh quay mới, trong khi chỉnh sửa video bằng AI thường bắt đầu từ cảnh quay đã có. Biên tập viên có thể kết hợp nội dung được tạo với các clip đã ghi hình, nhưng hai tác vụ này không thể thay thế cho nhau.
Hỗ trợ bằng AI cũng khác với chỉnh sửa tự động thông thường. Một chỉ thị cố định như “cắt mọi khung hình ở chính giữa” áp dụng cùng một quy tắc bất kể nội dung. Tính năng chỉnh lại khung hình có hỗ trợ AI có thể phản ứng theo vị trí chuyển động của hành động, như được minh họa trong tổng quan về Auto Reframe của Adobe. Trong cả hai trường hợp, biên tập viên nên kiểm tra để bảo đảm các chủ thể quan trọng vẫn hiển thị.
Hai ứng dụng thực tế#
Chuyển một cuộc phỏng vấn đã ghi thành clip ngắn. Nhóm sản xuất có thể chép lại một giờ trò chuyện, tìm câu trả lời phù hợp và dựng bản cắt ban đầu xoay quanh câu trả lời đó. Phụ đề tự động chuyển giọng nói thành văn bản cung cấp điểm khởi đầu để tạo phụ đề. Sau đó, biên tập viên đối chiếu bản chép lời với âm thanh, điều chỉnh nhịp độ và xác nhận rằng việc loại bỏ những lời nhận xét lân cận không làm thay đổi ý nghĩa của người nói. Điều này đặc biệt quan trọng với phụ đề: hướng dẫn của W3C về phụ đề dễ tiếp cận lưu ý rằng cần rà soát độ chính xác của nội dung được tạo tự động.
Chuẩn bị cảnh quay để chia sẻ. Nhóm quay phim tại một sự kiện công cộng có thể cần làm mờ những người xung quanh mà vẫn giữ cho hoạt động chính hiển thị. Bộ phát hiện có thể xác định vị trí mọi người trong từng khung hình, còn quy trình làm mờ đối tượng có thể áp dụng hiệu ứng làm mờ lên các vùng đã phát hiện. Biên tập viên phải kiểm tra kết quả: bỏ sót một đối tượng có thể khiến người đó vẫn hiển thị, trong khi hộp giới hạn quá lớn có thể che khuất nhiều phần khung cảnh hơn dự kiến. Làm mờ những người được phát hiện không đồng nghĩa với việc ẩn danh đáng tin cậy tất cả mọi người hoặc nhận diện cụ thể khuôn mặt.
Quy trình xử lý video thực tế#
Ví dụ dưới đây sử dụng Ultralytics YOLO26 để làm mờ những người được phát hiện trong một video hiện có. Cài đặt ultralytics và opencv-python, sau đó đặt video có tên input.mp4 cùng thư mục với script.
import cv2
from ultralytics import solutions
capture = cv2.VideoCapture("input.mp4")
assert capture.isOpened(), "Provide an input.mp4 video"
width = int(capture.get(cv2.CAP_PROP_FRAME_WIDTH))
height = int(capture.get(cv2.CAP_PROP_FRAME_HEIGHT))
fps = capture.get(cv2.CAP_PROP_FPS)
writer = cv2.VideoWriter("blurred.mp4", cv2.VideoWriter_fourcc(*"mp4v"), fps, (width, height))
assert writer.isOpened(), "Could not create the output video"
blurrer = solutions.ObjectBlurrer(model="yolo26n.pt", classes=[0])
while True:
success, frame = capture.read()
if not success:
break
result = blurrer(frame)
writer.write(result.plot_im)
capture.release()
writer.release()Lớp 0 chọn người trong model đã huấn luyện trước; lớp này không chọn khuôn mặt. Công cụ làm mờ xử lý từng khung hình, trong khi các công cụ ghi và thu video của OpenCV ghép các khung hình đã xử lý thành một tệp mới. Quy trình ngắn này xử lý các khung hình video, không xử lý track âm thanh gốc. Một bản chỉnh sửa hoàn chỉnh cần có bước hoàn thiện hỗ trợ âm thanh; tài liệu bộ lọc của FFmpeg trình bày thêm các tùy chọn xử lý video.
Những điều cần kiểm tra trước khi xuất bản#
Rà soát toàn bộ video đầu ra, đặc biệt là các điểm cắt, chuyển động nhanh, hiện tượng che khuất, phụ đề và khung hình đầu tiên cũng như cuối cùng của mỗi hiệu ứng. Giữ lại một bản chưa chỉnh sửa để có thể sửa các đoạn cắt sai hoặc hiệu ứng làm mờ chưa đầy đủ. Với nội dung truyền thông được phân phối, Thông tin xác thực nội dung và nguồn gốc có thể giúp ghi lại nguồn gốc và lịch sử chỉnh sửa của tệp, nhưng không xác định được thông điệp của tệp có trung thực hay không. AI có thể tăng tốc các công việc chỉnh sửa lặp lại; biên tập viên vẫn chịu trách nhiệm về ngữ cảnh, quyền riêng tư và video hoàn chỉnh.









