Voice Cloning
Tìm hiểu cách nhân bản giọng nói bằng AI hoạt động, khám phá các ứng dụng trong giao tiếp hỗ trợ và thuyết minh, đồng thời hiểu về sự đồng thuận, deepfake và các rủi ro an toàn.
Nhân bản giọng nói là việc sử dụng AI để tạo ra lời nói mới nghe giống một người cụ thể. Thay vì phát lại một bản ghi âm, hệ thống học những đặc điểm dễ nhận biết trong giọng nói của một người nói và tạo âm thanh cho những từ mà người đó có thể chưa từng nói. Việc này có thể giúp ai đó giao tiếp bằng giọng nói quen thuộc hoặc thuyết minh nội dung một cách nhất quán, nhưng cũng có nghĩa là một giọng nói thuyết phục không chứng minh được ai đang nói.
Cách thức hoạt động của nhân bản giọng nói#
Hệ thống nhân bản giọng nói bắt đầu với các bản ghi âm của người nói mục tiêu. Hệ thống phân tích các đặc điểm như cao độ, âm sắc—đặc tính khiến hai giọng nói nghe khác nhau dù có cùng cao độ—và cách phát âm. Hệ thống cũng học các khía cạnh của ngữ điệu: nhịp điệu, trọng âm và ngữ điệu lên xuống giúp lời nói nghe tự nhiên. Chất lượng bản ghi âm rất quan trọng. Tiếng ồn nền, vị trí micro không nhất quán hoặc các mẫu chỉ có một kiểu nói có thể khiến giọng nói được tạo ra kém tin cậy hơn.
Hệ thống biểu diễn những đặc điểm của người nói dưới dạng có thể sử dụng khi tạo âm thanh, thường được gọi là speaker embedding. Đây là mô tả số học cô đọng về âm sắc giọng nói, không phải danh sách câu được lưu trữ. Quy trình tạo giọng nói tùy chỉnh kết hợp bản ghi âm của người nói với bộ tạo giọng nói: văn bản cung cấp nội dung cần nói, còn các đặc điểm giọng nói đã học định hình cách lời nói phát ra. Một số quy trình có thể thích ứng từ một mẫu ngắn, dù chất lượng đầu ra phụ thuộc vào mẫu và tác vụ; tài liệu về giọng nói tùy chỉnh tức thì minh họa tầm quan trọng của bản ghi âm giọng nói phù hợp và sự đồng thuận.
Sau đó, bộ tạo tạo ra dạng sóng âm thanh—tín hiệu biến đổi được phát qua loa hoặc tai nghe. Một kết quả thuyết phục cần có lời nói dễ hiểu cũng như giọng nói dễ nhận ra. Cùng một người có thể nghe khác đi khi thì thầm, cười hoặc nói một ngôn ngữ khác, vì vậy việc khớp danh tính trong một đoạn clip ngắn không đảm bảo lời nói tự nhiên trong mọi tình huống.
Nhân bản giọng nói và các thuật ngữ liên quan#
Nhân bản giọng nói là một ứng dụng cụ thể của chuyển văn bản thành giọng nói, trong đó từ ngữ viết được đọc bằng một giọng nói đã học và có thể nhận diện. Công nghệ chuyển văn bản thành giọng nói thông thường có thể sử dụng giọng tổng hợp cài sẵn mà không giống bất kỳ người cụ thể nào. Nhân bản giọng nói cũng có thể nhận âm thanh lời nói làm đầu vào và chuyển lời nói đó thành một giọng khác; đặc điểm xác định là giọng đích, chứ không phải đầu vào ban đầu là văn bản hay lời nói.
Chuyển giọng nói thành văn bản hoạt động theo chiều ngược lại, chuyển lời nói thành bản chép lời. Thay đổi cao độ hoặc tốc độ của bản ghi âm lại là một việc khác: những chỉnh sửa đó thay đổi âm thanh hiện có thay vì tạo ra lời nói từ danh tính giọng nói đã học. Nhân bản giọng nói thuộc lĩnh vực AI tạo sinh vì công nghệ này tạo ra âm thanh mới.
Giọng nói được nhân bản trở thành một phần của deepfake khi phương tiện tổng hợp khiến người xem tin rằng một người đã nói điều họ chưa từng nói. Hai thuật ngữ này không thể dùng thay thế cho nhau: người sử dụng bản sao được cấp phép của chính giọng mình để giao tiếp không nhất thiết có ý định lừa dối bất kỳ ai.
Hai Ứng Dụng Thực Tế#
Một ứng dụng là giao tiếp hỗ trợ. Người dự kiến sẽ mất khả năng nói có thể ghi âm giọng nói của mình, sau đó gõ tin nhắn để chúng được đọc bằng phiên bản tổng hợp của giọng nói đó. Hướng dẫn về Personal Voice của Apple mô tả cách tiếp cận này để giao tiếp thông qua các tính năng trợ năng được hỗ trợ. Trong trường hợp này, việc giữ lại giọng nói quen thuộc có thể quan trọng không kém việc làm cho lời nói có thể nghe được.
Một ứng dụng khác là thuyết minh và lồng tiếng được cấp phép. Diễn viên lồng tiếng có thể cho phép đội ngũ sản xuất tạo các câu thoại đã được phê duyệt hoặc phần thuyết minh bản dịch bằng một giọng nói nhất quán. Cách này có thể giảm nhu cầu thu âm lại mỗi khi chỉnh sửa, nhưng cách phát âm, biểu đạt cảm xúc và thay đổi ngôn ngữ vẫn cần được con người rà soát. Các tùy chọn điều chỉnh tốc độ nói và cao độ, chẳng hạn như những tùy chọn được mô tả trong hướng dẫn về ngữ điệu của Amazon Polly, điều chỉnh cách thể hiện; chúng không thay thế sự cho phép sử dụng giọng nói của một người.
Nơi giao thoa giữa giọng nói và thị giác#
Nhân bản giọng nói xử lý âm thanh, không phải hình ảnh. Tuy nhiên, trong một ứng dụng AI đa phương thức, công nghệ này có thể được kết hợp với một thành phần thị giác riêng biệt. Ví dụ, một nhà sáng tạo làm video dễ tiếp cận có thể phân tích cảnh quay để xác định các vật thể nhìn thấy được, viết và rà soát phần mô tả, rồi dùng giọng nói được nhân bản có cấp phép để thuyết minh. Ultralytics YOLO26 và chế độ predict được tài liệu hóa có thể xử lý hình ảnh hoặc video ở giai đoạn thị giác. Các công nghệ này không nhân bản giọng nói hoặc xác minh danh tính người nói. Tách biệt các trách nhiệm đó giúp nhà phát triển đánh giá từng thành phần dựa trên chức năng thực tế của nó.
Sự đồng thuận, tính xác thực và an toàn#
Giọng nói gắn chặt với danh tính của một người, vì vậy hãy xin phép rõ ràng trước khi tạo bản sao và thống nhất những nơi có thể sử dụng đầu ra. Hướng dẫn về sự đồng thuận của người có chất giọng của Microsoft đưa ra ví dụ về quy trình xin phép rõ ràng. Bảo vệ bản ghi âm và âm thanh được tạo ra như một phần của quyền riêng tư dữ liệu, đồng thời thông báo cho người nghe khi lời nói là tổng hợp nếu bối cảnh đó cần thiết.
Tội phạm mạng có thể dùng giọng nói được nhân bản trong một cuộc gọi có vẻ như đến từ người thân hoặc lãnh đạo cấp cao để gây áp lực buộc ai đó chuyển tiền. Hướng dẫn của FTC về các vụ lừa đảo giả danh tình huống khẩn cấp khuyến nghị xác minh yêu cầu qua một số điện thoại đã biết là chính chủ, thay vì tin vào âm thanh giọng nói của người gọi. Đối với âm thanh được công bố, phần giải thích về Content Credentials của C2PA mô tả một cách ghi lại nguồn gốc của phương tiện. Thông tin nguồn gốc cung cấp bối cảnh hữu ích về lịch sử của tệp; bản thân thông tin đó không xác lập rằng mọi tuyên bố được nói ra đều là sự thật.









