Ultralytics YOLO27:
Vision AI

Model diffusion là gì? Hướng dẫn nhanh và toàn diện

Cùng tìm hiểu cách các model diffusion có thể được sử dụng để tạo nội dung chân thực và định hình lại các lĩnh vực như thiết kế, âm nhạc và điện ảnh qua nhiều ứng dụng.

ABAbirami Vina11 min read
Hướng dẫn về model diffusion trong AI tạo sinh

Việc sử dụng các công cụ AI tạo sinh như Midjourney và Sora để tạo nội dung đang ngày càng phổ biến, đồng thời ngày càng có nhiều người quan tâm đến cách các công cụ này vận hành bên trong. Trên thực tế, một nghiên cứu gần đây cho thấy 94% mọi người sẵn sàng học các kỹ năng mới để làm việc với AI tạo sinh. Hiểu cách các model AI tạo sinh hoạt động có thể giúp bạn sử dụng những công cụ này hiệu quả hơn và khai thác tối đa giá trị của chúng.

Nền tảng cốt lõi của các công cụ như Midjourney và Sora là những model diffusion tiên tiến—các model AI tạo sinh có thể tạo hình ảnh, video, văn bản và âm thanh cho nhiều ứng dụng khác nhau. Ví dụ, model diffusion là lựa chọn phù hợp để tạo các video marketing ngắn cho những nền tảng mạng xã hội như TikTokYouTube Shorts. Trong bài viết này, chúng ta sẽ tìm hiểu cách model diffusion hoạt động và những nơi có thể ứng dụng chúng. Hãy bắt đầu!

Nguồn cảm hứng đằng sau các model diffusion tiên tiến#

Trong vật lý, khuếch tán là quá trình các phân tử lan từ những vùng có nồng độ cao sang những vùng có nồng độ thấp. Khái niệm khuếch tán có liên hệ chặt chẽ với chuyển động Brown, trong đó các hạt chuyển động ngẫu nhiên khi va chạm với các phân tử trong chất lưu và dần lan ra theo thời gian.

Những khái niệm này đã truyền cảm hứng cho việc phát triển model diffusion trong AI tạo sinh. Model diffusion hoạt động bằng cách dần thêm nhiễu vào dữ liệu, sau đó học cách đảo ngược quá trình đó để tạo dữ liệu mới, chất lượng cao như văn bản, hình ảnh hoặc âm thanh. Điều này tương tự ý tưởng khuếch tán ngược trong vật lý. Về mặt lý thuyết, quá trình khuếch tán có thể được theo dõi ngược để đưa các hạt về trạng thái ban đầu. Tương tự, model diffusion học cách đảo ngược phần nhiễu đã thêm vào để tạo dữ liệu mới chân thực từ các đầu vào bị nhiễu.

Ví dụ sử dụng model diffusion để tạo hình ảnh

Tìm hiểu bên trong các model diffusion#

Nhìn chung, kiến trúc của một model diffusion gồm hai bước chính. Trước tiên, model học cách dần thêm nhiễu vào dataset. Sau đó, model được huấn luyện để đảo ngược quá trình này và đưa dữ liệu trở về trạng thái ban đầu. Hãy cùng xem kỹ hơn cách thức hoạt động của quy trình này.

Tiền xử lý dữ liệu#

Trước khi đi sâu vào phần cốt lõi của một model diffusion, điều quan trọng cần nhớ là mọi dữ liệu dùng để huấn luyện model đều phải được tiền xử lý. Ví dụ, nếu bạn đang huấn luyện một model diffusion để tạo hình ảnh, dataset huấn luyện hình ảnh cần được làm sạch trước. Tiền xử lý dữ liệu hình ảnh có thể bao gồm việc loại bỏ các giá trị ngoại lệ có thể ảnh hưởng đến kết quả, chuẩn hóa giá trị pixel để tất cả hình ảnh có cùng thang đo và sử dụng tăng cường dữ liệu để tạo thêm tính đa dạng. Các bước tiền xử lý dữ liệu giúp đảm bảo chất lượng dữ liệu huấn luyện; điều này không chỉ đúng với model diffusion mà còn với mọi model AI.

Ví dụ về tăng cường dữ liệu hình ảnh

Hình 2. Ví dụ về tăng cường dữ liệu hình ảnh.

Quá trình khuếch tán xuôi#

Sau khi tiền xử lý dữ liệu, bước tiếp theo là quá trình khuếch tán xuôi. Hãy tập trung vào việc huấn luyện một model diffusion để tạo hình ảnh. Quy trình bắt đầu bằng việc lấy mẫu từ một phân phối đơn giản, chẳng hạn như phân phối Gaussian. Nói cách khác, một lượng nhiễu ngẫu nhiên được chọn. Như minh họa trong hình bên dưới, model dần biến đổi hình ảnh qua một chuỗi bước. Hình ảnh ban đầu rõ nét rồi ngày càng trở nên nhiễu hơn qua từng bước, cuối cùng gần như biến thành nhiễu hoàn toàn.

Quá trình khuếch tán xuôi

Hình 3. Quá trình khuếch tán xuôi.

Mỗi bước được xây dựng dựa trên bước trước đó, và nhiễu được thêm vào theo cách có kiểm soát, từng phần một, bằng Chuỗi Markov. Chuỗi Markov là một model toán học trong đó xác suất của trạng thái tiếp theo chỉ phụ thuộc vào trạng thái hiện tại. Chuỗi này được dùng để dự đoán các kết quả trong tương lai dựa trên điều kiện hiện tại. Khi mỗi bước làm dữ liệu phức tạp hơn, chúng ta có thể nắm bắt những mẫu và chi tiết tinh vi nhất trong phân phối dữ liệu hình ảnh ban đầu. Việc thêm nhiễu Gaussian cũng tạo ra các mẫu đa dạng và chân thực khi quá trình khuếch tán diễn ra.

Quá trình khuếch tán ngược#

Quá trình khuếch tán ngược bắt đầu sau khi quá trình khuếch tán xuôi đã biến một mẫu thành trạng thái phức tạp và bị nhiễu. Quá trình này dần ánh xạ mẫu bị nhiễu trở lại trạng thái ban đầu thông qua một chuỗi phép biến đổi nghịch đảo. Các bước đảo ngược quy trình thêm nhiễu được định hướng bởi một Chuỗi Markov ngược.

Quá trình khuếch tán ngược

Hình 4. Quá trình khuếch tán ngược.

Trong quá trình ngược, các model diffusion học cách tạo dữ liệu mới bằng cách bắt đầu với một mẫu nhiễu ngẫu nhiên rồi dần tinh chỉnh mẫu đó thành đầu ra rõ nét, chi tiết. Dữ liệu được tạo cuối cùng gần như giống với dataset ban đầu. Khả năng này khiến model diffusion đặc biệt phù hợp với các tác vụ như tổng hợp hình ảnh, hoàn thiện dữ liệu và khử nhiễu. Trong phần tiếp theo, chúng ta sẽ tìm hiểu thêm về các ứng dụng của model diffusion.

Các ứng dụng của model diffusion#

Quá trình diffusion từng bước cho phép model diffusion tạo hiệu quả các phân phối dữ liệu phức tạp mà không bị quá tải bởi số chiều cao của dữ liệu. Hãy cùng xem một số ứng dụng mà model diffusion phát huy hiệu quả.

Thiết kế đồ họa#

Model diffusion có thể được sử dụng để nhanh chóng tạo nội dung hình ảnh đồ họa. Các nhà thiết kế và nghệ sĩ có thể cung cấp bản phác thảo, bố cục hoặc thậm chí một vài ý tưởng sơ bộ đơn giản về điều họ muốn, và các model có thể biến những ý tưởng đó thành hiện thực. Công nghệ này có thể đẩy nhanh toàn bộ quy trình thiết kế, mở ra nhiều khả năng mới từ ý tưởng ban đầu đến sản phẩm cuối cùng, đồng thời giúp các nhà thiết kế tiết kiệm đáng kể thời gian quý báu.

Các thiết kế đồ họa được tạo bởi model diffusion

Hình 5. Các thiết kế đồ họa được tạo bởi model diffusion.

Thiết kế âm nhạc và âm thanh#

Model diffusion cũng có thể được điều chỉnh để tạo các không gian âm thanh hoặc nốt nhạc rất độc đáo. Công nghệ này mang đến những cách thức mới để các nhạc sĩ và nghệ sĩ hình dung và tạo ra trải nghiệm thính giác. Dưới đây là một số trường hợp sử dụng model diffusion trong lĩnh vực tạo âm thanh và âm nhạc:

  • Chuyển đổi giọng âm: Model diffusion có thể được sử dụng để biến đổi một âm thanh thành âm thanh khác, chẳng hạn như chuyển một sample trống kick thành âm thanh trống snare để tạo ra các tổ hợp âm thanh độc đáo.
  • Biến thiên và nhân hóa âm thanh: Diffusion âm thanh có thể tạo ra những biến thể nhỏ trong âm thanh, bổ sung yếu tố con người cho âm thanh kỹ thuật số bằng cách mô phỏng phần trình diễn của nhạc cụ trực tiếp.
  • Điều chỉnh thiết kế âm thanh: Các model này có thể được sử dụng để thay đổi tinh tế một âm thanh, chẳng hạn như tăng cường sample tiếng cửa đóng sầm, nhằm điều chỉnh các đặc tính của âm thanh ở mức độ sâu hơn so với EQ hoặc bộ lọc truyền thống.
  • Tạo giai điệu: Các model này cũng có thể hỗ trợ tạo giai điệu mới và truyền cảm hứng cho nghệ sĩ tương tự như khi duyệt các sample pack.

Hình minh họa diffusion âm thanh

Hình 6. Hình minh họa diffusion âm thanh.

Phim và hoạt hình#

Một trường hợp sử dụng thú vị khác của model diffusion là tạo các đoạn phim và hoạt hình. Các model này có thể được dùng để tạo nhân vật, phông nền chân thực và thậm chí các yếu tố động trong cảnh. Việc sử dụng model diffusion có thể mang lại lợi thế lớn cho các công ty sản xuất. Công nghệ này tinh gọn workflow tổng thể và mở ra nhiều cơ hội hơn để thử nghiệm cũng như sáng tạo trong cách kể chuyện bằng hình ảnh. Một số đoạn phim được tạo bằng các model này có chất lượng tương đương với các đoạn hoạt hình hoặc phim thực tế. Thậm chí có thể sử dụng các model này để tạo toàn bộ một bộ phim.

Một cảnh trong phim ngắn Seasons được tạo bằng model diffusion

Hình 7. Một cảnh trong phim ngắn Seasons được tạo bằng model diffusion.

Các model diffusion phổ biến#

Giờ đây, sau khi đã tìm hiểu một số ứng dụng của model diffusion, hãy cùng xem một số model diffusion phổ biến mà bạn có thể dùng thử.

  • Stable Diffusion: Được Stability AI tạo ra, Stable Diffusion là một model hiệu quả, nổi tiếng với khả năng chuyển prompt văn bản thành hình ảnh chân thực. Model này có danh tiếng vững chắc về khả năng tạo hình ảnh chất lượng cao. Nó cũng có thể được điều chỉnh cho phim và hoạt hình.
  • DALL-E 3: DALL-E 3 là phiên bản mới nhất của model tạo hình ảnh của OpenAI. Model này được tích hợp vào ChatGPT và mang lại nhiều cải tiến về chất lượng tạo hình ảnh so với phiên bản trước là DALL-E 2.
  • Sora: Sora là model chuyển văn bản thành video của OpenAI, có thể tạo video 1080p cực kỳ chân thực với thời lượng lên đến một phút. Một số đoạn video được tạo bằng Sora dễ dàng bị nhầm là cảnh quay thực tế.
  • Imagen: Được Google phát triển, Imagen là một model diffusion chuyển văn bản thành hình ảnh, nổi bật nhờ khả năng tạo hình ảnh chân thực như ảnh chụp và năng lực hiểu ngôn ngữ tiên tiến.

Các thách thức và hạn chế liên quan đến model diffusion#

Mặc dù model diffusion mang lại lợi ích cho nhiều ngành, chúng ta cũng cần lưu ý đến một số thách thức đi kèm. Một thách thức là quá trình huấn luyện đòi hỏi rất nhiều tài nguyên. Dù những tiến bộ trong tăng tốc phần cứng có thể hỗ trợ, chi phí của chúng có thể rất cao. Một vấn đề khác là khả năng khái quát hóa hạn chế của model diffusion đối với dữ liệu chưa từng thấy. Việc điều chỉnh chúng cho các lĩnh vực cụ thể có thể đòi hỏi nhiều hoạt động fine-tuning hoặc huấn luyện lại.

Việc tích hợp các model này vào các tác vụ thực tế cũng đi kèm nhiều thách thức riêng. Điều then chốt là nội dung AI tạo ra phải thực sự phù hợp với ý định của con người. Ngoài ra còn có những mối quan ngại về đạo đức, chẳng hạn như nguy cơ các model này tiếp thu và phản ánh những thiên kiến từ dữ liệu dùng để huấn luyện chúng. Bên cạnh đó, việc quản lý kỳ vọng của người dùng và liên tục tinh chỉnh model dựa trên phản hồi có thể trở thành một nỗ lực lâu dài nhằm đảm bảo các công cụ này hiệu quả và đáng tin cậy nhất có thể.

Tương lai của model diffusion#

Model diffusion là một khái niệm hấp dẫn trong AI tạo sinh, giúp tạo ra hình ảnh, video và âm thanh chất lượng cao trong nhiều lĩnh vực khác nhau. Dù có thể đặt ra một số thách thức khi triển khai, chẳng hạn như yêu cầu tính toán và các vấn đề đạo đức, cộng đồng AI vẫn không ngừng cải thiện hiệu suất và tác động của chúng. Khi tiếp tục phát triển, model diffusion được kỳ vọng sẽ chuyển đổi các ngành như điện ảnh, sản xuất âm nhạc và sáng tạo nội dung kỹ thuật số.

Hãy cùng học hỏi và khám phá! Hãy xem repository GitHub của chúng tôi để tìm hiểu những đóng góp của chúng tôi cho AI. Khám phá cách chúng tôi đang định hình lại các ngành như sản xuấtchăm sóc sức khỏe bằng công nghệ AI tiên tiến.

Explore solutions

Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning