Năm 2024 khởi đầu với làn sóng AI tạo sinh
Cùng nhìn lại những đổi mới AI đầy thú vị trong quý đầu tiên của năm 2024. Chúng ta sẽ đề cập đến các đột phá như Sora AI của OpenAI, chip não của Neuralink và những LLM mới nhất.

Cộng đồng AI dường như gần như ngày nào cũng xuất hiện trên các mặt báo. Những tháng đầu năm 2024 thật sôi động và tràn ngập các đổi mới AI. Từ những mô hình ngôn ngữ lớn mới đầy mạnh mẽ đến các thiết bị cấy ghép vào não người, năm 2024 đang định hình để trở nên đáng kinh ngạc.
Chúng ta đang chứng kiến AI chuyển đổi các ngành công nghiệp, giúp thông tin dễ tiếp cận hơn, và thậm chí thực hiện những bước đầu tiên hướng tới việc hợp nhất tâm trí con người với máy móc. Hãy cùng nhìn lại quý đầu tiên của năm 2024 và xem xét kỹ hơn những tiến bộ của AI chỉ trong vài tháng.
LLMs đang trở thành xu hướng#
Các mô hình ngôn ngữ lớn (LLMs), được thiết kế để hiểu, tạo và thao tác ngôn ngữ con người dựa trên khối lượng dữ liệu văn bản khổng lồ, đã trở thành tâm điểm trong quý đầu tiên của năm 2024. Nhiều công ty công nghệ lớn đã phát hành model LLM của riêng mình, mỗi model có những năng lực độc đáo. Thành công đáng kinh ngạc của các LLM trước đó như GPT-3 đã truyền cảm hứng cho xu hướng này. Dưới đây là một số bản phát hành LLM đáng chú ý nhất vào đầu năm 2024.
Claude 3 của Anthropic#
Anthropic đã phát hành Claude 3 vào ngày 14 tháng 3 năm 2024. Model Claude 3 có ba phiên bản: Opus, Sonnet và Haiku, mỗi phiên bản phục vụ các thị trường và mục đích khác nhau. Haiku, model nhanh nhất, được tối ưu hóa cho các phản hồi nhanh và cơ bản. Sonnet cân bằng tốc độ với trí tuệ và hướng đến các ứng dụng doanh nghiệp. Opus, phiên bản tiên tiến nhất, mang lại năng lực trí tuệ và suy luận vượt trội, đồng thời phù hợp với các tác vụ phức tạp và việc đạt được các benchmark hàng đầu.
Claude 3 có nhiều tính năng và cải tiến nâng cao:
- Hội thoại đa ngôn ngữ được cải thiện: Năng lực xử lý các ngôn ngữ như tiếng Tây Ban Nha, tiếng Nhật và tiếng Pháp được nâng cao.
- Tính năng vision nâng cao: Có khả năng xử lý nhiều định dạng hình ảnh khác nhau.
- Giảm từ chối: Thể hiện khả năng thấu hiểu tốt hơn với ít lần từ chối không cần thiết hơn, cho thấy khả năng nắm bắt ngữ cảnh được cải thiện.
- Cửa sổ ngữ cảnh mở rộng: Cung cấp cửa sổ ngữ cảnh 200K, nhưng có khả năng xử lý đầu vào trên 1 triệu token tùy theo nhu cầu của khách hàng.

Hình 1. Claude 3 nhận biết ngữ cảnh tốt hơn các phiên bản trước.
DBRX của Databricks#
Databricks DBRX là một LLM mở, đa dụng, được Databricks phát hành vào ngày 27 tháng 3 năm 2024. DBRX đạt kết quả rất tốt trên nhiều benchmark, bao gồm khả năng hiểu ngôn ngữ, lập trình và toán học. Model này vượt qua các model đã được thiết lập khác trong khi có kích thước nhỏ hơn khoảng 40% so với các model tương tự.

Hình 2. So sánh DBRX với các model khác.
DBRX được huấn luyện bằng phương pháp dự đoán token tiếp theo với kiến trúc hỗn hợp chuyên gia (MoE) có độ chi tiết cao, nhờ đó hiệu năng huấn luyện và suy luận được cải thiện đáng kể. Kiến trúc này cho phép model dự đoán từ tiếp theo trong một chuỗi chính xác hơn bằng cách tham vấn một tập hợp đa dạng các submodel chuyên biệt (các "chuyên gia"). Những submodel này giỏi xử lý các loại thông tin hoặc tác vụ khác nhau.
Gemini 1.5 của Google#
Google đã giới thiệu Gemini 1.5, một model AI đa phương thức tiết kiệm tài nguyên tính toán, có thể phân tích lượng lớn dữ liệu văn bản, video và âm thanh, vào ngày 15 tháng 2 năm 2024. Model mới nhất này tiên tiến hơn về hiệu năng, hiệu quả và năng lực. Một tính năng then chốt của Gemini 1.5 là bước đột phá trong khả năng hiểu ngữ cảnh dài. Model có thể xử lý ổn định tới 1 triệu token. Các năng lực của Gemini 1.5 cũng là nhờ một kiến trúc mới dựa trên MoE.

Hình 3. So sánh độ dài ngữ cảnh của các LLM phổ biến
Dưới đây là một số tính năng thú vị nhất của Gemini 1.5:
- Xử lý dữ liệu được cải thiện: Cho phép tải trực tiếp các tệp PDF lớn, repository mã nguồn hoặc video dài để dùng làm prompt. Model có thể suy luận xuyên suốt nhiều modality và xuất văn bản.
- Tải lên và truy vấn nhiều tệp: Các developer giờ đây có thể tải lên nhiều tệp và đặt câu hỏi.
- Có thể sử dụng cho nhiều tác vụ khác nhau: Được tối ưu hóa để mở rộng trên nhiều tác vụ đa dạng, đồng thời cho thấy những cải thiện trong các lĩnh vực như toán học, khoa học, suy luận, đa ngôn ngữ, khả năng hiểu video và code.
Hình ảnh ấn tượng từ AI#
Quý đầu tiên của năm 2024 đã giới thiệu những model AI tạo sinh có thể tạo ra hình ảnh chân thực đến mức làm dấy lên các cuộc tranh luận về tương lai của mạng xã hội và tiến bộ của AI. Hãy cùng tìm hiểu các model đang khuấy động cuộc thảo luận này.
Sora của OpenAI#
OpenAI, nhà phát triển ChatGPT, đã công bố một model deep learning chuyển văn bản thành video tiên tiến hàng đầu có tên Sora vào ngày 15 tháng 2 năm 2024. Sora là một trình tạo video từ văn bản, có khả năng tạo các video dài tới một phút với chất lượng hình ảnh cao dựa trên prompt văn bản của người dùng.
Ví dụ, hãy xem prompt sau đây.
“Một thế giới papercraft tuyệt đẹp được dựng hình, mô tả một rạn san hô tràn ngập cá và các sinh vật biển nhiều màu sắc.”
Và đây là một khung hình từ video đầu ra.

Hình 4. Một khung hình từ video được tạo bởi Sora.
Kiến trúc của Sora khiến điều này trở nên khả thi bằng cách kết hợp các model diffusion để tạo texture và các model Transformer để đảm bảo tính nhất quán về cấu trúc. Cho đến nay, quyền truy cập Sora mới được cấp cho các red teamer và một nhóm chọn lọc gồm nghệ sĩ thị giác, nhà thiết kế và nhà làm phim nhằm tìm hiểu rủi ro và thu thập phản hồi.
Stable Diffusion 3 của Stability AI#
Stability AI đã công bố sự ra mắt của Stable Diffusion 3, một model tạo ảnh từ văn bản, vào ngày 22 tháng 2 năm 2024. Model này kết hợp kiến trúc diffusion Transformer với flow matching. Họ vẫn chưa phát hành technical paper, nhưng có một số tính năng chính đáng chú ý.

Hình 5. Hình ảnh đầu ra dựa trên prompt: “Tác phẩm anime sử thi về một phù thủy đứng trên đỉnh núi vào ban đêm, thi triển phép thuật vũ trụ vào bầu trời tối, trong đó có dòng chữ "Stable Diffusion 3" được tạo thành từ năng lượng nhiều màu sắc” (Nguồn)
Model Stable Diffusion mới nhất mang lại hiệu năng, chất lượng hình ảnh và độ chính xác được cải thiện khi tạo ảnh có nhiều chủ thể. Stable Diffusion 3 cũng sẽ cung cấp nhiều model với số lượng tham số từ 800 triệu đến 8 tỷ. Model này cho phép người dùng lựa chọn dựa trên nhu cầu cụ thể về khả năng mở rộng và độ chi tiết.
Lumiere của Google#
Ngày 23 tháng 1 năm 2024, Google đã ra mắt Lumiere, một model diffusion chuyển văn bản thành video. Lumiere sử dụng kiến trúc có tên Space-Time-U-Net, hay gọi tắt là STUNet. Kiến trúc này giúp Lumiere hiểu vị trí của các đối tượng và cách chúng chuyển động trong video. Nhờ đó, model có thể tạo ra các video mượt mà và sống động.

Hình 6. Một khung hình từ video được tạo dựa trên prompt: “Gấu trúc chơi ukulele ở nhà.”
Với khả năng tạo 80 khung hình cho mỗi video, Lumiere đang phá vỡ các giới hạn và thiết lập những tiêu chuẩn mới về chất lượng video trong lĩnh vực AI. Dưới đây là một số tính năng của Lumiere:
- Image-to-Video: Bắt đầu từ một hình ảnh và prompt, Lumiere có thể biến hình ảnh thành video hoạt họa.
- Tạo theo phong cách: Lumiere có thể tạo video theo các phong cách cụ thể bằng một hình ảnh tham chiếu duy nhất.
- Cinemagraphs: Lumiere có thể tạo chuyển động cho các vùng cụ thể trong một hình ảnh để tạo ra những cảnh động, chẳng hạn một đối tượng cụ thể chuyển động trong khi phần còn lại của cảnh giữ nguyên trạng thái tĩnh.
- Video Inpainting: Model có thể chỉnh sửa các phần của video, chẳng hạn thay đổi trang phục của người trong video hoặc điều chỉnh các chi tiết nền.
Tương lai dường như đã ở đây#
Những ngày đầu năm 2024 cũng mang đến nhiều đổi mới AI có cảm giác như bước ra từ một bộ phim khoa học viễn tưởng. Những điều trước đây chúng ta từng cho là không thể giờ đây đang được nghiên cứu và phát triển. Với những khám phá sau đây, tương lai dường như không còn quá xa.
Neuralink của Elon Musk#
Neuralink của Elon Musk đã cấy ghép thành công chip não không dây vào một người vào ngày 29 tháng 1 năm 2024. Đây là một bước tiến lớn hướng tới việc kết nối não người với máy tính. Elon Musk chia sẻ rằng sản phẩm đầu tiên của Neuralink, có tên ‘Telepathy’, đang trong quá trình phát triển.

Hình 7. Thiết bị cấy ghép Neuralink
Mục tiêu là cho phép người dùng, đặc biệt là những người đã mất chức năng chi, điều khiển thiết bị dễ dàng bằng suy nghĩ. Các ứng dụng tiềm năng không chỉ dừng lại ở sự tiện lợi. Elon Musk hình dung một tương lai nơi những người bị liệt có thể giao tiếp dễ dàng.
Sàn HoloTile của Disney#
Ngày 18 tháng 1 năm 2024, Walt Disney Imagineering đã giới thiệu Sàn HoloTile. Sản phẩm này được mệnh danh là sàn máy chạy đa hướng đầu tiên trên thế giới dành cho nhiều người.

Hình 8. Disney Imagineer Lanny Smoot tạo dáng trên cải tiến mới nhất của mình, sàn HoloTile.
Sàn có thể di chuyển bên dưới bất kỳ người hoặc vật thể nào như năng lực điều khiển từ xa bằng ý nghĩ, tạo ra trải nghiệm thực tế ảo và thực tế tăng cường sống động. Bạn có thể đi theo bất kỳ hướng nào và tránh va chạm khi đứng trên sàn. Sàn HoloTile của Disney cũng có thể được lắp đặt trên sân khấu để thực hiện các chuyển động và điệu nhảy sáng tạo.
Vision Pro của Apple#
Ngày 2 tháng 2 năm 2024, headset Vision Pro được mong đợi từ lâu của Apple đã có mặt trên thị trường. Sản phẩm có một loạt tính năng và ứng dụng được thiết kế để định nghĩa lại trải nghiệm thực tế ảo và thực tế tăng cường. Headset Vision Pro phục vụ nhiều đối tượng khác nhau bằng cách kết hợp giải trí, năng suất và điện toán không gian. Apple tự hào công bố rằng hơn 600 ứng dụng, từ công cụ năng suất đến dịch vụ game và giải trí, đã được tối ưu hóa cho Vision Pro ngay khi ra mắt.
Devin của Cognition#
Ngày 12 tháng 3 năm 2024, Cognition đã phát hành một trợ lý kỹ thuật phần mềm có tên Devin. Devin là nỗ lực đầu tiên trên thế giới nhằm tạo ra một kỹ sư phần mềm AI tự chủ. Khác với các coding assistant truyền thống chỉ đưa ra đề xuất hoặc hoàn thành những tác vụ cụ thể, Devin được thiết kế để xử lý toàn bộ dự án phát triển phần mềm, từ ý tưởng ban đầu đến khi hoàn thành.
Model có thể học các công nghệ mới, xây dựng và triển khai các app hoàn chỉnh, tìm và sửa bug, tự huấn luyện model của mình, đóng góp cho codebase mã nguồn mở và codebase production, thậm chí đảm nhận các công việc phát triển thực tế từ những website như Upwork.

Hình 9. So sánh Devin với các model khác.
Devin được đánh giá trên SWE-bench, một benchmark đầy thách thức yêu cầu các agent giải quyết những issue GitHub trong thế giới thực được tìm thấy ở các dự án mã nguồn mở như Django và scikit-learn. Devin đã giải quyết chính xác 13,86% số issue từ đầu đến cuối, so với mức 1,96% của phương pháp tiên tiến nhất trước đó.
Các đề cập đáng chú ý#
Đã có quá nhiều sự kiện diễn ra đến mức không thể đề cập mọi thứ trong bài viết này. Tuy nhiên, dưới đây là một số đề cập đáng chú ý khác.
- LATTE3D của NVIDIA, được công bố ngày 21 tháng 3 năm 2024, là một model AI chuyển văn bản thành 3D, có thể ngay lập tức tạo các biểu diễn 3D từ prompt văn bản.
- Trình tạo video từ văn bản mới của Midjourney, được CEO David Holz hé lộ, đã bắt đầu quá trình huấn luyện vào tháng 1 và dự kiến sớm ra mắt.
- Thúc đẩy cuộc cách mạng AI PC, Lenovo đã phát hành ThinkBook 13x với công nghệ E Ink Prism và các laptop AI hiệu năng cao vào ngày 8 tháng 1 năm 2024.
Hãy cùng chúng tôi cập nhật các xu hướng AI!#
Những ngày đầu năm 2024 chứng kiến các đột phá mang tính nền tảng trong AI và nhiều cột mốc công nghệ quan trọng. Nhưng đây mới chỉ là khởi đầu cho những gì AI có thể làm. Nếu bạn muốn tìm hiểu thêm về những phát triển AI mới nhất, Ultralytics luôn sẵn sàng hỗ trợ bạn.
Hãy xem repository GitHub của chúng tôi để tìm hiểu những đóng góp mới nhất trong computer vision và AI. Bạn cũng có thể xem các trang giải pháp của chúng tôi để biết AI đang được ứng dụng như thế nào trong các ngành như sản xuất và chăm sóc sức khỏe.






