GPT-4o của OpenAI cho thấy tiềm năng của AI
Khám phá GPT-4o mới của OpenAI, được trang bị AI tiên tiến với các tương tác sống động như thật, làm thay đổi cách chúng ta giao tiếp với công nghệ. Khám phá những tính năng đột phá của model này!

Vào thứ Hai, ngày 13 tháng 5 năm 2024, OpenAI đã công bố ra mắt model chủ lực mới của mình là GPT-4o, trong đó chữ 'o' là viết tắt của 'omni'. GPT-4o là một model AI đa phương thức tiên tiến dành cho các tương tác văn bản, âm thanh và hình ảnh theo thời gian thực, cung cấp tốc độ xử lý nhanh hơn, hỗ trợ đa ngôn ngữ và độ an toàn cao hơn.
Model này mang đến những khả năng AI tạo sinh chưa từng thấy. Dựa trên thế mạnh hội thoại của ChatGPT, các tính năng của GPT-4o đánh dấu một bước tiến đáng kể trong cách con người nhìn nhận AI. Giờ đây, chúng ta có thể trò chuyện với GPT-4o như thể đó là một người thật. Hãy cùng tìm hiểu chính xác GPT-4o có thể làm được gì!
Tìm hiểu về GPT-4o#
Tại sự kiện cập nhật mùa xuân của OpenAI, người ta tiết lộ rằng mặc dù GPT-4o thông minh ngang GPT-4, model này có thể xử lý dữ liệu nhanh hơn và được tối ưu tốt hơn để xử lý văn bản, hình ảnh và âm thanh. Không giống các phiên bản trước tập trung vào việc làm cho model thông minh hơn, phiên bản này được phát triển với mục tiêu giúp AI dễ sử dụng hơn đối với đông đảo người dùng.

Hình 1. Bản cập nhật mùa xuân của OpenAI
Chế độ giọng nói của ChatGPT, được phát hành vào cuối năm ngoái, sử dụng ba model khác nhau để cùng chuyển giọng nói đầu vào thành văn bản, hiểu và tạo câu trả lời dạng văn bản, rồi chuyển văn bản thành giọng nói để người dùng nghe phản hồi. Chế độ này gặp vấn đề về độ trễ và không tạo cảm giác tự nhiên. GPT-4o có thể xử lý trực tiếp văn bản, hình ảnh và âm thanh trong một lần, tạo cho người dùng ấn tượng rằng họ đang tham gia một cuộc trò chuyện tự nhiên.
Ngoài ra, không giống chế độ giọng nói, giờ đây bạn có thể ngắt lời GPT-4o khi model đang nói và model sẽ phản ứng giống như một người thật. Model sẽ dừng lại để lắng nghe, sau đó đưa ra phản hồi theo thời gian thực dựa trên những gì bạn nói. Model cũng có thể thể hiện cảm xúc qua giọng nói và hiểu giọng điệu của bạn.
Các tính năng thú vị của GPT-4o#
Kết quả đánh giá model GPT-4o cho thấy mức độ tiên tiến của model này. Một trong những kết quả đáng chú ý nhất là GPT-4o cải thiện đáng kể khả năng nhận dạng giọng nói so với Whisper-v3 ở mọi ngôn ngữ, đặc biệt là những ngôn ngữ ít được sử dụng.
Hiệu năng ASR âm thanh (ASR) đo lường mức độ chính xác của một model khi chuyển ngôn ngữ nói thành văn bản. Hiệu năng của GPT-4o được theo dõi bằng Tỷ lệ lỗi từ (WER), cho biết phần trăm số từ được chép lại không chính xác (WER thấp hơn đồng nghĩa với chất lượng tốt hơn). Biểu đồ dưới đây cho thấy WER thấp hơn của GPT-4o ở nhiều khu vực, qua đó chứng minh hiệu quả của model trong việc cải thiện khả năng nhận dạng giọng nói đối với các ngôn ngữ có nguồn lực hạn chế.

Hình 2. GPT-4o có khả năng nhận dạng giọng nói vượt trội ở nhiều ngôn ngữ.
Dưới đây là một số tính năng độc đáo khác của GPT-4o:
- Nhanh hơn - Tốc độ của model này nhanh gấp đôi GPT-4 Turbo. Model có thể phản hồi đầu vào âm thanh chỉ trong 232 mili giây, tương đương thời gian phản hồi trong hội thoại của con người.
- Tiết kiệm chi phí - Phiên bản API của GPT-4o rẻ hơn 50% so với GPT-4 Turbo.
- Ghi nhớ - GPT-4o có khả năng duy trì nhận thức giữa các cuộc trò chuyện khác nhau. Model có thể nhớ bạn đang nói về điều gì trong các cuộc chat khác nhau.
- Đa ngôn ngữ - GPT-4o được huấn luyện để cải thiện tốc độ và chất lượng ở 50 ngôn ngữ khác nhau.
Ví dụ về những gì GPT-4o có thể làm#
Giờ đây, bạn có thể mở GPT-4o trên điện thoại, bật camera và yêu cầu GPT-4o, như thể đang hỏi một người bạn, đoán tâm trạng của bạn dựa trên biểu cảm khuôn mặt. GPT-4o có thể quan sát bạn qua camera và trả lời.

Hình 3. GPT-4o hiểu tâm trạng của con người qua video.
Bạn thậm chí có thể sử dụng model để hỗ trợ giải các bài toán bằng cách cho GPT-4o xem những gì bạn đang viết qua video. Ngoài ra, bạn có thể chia sẻ màn hình để model trở thành một gia sư hữu ích trên Khan Academy, yêu cầu bạn chỉ ra các phần khác nhau của một tam giác trong hình học, như minh họa bên dưới.

Hình 4. GPT-4o hoạt động như một gia sư trên Khan Academy.
Ngoài việc hỗ trợ trẻ em học toán, các developer có thể trò chuyện với GPT-4o để debug code. Điều này trở nên khả thi nhờ ChatGPT được ra mắt dưới dạng ứng dụng desktop. Nếu bạn bôi chọn và sao chép code bằng CTRL “C” trong khi trò chuyện với ứng dụng giọng nói GPT-4o trên desktop, model sẽ có thể đọc code của bạn. Hoặc bạn có thể sử dụng model để dịch các cuộc trò chuyện giữa những developer nói các ngôn ngữ khác nhau.
Những khả năng với GPT-4o dường như là vô tận. Một trong những màn demo thú vị nhất của OpenAI đã sử dụng hai điện thoại để cho thấy GPT-4o trò chuyện với các phiên bản khác nhau của chính nó và cùng nhau hát.

Hình 5. AI trò chuyện và hát cùng AI.
Các ứng dụng của GPT-4o#
Như được minh họa trong một màn demo, GPT-4o có thể giúp thế giới trở nên dễ tiếp cận hơn đối với người khiếm thị. Model có thể hỗ trợ họ tương tác và di chuyển an toàn, độc lập hơn. Ví dụ, người dùng có thể bật video và cho GPT-4o xem khung cảnh đường phố. Sau đó, GPT-4o có thể cung cấp mô tả môi trường theo thời gian thực, chẳng hạn như xác định chướng ngại vật, đọc biển báo đường phố hoặc hướng dẫn họ đến một địa điểm cụ thể. Model thậm chí có thể giúp họ gọi taxi bằng cách thông báo khi taxi đang đến gần.

Hình 6. GPT-4o thông báo taxi đang đến gần.
Tương tự, GPT-4o có thể chuyển đổi nhiều ngành công nghiệp nhờ các khả năng tiên tiến của mình. Trong lĩnh vực bán lẻ, model có thể cải thiện dịch vụ khách hàng bằng cách hỗ trợ theo thời gian thực, trả lời câu hỏi và giúp khách hàng tìm sản phẩm cả trực tuyến lẫn tại cửa hàng. Giả sử bạn đang nhìn vào một kệ hàng nhưng không thể tìm ra sản phẩm mình cần, GPT-4o có thể hỗ trợ bạn.
Trong lĩnh vực chăm sóc sức khỏe, GPT-4o có thể hỗ trợ chẩn đoán bằng cách phân tích dữ liệu bệnh nhân, đề xuất các tình trạng có thể xảy ra dựa trên triệu chứng và đưa ra hướng dẫn về các phương án điều trị. Model cũng có thể hỗ trợ chuyên gia y tế bằng cách tóm tắt hồ sơ bệnh nhân, cung cấp quyền truy cập nhanh vào tài liệu y khoa và thậm chí dịch ngôn ngữ theo thời gian thực để giao tiếp với bệnh nhân nói các ngôn ngữ khác nhau. Đây chỉ là một vài ví dụ. Các ứng dụng của GPT-4o giúp cuộc sống hằng ngày trở nên dễ dàng hơn bằng cách cung cấp hỗ trợ phù hợp với từng người, nhận biết ngữ cảnh và phá bỏ rào cản đối với thông tin cũng như giao tiếp.
GPT-4o và độ an toàn của model#
Cũng như các phiên bản GPT trước đây, vốn đã tác động đến cuộc sống của hàng trăm triệu người, GPT-4o có khả năng sẽ tương tác với âm thanh và video theo thời gian thực trên toàn cầu, khiến độ an toàn trở thành yếu tố then chốt trong các ứng dụng này. OpenAI đã rất thận trọng khi xây dựng GPT-4o, tập trung vào việc giảm thiểu các rủi ro tiềm ẩn.
Để đảm bảo độ an toàn và độ tin cậy, OpenAI đã triển khai các biện pháp an toàn nghiêm ngặt. Các biện pháp này bao gồm lọc dữ liệu huấn luyện, tinh chỉnh hành vi của model sau huấn luyện và tích hợp các hệ thống an toàn mới để quản lý đầu ra giọng nói. Ngoài ra, GPT-4o đã được hơn 70 chuyên gia bên ngoài kiểm thử chuyên sâu trong các lĩnh vực như tâm lý học xã hội, thiên kiến và tính công bằng cũng như thông tin sai lệch. Việc kiểm thử bên ngoài giúp đảm bảo mọi rủi ro do các tính năng mới tạo ra hoặc khuếch đại đều được xác định và xử lý.
Để duy trì các tiêu chuẩn an toàn cao, OpenAI sẽ từng bước phát hành các tính năng của GPT-4o trong vài tuần tới. Việc triển khai theo từng giai đoạn cho phép OpenAI theo dõi hiệu năng, xử lý các vấn đề và thu thập phản hồi từ người dùng. Cách tiếp cận thận trọng này đảm bảo GPT-4o cung cấp các khả năng tiên tiến đồng thời duy trì tiêu chuẩn cao nhất về an toàn và sử dụng có đạo đức.
Tự mình trải nghiệm GPT-4o#
GPT-4o được cung cấp miễn phí. Để trải nghiệm khả năng hội thoại theo thời gian thực được đề cập ở trên, bạn có thể tải ứng dụng ChatGPT trực tiếp về điện thoại từ Google Play Store hoặc Apple App Store.
Sau khi đăng nhập, bạn có thể chọn GPT-4o từ danh sách hiển thị bằng cách nhấn vào biểu tượng ba dấu chấm ở góc trên bên phải màn hình. Sau khi chuyển đến một cuộc chat được bật GPT-4o, nếu nhấn vào dấu cộng ở góc dưới bên trái màn hình, bạn sẽ thấy nhiều tùy chọn đầu vào. Ở góc dưới bên phải màn hình, bạn sẽ thấy biểu tượng tai nghe. Khi chọn biểu tượng tai nghe, bạn sẽ được hỏi có muốn trải nghiệm phiên bản GPT-4o rảnh tay hay không. Sau khi đồng ý, bạn có thể trải nghiệm GPT-4o như minh họa bên dưới.

Hình 7. Trải nghiệm GPT-4o trên ứng dụng ChatGPT dành cho thiết bị di động.
Nếu muốn tích hợp các khả năng tiên tiến của GPT-4o vào dự án riêng, bạn có thể sử dụng model dưới dạng API dành cho developer. API cho phép bạn tích hợp khả năng nhận dạng giọng nói mạnh mẽ, hỗ trợ đa ngôn ngữ và hội thoại theo thời gian thực của GPT-4o vào ứng dụng. Bằng cách sử dụng API, bạn có thể nâng cao trải nghiệm người dùng, xây dựng các ứng dụng thông minh hơn và đưa công nghệ AI tiên tiến vào nhiều lĩnh vực khác nhau.
GPT-4o: Vẫn chưa hoàn toàn giống con người#
Mặc dù GPT-4o tiên tiến hơn nhiều so với các model AI trước đây, điều quan trọng cần nhớ là GPT-4o vẫn có những hạn chế riêng. OpenAI cho biết đôi khi model có thể chuyển ngôn ngữ ngẫu nhiên trong khi trò chuyện, từ tiếng Anh sang tiếng Pháp. Họ cũng nhận thấy GPT-4o đôi khi dịch không chính xác giữa các ngôn ngữ. Khi có thêm nhiều người trải nghiệm model, chúng ta sẽ hiểu rõ hơn GPT-4o vượt trội ở đâu và cần được cải thiện thêm ở điểm nào.
Tóm lại#
GPT-4o của OpenAI mở ra những hướng đi mới cho AI nhờ khả năng xử lý văn bản, hình ảnh và âm thanh tiên tiến, mang đến tương tác tự nhiên như con người. Model nổi bật về tốc độ, hiệu quả chi phí và hỗ trợ đa ngôn ngữ. GPT-4o là một công cụ linh hoạt cho giáo dục, khả năng tiếp cận và hỗ trợ theo thời gian thực. Khi người dùng khám phá các khả năng của GPT-4o, phản hồi của họ sẽ thúc đẩy model tiếp tục phát triển. GPT-4o chứng minh rằng AI thực sự đang thay đổi thế giới và trở thành một phần trong cuộc sống hằng ngày của chúng ta.
Khám phá repository GitHub của chúng tôi và tham gia cộng đồng để tìm hiểu sâu hơn về AI. Truy cập các trang giải pháp của chúng tôi để xem AI đang chuyển đổi những ngành như sản xuất và nông nghiệp.









