Phân tích chuyên sâu các khả năng của GPT-4o Mini của OpenAI
Khám phá các tính năng và ứng dụng của GPT-4o Mini. Model mới nhất và tiết kiệm chi phí nhất của OpenAI cung cấp các khả năng AI nâng cao với chi phí rẻ hơn 60% so với GPT-3.5 Turbo.

Vào tháng 5 năm 2024, OpenAI đã phát hành GPT-4o, và giờ đây, chỉ ba tháng sau, họ đã trở lại với một model ấn tượng khác: GPT-4o Mini. Vào ngày 18 tháng 7 năm 2024, OpenAI giới thiệu GPT-4o Mini. Họ gọi đây là “model tiết kiệm chi phí nhất” của mình! GPT-4o Mini là một model nhỏ gọn, kế thừa các khả năng của những model trước đó và hướng đến việc giúp AI tiên tiến trở nên dễ tiếp cận và hợp túi tiền hơn.
GPT-4o Mini hiện hỗ trợ tương tác bằng văn bản và hình ảnh, với các bản cập nhật trong tương lai dự kiến bổ sung khả năng xử lý hình ảnh, video và âm thanh. Trong bài viết này, chúng ta sẽ tìm hiểu GPT-4o Mini là gì, các tính năng nổi bật, cách sử dụng, sự khác biệt giữa GPT-4 và GPT-4o Mini, cũng như cách sử dụng model này trong nhiều use case computer vision khác nhau. Hãy cùng tìm hiểu GPT-4o Mini có thể mang lại những gì!
GPT-4o Mini là gì?#
GPT-4o Mini là bổ sung mới nhất vào dòng model AI của OpenAI, được thiết kế để tiết kiệm chi phí và dễ tiếp cận hơn. Đây là một mô hình ngôn ngữ lớn (LLM) đa phương thức, nghĩa là model có thể xử lý và tạo ra nhiều loại dữ liệu khác nhau, chẳng hạn như văn bản, hình ảnh, video và âm thanh. Model này kế thừa thế mạnh của các model trước đó như GPT-4 và GPT-4o để cung cấp các khả năng mạnh mẽ trong một gói nhỏ gọn.
GPT-4o Mini rẻ hơn 60% so với GPT-3.5 Turbo, với chi phí 15 cent cho mỗi triệu token đầu vào (đơn vị văn bản hoặc dữ liệu mà model xử lý) và 60 cent cho mỗi triệu token đầu ra (đơn vị mà model tạo ra để phản hồi). Để dễ hình dung, một triệu token tương đương với việc xử lý khoảng 2.500 trang văn bản. Với context window 128K token và khả năng xử lý tối đa 16K token đầu ra cho mỗi request, GPT-4o Mini được thiết kế để vừa hiệu quả vừa tiết kiệm chi phí.

Hình 1. GPT-4o Mini rẻ hơn 60% so với GPT-3.5 Turbo.
Các tính năng chính của GPT-4o Mini#
GPT-4o Mini hỗ trợ nhiều tác vụ, khiến model này trở thành lựa chọn phù hợp cho nhiều ứng dụng khác nhau. Model có thể được sử dụng khi chạy đồng thời nhiều operation, chẳng hạn như gọi nhiều API, xử lý lượng dữ liệu lớn như toàn bộ codebase hoặc lịch sử hội thoại, và cung cấp phản hồi nhanh theo thời gian thực trong chatbot hỗ trợ khách hàng.
Dưới đây là một số tính năng chính khác:
- Knowledge Base được cập nhật: Model chứa thông tin đến tháng 10 năm 2023.
- Tokenizer được cải thiện: GPT-4o Mini giúp xử lý văn bản không phải tiếng Anh tiết kiệm chi phí hơn.
- Biện pháp an toàn mạnh mẽ: Các biện pháp này bao gồm lọc nội dung có hại và bảo vệ trước các vấn đề bảo mật như prompt injection và thao túng hệ thống.
Bắt đầu sử dụng GPT-4o Mini#
Bạn có thể dùng thử GPT-4o Mini thông qua giao diện ChatGPT. Model này khả dụng cho người dùng gói Free, Plus và Team, thay thế GPT-3.5 như minh họa bên dưới. Người dùng gói Enterprise cũng sẽ sớm được truy cập, phù hợp với mục tiêu của OpenAI là mang lại lợi ích của AI cho tất cả mọi người. GPT-4o Mini cũng khả dụng thông qua API dành cho các developer muốn tích hợp các khả năng của model vào ứng dụng của mình. Hiện tại, các khả năng vision chỉ có thể được truy cập thông qua API.

Hình 2. Các tùy chọn model trong ChatGPT.
Sự khác biệt giữa GPT-4o và GPT-4o Mini#
GPT-4o Mini và GPT-4o đều đạt kết quả ấn tượng trên nhiều benchmark khác nhau. Mặc dù GPT-4o nhìn chung vượt trội hơn GPT-4o Mini, GPT-4o Mini vẫn là một giải pháp tiết kiệm chi phí cho các tác vụ hằng ngày. Các benchmark bao gồm tác vụ suy luận, năng lực toán học và coding, cũng như suy luận đa phương thức. Như trong hình bên dưới, GPT-4o Mini đạt điểm khá cao khi so sánh với các model phổ biến khác.

Hình 3. So sánh GPT-4o Mini với các model phổ biến khác.
Trải nghiệm thực tế với GPT-4o và GPT-4o Mini#
Một prompt thú vị từng được thảo luận trên mạng liên quan đến việc các LLM phổ biến so sánh không chính xác các số thập phân. Khi kiểm tra GPT-4o và GPT-4o Mini, khả năng suy luận của chúng cho thấy sự khác biệt rõ ràng. Trong hình bên dưới, chúng tôi hỏi cả hai model số nào lớn hơn: 9.11 hay 9.9, sau đó yêu cầu chúng giải thích quá trình suy luận.

Hình 4. Kiểm tra GPT-4o và GPT-4o Mini.
Ban đầu, cả hai model đều trả lời sai và cho rằng 9.11 lớn hơn. Tuy nhiên, GPT-4o có thể tự suy luận để đưa ra đáp án đúng và khẳng định 9.9 lớn hơn. Model cung cấp lời giải thích chi tiết và so sánh chính xác các số thập phân. Ngược lại, GPT-4o Mini vẫn cố chấp giữ câu trả lời ban đầu dù đã xác định đúng lý do 9.9 lớn hơn.
Cả hai model đều thể hiện kỹ năng suy luận tốt. Khả năng tự sửa lỗi của GPT-4o khiến model này vượt trội hơn và hữu ích cho các tác vụ phức tạp hơn. GPT-4o Mini tuy kém linh hoạt hơn nhưng vẫn cung cấp khả năng suy luận rõ ràng và chính xác cho các tác vụ đơn giản.
Sử dụng GPT-4o Mini cho nhiều use case computer vision khác nhau#
Nếu muốn khám phá các khả năng vision của GPT-4o Mini mà không cần đi sâu vào code, bạn có thể dễ dàng kiểm thử API trên OpenAI Playground. Chúng tôi cũng đã tự thử nghiệm để xem GPT-4o Mini xử lý tốt đến đâu các use case liên quan đến computer vision.
Phân loại hình ảnh bằng GPT-4o Mini#
Chúng tôi yêu cầu GPT-4o Mini phân loại hai hình ảnh: một hình ảnh con bướm và một hình ảnh bản đồ. Model AI đã xác định chính xác con bướm và bản đồ. Đây là một tác vụ khá đơn giản vì hai hình ảnh rất khác nhau.

Hình 5. Phân loại hình ảnh với sự hỗ trợ của GPT-4o Mini.
Sau đó, chúng tôi đưa thêm hai hình ảnh qua model: một hình ảnh cho thấy con bướm đậu trên cây và một hình ảnh cho thấy con bướm đậu trên mặt đất. AI lại thực hiện rất tốt, xác định chính xác con bướm trên cây và con bướm trên mặt đất. Vì vậy, chúng tôi tiếp tục nâng độ khó.

Hình 6. Phân loại các hình ảnh tương tự với sự hỗ trợ của GPT-4o Mini.
Tiếp theo, chúng tôi yêu cầu GPT-4o Mini phân loại hai hình ảnh: một hình ảnh cho thấy con bướm đang hút mật từ hoa Swamp Milkweed và hình ảnh còn lại cho thấy con bướm đang hút mật từ hoa Zinnia. Thật ấn tượng khi model có thể phân loại một nhãn cụ thể đến vậy mà không cần fine-tuning thêm. Những ví dụ nhanh này cho thấy GPT-4o Mini có thể được sử dụng cho các tác vụ phân loại hình ảnh mà không cần custom training.

Hình 7. Phân loại các hình ảnh chi tiết với sự hỗ trợ của GPT-4o Mini.
Tìm hiểu tư thế bằng GPT-4o Mini#
Hiện tại, các tác vụ computer vision như phát hiện đối tượng và phân đoạn instance chưa thể được xử lý bằng GPT-4o Mini. GPT-4o gặp khó khăn về độ chính xác nhưng vẫn có thể được sử dụng cho các tác vụ này. Tương tự, đối với việc tìm hiểu tư thế, chúng ta không thể phát hiện hoặc ước tính tư thế trong hình ảnh, nhưng có thể phân loại và tìm hiểu tư thế đó.

Hình 8. Sử dụng GPT-4o Mini để tìm hiểu các tư thế trong hình ảnh.
Hình ảnh trên cho thấy GPT-4o Mini có thể phân loại và tìm hiểu các tư thế, dù không thể phát hiện hoặc ước tính tọa độ chính xác của tư thế. Điều này có thể hữu ích trong nhiều ứng dụng khác nhau. Ví dụ, trong phân tích thể thao, model có thể đánh giá tổng quát chuyển động của vận động viên và hỗ trợ phòng tránh chấn thương. Tương tự, trong vật lý trị liệu, model có thể hỗ trợ theo dõi các bài tập để đảm bảo bệnh nhân thực hiện đúng động tác trong quá trình phục hồi chức năng. Trong lĩnh vực giám sát, model cũng có thể xác định các hoạt động đáng ngờ bằng cách phân tích ngôn ngữ cơ thể tổng quát. Mặc dù GPT-4o Mini không thể phát hiện các keypoint cụ thể, khả năng phân loại các tư thế tổng quát khiến model hữu ích trong những lĩnh vực này và nhiều lĩnh vực khác.
Các ứng dụng phù hợp với GPT-4o Mini#
Chúng ta đã tìm hiểu GPT-4o Mini có thể làm gì. Bây giờ, hãy thảo luận về những ứng dụng mà GPT-4o Mini phù hợp nhất.
GPT-4o Mini phù hợp với các ứng dụng yêu cầu khả năng hiểu ngôn ngữ tự nhiên nâng cao và có footprint tính toán nhỏ. Model giúp tích hợp AI vào những ứng dụng mà trước đây chi phí triển khai thường quá cao. Trên thực tế, một phân tích chi tiết của Artificial Analysis cho thấy GPT-4o Mini cung cấp phản hồi chất lượng cao với tốc độ cực nhanh so với hầu hết các model khác.

Hình 9. Chất lượng so với tốc độ đầu ra của GPT-4o Mini.
Dưới đây là một số lĩnh vực chính mà model có thể phát huy hiệu quả trong tương lai:
- Trợ lý ảo và Chatbot: GPT-4o Mini có thể cung cấp phản hồi nhanh và thông minh để cải thiện tương tác với người dùng.
- Công cụ giáo dục: Model có thể được sử dụng để xây dựng các công cụ cung cấp gia sư cá nhân hóa và tạo nội dung.
- Công cụ năng suất: Model có thể cải thiện các tác vụ như tóm tắt tài liệu, soạn email và dịch ngôn ngữ để nâng cao hiệu quả.
- Dịch ngôn ngữ: Phiên bản GPT mới nhất có thể được sử dụng để phát triển các trình dịch, cung cấp khả năng dịch ngôn ngữ chính xác theo thời gian thực nhằm cải thiện giao tiếp giữa các ngôn ngữ khác nhau.
GPT-4o Mini mở ra những cơ hội mới#
GPT-4o Mini đang tạo ra những cơ hội mới cho tương lai của AI đa phương thức. Chi phí xử lý mỗi phần văn bản hoặc dữ liệu, được gọi là chi phí trên mỗi token, đã giảm đáng kể — gần 99% — kể từ năm 2022, khi text-davinci-003, model GPT-3, được phát hành. Mức giảm chi phí cho thấy xu hướng rõ ràng hướng đến việc làm cho AI tiên tiến trở nên hợp túi tiền hơn. Khi các model AI tiếp tục được cải thiện, khả năng tích hợp AI vào mọi ứng dụng và website với chi phí hợp lý ngày càng trở nên khả thi về mặt kinh tế!
Bạn muốn trải nghiệm thực tế với AI? Hãy truy cập repository GitHub của chúng tôi để xem các đổi mới và tham gia cộng đồng năng động. Tìm hiểu thêm về các ứng dụng AI trong sản xuất và nông nghiệp trên các trang giải pháp của chúng tôi.






