OpenAI o1: Một chuỗi model OpenAI mới cho suy luận AI
Tìm hiểu về các model OpenAI o1 mới ra mắt và điều gì làm cho chúng trở nên đặc biệt. Chúng tôi cũng sẽ xem xét cách chúng hoạt động và tác động của chúng đối với tương lai của AI.

Cộng đồng AI đang xôn xao bàn tán về bước đi tiếp theo của OpenAI’s GPT models, với nhiều người gọi đây là "Project Strawberry." Lý do đằng sau điều này là nếu bạn prompt GPT-4o bằng cách hỏi có bao nhiêu chữ R trong từ "strawberry," nó sẽ trả lời rằng có hai chữ R trong từ "strawberry." Điều này có vẻ kỳ lạ khi xét đến độ mạnh mẽ của GPT-4o. Tuy nhiên, model được xây dựng để xử lý các tầng nghĩa ngầm thay vì các từ chính xác. Có tin đồn rằng model tiếp theo sẽ nhắm tới việc giải quyết vấn đề này. Sam Altman càng làm bùng lên các tin đồn này khi đăng các bức ảnh quả dâu tây trên X (formerly known as Twitter) account của mình.
Với OpenAI’s latest announcement vào thứ Năm ngày 12 tháng 9, cuối cùng chúng ta cũng có câu trả lời cho những đồn đoán! OpenAI o1, một dòng AI models mới được thiết kế để chậm lại và suy nghĩ trước khi phản hồi, đã chính thức ra mắt. Thật thú vị, OpenAI o1 có khả năng suy luận tốt hơn và trả lời đúng câu hỏi về quả dâu tây! Trong bài viết này, chúng ta sẽ thảo luận OpenAI o1 là gì, cách thức hoạt động, các trường hợp ứng dụng và ý nghĩa của nó đối với tương lai của AI. Hãy cùng bắt đầu nhé!

Fig 1. Ví dụ về việc prompt OpenAI o1 về quả dâu tây.
Những tiến bộ mới trong AI của OpenAI#
Vào tháng 7 năm 2024, các giám đốc điều hành của OpenAI đã chia sẻ rằng nghiên cứu của OpenAI đang tiến gần đến cấp độ giải quyết vấn đề của con người, được gọi là level 2 of AI. Rõ ràng cấp độ này tập trung vào khả năng suy luận khi OpenAI giới thiệu dòng model mới, OpenAI o1, với đặc tính suy nghĩ trước khi trả lời. OpenAI o1 là một LLM (large language model) mới, một AI model hiểu và tạo ra văn bản giống con người bằng cách học các mẫu từ lượng dữ liệu ngôn ngữ khổng lồ. Nó được thiết kế để xử lý các bài toán phức tạp đòi hỏi tư duy chiều sâu.

Fig 2. Góc nhìn của OpenAI về các giai đoạn phát triển của AI.
Model được trained sử dụng reinforcement learning, một kỹ thuật trong đó model học cách đưa ra các quyết định tốt hơn thông qua thử và sai bằng cách nhận phần thưởng hoặc hình phạt cho các hành động của mình. Thuật toán reinforcement learning giúp model suy nghĩ hiệu quả hơn bằng cách tuân theo một chuỗi tư duy. OpenAI cũng chia sẻ rằng performance của o1 tiếp tục cải thiện nhờ quá trình reinforcement learning lớn hơn trong khi training và thời gian "suy nghĩ" nhiều hơn trong quá trình giải quyết vấn đề, cho thấy cả việc mở rộng training lẫn xử lý chu đáo đều giúp thúc đẩy năng lực của model.
Mặc dù OpenAI o1 là một bước tiến đáng kể cho suy luận phức tạp, nó vẫn là một model sơ khai và thiếu một số tính năng làm cho ChatGPT trở nên hữu ích, chẳng hạn như duyệt web hoặc tải lên tệp và hình ảnh. Đối với nhiều tác vụ phổ biến, GPT-4o hiện tại vẫn có thể mạnh hơn. Tuy nhiên, OpenAI o1 đánh dấu một bước tiến lớn trong khả năng của AI trong việc xử lý suy luận phức tạp, đó là lý do tại sao OpenAI đang bắt đầu một dòng mới và gọi nó là OpenAI o1.
Các model mới của OpenAI nâng cao khả năng suy luận AI như thế nào#
OpenAI o1 có thể được sử dụng cho các tác vụ như giải mã mật mã, giải quyết các thử thách lập trình, giải toán, xử lý ô chữ, và thậm chí giải quyết các chủ đề phức tạp trong science, safety, và healthcare. Để hưởng ứng đầy hài hước đối với tên mã của dự án, OpenAI đã thể hiện reasoning skills của model bằng cách bẻ khóa một đoạn mật mã tiết lộ thông điệp "THERE ARE THREE R’S IN STRAWBERRY."
Ngoài việc giải mã, OpenAI o1 cũng rất thành thạo về lập trình. Nó hoạt động tốt trong các thử thách lập trình cạnh tranh như trên Codeforces, một nền tảng nơi các lập trình viên giải quyết các bài toán lập trình phức tạp trong điều kiện giới hạn thời gian. Trong các thử thách này, model đạt được điểm số Elo cao (hệ thống tính điểm đo lường cấp độ kỹ năng dựa trên hiệu suất thi đấu với các đối thủ khác) và vượt trội hơn các models trước đó. Nó cũng xuất sắc trong toán học và đạt kết quả tốt trong các exams như American Invitational Mathematics Examination (AIME).

Fig 3. Đánh giá năng lực lập trình của o1.
Những tiến bộ này định vị OpenAI o1 như một bản nâng cấp đáng kể so với các models trước đó như GPT-4o. Nó mở ra những khả năng mới cho AI trong các lĩnh vực như business, phát triển, research, và healthcare. Ví dụ, trong genetics research, OpenAI o1 có thể nhanh chóng rà soát một số lượng lớn các bài báo nghiên cứu, chọn lọc ra các phát hiện quan trọng và mối liên hệ giữa các dấu ấn di học và diseases. Nó hiểu được ngôn ngữ khoa học phức tạp và có thể tóm tắt các điểm quan trọng, giúp các nhà nghiên cứu tập trung vào thông tin phù hợp nhất.
Tìm hiểu kỹ hơn về chuỗi suy nghĩ#
Chúng ta đã thấy trước đó rằng OpenAI o1 giới thiệu quy trình suy luận "Chain of Thought". Nó cho phép model giải quyết các bài toán phức tạp theo cách tương tự như các chiến lược nhận thức của con người. Model có thể chia nhỏ các thử thách thành các bước nhỏ hơn, dễ quản lý hơn và lặp đi lặp lại để tinh chỉnh cách tiếp cận của mình. Không giống như các models trước đây dựa vào pattern recognition tức thời, o1 tối ưu hóa việc ra quyết định của mình bằng cách khám phá nhiều luồng suy luận, học hỏi từ cả thành công lẫn sai lầm thông qua reinforcement learning.
OpenAI đã quyết định giữ kín các chuỗi tư duy thô này với người dùng, thay vào đó cung cấp các bản tóm tắt mang lại cái nhìn chi tiết về quá trình suy luận của model mà không phơi bày mọi bước. Quyết định này giúp ngăn chặn việc lạm dụng quá trình tư duy của model đồng thời cho phép các nhà phát triển theo dõi và tinh chỉnh sự an toàn cũng như sự liên kết của AI. Bằng cách quan sát các chuỗi ẩn ở bên trong, các nhà phát triển có thể đảm bảo rằng o1 tuân thủ ethical guidelines và tránh các hành vi có hại.
Đánh giá OpenAI o1#
OpenAI o1 cho thấy những cải tiến lớn so với GPT-4o trong một số benchmarks kiểm tra khả năng suy luận và giải quyết vấn đề. Tại American Invitational Mathematics Examination (AIME) 2024, một kỳ thi toán học đầy thử thách dành cho học sinh trung học xuất sắc, o1 đạt tỷ lệ chính xác 74% chỉ với một mẫu cho mỗi bài toán, so với mức 12% của GPT-4o. Với sự đồng thuận trên 64 mẫu, độ chính xác của nó tăng lên 83%, và bằng cách sử dụng phương pháp sắp xếp lại được tinh chỉnh với 1.000 mẫu, nó đạt 93%, lọt vào top 500 học sinh toàn quốc.
Ngoài toán học, o1 cũng thể hiện cực kỳ tốt trên các benchmarks kiểm tra kiến thức khoa học, như GPQA Diamond, bao gồm các câu hỏi cấp độ tiến sĩ về hóa học, physics, và biology. Đáng chú ý, o1 đã vượt trội hơn các chuyên gia con người có bằng tiến sĩ trong bài kiểm tra này, trở thành AI model đầu tiên làm được điều đó. Nó cũng vượt qua GPT-4o ở 54 trên 57 danh mục trong benchmark MMLU, kiểm tra sự hiểu biết trên nhiều chủ đề đa dạng, bao gồm history, law, và khoa học.

Fig 4. Đánh giá OpenAI o1.
Trải nghiệm thực tế với OpenAI o1#
OpenAI đã giới thiệu hai model AI mới trong dòng o1: o1-preview và o1-mini. Model o1-preview được thiết kế để suy nghĩ sâu hơn trước khi phản hồi, vượt trội trong các tác vụ suy luận phức tạp về khoa học, lập trình và toán học. Nó cung cấp các khả năng giải quyết vấn đề nâng cao cho người dùng thực hiện các dự án đầy thử thách. Ngược lại, o1-mini là một model nhỏ hơn, nhanh hơn và tiết kiệm chi phí hơn được tối ưu hóa đặc biệt cho suy luận STEM, đặc biệt là toán học và lập trình. Mặc dù nó có thể có kiến thức thế giới ít rộng hơn, o1-mini gần như đạt hiệu suất của o1-preview trên các đánh giá chính như cuộc thi toán AIME và các thử thách lập trình Codeforces, tất cả với chi phí thấp hơn 80%.

Fig 5. So sánh các OpenAI Models.
Bạn có thể thử nghiệm các model này thông qua nhiều nền tảng của OpenAI. Người dùng ChatGPT Plus và Team có thể truy cập cả o1-preview và o1-mini thông qua bộ chọn model, trải nghiệm các khả năng suy luận nâng cao trực tiếp trong ChatGPT. Các nhà phát triển có quyền truy cập API cấp 5 có thể bắt đầu tạo mẫu với các model này, mặc dù một số tính năng nâng cao vẫn đang được phát triển. OpenAI cũng có kế hoạch sớm cung cấp o1-mini cho tất cả người dùng ChatGPT Free. Bằng cách khám phá các model này, bạn có thể trực tiếp trải nghiệm những tiến bộ trong suy luận AI và chọn model phù hợp nhất với nhu cầu của mình.
Các cân nhắc về AI đạo đức của OpenAI#
OpenAI đã tập trung vào ethics and safety trong quá trình phát triển dòng o1 model. Trước khi phát hành các o1-preview và o1-mini models, họ đã tiến hành các đánh giá kỹ lưỡng, bao gồm các bài kiểm tra bên ngoài và kiểm tra nội bộ đối với các rủi ro như nội dung bị cấm, hiện tượng ảo giác (hallucinations), và thiên vị. Các models được thiết kế với các khả năng suy luận nâng cao để hiểu rõ hơn và tuân thủ các quy tắc an toàn.
OpenAI cũng đã triển khai các biện pháp bảo vệ như danh sách chặn và bộ phân loại an toàn để quản lý rủi ro. o1 model có mức xếp hạng rủi ro tổng thể ở mức trung bình. Nó có rủi ro thấp trong các lĩnh vực như an ninh mạng và tính tự chủ của model, đồng thời có rủi ro trung bình trong các lĩnh vực như nội dung CBRN (Hóa học, Sinh học, Phóng xạ và Hạt nhân) và tính thuyết phục. Nhóm Cố vấn An toàn và Ban Giám đốc của OpenAI đã xem xét các safety measures này để đảm bảo model an toàn và có đạo đức khi sử dụng.

Fig 6. Bảng điểm OpenAI o1.
Từ tin đồn đến hiện thực: OpenAI o1 xuất hiện#
OpenAI o1 là một bước tiến lớn trong suy luận AI, biến một số tin đồn ban đầu thành hiện thực. Không giống như GPT-4o, dòng o1 suy nghĩ sâu hơn bằng cách sử dụng phương pháp "Chuỗi suy nghĩ", chia nhỏ các vấn đề phức tạp thành các bước nhỏ hơn để có phản hồi tốt hơn. Hiện có sẵn dưới dạng xem trước sớm trong ChatGPT và API, OpenAI có kế hoạch thêm các tính năng như duyệt web và tải lên tệp và hình ảnh. OpenAI cũng chia sẻ rằng họ có kế hoạch tiếp tục phát triển và phát hành các model trong dòng GPT, cùng với dòng OpenAI o1 mới. Khi AI tiếp tục phát triển, những tiến bộ như thế này đang mở đường cho các hệ thống AI mạnh mẽ, trực quan và linh hoạt hơn, có thể hỗ trợ và hiểu nhu cầu con người tốt hơn.
Cập nhật các thông tin mới nhất về AI bằng cách tham gia our community! Hãy truy cập GitHub repository của chúng tôi để xem cách chúng tôi tiên phong tạo ra các giải pháp AI trong các lĩnh vực như manufacturing và healthcare. 🚀






