Các cập nhật mới nhất từ OpenAI: Canvas, Tinh chỉnh thị giác và hơn thế nữa
Hãy cùng chúng tôi xem xét kỹ hơn các bản cập nhật ChatGPT gần đây do OpenAI phát hành. Chúng ta sẽ khám phá Canvas, tinh chỉnh (fine-tuning) cho khả năng thị giác và tính năng Tìm kiếm mới nhất.

Sau lần cuối chúng ta tìm hiểu về OpenAI's o1 models vào tháng 9 (được thiết kế để cải thiện khả năng suy luận), nhiều tính năng mới và thú vị đã được thêm vào ChatGPT. Một số bản phát hành này hướng đến các nhà phát triển, trong khi những bản khác được thiết kế để cải thiện trải nghiệm người dùng. Nhìn chung, mỗi bản nâng cấp giúp việc tương tác với ChatGPT trở nên trực quan và hiệu quả hơn.
Các bản cập nhật như Canvas, được thiết kế để viết và lập trình cộng tác, và fine-tuning cho vision capabilities giúp cải thiện cách ChatGPT xử lý images, đã thu hút rất nhiều sự quan tâm, khuyến khích người dùng khám phá nhiều khả năng sáng tạo hơn. Trong khi đó, các nâng cấp kỹ thuật, như các API mới và báo cáo kiểm tra tính công bằng, giải quyết các khía cạnh như integration model và các thực hành ethical AI. Hãy cùng tìm hiểu sâu hơn và nắm bắt rõ hơn về các tính năng ChatGPT mới nhất từ OpenAI!
Tổng quan về tính năng Canvas của OpenAI#
Canvas là bản cập nhật lớn đầu tiên cho giao diện người dùng (UI) của ChatGPT kể từ khi ra mắt. Đây là một giao diện mới với bố cục hai màn hình, thanh bên trái chứa các câu lệnh (prompt) và cửa sổ bên phải hiển thị phản hồi. UI mới này loại bỏ cấu trúc màn hình đơn kiểu trò chuyện thông thường và chuyển sang bố cục hai màn hình, phù hợp cho nhu cầu đa nhiệm nhằm tăng năng suất.

Hình 1. Canvas mang các cập nhật giao diện đến ChatGPT.
Trước khi Canvas được giới thiệu, việc làm việc với các documents dài trên ChatGPT đồng nghĩa với việc phải cuộn lên cuộn xuống khá nhiều. Trong giao diện mới, các prompt được hiển thị ở thanh bên trái, và tài liệu văn bản hoặc đoạn code chiếm phần lớn màn hình. Nếu cần thiết, bạn thậm chí có thể tùy chỉnh kích thước của thanh bên trái và màn hình đầu ra. Ngoài ra, bạn có thể chọn một phần văn bản hoặc một đoạn code và chỉnh sửa phần cụ thể đó mà không làm thay đổi toàn bộ tài liệu.

Hình 2. Chỉnh sửa các phần văn bản cụ thể bằng Canvas.
Nếu bạn sử dụng Canvas, bạn sẽ nhận thấy không có nút hoặc công tắc cụ thể nào để mở nó trên giao diện ChatGPT. Thay vào đó, khi bạn đang làm việc với model GPT-4o, Canvas sẽ tự động mở nếu nó phát hiện bạn đang editing, writing, hoặc coding. Đối với các prompt đơn giản hơn, nó sẽ ở trạng thái không hoạt động. Nếu bạn muốn mở thủ công, bạn có thể sử dụng các prompt như "Open the Canvas" hoặc "Get me the Canvas layout."
Hiện tại, Canvas đang trong giai đoạn beta và chỉ khả dụng với GPT-4o. Tuy nhiên, OpenAI cho biết Canvas sẽ có sẵn cho tất cả người dùng miễn phí khi nó chính thức ra mắt khỏi giai đoạn beta.
Các cập nhật API của ChatGPT#
OpenAI đã phát hành ba bản cập nhật API ChatGPT mới nhằm cải thiện hiệu suất, khả năng mở rộng và tính linh hoạt. Hãy cùng xem xét kỹ hơn từng bản cập nhật này.
Chưng cất model (Model distillation)#
Sử dụng tính năng Model Distillation thông qua OpenAI API, các nhà phát triển có thể tận dụng đầu ra của các advanced models như GPT-4o hoặc o1-preview để nâng cao performance của các model nhỏ hơn, tiết kiệm chi phí hơn như GPT-4o mini. Chưng cất model là một quá trình liên quan đến việc training các model nhỏ hơn để mô phỏng hành vi của các model tiên tiến hơn, giúp chúng hiệu quả hơn cho specific tasks.
Trước khi tính năng này được giới thiệu, các nhà phát triển phải thủ công phối hợp nhiều tác vụ khác nhau bằng cách sử dụng các công cụ khác nhau. Các tác vụ này bao gồm tạo datasets, đo lường model performance, và fine-tuning các model, điều này thường làm cho quá trình trở nên phức tạp và dễ xảy ra lỗi. Bản cập nhật Model Distillation cho phép các nhà phát triển sử dụng Stored Completions, một công cụ cho phép họ tự động generate datasets bằng cách thu thập và lưu trữ các cặp đầu vào-đầu ra được tạo bởi các model tiên tiến thông qua API.
Một tính năng khác của Model Distillation, Evals (hiện đang trong giai đoạn beta), giúp đo lường mức độ hoạt động của một model performs trên các tác vụ cụ thể, mà không cần tạo các tập lệnh evaluation tùy chỉnh hoặc sử dụng các công cụ riêng biệt. Bằng cách sử dụng các dataset được generated với Stored Completions và evaluating performance bằng Evals, các nhà phát triển có thể fine-tune các model GPT tùy chỉnh của riêng họ.

Hình 3. Bạn có thể sử dụng Evals để đo lường hiệu suất model.
Bộ nhớ đệm câu lệnh (Prompt caching)#
Thông thường khi xây dựng AI applications, đặc biệt là chatbots, cùng một context (thông tin nền hoặc lịch sử hội thoại trước đó cần thiết để hiểu yêu cầu hiện tại) sẽ được sử dụng lặp đi lặp lại cho nhiều lệnh gọi API. Prompt Caching giúp các nhà phát triển có thể tái sử dụng các input tokens gần đây (các phân đoạn văn bản mà model xử lý để hiểu prompt và tạo ra phản hồi), giúp giảm chi phí và độ trễ.
Từ ngày 1 tháng 10, OpenAI đã tự động áp dụng Prompt Caching cho các model của mình như GPT-4o, GPT-4o mini, o1-preview và o1-mini. Điều này có nghĩa là khi các nhà phát triển sử dụng API để tương tác với một model có prompt dài (hơn 1.024 token), hệ thống sẽ lưu lại các phần mà nó đã xử lý.
Bằng cách này, nếu các câu lệnh tương tự hoặc giống hệt nhau được sử dụng lại, hệ thống có thể bỏ qua việc tính toán lại các phần đó. Hệ thống tự động lưu vào bộ nhớ đệm phần dài nhất của câu lệnh mà nó đã gặp trước đó, bắt đầu với 1.024 token và cộng thêm theo từng khối 128 token khi câu lệnh trở nên dài hơn.
Realtime API#
Việc tạo ra một voice assistant thường liên quan đến việc cần chuyển đổi audio to text, xử lý văn bản, và sau đó chuyển đổi ngược lại thành audio to play phản hồi. Realtime API của OpenAI nhằm mục đích xử lý toàn bộ quá trình này chỉ với một yêu cầu API duy nhất. Bằng cách làm cho quá trình trở nên đơn giản hơn, API cho phép thực hiện các cuộc trò chuyện thời gian thực với AI.
Ví dụ, một trợ lý giọng nói tích hợp với Realtime API có thể thực hiện các hành động cụ thể, chẳng hạn như placing an order hoặc finding information, dựa trên yêu cầu của người dùng. API làm cho trợ lý giọng nói có độ phản hồi cao hơn và có khả năng thích ứng nhanh chóng với nhu cầu của người dùng. Realtime API đã có sẵn thông qua bản beta công khai vào ngày 1 tháng 10, với sáu giọng nói. Vào ngày 30 tháng 10, thêm năm giọng nói nữa đã được thêm vào, tổng cộng có mười một giọng nói khả dụng.

Hình 4. Một ví dụ về việc sử dụng Realtime API để luyện tập hội thoại bằng một ngôn ngữ mới.
Tinh chỉnh ChatGPT cho các tác vụ vision#
Ban đầu, model ngôn ngữ vision GPT-4o chỉ có thể được tinh chỉnh và tùy chỉnh bằng cách sử dụng các dataset chỉ toàn văn bản. Giờ đây, với việc phát hành API tinh chỉnh vision, các nhà phát triển có thể huấn luyện và tùy chỉnh GPT-4o bằng các dataset hình ảnh. Kể từ khi ra mắt, tinh chỉnh vision đã trở thành một chủ đề quan trọng được các nhà phát triển và kỹ sư thị giác máy tính (computer vision) quan tâm.
Để tinh chỉnh khả năng vision của GPT-4o, nhà phát triển có thể sử dụng các dataset hình ảnh từ ít nhất 100 ảnh đến tối đa 50.000 ảnh. Sau khi đảm bảo dataset khớp với định dạng yêu cầu của OpenAI, nó có thể được tải lên nền tảng OpenAI và model có thể được tinh chỉnh cho các ứng dụng cụ thể.
Ví dụ, Automat, một công ty tự động hóa, đã sử dụng một tập dataset gồm các ảnh chụp màn hình để train GPT-4o có khả năng nhận diện các phần tử UI trên màn hình dựa trên mô tả. Điều này giúp tối ưu hóa Tự động hóa Quy trình Rô-bốt (RPA) bằng cách giúp các bot dễ dàng tương tác với giao diện người dùng hơn. Thay vì dựa vào các tọa độ cố định hoặc quy tắc bộ chọn phức tạp, model có thể nhận diện các phần tử UI dựa trên các mô tả đơn giản, giúp các thiết lập tự động hóa dễ thích ứng hơn và dễ bảo trì hơn khi giao diện thay đổi.

Hình 5. Sử dụng phiên bản đã được fine-tune của model GPT-4o để phát hiện các phần tử UI.
ChatGPT và việc phát hiện sự thiên kiến và công bằng#
Ethical concerns xung quanh AI applications là một chủ đề thảo luận nổi bật khi AI ngày càng trở nên tiên tiến hơn. Vì các phản hồi của ChatGPT dựa trên các prompt do người dùng cung cấp và dữ liệu có sẵn trên Internet, nên việc tinh chỉnh ngôn ngữ của nó để có trách nhiệm mọi lúc có thể là một thử thách. Các báo cáo cho biết ChatGPT’s answers are biased về tên, giới tính và chủng tộc. Để giải quyết vấn đề này, đội ngũ nội bộ của OpenAI đã tiến hành một bài kiểm tra tính công bằng góc nhìn thứ nhất.
Tên thường mang những gợi ý tinh tế về our culture và các yếu tố địa lý. Trong hầu hết các trường hợp, ChatGPT sẽ bỏ qua các gợi ý tinh tế trong tên. Tuy nhiên, trong một số trường hợp, tên phản ánh chủng tộc hoặc văn hóa dẫn đến các phản hồi khác nhau từ ChatGPT, với khoảng 1% trong số này phản ánh harmful language. Việc loại bỏ sự thiên vị và ngôn ngữ có hại là một nhiệm vụ khó khăn đối với một language model. Tuy nhiên, bằng cách chia sẻ những phát hiện này công khai và thừa nhận những hạn chế của model, OpenAI giúp người dùng tinh chỉnh prompt của họ để đạt được các câu trả lời trung lập hơn, không bị thiên vị.

Hình 6. Một ví dụ về các phản hồi khác nhau do tên của người dùng.
Tìm hiểu về tìm kiếm trên ChatGPT#
Khi ChatGPT mới ra mắt, đã có những cuộc thảo luận trong cộng đồng AI về việc liệu nó có thể thay thế trình duyệt web truyền thống hay không. Hiện nay, nhiều người dùng đang sử dụng ChatGPT thay vì Google Search.
Bản cập nhật mới của OpenAI, tính năng Tìm kiếm (Search), đưa điều này đi xa hơn nữa. Với Tìm kiếm, ChatGPT tạo ra các phản hồi cập nhật và bao gồm các liên kết đến các nguồn liên quan. Kể từ ngày 31 tháng 10, tính năng Tìm kiếm đã có sẵn cho tất cả người dùng ChatGPT Plus và Team, làm cho ChatGPT hoạt động giống như một công cụ tìm kiếm được hỗ trợ bởi AI.

Hình 7. Một ví dụ về việc sử dụng tính năng Search mới của ChatGPT.
Hướng tới tương lai#
Các cập nhật gần đây của ChatGPT tập trung vào việc làm cho AI trở nên hữu ích, linh hoạt và công bằng hơn. Tính năng Canvas mới giúp người dùng làm việc hiệu quả hơn, trong khi việc tinh chỉnh vision cho phép các nhà phát triển tùy chỉnh các model để xử lý tốt hơn các tác vụ thị giác. Giải quyết sự công bằng và giảm bớt thiên kiến cũng là những ưu tiên chính, đảm bảo AI hoạt động tốt cho tất cả mọi người, bất kể họ là ai. Cho dù bạn là nhà phát triển đang tinh chỉnh model hay chỉ đang sử dụng các tính năng mới nhất, ChatGPT đang phát triển để đáp ứng nhiều nhu cầu khác nhau. Với khả năng thời gian thực, tích hợp thị giác và sự tập trung vào việc sử dụng có trách nhiệm, các bản cập nhật này đang xây dựng một trải nghiệm AI đáng tin cậy và hiệu quả hơn cho tất cả mọi người.
Khám phá thêm về AI bằng cách truy cập GitHub repository của chúng tôi và tham gia community của chúng tôi. Tìm hiểu thêm về các ứng dụng AI trong self-driving và healthcare.






