Ultralytics YOLO27:
Vision AI

Các bản cập nhật mới nhất của OpenAI: Canvas, fine-tuning cho Vision và hơn thế nữa

Hãy cùng xem xét kỹ hơn các bản cập nhật ChatGPT gần đây do OpenAI phát hành. Chúng ta sẽ khám phá Canvas, fine-tuning cho các khả năng vision và tính năng Search mới nhất.

ABAbirami Vina11 min read
Tổng quan về các bản cập nhật ChatGPT mới nhất của OpenAI

Sau lần gần nhất chúng ta xem xét các model o1 của OpenAI vào tháng 9 (được thiết kế để cải thiện khả năng suy luận), nhiều tính năng mới và thú vị đã được bổ sung vào ChatGPT. Một số bản phát hành hướng đến developer, trong khi những bản khác được thiết kế để hoàn thiện trải nghiệm người dùng. Nhìn chung, mỗi bản nâng cấp đều giúp các tương tác với ChatGPT trở nên trực quan và hiệu quả hơn.

Các bản cập nhật như Canvas, được thiết kế cho viết và lập trình cộng tác, cùng tính năng fine-tuning cho khả năng thị giác, giúp cải thiện cách ChatGPT làm việc với hình ảnh, đã thu hút nhiều sự quan tâm và khuyến khích người dùng khám phá thêm các khả năng sáng tạo. Trong khi đó, những nâng cấp kỹ thuật như API mới và báo cáo kiểm thử tính công bằng giải quyết các khía cạnh như tích hợp model và các thực hành AI có đạo đức. Hãy cùng tìm hiểu để hiểu rõ hơn về các tính năng ChatGPT mới nhất của OpenAI!

Tổng quan về tính năng Canvas của OpenAI#

Canvas là bản cập nhật lớn đầu tiên cho giao diện người dùng (UI) của ChatGPT kể từ khi ra mắt. Đây là một giao diện mới với bố cục hai màn hình, prompt ở thanh bên trái và câu trả lời trong cửa sổ bên phải. UI mới loại bỏ quy trình làm việc quen thuộc với cấu trúc trò chuyện trên một màn hình duy nhất, chuyển sang bố cục hai màn hình phù hợp với mục đích đa nhiệm để tăng năng suất.

Canvas mang đến các cập nhật UI cho ChatGPT

Hình 1. Canvas mang đến các cập nhật UI cho ChatGPT.

Trước khi Canvas được giới thiệu, làm việc với tài liệu dài trên ChatGPT đồng nghĩa với việc phải cuộn lên xuống khá nhiều. Trong bố cục mới, prompt được hiển thị ở thanh bên trái, còn tài liệu văn bản hoặc đoạn code chiếm phần lớn màn hình. Nếu cần, bạn thậm chí có thể tùy chỉnh kích thước của thanh bên trái và màn hình đầu ra. Ngoài ra, bạn có thể chọn một phần văn bản hoặc một đoạn code rồi chỉnh sửa phần cụ thể đó mà không làm thay đổi toàn bộ tài liệu.

Chỉnh sửa các phần văn bản cụ thể bằng Canvas

Hình 2. Chỉnh sửa các phần văn bản cụ thể bằng Canvas.

Nếu sử dụng Canvas, bạn sẽ nhận thấy không có nút hoặc công tắc cụ thể nào để mở tính năng này trên giao diện ChatGPT. Thay vào đó, khi làm việc với model GPT-4o, Canvas sẽ tự động mở nếu phát hiện bạn đang chỉnh sửa, viết hoặc lập trình. Với các prompt đơn giản hơn, tính năng này vẫn không hoạt động. Nếu muốn mở thủ công, bạn có thể sử dụng các prompt như "Open the Canvas" hoặc "Get me the Canvas layout."

Hiện tại, Canvas đang ở giai đoạn beta và chỉ khả dụng với GPT-4o. Tuy nhiên, OpenAI cho biết Canvas sẽ khả dụng cho tất cả người dùng miễn phí khi thoát khỏi giai đoạn beta.

Các cập nhật API của ChatGPT#

OpenAI đã phát hành ba bản cập nhật API ChatGPT mới nhằm cải thiện hiệu suất, khả năng mở rộng và tính linh hoạt. Hãy cùng xem xét kỹ hơn từng bản cập nhật này.

Chưng cất model#

Thông qua tính năng Model Distillation của các API OpenAI, developer có thể sử dụng đầu ra của các model nâng cao như GPT-4o hoặc o1-preview để cải thiện hiệu suất của các model nhỏ hơn, tiết kiệm chi phí như GPT-4o mini. Chưng cất model là một quy trình đào tạo các model nhỏ hơn để mô phỏng hành vi của những model nâng cao hơn, giúp chúng hoạt động hiệu quả hơn cho các tác vụ cụ thể.

Trước khi tính năng này được giới thiệu, developer phải điều phối thủ công nhiều tác vụ bằng các công cụ khác nhau. Các tác vụ này bao gồm tạo dataset, đo hiệu suất modelfine-tuning model, khiến quy trình thường trở nên phức tạp và dễ phát sinh lỗi. Bản cập nhật Model Distillation cho phép developer sử dụng Stored Completions, một công cụ giúp họ tự động tạo dataset bằng cách thu thập và lưu trữ các cặp đầu vào-đầu ra do những model nâng cao tạo ra thông qua API.

Một tính năng khác của Model Distillation là Evals (hiện đang ở giai đoạn beta), giúp đo lường mức độ model thực hiện tốt các tác vụ cụ thể mà không cần tạo các script đánh giá tùy chỉnh hoặc sử dụng công cụ riêng. Bằng cách sử dụng các dataset được tạo bằng Stored Completions và đánh giá hiệu suất bằng Evals, developer có thể fine-tune các model GPT tùy chỉnh của riêng mình.

Sử dụng Evals để đo lường hiệu suất model

Hình 3. Bạn có thể sử dụng Evals để đo lường hiệu suất model.

Caching prompt#

Khi xây dựng ứng dụng AI, đặc biệt là chatbot, cùng một context (thông tin nền hoặc lịch sử hội thoại trước đó cần thiết để hiểu yêu cầu hiện tại) thường được sử dụng lặp lại trong nhiều lệnh gọi API. Prompt Caching cho phép developer tái sử dụng các input token được dùng gần đây (các đoạn văn bản mà model xử lý để hiểu prompt và tạo câu trả lời), giúp giảm chi phí và độ trễ.

Kể từ ngày 1 tháng 10, OpenAI đã tự động áp dụng Prompt Caching cho các model như GPT-4o, GPT-4o mini, o1-preview và o1-mini. Điều này có nghĩa là khi developer sử dụng API để tương tác với một model có prompt dài (hơn 1.024 token), hệ thống sẽ lưu lại những phần đã được xử lý.

Nhờ đó, nếu sử dụng lại các prompt giống hoặc tương tự, hệ thống có thể bỏ qua việc tính toán lại những phần đó. Hệ thống tự động cache phần dài nhất của prompt mà nó đã gặp trước đó, bắt đầu từ 1.024 token và bổ sung theo từng khối 128 token khi prompt dài hơn.

Realtime API#

Việc tạo một trợ lý giọng nói thường đòi hỏi phải chuyển âm thanh thành văn bản, xử lý văn bản rồi chuyển đổi lại thành âm thanh để phát câu trả lời. Realtime API của OpenAI hướng đến việc xử lý toàn bộ quy trình này bằng một yêu cầu API duy nhất. Bằng cách đơn giản hóa quy trình, API cho phép trò chuyện với AI theo thời gian thực.

Ví dụ, một trợ lý giọng nói được tích hợp với Realtime API có thể thực hiện các hành động cụ thể như đặt hàng hoặc tìm kiếm thông tin dựa trên yêu cầu của người dùng. API giúp trợ lý giọng nói phản hồi nhanh hơn và thích ứng nhanh với nhu cầu của người dùng. Realtime API được cung cấp thông qua bản beta công khai vào ngày 1 tháng 10 với sáu giọng nói. Ngày 30 tháng 10, năm giọng nói khác được bổ sung, nâng tổng số giọng nói khả dụng lên mười một.

Sử dụng Realtime API để thực hành hội thoại bằng một ngôn ngữ mới

Hình 4. Ví dụ về việc sử dụng Realtime API để thực hành hội thoại bằng một ngôn ngữ mới.

Fine-tuning ChatGPT cho các tác vụ thị giác#

Ban đầu, vision language model GPT-4o chỉ có thể được fine-tune và tùy chỉnh bằng các dataset chỉ chứa văn bản. Hiện nay, với việc phát hành vision fine-tuning API, developer có thể đào tạo và tùy chỉnh GPT-4o bằng các dataset hình ảnh. Kể từ khi ra mắt, vision fine-tuning đã trở thành một chủ đề được các developer và kỹ sư computer vision đặc biệt quan tâm.

Để fine-tune khả năng thị giác của GPT-4o, developer có thể sử dụng các dataset hình ảnh với số lượng từ ít nhất 100 đến nhiều nhất 50.000 ảnh. Sau khi đảm bảo dataset phù hợp với format mà OpenAI yêu cầu, dataset có thể được tải lên nền tảng OpenAI và model có thể được fine-tune cho các ứng dụng cụ thể.

Ví dụ, Automat, một công ty tự động hóa, đã sử dụng dataset gồm các ảnh chụp màn hình để đào tạo GPT-4o có khả năng xác định các phần tử UI trên màn hình dựa trên mô tả. Điều này giúp tinh gọn Tự động hóa quy trình bằng robot (RPA) bằng cách giúp bot tương tác với giao diện người dùng dễ dàng hơn. Thay vì phụ thuộc vào tọa độ cố định hoặc các quy tắc selector phức tạp, model có thể xác định các phần tử UI dựa trên những mô tả đơn giản, giúp thiết lập tự động hóa dễ thích ứng hơn và dễ bảo trì hơn khi giao diện thay đổi.

Sử dụng model GPT-4o đã fine-tune để phát hiện các phần tử UI

Hình 5. Sử dụng phiên bản model GPT-4o đã fine-tune để phát hiện các phần tử UI.

Tính công bằng và phát hiện thiên kiến của ChatGPT#

Các mối quan ngại về đạo đức xoay quanh ứng dụng AI đang là chủ đề thảo luận nổi bật khi AI ngày càng tiên tiến. Vì câu trả lời của ChatGPT dựa trên prompt do người dùng cung cấp và dữ liệu có sẵn trên Internet, việc fine-tune ngôn ngữ của hệ thống để luôn có trách nhiệm có thể là một thách thức. Các báo cáo cho biết câu trả lời của ChatGPT có thiên kiến dựa trên tên, giới tính và chủng tộc. Để giải quyết vấn đề này, nhóm nội bộ của OpenAI đã tiến hành một bài kiểm tra tính công bằng ở ngôi thứ nhất.

Tên thường mang theo những dấu hiệu tinh tế về văn hóa của chúng ta và các yếu tố địa lý. Trong hầu hết trường hợp, ChatGPT sẽ bỏ qua những dấu hiệu tinh tế trong tên. Tuy nhiên, trong một số trường hợp, những cái tên phản ánh chủng tộc hoặc văn hóa dẫn đến các câu trả lời khác nhau từ ChatGPT, trong đó khoảng 1% chứa ngôn ngữ gây hại. Loại bỏ thiên kiến và ngôn ngữ gây hại là một nhiệm vụ đầy thách thức đối với language model. Tuy nhiên, bằng cách công khai chia sẻ những phát hiện này và thừa nhận các hạn chế của model, OpenAI giúp người dùng tinh chỉnh prompt để đạt được câu trả lời trung lập và không thiên kiến hơn.

Ví dụ về các câu trả lời ChatGPT khác nhau do tên của người dùng

Hình 6. Ví dụ về các câu trả lời khác nhau do tên của người dùng.

Tìm hiểu về tính năng tìm kiếm của ChatGPT#

Khi ChatGPT lần đầu ra mắt, cộng đồng AI đã thảo luận về việc liệu công cụ này có thể thay thế hoạt động duyệt web truyền thống hay không. Hiện nay, nhiều người dùng đang sử dụng ChatGPT thay cho Google Search.

Bản cập nhật mới của OpenAI, tính năng Search, đưa điều này tiến thêm một bước. Với Search, ChatGPT tạo ra các câu trả lời cập nhật và bao gồm liên kết đến các nguồn liên quan. Tính đến ngày 31 tháng 10, tính năng Search khả dụng cho tất cả người dùng ChatGPT Plus và Team, giúp ChatGPT hoạt động giống một công cụ tìm kiếm được hỗ trợ bởi AI hơn.

Ví dụ về việc sử dụng tính năng Search mới của ChatGPT

Hình 7. Ví dụ về việc sử dụng tính năng Search mới của ChatGPT.

Chặng đường phía trước#

Các bản cập nhật gần đây của ChatGPT tập trung vào việc làm cho AI trở nên hữu ích, linh hoạt và công bằng hơn. Tính năng Canvas mới giúp người dùng làm việc hiệu quả hơn, trong khi vision fine-tuning cho phép developer tùy chỉnh model để xử lý tốt hơn các tác vụ trực quan. Giải quyết vấn đề công bằng và giảm thiên kiến cũng là những ưu tiên quan trọng, bảo đảm AI hoạt động tốt cho mọi người, bất kể họ là ai. Dù bạn là developer đang fine-tune model hay chỉ sử dụng các tính năng mới nhất, ChatGPT đang phát triển để đáp ứng nhiều nhu cầu khác nhau. Với các khả năng theo thời gian thực, tích hợp thị giác và trọng tâm là việc sử dụng có trách nhiệm, những bản cập nhật này đang xây dựng trải nghiệm AI đáng tin cậy và vững chắc hơn cho tất cả mọi người.

Khám phá thêm về AI bằng cách truy cập repository GitHub của chúng tôi và tham gia cộng đồng. Tìm hiểu thêm về các ứng dụng AI trong lĩnh vực xe tự láichăm sóc sức khỏe.

Explore solutions

Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Thị giác máy tính cho hình ảnh trên không

Thị giác máy tính cho hình ảnh trên không

Biến đổi hình ảnh từ máyδ bay không người lái và ảnh chụp trên không thành thông tin chi tiết thời gian thực cho nông nghiệp, nuôi trồng thủy sản, giám sát môi trường, bảo tồn và phân tích không gian địa lý với Ultralytics YOLO.
Tìm hiểu thêm
Thị giác máy tính trong hàng không vũ trụ

Thị giác máy tính trong hàng không vũ trụ

Mang thị giác AI đến với hoạt động giám sát trên không bằng các model Ultralytics YOLO. Cung cấp sức mạnh cho máy bay không người lái, quy trình hàng không vũ trụ, bảo tồn môi trường & ngành công nghiệp địa không gian với các giải pháp thị giác máy tính.
Tìm hiểu thêm

Bảo vệ mọi địa điểm bằng các model Ultralytics YOLO. Thị giác AI cung cấp sức mạnh cho việc giám sát chu vi, phát hiện mối đe dọa, nhận diện biển số xe và an toàn nơi làm việc.
Tìm hiểu thêm
Thị giác máy tính trong robotics

Thị giác máy tính trong robotics

Nâng cao năng lực cho máy móc thông minh hơn với các model Ultralytics YOLO. Vision AI trong robotics hỗ trợ điều hướng tự động, nhận thức, theo dõi đối tượng và điều khiển theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong logistics

Thị giác máy tính trong logistics

Tinh gọn logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra kiện hàng, phân loại, theo dõi phương tiện và giám sát an toàn kho theo thời gian thực.
Tìm hiểu thêm
Thị giác máy tính trong bán lẻ

Thị giác máy tính trong bán lẻ

Định hình lại ngành bán lẻ với các model Ultralytics YOLO. Vision AI hỗ trợ tracking hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và cung cấp insight khách hàng thông minh hơn.
Tìm hiểu thêm
Computer vision trong healthcare

Computer vision trong healthcare

Xây dựng các giải pháp healthcare với các model Ultralytics YOLO. Vision AI trong healthcare thúc đẩy chẩn đoán hình ảnh nhanh hơn, chẩn đoán thông minh hơn và giám sát bệnh nhân.
Tìm hiểu thêm
Computer vision trong sản xuất

Computer vision trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Computer vision trong ngành ô tô

Computer vision trong ngành ô tô

Ứng dụng computer vision trong ngành ô tô với các model Ultralytics YOLO. Vision AI nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện để tạo nên những tuyến đường thông minh hơn.
Tìm hiểu thêm
Computer vision trong nông nghiệp

Computer vision trong nông nghiệp

Đưa vision AI vào nông nghiệp thông minh với các model Ultralytics YOLO. Thúc đẩy giám sát cây trồng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning