Bảo mật cấp doanh nghiệp: Tuân thủ ISO 27001 + SOC 2 Type I.
Quay lại Bảng thuật ngữ Ultralytics

Chunked Prefill

Tìm hiểu cách prefill theo từng khối (chunked prefill) cải thiện độ trễ và thông lượng suy luận LLM bằng cách chia các prompt dài thành các khối token để phục vụ mượt mà hơn dưới các khối lượng công việc đồng thời.

Chunked prefill là một kỹ thuật lập lịch suy luận (inference scheduling) chia một prompt đầu vào dài thành các nhóm tokens nhỏ hơn thay vì xử lý toàn bộ prompt trong một thao tác liên tục không ngắt quãng. Một engine suy luận có thể đan xen các chunk này với quá trình tạo token cho các yêu cầu khác, ngăn không cho một prompt dài chiếm dụng toàn bộ GPU. Kết quả thường là độ trễ mượt mà hơn dưới các workload đồng thời, hiệu suất tận dụng phần cứng tốt hơn và dịch vụ dễ dự đoán hơn cho các ứng dụng large language model tương tác.

Cách thức hoạt động của Chunked Prefill#

Quá trình suy luận Transformer tự hồi quy (autoregressive) có hai giai đoạn chính:

  • Prefill: Model xử lý tất cả các token đầu vào, tính toán trạng thái chú ý (attention states) và điền vào KV cache. Giai đoạn prefill đánh giá nhiều token song song và thường bị giới hạn bởi khả năng tính toán (compute-bound).
  • Decode: Model tạo ra đầu ra từng token một trong khi đọc các trạng thái đã được cache trước đó. Giai đoạn decode thường bị giới hạn bởi băng thông bộ nhớ thay vì khả năng tính toán thô.

Nếu không chia chunk, một yêu cầu 20.000 token có thể chiếm một bước suy luận lâu hơn rất nhiều so với một yêu cầu ngắn. Các tiến trình tạo sinh đang hoạt động sau đó có thể gặp tình trạng tạm dừng, làm tăng độ trễ giữa các token ngay cả khi prompt của chính chúng rất nhỏ.

Với chunked prefill, bộ lập lịch gán cho mỗi lần lặp một ngân sách token (token budget). Nó lập lịch cho các hoạt động decode đang hoạt động trước, sau đó sử dụng ngân sách còn lại cho một hoặc nhiều chunk prompt. Nếu một prompt không vừa, các token còn lại của nó sẽ chờ cho lần lặp sau. vLLM optimization guidance hiện tại mô tả phương pháp này như một cách kết hợp công việc prefill nặng về tính toán với quá trình decode nặng về bộ nhớ.

Việc chia chunk làm thay đổi thời điểm các token prompt được xử lý, chứ không thay đổi thứ tự hay ý nghĩa của chúng. Mỗi chunk hoàn thành sẽ mở rộng trạng thái attention đã cache của yêu cầu cho đến khi toàn bộ prompt sẵn sàng và quá trình decoding có thể bắt đầu.

Tại sao Chunked Prefill lại quan trọng#

Chunked prefill giải quyết các mục tiêu hiệu năng cạnh tranh trong model serving ở môi trường production:

  • Độ trễ giữa các token (Inter-token latency): Ưu tiên các yêu cầu decode hiện có giúp các phản hồi được stream tiếp tục mà không bị dừng lại lâu.
  • Thời gian tới token đầu tiên (Time to first token): Các chunk lớn hoàn thành một prompt mới sớm hơn, trong khi các chunk rất nhỏ có thể làm chậm token đầu tiên được tạo ra của nó.
  • Thông lượng (Throughput): Kết hợp công việc prefill và decode có thể tận dụng năng lực tính toán GPU và băng thông bộ nhớ hiệu quả hơn.
  • Tính công bằng (Fairness): Các prompt dài ít có khả năng chặn nhiều yêu cầu tương tác ngắn.

Do đó, cài đặt chunk hoặc ngân sách token là một sự đánh đổi. vLLM scheduler configuration cung cấp các tùy chọn điều khiển giới hạn token theo batch, prefill một phần và ngưỡng cho prompt dài. Ngân sách nhỏ thường ưu tiên cho decoding phản hồi nhanh, trong khi ngân sách lớn ưu tiên nạp prompt nhanh hơn.

Việc chia chunk không loại bỏ mọi điểm nghẽn (bottleneck). Ngữ cảnh dài vẫn tiêu tốn bộ nhớ cache, và việc tiếp nhận quá mức có thể gây áp lực lên cache, tranh chấp yêu cầu (request preemption) hoặc lặp lại công việc. Các nhà vận hành nên đo lường độ trễ suy luận trung vị và đuôi (inference latency), thời gian tới token đầu tiên, độ trễ giữa các token, thông lượng và mức sử dụng bộ nhớ GPU dưới các phân phối prompt thực tế.

Các khái niệm suy luận liên quan#

Chunked prefill gắn kết chặt chẽ với một số tối ưu hóa nhưng phục vụ một mục đích riêng biệt:

  • Continuous batching: Tự động thêm và xóa các yêu cầu một cách động trong quá trình tạo sinh. Chunked prefill bổ trợ cho phương pháp này bằng cách giúp việc xử lý prompt dài có thể được lập lịch ở các ranh giới cấp token.
  • Prompt caching: Tái sử dụng các trạng thái đã tính toán trước đó cho tiền tố prompt được lặp lại. Chunked prefill lên lịch cho các tính toán mới; nó không bỏ qua các tính toán đó.
  • Quản lý Paged KV-cache: Tổ chức các trạng thái attention đã cache thành các khối bộ nhớ. TensorRT-LLM overview của NVIDIA bao gồm tính năng cache phân trang (paged caching) và gom batch khi đang chạy (in-flight batching) bên cạnh các tối ưu hóa xử lý prompt.
  • Dynamic batching: Kết hợp các yêu cầu riêng biệt thành các batch, như được giải thích trong NVIDIA Triton dynamic batching guide. Phương pháp này không nhất thiết phải chia một prompt dài cá nhân thành các prefill một phần.
  • Disaggregated prefill and decode: Chạy các giai đoạn trên các worker riêng biệt. prefill and decode deployment guidance của NVIDIA cho thấy cách các giai đoạn này có thể được scale độc lập thay vào đó.

Mặc dù Ultralytics YOLO26 Triton deployment workflow hỗ trợ suy luận thị giác máy tính có thể scale và gom batch tự động, nhưng phát hiện đối tượng YOLO tiêu chuẩn không có giai đoạn prefill văn bản tự hồi quy. Chunked prefill áp dụng chủ yếu cho các model ngôn ngữ tạo sinh và model đa phương thức (multimodal models).

Các ứng dụng trong thực tế#

  1. Trợ lý tài liệu: Một trợ lý tăng cường truy xuất (retrieval-augmented assistant) có thể nhận một báo cáo dài trong khi đồng thời phục vụ người dùng với các câu hỏi ngắn. Việc chia nhỏ phần prefill của báo cáo cho phép các cuộc trò chuyện đang diễn ra tiếp tục decoding thay vì bị đóng băng cho đến khi toàn bộ ngữ cảnh được xử lý xong.

  2. Phân tích video đa phương thức: Một vision-language model có thể nhận các đặc trưng hình ảnh, mô tả đối tượng và một chỉ thị văn bản dài. Một pipeline thị giác có thể tạo ra các phát hiện trước bằng cách sử dụng Ultralytics YOLO prediction, sau đó gửi ngữ cảnh trực quan có cấu trúc đến model tạo sinh. Chunked prefill giúp lên lịch cho các token hình ảnh và văn bản kết quả cùng với các yêu cầu khác. multimodal encode-prefill-decode workflow của NVIDIA minh họa lý do tại sao việc quản lý độc lập các giai đoạn này có thể cải thiện khả năng scale.

Hướng dẫn triển khai thực tế#

Chỉ bật chunked prefill thông qua một engine serving hỗ trợ chính thức kiến trúc mục tiêu. Ví dụ: TensorRT-LLM backend configuration tài liệu hóa các điều khiển ngữ cảnh được chia chunk cho các bản triển khai được hỗ trợ.

Đánh giá hiệu năng (benchmark) với độ đồng thời, độ dài đầu vào và độ dài đầu ra thực tế thay vì dựa vào một yêu cầu đơn lẻ. Bắt đầu với ngân sách token được khuyến nghị của runtime, sau đó điều chỉnh trong khi theo dõi thời gian tới token đầu tiên và độ trễ giữa các token. Cuối cùng, thử nghiệm các workload hỗn hợp chứa cả các prompt rất dài và rất ngắn; đây là nơi chunked prefill mang lại giá trị vận hành rõ ràng nhất.

Explore solutions

Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Robot

Tăng cường sức mạnh cho các cỗ máy thông minh hơn với các model Ultralytics YOLO. AI thị giác trong lĩnh vực robot thúc đẩy khả năng điều hướng tự hành, nhận thức, theo dõi đối tượng và điều khiển thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong Logistics

Tối ưu hóa logistics với các model Ultralytics YOLO. Vision AI hỗ trợ kiểm tra hàng hóa, phân loại, theo dõi phương tiện và giám sát an toàn kho bãi trong thời gian thực.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong ngành Bán lẻ

Tái định hình bán lẻ với các model Ultralytics YOLO. Vision AI thúc đẩy theo dõi hàng tồn kho, giám sát kệ hàng, quản lý hàng đợi và thông tin chi tiết thông minh hơn về khách hàng.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong chăm sóc sức khỏe

Xây dựng các giải pháp y tế với các model Ultralytics YOLO. AI thị giác trong y tế hỗ trợ chẩn đoán hình ảnh y khoa nhanh hơn, chẩn đoán thông minh hơn và theo dõi bệnh nhân.
Tìm hiểu thêm
Real-time AI that works with your team

AI trong sản xuất

Tối ưu hóa sản xuất với các model Ultralytics YOLO. Vision AI thúc đẩy kiểm soát chất lượng, phát hiện lỗi, tuân thủ PPE và tự động hóa dây chuyền lắp ráp.
Tìm hiểu thêm
Real-time AI that works with your operation

AI trong Ô tô

Áp dụng thị giác máy tính trong ô tô với các model Ultralytics YOLO. AI thị giác nâng cao an toàn đường bộ, hỗ trợ người lái và tự động hóa phương tiện cho những con đường thông minh hơn.
Tìm hiểu thêm
Real-time AI tailored to your operation

AI trong Nông nghiệp

Mang AI thị giác vào nông nghiệp thông minh với các model Ultralytics YOLO. Tăng cường giám sát mùa màng, theo dõi vật nuôi và canh tác chính xác để đạt năng suất cao hơn, thông minh hơn.
Tìm hiểu thêm

Hãy cùng nhau xây dựng tương lai của AI!

Bắt đầu hành trình của bạn với tương lai của machine learning