FastVLM: Apple giới thiệu model vision-language nhanh mới
Apple ra mắt FastVLM tại CVPR 2025. Model vision-language mã nguồn mở này sử dụng encoder FastViTHD, mang lại tốc độ time-to-first-token nhanh hơn tới 85 ×.

Tại hội nghị CVPR 2025, Apple đã giới thiệu một model AI mã nguồn mở mới có tên FastVLM. Model này được xây dựng để hiểu cả hình ảnh lẫn ngôn ngữ và chạy trên các thiết bị Apple như iPhone, iPad và Mac. Điều này cho phép model nhanh chóng tạo ra kết quả thông minh mà không cần gửi dữ liệu của bạn lên cloud.
Điểm khiến FastVLM đặc biệt đáng chú ý là tốc độ nhanh và hiệu quả cao. Apple đã phát triển một vision encoder mới có tên FastViTHD, giúp model diễn giải hình ảnh chất lượng cao trong khi sử dụng ít bộ nhớ và năng lượng hơn. Toàn bộ quá trình xử lý diễn ra cục bộ trên thiết bị, mang lại thời gian phản hồi nhanh hơn đồng thời bảo vệ quyền riêng tư của người dùng.
Trong bài viết này, chúng ta sẽ tìm hiểu cách FastVLM hoạt động, những điểm khác biệt của model này và lý do bản phát hành của Apple có thể là một bước tiến quan trọng đối với các ứng dụng AI hằng ngày trên thiết bị của bạn.
Tìm hiểu về các model ngôn ngữ-thị giác (VLMs)#
Trước khi đi sâu vào những điểm đặc biệt của FastVLM, hãy cùng tìm hiểu “VLM” trong tên của model này có nghĩa là gì. Đây là viết tắt của một model ngôn ngữ-thị giác, được thiết kế để hiểu và kết nối nội dung hình ảnh với ngôn ngữ.
VLMs kết hợp khả năng hiểu hình ảnh và ngôn ngữ, cho phép thực hiện các tác vụ như mô tả ảnh, trả lời câu hỏi về ảnh chụp màn hình hoặc trích xuất văn bản từ tài liệu. Các model ngôn ngữ-thị giác thường hoạt động theo hai phần: một phần xử lý hình ảnh và chuyển đổi hình ảnh thành dữ liệu, còn phần kia diễn giải dữ liệu đó để tạo ra phản hồi mà bạn có thể đọc hoặc nghe.
Có thể bạn đã sử dụng loại đổi mới AI này mà không hề nhận ra. Các ứng dụng quét hóa đơn, đọc thẻ căn cước, tạo chú thích cho hình ảnh hoặc hỗ trợ người thị lực kém tương tác với màn hình thường dựa vào các model ngôn ngữ-thị giác chạy âm thầm ở chế độ nền.
FastVLM là gì?#
Apple xây dựng FastVLM để thực hiện các tác vụ tương tự những model ngôn ngữ-thị giác khác, nhưng với tốc độ cao hơn, quyền riêng tư tốt hơn và hiệu năng được tối ưu trên chính các thiết bị của Apple. Model có thể hiểu nội dung hình ảnh và phản hồi bằng văn bản, nhưng không giống nhiều model phụ thuộc vào cloud server, FastVLM có thể chạy hoàn toàn trên iPhone, iPad hoặc Mac của bạn.
VLMs thường hoạt động tốt hơn với hình ảnh độ phân giải cao. Ví dụ, như minh họa bên dưới, FastVLM chỉ có thể xác định chính xác biển báo đường phố là “Cấm đi vào” khi được cung cấp phiên bản hình ảnh độ phân giải cao. Tuy nhiên, input độ phân giải cao thường khiến model chạy chậm hơn. Đây là điểm FastViTHD tạo ra khác biệt.

Hình 1. Hiệu năng của FastVLM trên hình ảnh độ phân giải thấp và cao. (Nguồn)
Vision encoder mới của Apple, FastViTHD, giúp FastVLM xử lý hình ảnh chất lượng cao hiệu quả hơn với ít bộ nhớ và năng lượng hơn. Cụ thể, FastViTHD đủ nhẹ để chạy mượt mà ngay cả trên các thiết bị nhỏ hơn.
FastVLM cũng được cung cấp công khai trong repository FastVLM trên GitHub, nơi các developer có thể truy cập source code, thực hiện thay đổi và sử dụng model trong ứng dụng của riêng mình theo các điều khoản license của Apple.
So sánh FastVLM với các model VLM khác#
So với các model ngôn ngữ-thị giác khác, FastVLM được tối ưu để chạy trên các thiết bị phổ biến như smartphone và laptop. Trong các bài kiểm tra hiệu năng, FastVLM tạo ra từ đầu tiên hoặc output nhanh hơn tới 85 lần so với các model như LLaVA-OneVision-0.5B.

Hình 2. So sánh hiệu năng của FastVLM với các model khác. (Nguồn)
Dưới đây là tổng quan về một số benchmark tiêu chuẩn mà FastVLM đã được đánh giá:
- DocVQA (Trả lời câu hỏi trực quan về tài liệu): Benchmark này đánh giá khả năng đọc và hiểu thông tin văn bản trong tài liệu của model, chẳng hạn như biểu mẫu hoặc trang được scan.
- TextVQA (Trả lời câu hỏi trực quan dựa trên văn bản): Benchmark đánh giá khả năng diễn giải hình ảnh có chứa văn bản nhúng và trả lời chính xác các câu hỏi liên quan của model.
- GQA (Trả lời câu hỏi về đồ thị): Tác vụ này kiểm tra khả năng suy luận của model bằng cách yêu cầu model hiểu mối quan hệ giữa các đối tượng và bối cảnh trong một hình ảnh.
- MMMU (Hiểu đa phương thức đa lĩnh vực quy mô lớn): Benchmark đo lường hiệu năng của model trên nhiều môn học và định dạng học thuật, kết hợp khả năng hiểu hình ảnh và văn bản.
- SeedBench (Đánh giá tiêu chuẩn dữ liệu nâng cao để benchmark): Benchmark này khảo sát các khả năng tổng quát của model trong việc hiểu hình ảnh và suy luận trên nhiều lĩnh vực.
Trên các benchmark này, FastVLM đạt kết quả cạnh tranh trong khi sử dụng ít tài nguyên hơn. Model mang AI thị giác thiết thực đến các thiết bị phổ biến như điện thoại, tablet và laptop.
Vision encoder hiệu quả của FastVLM: FastViTHD#
Tiếp theo, hãy cùng xem xét kỹ hơn FastViTHD, vision encoder đóng vai trò quan trọng trong hiệu năng xử lý hình ảnh của FastVLM.
Hầu hết các model ngôn ngữ-thị giác chia hình ảnh thành hàng nghìn mảnh nhỏ gọi là token. Càng nhiều token, model càng cần nhiều thời gian và năng lượng để hiểu hình ảnh. Điều này có thể khiến quá trình xử lý chậm, đặc biệt trên điện thoại hoặc laptop.

Hình 3. Cách vision encoder xử lý hình ảnh. (Nguồn)
FastViTHD tránh tình trạng chậm do xử lý quá nhiều token bằng cách sử dụng ít token hơn mà vẫn hiểu được toàn bộ hình ảnh. Model kết hợp hai phương pháp: transformer, phù hợp để mô hình hóa các pattern và mối quan hệ, cùng các lớp tích chập, vốn hiệu quả trong xử lý dữ liệu hình ảnh. Kết quả là một hệ thống hoạt động nhanh hơn và sử dụng ít bộ nhớ hơn.
Theo Apple, FastViTHD nhỏ hơn tới 3,4 lần so với một số vision encoder truyền thống mà vẫn duy trì độ chính xác cao. Thay vì phụ thuộc vào các kỹ thuật tối ưu model như cắt tỉa token (loại bỏ các mảnh hình ảnh ít quan trọng hơn để tăng tốc xử lý), model đạt hiệu quả nhờ một kiến trúc đơn giản và tinh gọn hơn.
Các biến thể model và pipeline training của FastVLM#
Apple đã phát hành FastVLM với ba kích thước khác nhau: 0.5B, 1.5B và 7B tham số (trong đó “B” là viết tắt của billion, chỉ số lượng trọng số có thể train trong model). Mỗi phiên bản được thiết kế cho các loại thiết bị khác nhau. Các model nhỏ hơn có thể chạy trên điện thoại và tablet, trong khi model 7B lớn hơn phù hợp với desktop hoặc các tác vụ đòi hỏi nhiều tài nguyên hơn.
Điều này mang lại cho developer sự linh hoạt khi lựa chọn giải pháp phù hợp nhất với ứng dụng. Họ có thể xây dựng một giải pháp nhanh và nhẹ cho mobile hoặc một giải pháp phức tạp hơn cho các hệ thống lớn, đồng thời vẫn sử dụng cùng kiến trúc model nền tảng.
Apple đã train các biến thể model FastVLM bằng pipeline LLaVA‑1.5, một framework dùng để căn chỉnh các model ngôn ngữ với vision. Đối với thành phần ngôn ngữ, Apple đánh giá FastVLM bằng các model mã nguồn mở hiện có như Qwen và Vicuna, vốn nổi tiếng với khả năng tạo văn bản tự nhiên và mạch lạc. Thiết lập này cho phép FastVLM xử lý cả hình ảnh đơn giản lẫn phức tạp và tạo ra các phản hồi dễ đọc, phù hợp.
Ý nghĩa của FastVLM: Cách tiếp cận AI hiệu quả của Apple#
Có thể bạn đang thắc mắc: tại sao việc xử lý hình ảnh hiệu quả của FastVLM lại quan trọng? Câu trả lời nằm ở khả năng giúp các ứng dụng hoạt động mượt mà theo thời gian thực mà không phụ thuộc vào cloud. FastVLM có thể xử lý hình ảnh độ phân giải cao, lên tới 1152 × 1152 pixel, đồng thời vẫn đủ nhanh và nhẹ để chạy trực tiếp trên thiết bị.
Điều này cho phép ứng dụng mô tả những gì camera nhìn thấy, scan hóa đơn ngay khi được chụp hoặc phản hồi trước các thay đổi trên màn hình, trong khi mọi dữ liệu vẫn được giữ cục bộ. Model đặc biệt hữu ích trong các lĩnh vực như giáo dục, khả năng tiếp cận, năng suất và nhiếp ảnh.
Vì FastViTHD vẫn hiệu quả khi xử lý hình ảnh lớn, model giúp thiết bị duy trì khả năng phản hồi và không bị nóng. Model hoạt động với mọi kích thước model, bao gồm cả phiên bản nhỏ nhất chạy trên các iPhone phổ thông. Điều đó có nghĩa là cùng một tính năng AI có thể hoạt động trên điện thoại, tablet và Mac.
Các ứng dụng của FastVLM#
FastVLM có thể hỗ trợ nhiều loại ứng dụng nhờ các lợi ích chính như tốc độ, hiệu quả và quyền riêng tư trên thiết bị. Dưới đây là một số cách sử dụng:
-
Đọc tài liệu: Model có thể scan hóa đơn, biểu mẫu hoặc thẻ căn cước và chỉ trích xuất thông tin liên quan. Model có thể tập trung vào các khu vực cụ thể trong hình ảnh, rất hữu ích cho các ứng dụng cần trích xuất văn bản nhanh và chính xác.
-
Chú thích hình ảnh: Bằng cách phân tích ảnh, model có thể tạo mô tả rõ ràng về nội dung trong ảnh. Tính năng này hỗ trợ các chức năng trong ứng dụng camera, thư viện ảnh hoặc bất kỳ công cụ nào hưởng lợi từ khả năng hiểu hình ảnh theo thời gian thực.
-
Hỗ trợ khả năng tiếp cận: FastVLM có thể mô tả nội dung trên màn hình cho người mù hoặc thị lực kém, giúp họ dễ điều hướng và sử dụng các nút, menu và thành phần bố cục hơn.
-
Trợ lý AI trên thiết bị: FastVLM có thể hoạt động hiệu quả với các trợ lý AI cần nhanh chóng hiểu nội dung trên màn hình. Vì chạy trực tiếp trên thiết bị và bảo vệ dữ liệu riêng tư, model có thể hỗ trợ các tác vụ như đọc văn bản, xác định nút hoặc icon và hướng dẫn người dùng theo thời gian thực mà không cần gửi thông tin lên cloud.

Hình 4. FastVLM có thể được sử dụng để nhận dạng văn bản và trả lời câu hỏi trực quan. (Nguồn)
Những điểm chính#
FastVLM mang AI ngôn ngữ-thị giác trên thiết bị đến các thiết bị Apple, kết hợp tốc độ, quyền riêng tư và hiệu quả. Với thiết kế nhẹ và bản phát hành mã nguồn mở, model cho phép hiểu hình ảnh theo thời gian thực trên các ứng dụng mobile và desktop.
Điều này giúp AI trở nên thiết thực và dễ tiếp cận hơn trong sử dụng hằng ngày, đồng thời cung cấp cho developer một nền tảng vững chắc để xây dựng các ứng dụng hữu ích, tập trung vào quyền riêng tư. Trong tương lai, nhiều khả năng các model ngôn ngữ-thị giác sẽ đóng vai trò quan trọng trong cách chúng ta tương tác với công nghệ, giúp AI phản hồi nhanh hơn, hiểu ngữ cảnh tốt hơn và hữu ích hơn trong các tình huống hằng ngày.
Khám phá repository GitHub của chúng tôi để tìm hiểu thêm về AI. Tham gia cộng đồng năng động của chúng tôi và khám phá những đổi mới trong các lĩnh vực như AI trong ngành ô tô và AI thị giác trong sản xuất. Để bắt đầu với computer vision ngay hôm nay, hãy xem các tùy chọn license.









