Vector Database
Узнай, как векторные базы данных управляют высокоразмерными эмбеддингами для семантического поиска. Научись создавать ИИ-приложения с помощью Ultralytics YOLO26 и семантического поиска.
Векторная база данных — это специализированная система хранения, разработанная для управления, индексации и запроса многомерных векторных данных, часто называемых эмбеддингами. В отличие от традиционной реляционной базы данных, которая организует структурированные данные в строки и столбцы для точного сопоставления ключевых слов, векторная база данных оптимизирована для семантического поиска. Она позволяет интеллектуальным системам находить точки данных, которые концептуально похожи, а не идентичны. Эта возможность является основополагающей для современной инфраструктуры искусственного интеллекта (ИИ), позволяя приложениям обрабатывать и понимать неструктурированные данные — такие как изображения, аудио, видео и текст — путем анализа математических связей между ними. Эти базы данных служат долгосрочной памятью для интеллектуальных агентов, облегчая такие задачи, как визуальный поиск и персональные рекомендации.
Как работают векторные базы данных#
Функция векторной базы данных сосредоточена на концепции векторного пространства, где элементы данных отображаются в виде точек в многомерной системе координат. Процесс начинается с извлечения признаков, где модель глубокого обучения (DL) преобразует исходные данные в числовые векторы.
-
Поступление данных: Данные обрабатываются нейронной сетью, такой как передовая YOLO26, для генерации эмбеддингов. Эти векторы сжимают семантический смысл входных данных в плотный список чисел с плавающей запятой.
-
Индексация: Чтобы обеспечить низкую задержку выводов при извлечении, база данных организует эти векторы с помощью специализированных алгоритмов. Такие методы, как иерархический навигационный мир малых размеров (HNSW) или инвертированный индекс файлов (IVF), позволяют системе эффективно перемещаться по миллиардам векторов без сканирования каждой отдельной записи.
-
Запросы: Когда ты отправляешь поисковый запрос (например, изображение определенного стиля обуви), система преобразует запрос в вектор и вычисляет его близость к сохраненным векторам с использованием метрик расстояния, таких как косинусное сходство или евклидово расстояние.
-
Получение результатов: База данных возвращает «ближайших соседей», которые представляют собой наиболее контекстуально релевантные результаты.
Следующий фрагмент Python демонстрирует, как генерировать эмбеддинги с помощью стандартной модели ultralytics, что является предварительным шагом перед заполнением векторной базы данных.
from ultralytics import YOLO
# Load a pre-trained YOLO26 classification model
model = YOLO("yolo26n-cls.pt")
# Generate feature embeddings for an image file
# The 'embed' method creates the vector representation needed for the database
results = model.embed("https://ultralytics.com/images/bus.jpg")
# Output the shape of the resulting embedding vector
print(f"Embedding vector shape: {results[0].shape}")Реальные приложения#
Векторные базы данных являются движком для многих продвинутых приложений компьютерного зрения (CV) и обработки естественного языка (NLP), используемых в корпоративных средах сегодня.
- Генерация с дополненным извлечением (RAG): В эпоху генеративного ИИ векторные базы данных позволяют большим языковым моделям (LLM) получать доступ к огромной библиотеке частных и актуальных данных. Извлекая релевантные документы на основе семантического смысла твоего промпта, система уменьшает галлюцинации в LLM и предоставляет фактические, контекстно-зависимые ответы.
- Системы визуальных рекомендаций: В ИИ в ритейле платформы используют векторные базы данных для реализации функций «купить похожие стили». Если ты просматриваешь конкретное летнее платье, система запрашивает в базе данных другие изображения продуктов с похожими визуальными эмбеддингами — сопоставляя узоры, крои и цвета, обеспечивая лучший пользовательский опыт, чем простая фильтрация по тегам.
- Обнаружение аномалий и угроз: Системы безопасности используют векторные базы данных для обнаружения аномалий. Храня эмбеддинги «нормального» поведения или авторизованного персонала, система может мгновенно отмечать выбросы, которые выпадают за пределы ожидаемого кластера в векторном пространстве, повышая безопасность данных и мониторинг объекта.
Разграничение связанных понятий#
Для эффективного внедрения этих систем полезно отличать векторную базу данных от связанных технологий в ландшафте операций машинного обучения (MLOps).
- Векторная база данных против векторного поиска: Векторный поиск — это действие или алгоритмический процесс поиска похожих векторов («как»). Векторная база данных — это надежная инфраструктура, созданная для хранения данных, управления индексом и выполнения таких поисков в масштабе («где»).
- Векторная база данных против хранилища признаков: Хранилище признаков — это централизованный репозиторий для управления признаками, используемыми при обучении моделей и выводах, обеспечивающий согласованность. Хотя оно обрабатывает данные признаков, оно не оптимизировано в первую очередь для запросов поиска на основе сходства, которые определяют векторную базу данных.
- Векторная база данных против озера данных: Озеро данных хранит огромные объемы сырых данных в их исходном формате. Векторная база данных хранит обработанные математические представления (эмбеддинги) этих данных, оптимизированные специально для поиска по сходству.
Интеграция с современными рабочими процессами ИИ#
Внедрение векторной базы данных часто включает конвейер, в котором такие модели, как эффективная YOLO26, действуют как механизм эмбеддингов. Эти модели обрабатывают визуальные данные на периферии или в облаке, а полученные векторы передаются в такие решения, как Pinecone, Milvus или Qdrant.
Для команд, стремящихся оптимизировать весь этот жизненный цикл — от кураторства данных и авторазметки до обучения и развертывания моделей — Ultralytics Platform предлагает комплексную среду. Объединяя обучение моделей с эффективными стратегиями развертывания, ты можешь гарантировать, что эмбеддинги, питающие твои векторные базы данных, будут точными, что приведет к более качественным результатам поиска и более умным ИИ-агентам.






