Latent Space
Разберись в латентном пространстве в машинном обучении. Узнай, как нейронные сети сжимают данные в эмбеддинги и как извлекать признаки с помощью Ultralytics YOLO26.
В искусственном интеллекте латентное пространство — это сжатое математическое представление сложных данных с меньшим числом измерений. Когда нейронная сеть обрабатывает входные данные высокой размерности — например, исходные значения пикселей изображения или последовательность токенов текста, — она преобразует эту информацию в компактный многомерный вектор. В этом скрытом геометрическом пространстве точки данных со схожим смыслом расположены рядом друг с другом в системе координат. Например, математическое представление «автомобиля» будет ближе к представлению «грузовика», чем к представлению «яблока». Отображая данные на непрерывное математическое многообразие, модели машинного обучения могут легко сравнивать, интерполировать и извлекать значимые закономерности, не обрабатывая избыточный фоновый шум.
Различия между связанными понятиями#
Чтобы понять, как работают эти скрытые представления, нужно отличать их от близких понятий в области компьютерного зрения:
- Эмбеддинги: Эмбеддинг — это конкретный математический вектор (координаты), представляющий отдельный элемент данных. Латентное пространство — более широкая математическая среда, в которой располагаются все отдельные эмбеддинги.
- Снижение размерности: Снижение размерности — это алгоритмический процесс сжатия данных, например метод главных компонент. Латентное пространство — это среда, которая получается в результате этого процесса.
Практическое применение ИИ#
Возможность сжимать данные и упорядочивать их по смыслу делает эту концепцию фундаментальной для современных систем компьютерного зрения и лежит в основе нескольких практических сценариев применения в отрасли:
- Генеративный ИИ: Продвинутые генеративные архитектуры, в частности модели латентной диффузии (LDM), создают изображения не по пикселям. Вместо этого, как описано в основополагающих академических исследованиях, они итеративно добавляют и удаляют шум непосредственно в сжатом пространстве. Это значительно снижает вычислительные затраты и позволяет исследовательским организациям обучать высокоэффективные модели.
- Классификация изображений: Архитектуры вроде CLIP отображают визуальные данные и текстовые описания в общее латентное пространство. Рассчитав расстояние между вектором изображения и вектором текста, модель может распознавать объекты, на которых ее явно не обучали. Это меняет подход корпоративных команд к автоматизированным процессам разметки данных.
- Обнаружение аномалий: Если обучить автоэнкодер на изображениях нормальных изделий без дефектов, сеть выучит их характерное базовое представление. Когда ей подают дефектное изделие, его представление оказывается за пределами ожидаемой области, и система помечает его для немедленной проверки.
Извлечение латентных признаков#
На практике получить доступ к таким скрытым представлениям можно, извлекая карты признаков из последних слоев модели компьютерного зрения до классификационной или детекционной головы. Ниже приведен краткий пример генерации эмбеддингов изображений с помощью Ultralytics YOLO26.
from ultralytics import YOLO
# Load a pretrained YOLO26 Nano model
model = YOLO("yolo26n.pt")
# Pass an image through the model to extract its latent embedding vector
results = model.embed("https://ultralytics.com/images/bus.jpg")
# The result is a high-dimensional tensor representing the image in the latent space
print(f"Embedding shape: {results[0].shape}")Разработка на основе латентных представлений#
По мере того как отрасль переходит к высокоэффективным решениям для периферийных вычислений и компактным базовым моделям, умение работать с латентным пространством становится необходимым. Используя эти плотные векторные пространства, разработчики могут создавать надежные рекомендательные системы и поисковые системы с учетом смысла. Командам, которые хотят масштабировать собственные приложения компьютерного зрения, платформа Ultralytics предлагает удобную облачную среду для управления наборами данных, автоматизированной разметки и простого развертывания моделей, помогая превращать исходные визуальные данные в полезную информацию.









