Foundation Model
Изучи возможности базовых моделей в ИИ. Узнай, как адаптировать крупномасштабные модели, такие как Ultralytics YOLO26, к пользовательским задачам с помощью Ultralytics Platform.
Базовая модель представляет собой значительный сдвиг парадигмы в области искусственного интеллекта (AI). Это крупномасштабная модель машинного обучения, обученная на огромном объёме данных — часто содержащем миллиарды параметров, — которую можно адаптировать для широкого спектра последующих задач. В отличие от традиционных моделей машинного обучения (ML), которые обычно создаются для одной конкретной цели, например классификации определённого вида цветов, базовая модель изучает общие закономерности, структуры и взаимосвязи на ресурсоёмком этапе предварительного обучения. Эта обширная база знаний позволяет разработчикам применять модель к новым задачам с помощью переноса обучения, значительно сокращая время и объём данных, необходимые для достижения передовых результатов.
Основные механизмы: предварительное обучение и адаптация#
Мощь базовой модели заключается в её двухэтапном процессе разработки: предварительном обучении и дообучении. Во время предварительного обучения модель получает доступ к огромным наборам данных, таким как значительные части интернета, разнообразные библиотеки изображений или обширные репозитории кода. На этом этапе часто применяется обучение с самоконтролем — метод, при котором модель самостоятельно создаёт метки на основе структуры самих данных, устраняя узкое место в виде ручной аннотации данных. Например, языковая модель может учиться предсказывать следующее слово в предложении, а модель компьютерного зрения — распознавать границы и текстуры объектов, а также сохранять их идентичность.
После предварительного обучения модель становится универсальной отправной точкой. В рамках процесса, называемого дообучением, разработчики могут скорректировать веса модели на меньшем наборе данных, относящемся к конкретной предметной области. Эта возможность лежит в основе демократизации ИИ, поскольку позволяет организациям с ограниченными вычислительными ресурсами использовать мощные архитектуры. В современных рабочих процессах часто применяются такие инструменты, как Ultralytics Platform, чтобы упростить этот процесс адаптации и обеспечить эффективное обучение на пользовательских наборах данных без необходимости создавать нейронную сеть с нуля.
Практические применения#
Базовые модели служат основой инноваций в различных отраслях. Благодаря способности к обобщению их можно применять к задачам от обработки естественного языка до передовых задач компьютерного зрения.
- Компьютерное зрение в здравоохранении: специализированные базовые модели компьютерного зрения можно дообучить для помощи в анализе медицинских изображений. Модель, изначально обученная на обычных изображениях, может быть адаптирована для обнаружения опухолей на снимках МРТ или выявления торусных переломов на рентгеновских снимках. Этот пример показывает, как общее визуальное понимание преобразуется в диагностические инструменты, способные спасать жизни.
- Промышленная автоматизация: в производстве модели компьютерного зрения, такие как Ultralytics YOLO26, выступают в качестве базовых архитектур для обнаружения объектов. Фабрики используют эти модели для автоматизации контроля качества, быстро и точно выявляя дефекты на сборочных линиях. Уже имеющиеся у модели знания о границах объектов ускоряют внедрение таких решений для умного производства.
Пример технической реализации#
Разработчики могут использовать базовые модели для выполнения сложных задач с минимальным объёмом кода. В следующем примере показано, как загрузить предварительно обученную модель YOLO26 — базовую модель компьютерного зрения, оптимизированную для приложений реального времени, — и выполнить обнаружение объектов на изображении.
from ultralytics import YOLO
# Load a pre-trained YOLO26 foundation model
# 'n' stands for nano, the smallest and fastest version
model = YOLO("yolo26n.pt")
# Perform inference on an image to detect objects
# The model uses its pre-trained knowledge to identify common objects
results = model("https://ultralytics.com/images/bus.jpg")
# Display the results
results[0].show()Различия между ключевыми терминами#
Чтобы понять особенности их применения, полезно отличать «базовую модель» от связанных с ней концепций в области ИИ:
- Большая языковая модель (LLM): LLM — это тип базовой модели, специально разработанный для обработки и создания текста. Хотя все LLM являются базовыми моделями, не все базовые модели относятся к LLM; к этой категории также относятся модели компьютерного зрения, такие как SAM (модель Segment Anything), и мультимодальные системы.
- Перенос обучения: это методика, используемая для применения базовой модели к новой задаче. Базовая модель — это артефакт (сохранённая нейронная сеть), а перенос обучения — процесс обновления знаний этого артефакта для конкретного сценария использования, например для борьбы с вредителями в сельском хозяйстве.
- Генеративный ИИ: этот термин обозначает системы, способные создавать новый контент (текст, изображения, код). Многие базовые модели лежат в основе приложений генеративного ИИ, однако их также можно использовать для дискриминативных задач, таких как классификация или отслеживание объектов, которые не являются строго «генеративными».
Будущие направления и влияние#
Развитие базовых моделей движется в сторону мультимодального ИИ, где одна система может одновременно обрабатывать и сопоставлять информацию из текста, изображений, аудио и данных датчиков. Исследования таких учреждений, как Стэнфордский институт человекоцентричного ИИ (HAI), подчёркивают потенциал этих систем в рассуждении о мире подобно человеку. По мере повышения эффективности этих моделей их развёртывание на устройствах периферийных вычислений становится всё более реалистичным, позволяя напрямую предоставлять мощные возможности ИИ смартфонам, дронам и датчикам IoT.









