World Model
Узнай, как модели мира моделируют среды для предсказания будущих событий. Изучи, как они расширяют возможности Ultralytics YOLO26 для автономного вождения и продвинутой робототехники.
Мировая модель — это передовая система искусственного интеллекта, предназначенная для построения всеобъемлющей симуляции окружающей среды, предсказания того, как мир меняется со временем и как собственные действия системы влияют на будущее. В отличие от традиционного предиктивного моделирования, которое обычно преобразует статические входные данные в выходные — например, классифицирует изображение, — мировая модель стремится понять причинно-следственную динамику сцены. Усваивая физические законы, логику и временные последовательности наблюдаемых данных, она может симулировать возможные результаты до того, как они наступят. Эта способность напоминает внутреннюю модель мира у человека и позволяет ИИ «воображать» или визуализировать будущие сценарии, чтобы планировать сложные задачи или создавать реалистичные видео.
Выход за рамки статического восприятия#
Главное новшество мировых моделей — способность рассуждать о времени и причинно-следственных связях. В стандартных задачах компьютерного зрения модели, такие как Ultralytics YOLO26, отлично обнаруживают объекты в одном кадре. Мировая модель идет дальше и предсказывает, где эти объекты окажутся в следующем кадре. Такой переход от статического распознавания к динамическому прогнозированию крайне важен для разработки автономных транспортных средств и сложных робототехнических систем.
Недавние прорывы, в том числе модель Sora для преобразования текста в видео от OpenAI, демонстрируют возможности генерации мировых моделей. Понимая, как взаимодействуют свет, движение и геометрия, такие системы могут создавать крайне реалистичные среды по простым текстовым промптам. Аналогично, в области обучения с подкреплением агенты используют внутренние симуляции, чтобы безопасно обучаться в виртуальной среде, прежде чем выполнять опасные задачи в реальном мире, что значительно повышает безопасность ИИ и эффективность.
Модели мира и базовые модели#
Полезно отличать модели мира от других широких категорий ИИ.
- Модели мира и базовые модели: базовая модель — это модель общего назначения, обученная на огромном объёме данных (например, GPT-4). Модель мира часто представляет собой особый тип базовой модели или её компонент, специально спроектированный для моделирования динамики среды и временной согласованности.
- Модели мира и большие языковые модели (LLMs): LLMs предсказывают следующий текстовый токен на основе языковых закономерностей, а модели мира предсказывают следующее «состояние» мира (часто видеокадры или сенсорные данные), опираясь на физические и пространственные правила.
Примеры применения в реальных условиях#
Польза моделей мира далеко не ограничивается созданием развлекательных видео. Они становятся важными компонентами отраслей, где требуется принимать сложные решения.
-
Автономное вождение: компании, разрабатывающие беспилотные автомобили, например Waymo, используют модели мира для симуляции миллионов дорожных ситуаций. ИИ автомобиля может прогнозировать траектории пешеходов и других машин и планировать безопасный маршрут через оживлённые перекрёстки, не сталкиваясь в реальности с каждой возможной аварийной ситуацией.
-
Робототехника и производство: в умном производстве роботы с моделями мира могут манипулировать незнакомыми им объектами. Симулируя физику захвата или подъёма, робот прогнозирует, выскользнет ли предмет или сломается, и адаптирует свои действия в циклах инференса в реальном времени, обеспечивая точность.
Практический пример: визуализация будущих состояний#
Полномасштабные модели мира требуют огромных вычислительных ресурсов, но принцип прогнозирования будущих кадров можно проиллюстрировать с помощью принципов понимания видео. В следующем примере показано, как настроить среду, в которой агент (или модель) сможет отслеживать движение объектов и предугадывать его — это базовый шаг к созданию прогнозирующей модели мира.
import cv2
from ultralytics import YOLO26
# Загрузи модель Ultralytics YOLO26, которая будет отвечать за восприятие
model = YOLO26("yolo26n.pt")
# Открой источник видео (0 для веб-камеры или путь к видеофайлу)
cap = cv2.VideoCapture(0)
while cap.isOpened():
success, frame = cap.read()
if not success:
break
# Режим 'track' сохраняет идентичность объектов с течением времени,
# что необходимо для изучения динамики объектов
results = model.track(frame, persist=True)
# Визуализируй отслеживание, чтобы увидеть, как модель следует за движением
annotated_frame = results[0].plot()
cv2.imshow("Object Tracking Stream", annotated_frame)
if cv2.waitKey(1) & 0xFF == ord("q"):
break
cap.release()
cv2.destroyAllWindows()Будущее предиктивного ИИ#
Разработка моделей мира — это шаг на пути к искусственному общему интеллекту (AGI). Научившись эффективно моделировать мир, системы ИИ обретают пространственный интеллект и своего рода «здравый смысл» в отношении физических взаимодействий. Исследователи изучают предиктивные архитектуры совместного встраивания (JEPA), чтобы сделать такие модели эффективнее: вместо генерации каждого пикселя они сосредоточиваются на прогнозировании признаков высокого уровня, снижая вычислительные затраты. По мере развития этих технологий мы можем ожидать их более глубокой интеграции с платформой Ultralytics, которая позволит разработчикам обучать агентов, способных не только видеть мир, но и по-настоящему его понимать.









