Vanishing Gradient
Узнай, как проблема исчезающего градиента влияет на глубокое обучение, и изучи эффективные решения, такие как ReLU и residual connections, используемые в Ultralytics YOLO26.
Проблема исчезающего градиента — это серьёзная сложность, возникающая при обучении глубоких искусственных нейронных сетей. Она возникает, когда градиенты — значения, определяющие, насколько должны измениться параметры сети, — становятся чрезвычайно малыми по мере обратного распространения от выходного слоя к входным слоям. Поскольку эти градиенты необходимы для обновления весов модели, их исчезновение приводит к тому, что ранние слои сети перестают обучаться. Это явление фактически не позволяет модели выявлять сложные закономерности в данных, ограничивая глубину и производительность архитектур глубокого обучения.
Механика исчезновения сигналов#
Чтобы понять, почему это происходит, полезно рассмотреть процесс обратного распространения ошибки. Во время обучения сеть вычисляет ошибку между своим предсказанием и фактической целевой величиной с помощью функции потерь. Затем эта ошибка передаётся обратно через слои для корректировки весов. Такая корректировка опирается на цепное правило дифференцирования и включает последовательное перемножение производных функций активации для каждого слоя.
Если сеть использует такие функции активации, как сигмоидальная функция или гиперболический тангенс (tanh), их производные часто меньше 1. При перемножении множества таких небольших чисел в глубокой сети с десятками или сотнями слоёв результат стремится к нулю. Это можно представить как игру в «испорченный телефон», где сообщение шёпотом передаётся по длинной цепочке людей: к тому времени, когда оно достигает начала цепочки, сообщение становится неразборчивым, и первый человек уже не знает, что сказать.
Решения и современные архитектуры#
В области ИИ разработано несколько эффективных стратегий для уменьшения проблемы исчезающих градиентов, что позволяет создавать мощные модели, такие как Ultralytics YOLO26.
- ReLU и её варианты: выпрямленная линейная единица (ReLU) и её последующие варианты, такие как Leaky ReLU и SiLU, не насыщаются при положительных значениях. Их производные равны либо 1, либо небольшой константе, благодаря чему величина градиента сохраняется в глубоких слоях.
- Остаточные соединения: Представленные в остаточных сетях (ResNets), они представляют собой «пропускающие соединения», позволяющие градиенту обходить один или несколько слоёв. Это создаёт «сверхскоростную магистраль» для беспрепятственного прохождения градиента к более ранним слоям — концепцию, необходимую для современного обнаружения объектов.
- Пакетная нормализация: Нормализуя входы каждого слоя, пакетная нормализация обеспечивает работу сети в стабильном режиме, в котором производные не становятся слишком малыми, снижая зависимость от тщательной инициализации.
- Архитектуры с управляющими механизмами: Для последовательных данных сети с долгой кратковременной памятью (LSTM) и GRU используют специализированные управляющие механизмы, чтобы определять, какой объём информации сохранять или забывать, эффективно защищая градиент от исчезновения на длинных последовательностях.
Исчезающие и взрывающиеся градиенты#
Хотя они обусловлены одним и тем же базовым механизмом (многократным перемножением), исчезающие градиенты отличаются от взрывающихся градиентов.
- Исчезающий градиент: Градиенты стремятся к нулю, из-за чего обучение останавливается. Это часто происходит в глубоких сетях с сигмоидальными функциями активации.
- Взрывающийся градиент: Градиенты накапливаются и становятся чрезмерно большими, из-за чего веса модели начинают резко колебаться или достигают значения
NaN(не число). Обычно это исправляют с помощью ограничения градиента.
Практические применения#
Преодоление проблемы исчезающих градиентов стало необходимым условием успеха современных приложений ИИ.
-
Глубокое обнаружение объектов: Моделям, используемым в автономных транспортных средствах, например моделям серии YOLO, требуются сотни слоёв, чтобы различать пешеходов, дорожные знаки и транспортные средства. Без таких решений, как остаточные блоки и пакетная нормализация, обучение этих глубоких сетей на огромных наборах данных, таких как COCO, было бы невозможным. Такие инструменты, как Ultralytics Platform, помогают упростить этот процесс обучения и обеспечивают корректную сходимость сложных архитектур.
-
Машинный перевод: В обработке естественного языка (NLP) перевод длинного предложения требует понимания связи между первым и последним словами. Решение проблемы исчезающих градиентов в RNN (с помощью LSTM), а позднее и Transformer, позволило моделям сохранять контекст на протяжении длинных абзацев, что произвело революцию в сервисах машинного перевода, таких как Google Translate.
Пример на Python#
Современные фреймворки и модели скрывают многие из этих сложностей. При обучении такой модели, как Ultralytics YOLO26, архитектура автоматически включает такие компоненты, как активация SiLU и пакетная нормализация, чтобы предотвратить исчезновение градиентов.
from ultralytics import YOLO
# Load the YOLO26 model (latest generation, Jan 2026)
# This architecture includes residual connections and modern activations
# that inherently prevent vanishing gradients.
model = YOLO("yolo26n.pt")
# Train the model on a dataset
# The optimization process remains stable due to the robust architecture
results = model.train(data="coco8.yaml", epochs=10)








