Непрерывное обучение без «ночной» фазы: нейросеть закрепляет память прямо во время работы
Большинство методов непрерывного обучения на основе воспроизведения (replay) закрепляют знания либо в отдельной офлайн-фазе, либо подмешивая воспроизводимые примеры в поток входных данных. Авторы препринта на arXiv напоминают, что мозг закрепляет память и во время бодрствования, через «локальный сон»: короткие, зависящие от использования выключения отдельных цепей. Они спрашивают, может ли сеть, обученная локальными биологически ограниченными правилами, закреплять память вообще без офлайн-фазы.
Предложенная схема состоит из нескольких правил. Правило изоляции ограничивает обновления при воспроизведении теми скрытыми синапсами, которые «невидимы» для текущего входа при динамике k-WTA (k победителей забирают всё); состояние оптимизатора продвигается только внутри маски. Правило рефрактерной ротации заставляет только что сработавшие нейроны пропускать следующее соревнование, что расширяет множество синапсов, доступных для закрепления. Гомеостатическое давление и шлюз относительной новизны решают, когда запускаются всплески воспроизведения и когда включается ротация.
Это переворачивает привычное направление обучения без взаимных помех: вычисление в скрытых слоях на текущем входе удерживается неизменным (точно, на «доказанных» каналах, а на остальных, для всех образцов бодрствования, кроме 0,3% на одно обновление), а старые воспоминания записываются в степени свободы, которые текущий пакет данных не использует.
Результаты. На классово-инкрементальном split-MNIST система достигает 91,6±0,3% без офлайн-фазы. По заявлению авторов, это на уровне или выше лучшего расписания с офлайн-«ночью» на двух отложенных разбиениях, на уровне DER++ и выше experience replay, ER-ACE, A-GEM и локального воспроизведения без маски. При обучении за один проход система опережает DER++ (91,8% против 90,1%), тогда как «ночное» расписание падает до 76,9%. Преимущество максимально при малых буферах и уступает место эталонам на обратном распространении ошибки при больших. На split CIFAR-10 система опережает офлайн-повторение и experience replay, но отстаёт от ER-ACE и DER++.
Абляции: ротация даёт основную часть выигрыша, изоляция добавляет гарантию инвариантности. Механизм не привязан к локальному правилу: при том же расписании сеть с обратным распространением ошибки и скрытыми слоями k-WTA тоже выигрывает от ротации, а изоляция сверху снова ничего не стоит.
Ключевые факты
- Локальные биологически ограниченные правила позволяют закреплять память без офлайн-фазы: воспроизведение идёт прямо во время работы, по аналогии с «локальным сном» мозга.
- Схема включает правило изоляции, рефрактерную ротацию, гомеостатическое давление и шлюз относительной новизны.
- На классово-инкрементальном split-MNIST: 91,6±0,3% без офлайн-фазы; при одном проходе 91,8% против 90,1% у DER++, а «ночное» расписание, 76,9%.
- Преимущество максимально при малых буферах и исчезает при больших; на split CIFAR-10 система опережает офлайн-повторение и experience replay, но уступает ER-ACE и DER++.
- Ротация даёт основную часть выигрыша; и сеть с обратным распространением ошибки и слоями k-WTA выигрывает от неё.
Почему это важно
Непрерывное обучение, это задача, в которой сеть учится новому, не забывая старое. Привычные решения на основе воспроизведения требуют отдельной офлайн-фазы или подмешивания старых примеров в поток. Работа показывает, что при определённых локальных правилах консолидация возможна прямо во время работы, а вычисление на текущем входе при этом удерживается неизменным. Идея развернуть направление «без помех»: не защищать старое от нового, а записывать старое в то, что текущий пакет не использует.
Кому это важно
Исследователям непрерывного обучения и нейроморфных или биологически правдоподобных систем, а также тем, кто следит за альтернативами обратному распространению ошибки. Практикам работа пока интересна как идея, а не как готовый инструмент: результаты приведены только для split-MNIST и split CIFAR-10.
Как это применить
Прямого практического рецепта в аннотации нет. Идею ротации (только что сработавшие нейроны пропускают следующее соревнование) и изоляции (обновления только в неиспользуемых синапсах) можно проверить на собственных сетях со скрытыми слоями k-WTA: по данным авторов, ротация помогает и сети с обратным распространением ошибки, а изоляция сверху ничего не стоит.
Можно ли доверять
Это препринт на arXiv, все цифры, заявления самих авторов, независимой проверки в тексте нет. В аннотации не названы авторы и организации, не указана метрика для процентов на split-MNIST, не приведены числа для split CIFAR-10 (только место среди методов) и не заданы размеры буферов (только «малые» и «большие»). Уровень 91,6±0,3% нужно читать с этой оговоркой.
Риски и подводные камни
Преимущество метода зависит от размера буфера: оно наибольшее при малых буферах, а при больших уступает эталонам на обратном распространении ошибки. На более сложном split CIFAR-10 метод отстаёт от ER-ACE и DER++. Проверены только два набора данных; о применении в реальных системах в источнике ничего не заявлено.
«Ротация даёт основную часть выигрыша; изоляция добавляет гарантию инвариантности.»
— из аннотации препринта на arXiv