Замороженные случайные свёрточные сети в RL-агентах сами становятся разреженными
Учёные описали неожиданный эффект в агентах глубокого обучения с подкреплением (RL): если свёрточная сеть (CNN), которая извлекает признаки из изображения игры, заморожена и никогда не обучается (её веса, случайная инициализация, зафиксированная с самого начала), то первый полносвязный слой после неё (FC1, преобразующий 3136 входов в 64 нейрона) спонтанно становится крайне разреженным, без какой-либо специальной цели поощрять разреженность в функции потерь.
В детерминированной версии игры Pong агент использует всего 1, 3 активных нейрона из 64, чтобы решить задачу; в стохастической версии Pong, 5, 11 нейронов. Для сравнения: если свёрточную сеть обучать вместе со всей моделью, а не замораживать, активными оказываются 55, 64 нейрона из 64, почти весь слой.
Авторы формулируют четыре ключевых вывода. Во-первых, число активных нейронов в FC1 растёт вместе со сложностью игры: 1, 11 для Pong, 19, 26 для Breakout и около 42 для Space Invaders. Эксперимент с изменением ширины сети подтвердил, что это отражает внутреннюю структуру задачи, а не просто фиксированную долю от общей ёмкости слоя.
Во-вторых, разброс проявляется даже внутри одной игры: три запуска Pong с идентичной настройкой, отличающиеся только случайным зерном (seed), дали 5, 7 и 11 активных нейронов соответственно. Прогон с 5 нейронами застрял на награде +14, тогда как два других достигли экспертного уровня (+18,4 и +18,7). Это говорит о том, что итоговое качество агента ограничено «полезной» размерностью случайной проекции, которую задаёт конкретное случайное зерно.
В-третьих, абляционные эксперименты подтвердили, что найденные активные нейроны действительно необходимы: если их удалить, качество агента резко падает, эффект воспроизводится на двух разных реализациях алгоритма PPO и в четырёх играх.
В-четвёртых, информационное бутылочное горлышко формируется рано: набор активных нейронов фиксируется уже к 15, 30 миллионам шагов обучения, тогда как награда становится положительной значительно позже, через 35, 105 миллионов шагов после этого.
Дополнительный эксперимент на Breakout показал, что замороженные и обучаемые сети достигают сопоставимой награды разными путями: замороженные агенты используют 17, 25 активных нейронов (коэффициент участия, participation ratio, около 10, 14), тогда как обучаемые агенты используют 51 нейрон (participation ratio около 3,6), то есть структурно иной тип бутылочного горлышка.
Авторы заключают: там, где размерность входных данных значительно превышает истинную (внутреннюю) размерность задачи, градиентный спуск поверх замороженной случайной проекции способен сам, без явного механизма разреженности, выявить эффективный ранг лежащей в основе задачи.
Ключевые факты
- В RL-агентах с замороженной случайной свёрточной сетью первый полносвязный слой (FC1, 3136→64) спонтанно становится крайне разреженным без явного штрафа за разреженность в функции потерь.
- В детерминированной Pong активны всего 1, 3 нейрона из 64 (в стохастической, 5, 11), тогда как в полностью обучаемой сети активны 55, 64 нейрона.
- Число активных нейронов растёт со сложностью игры: 1, 11 для Pong, 19, 26 для Breakout, около 42 для Space Invaders.
- Разное случайное зерно инициализации даёт разное число активных нейронов и разный потолок качества: 5 нейронов ограничивают агента наградой +14 против +18,4, 18,7 при 7, 11 нейронах.
- Набор активных нейронов фиксируется уже на 15, 30 млн шагов обучения, за 35, 105 млн шагов до того, как награда становится положительной.
Почему это важно
Работа поднимает фундаментальный вопрос о том, что именно «делает» нейросеть в задаче обучения с подкреплением. Обычно предполагается, что для сложной визуальной задачи нужна вся мощность свёрточного экстрактора признаков и много активных нейронов в последующих слоях. Здесь показано обратное: даже если свёрточная часть сети вообще не обучается (её веса, просто случайные числа, зафиксированные с самого начала), агент всё равно способен решать игру, а обучаемая часть сети сама, без всякого явного стимула, «схлопывается» до горстки нейронов. Это говорит о том, что реальная (внутренняя) сложность многих RL-задач гораздо ниже кажущейся размерности картинки на входе, и обучение способно само находить этот эффективный ранг задачи.
Кому это важно
Результат интересен исследователям обучения с подкреплением и интерпретируемости нейросетей, он даёт простой диагностический инструмент: заморозив случайную свёрточную сеть и посмотрев, сколько нейронов «включается» в следующем слое, можно оценить истинную сложность задачи, не обучая всю модель целиком. Полезно это и тем, кто занимается сжатием и разрежением моделей: эффект возникает сам, без специальных функций потерь на разреженность.
Как это применить
Подход можно использовать как дешёвый тест сложности задачи: заморозить случайную свёрточную сеть, обучить только полносвязный слой поверх неё и посчитать число активных нейронов, это даёт оценку «эффективного ранга» задачи без затрат на обучение полноценной модели. Авторы также показывают, что абляция (удаление) выявленных активных нейронов, рабочий способ проверить, действительно ли они необходимы агенту; этот приём можно переиспользовать как метод анализа представлений в других RL-агентах.
Можно ли доверять
Работа, препринт на arXiv, то есть ещё не прошла рецензирование. В её пользу, воспроизведение эффекта на четырёх играх (Pong в двух режимах, Breakout, Space Invaders) и на двух независимых реализациях алгоритма PPO, а также контрольный эксперимент с изменением ширины сети, который отделяет «структуру задачи» от простого артефакта размера сети. Это придаёт находке вес, но независимая проверка другими группами пока не проводилась.
Риски и подводные камни
Все эксперименты проведены на классических аркадных играх Atari (Pong, Breakout, Space Invaders), сравнительно простых визуальных средах с ограниченным набором сцен; неясно, сохранится ли эффект в задачах с более сложным и разнообразным визуальным входом, например в реалистичных 3D-симуляциях или робототехнике. Кроме того, конкретное число активных нейронов сильно зависит от случайного зерна инициализации, то есть вывод об «эффективном ранге задачи» может быть менее устойчивым, чем кажется, и чувствителен к везению при инициализации.
«Мы описываем поразительное явление: агенты глубокого обучения с подкреплением, обученные с замороженными, случайно инициализированными свёрточными экстракторами признаков, спонтанно формируют крайне разреженные полносвязные представления, без какой-либо цели, поощряющей разреженность.»
— авторы препринта на arXiv