Optane мог спасти ИИ-инференс от дефицита памяти, но Intel закрыла проект в 2022

The Register разбирает историю памяти Intel Optane (технология 3D XPoint, созданная совместно с Micron) и объясняет, почему её отмена в 2022 году выглядит особенно неудачно на фоне текущего дефицита DRAM для ИИ-инференса.
Intel и Micron представили 3D XPoint в 2015 году как промежуточное звено между NAND-флешем в SSD и DRAM в оперативной памяти. В отличие от NAND, технология была энергонезависимой, но хранила данные не за счёт захваченных электронов, а за счёт материала с фазовым переходом, это давало задержки менее 10 микросекунд (у поздних модулей PMem, около 350 наносекунд) и экстремальную выносливость к перезаписи. По заявленным Intel характеристикам, предпоследнее поколение Optane SSD выдерживало 100 полных перезаписей диска в день при среднем времени наработки на отказ в 2 миллиона часов, показатели, которые не превзойдены до сих пор (сама Intel признавала, что эти цифры экстраполированы, но, по мнению издания, скорее занижены, чем завышены). Модули постоянной памяти Optane также предлагали ёмкость до 512 ГБ на DIMM, против максимум 128 ГБ у дорогой DDR4 того времени, и могли работать как основная память, с обычной DDR4 в роли кеша четвёртого уровня, как отдельный пул хранения или в режиме прямого доступа приложений к памяти Optane.
При этом Optane был неудачно позиционирован по цене: при той же плотности памяти 3D XPoint стоил дороже NAND, но уступал в производительности DRAM, поэтому почти всегда было выгоднее купить больше NAND или более крупные DIMM DRAM. К тому же, как отмечали аналитики TechInsights, 3D XPoint недостаточно быстро наращивал битовую плотность, чтобы угнаться за NAND-флешем. В 2021 году Micron прекратила разработку продуктов на 3D XPoint, лишив Optane источника новых чипов, а в 2022 году тогдашний CEO Intel Пэт Гелсингер официально закрыл направление. Последними продуктами линейки стали SSD P5810X и P5811X, выпущенные в конце 2022 года.
В том же 2022 году OpenAI представила ChatGPT, запустив гонку ИИ-разработок. До 2025 года основная вычислительная нагрузка приходилась на обучение всё более крупных моделей, но с появлением DeepSeek в начале того же года индустрия начала смещаться в сторону инференса, работы, требующей много вычислений, памяти и хранилища одновременно. Один из ключевых приёмов оптимизации современных движков инференса, кеширование пар «ключ-значение» (KV cache), которое позволяет не пересчитывать заново весь контекст диалога при каждом новом запросе. При больших контекстах и высокой параллельности такие кеши разрастаются: одна последовательность из 64 тысяч токенов в модели вроде DeepSeek R1 занимает до 4 ГБ памяти GPU, и это умножается на сотни или тысячи одновременных пользователей. Поскольку памяти на GPU мало, а бóльшая её часть занята весами модели, движки инференса выгружают неактивные KV-кеши в системную DRAM, а затем, при длительном простое сессии, в NAND-хранилища. Проблема в том, что KV-кеширование, операция с интенсивной записью, а у NAND конечный ресурс перезаписи: рано или поздно накопитель изнашивается. Именно здесь и раскрылась бы главная сила Optane, сочетание сверхвысокой выносливости к записи и низкой задержки на случайных операциях чтения-записи малого объёма, которые как раз и доминируют в KV-кешировании.
Одним из факторов, ускоривших закат Optane, стало появление на горизонте протокола Compute Express Link (CXL): если главной причиной перехода на Optane было получить большой пул памяти, похожей на DRAM, то CXL давал те же преимущества без компромиссов Optane, позволяя подключать к контроллеру DDR4- или DDR5-память через свободный слот PCIe. Но CXL не решает проблему дороговизны самой DDR5, а сейчас цены на DRAM особенно высоки (при этом контроллер CXL может использовать DDR4 даже там, где CPU поддерживает только DDR5, именно так Meta дёшево наращивает объём памяти своих систем). В отсутствие Optane производители памяти пытаются заполнить нишу собственными вариантами write-optimized NAND: XL-Flash от Kioxia на основе однобитных SLC-ячеек обещает задержки записи ниже 10 микросекунд и выносливость до 60 перезаписей диска в день, а также может представляться системе как CXL-устройство. Samsung пытается воспроизвести свойства Optane в технологии Z-NAND, которая пока заметно уступает 3D XPoint, но, как сообщается, компания дорабатывает её с прицелом на 15-кратный прирост производительности относительно обычного NAND. Ни один из преемников пока не дотягивает до характеристик Optane, по выводу издания, технология просто опередила своё время: подожди Intel и Micron ещё несколько лет, Optane мог бы оседлать волну ИИ-инференса.
Ключевые факты
- Intel и Micron выпустили память Optane (технология 3D XPoint) в 2015 году как энергонезависимое звено между NAND-флешем и DRAM.
- Заявленные характеристики: задержки менее 10 микросекунд (около 350 нс у модулей PMem), выносливость 100 перезаписей диска в день, наработка на отказ 2 млн часов, рекорд, не превзойдённый до сих пор.
- Из-за высокой цены относительно NAND и меньшей производительности относительно DRAM Optane не нашёл массового рынка: Micron остановила выпуск 3D XPoint в 2021 году, а Intel при CEO Пэте Гелсингере официально закрыла линейку в 2022 году, последними продуктами стали P5810X и P5811X.
- В том же 2022 году вышел ChatGPT, а к 2025 году, с приходом DeepSeek, фокус индустрии сместился на инференс и write-intensive кеширование KV-пар, одна последовательность в 64 тыс. токенов у DeepSeek R1 занимает до 4 ГБ памяти GPU, и именно под такую нагрузку Optane подходил бы идеально.
- Современные заменители, Kioxia XL-Flash и Samsung Z-NAND, пока не дотягивают до характеристик Optane, а протокол CXL решает проблему объёма памяти, но не высокой цены DDR5.
Почему это важно
Материал показывает редкое совпадение: технология, которую рынок отверг как слишком дорогую и нишевую, по характеристикам, экстремальная выносливость к записи и низкая задержка на случайных операциях малого объёма, почти идеально описывает требования сегодняшнего узкого места ИИ-инфраструктуры: кеширования KV-пар при инференсе больших языковых моделей. Optane закрыли за несколько месяцев до того, как этот спрос стал массовым, и сейчас индустрия сталкивается с дефицитом и высокой ценой DRAM без прямого эквивалента той памяти.
Кому это важно
Инженерам инфраструктуры инференса и разработчикам движков LLM, которые проектируют выгрузку KV-кешей между GPU, DRAM и хранилищем; операторам дата-центров и облачных провайдеров, которые сталкиваются с дефицитом и высокой ценой DRAM; производителям памяти и хранилищ, ищущим замену Optane классом storage-class memory.
Как это применить
Прямого применения нет, линейка Optane закрыта, новых чипов 3D XPoint не производится. Практический вывод для инфраструктурных команд, присматриваться к частичным заменителям: write-optimized NAND вроде Kioxia XL-Flash (задержки записи ниже 10 мкс, до 60 перезаписей диска в день, можно представить как CXL-устройство) и Samsung Z-NAND, а также к пулам памяти на CXL с DDR4/DDR5, именно так, по данным издания, Meta дёшево наращивает объём памяти своих систем.
Можно ли доверять
Материал, авторская ретроспектива The Register, издания, специализирующегося на серверном и storage-железе; это аналитический разбор, а не сатирическая рубрика. Технические характеристики Optane приведены как официально заявленные Intel и частично экстраполированные показатели, сама Intel признавала это, а издание отмечает, что реальные цифры, вероятно, консервативны, а не завышены.
Риски и подводные камни
Ключевые цифры по выносливости и наработке на отказ, экстраполяция производителя, а не независимо измеренные показатели. Ни один из текущих заменителей (XL-Flash, Z-NAND) пока не воспроизводит полный профиль Optane по задержке и выносливости одновременно. CXL решает проблему объёма адресуемой памяти, но не устраняет главную причину дефицита, высокую цену самой DDR5.
Компания Meta Platforms признана экстремистской организацией, её деятельность на территории РФ запрещена.