Учёные скрестили готовую диффузионную модель для картинок с топологической оптимизацией конструкций
Природные несущие структуры, жилкование листа, губчатая (трабекулярная) костная ткань, паутина, при небольшой массе достигают высокой жёсткости, но классические алгоритмы топологической оптимизации (метод, который решает, где в заданном объёме оставить материал, а где его убрать, чтобы деталь при заданной нагрузке была одновременно лёгкой и жёсткой) редко приближаются к таким органическим формам. Мало какие из существующих методов вообще позволяют инженеру задать замысел конструкции обычным текстовым описанием, управление в них обычно ограничено числовыми параметрами задачи: нагрузкой, объёмом материала, граничными условиями.
Авторы новой работы предлагают взять готовую диффузионную модель для генерации изображений, без какого-либо дополнительного обучения, «замороженную» как есть, и использовать её как источник знаний о форме прямо внутри физического расчёта. На каждой итерации топологической оптимизации, основанной на плотности материала (форма детали описывается значением плотности от 0 до 1 в каждой точке пространства), берётся поправка к форме, которую по текстовому запросу выдаёт диффузионная модель, она извлекается техникой score distillation sampling (SDS), без обычной пошаговой генерации картинки, и складывается с градиентом чувствительности по методу конечных элементов: стандартным физическим расчётом, который показывает, какие участки конструкции важнее всего для её жёсткости. Какие из подсказанных диффузионной моделью черт формы «выживут», а какие будут отброшены, решает именно физика, а не генератор изображений. Так текстовый запрос превращается в явное, машиночитаемое представление замысла инженера, без переобучения самой генеративной модели под инженерную задачу.
Метод проверили в 245 основных запусках SDS, охватывающих четыре геометрические области и два физических режима, механическую и тепловую нагрузку. В 38 из 49 протестированных сочетаний «текстовый запрос + область» получилось статистически значимое снижение податливости конструкции (податливость показывает, насколько деталь деформируется под заданной нагрузкой: чем она ниже, тем деталь жёстче при том же расходе материала), до 31,5% при механической нагрузке и до 23,0% при тепловой. По этому показателю метод превзошёл обычные градиентные алгоритмы топологической оптимизации, взятые как база для сравнения.
Сопоставление получившихся конструкций между областями выявило повторяющийся структурный признак улучшения: в большинстве (не во всех) областей генеративный источник знаний о форме подавляет тупиковые ветви в рёберном скелете детали, участки материала, которые никуда не ведут и не несут нагрузку. Корреляция между числом таких тупиковых окончаний и итоговой податливостью конструкции варьируется от r = +0,56 до +0,99 в зависимости от области: меньше тупиковых веток, ниже податливость. У самой связки «диффузия + физика» нашёлся и побочный эффект: выраженная тенденция к промежуточным значениям плотности материала, не однозначно «материал» и не однозначно «пустота», которые непригодны для реального изготовления детали; их доля доходила до 42,6%. Авторы устранили это стандартным для топологической оптимизации приёмом, проекцией Хевисайда с постепенным увеличением параметра β (beta-continuation), которая довела долю таких промежуточных значений до менее 3%. После этого автоматический конвейер на основе скелетизации переводит итоговые поля плотности в предварительную геометрию, готовую для систем автоматизированного проектирования (CAD).
По формулировке авторов, чтобы перенести метод на новую область, вид нагрузки или физическую цель, достаточно поменять текстовый запрос, постановка самой физической задачи (нагрузка, граничные условия) для каждого нового случая всё равно указывается отдельно. Главный вывод, который они делают: одна и та же предобученная генеративная модель без какого-либо переобучения может служить многоразовым источником знаний о форме для инженерного проектирования в самых разных задачах.
Ключевые факты
- Метод берёт готовую диффузионную модель для генерации изображений без какого-либо дополнительного обучения и встраивает её отклик прямо в физический расчёт топологической оптимизации: текстовый запрос техникой score distillation sampling (SDS) превращается в градиент, который на каждой итерации складывается с градиентом чувствительности по методу конечных элементов, а не подменяет физику.
- В 245 основных запусках SDS по четырём геометрическим областям и двум физическим режимам (механическая и тепловая нагрузка) статистически значимое снижение податливости конструкции получили 38 из 49 протестированных сочетаний «запрос + область», до 31,5% при механической нагрузке и до 23,0% при тепловой, превзойдя обычные градиентные алгоритмы оптимизации.
- В большинстве (не во всех) областей генеративная подсказка подавляет тупиковые, не несущие нагрузку ветви рёберного скелета детали; корреляция между числом таких тупиков и итоговой податливостью, от r = +0,56 до +0,99 в зависимости от области.
- У связки «диффузионная модель + физика» есть побочный эффект, тенденция к промежуточным (не чётко «материал»/«пустота») значениям плотности, доходящая до 42,6% детали; проекция Хевисайда с постепенным увеличением параметра β снижает эту долю до менее 3%, после чего автоматический конвейер на основе скелетизации переводит поля плотности в геометрию, готовую для CAD.
- По словам авторов, перенос метода на новую область, нагрузку или физическую цель требует лишь смены текстового запроса, постановка самой физической задачи всё равно задаётся отдельно для каждого нового случая; готовая генеративная модель при этом переиспользуется без переобучения.
Почему это важно
Инженеры давно знают, что природные несущие конструкции, жилкование листа, губчатая костная ткань, паутина, при небольшой массе держат нагрузку лучше, чем типичные результаты классической топологической оптимизации, а задать замысел конструкции обычным языком существующие инструменты почти не позволяют: управление в них обычно ограничено числовыми параметрами задачи. Эта работа предлагает неожиданный источник недостающего знания о форме, обычную, никак не переученную под инженерные задачи диффузионную модель для картинок: чтобы использовать её отклик на текстовый запрос как ещё один градиент внутри физического расчёта, не нужно ни собирать датасет инженерных чертежей, ни дообучать саму генеративную модель, а финальное решение о том, какие подсказанные ей черты формы сохранятся, всё равно проверяет и корректирует физика на каждом шаге оптимизации.
Кому это важно
Прежде всего, инженерам-расчётчикам и разработчикам инструментов автоматизированного проектирования и инженерного анализа (CAD/CAE), которым приходится проектировать детали, где важны одновременно низкая масса и высокая жёсткость: именно для таких задач и существует топологическая оптимизация. Интересно это и исследователям генеративного ИИ: работа показывает, где ещё, помимо генерации картинок и видео, можно применить технику score distillation sampling (SDS), ещё один пример переноса приёмов генеративного ИИ в смежную техническую область. Наконец, важно тем, кто занимается человеко-машинными интерфейсами инженерного софта: работа показывает, что естественный язык может стать полноценным входом для физически ограниченной оптимизации, а не только подсказкой для чат-бота.
Как это применить
Это исследовательская работа, а не готовый плагин для CAD-системы, но у неё чёткий переносимый рецепт. Берётся любая готовая («замороженная», без дообучения) диффузионная модель для генерации изображений. На каждой итерации плотностной топологической оптимизации к обычному градиенту чувствительности (из метода конечных элементов) добавляется поправка, которую по текстовому запросу выдаёт диффузионная модель, извлекается она техникой score distillation sampling (SDS). Чтобы итоговое поле плотности не «зависало» в промежуточных, непригодных для изготовления значениях, применяется проекция Хевисайда с постепенным увеличением параметра β (обычный для топологической оптимизации приём, здесь особенно нужный из-за связки с диффузионной моделью). Готовое поле плотности пропускается через автоматическую скелетизацию, и на выходе получается геометрия, готовая для CAD. Перенастройка на новую задачу, это смена текстового запроса; но физическую постановку (нагрузка, граничные условия) для каждой новой задачи всё равно нужно задавать отдельно, сама по себе смена запроса такую настройку не заменяет.
Можно ли доверять
Источник, препринт на arXiv; аннотация не называет ни конкретную диффузионную модель, ни авторов, ни организацию, ни статус независимого рецензирования или публикации, поэтому проверить репутацию команды и происхождение метода по одному тексту нельзя. При этом заявленные результаты, не голословное описание идеи: авторы прогнали 245 основных запусков SDS по четырём геометрическим областям и двум физическим режимам и приводят статистику по 38 из 49 сочетаний «запрос + область», а не единичный удачный пример. Однако в тексте нет ни абсолютных значений податливости до и после оптимизации, ни времени расчёта, ни используемого оборудования, судить, насколько практичен метод по вычислительным затратам и насколько велик абсолютный (а не только процентный) выигрыш, по одной аннотации нельзя. Не сказано и про то, будут ли открыты код или данные, без них независимо воспроизвести результат не получится.
Риски и подводные камни
Метод сработал статистически значимо в 38 из 49 протестированных сочетаний «запрос + область», иначе говоря, в 11 сочетаниях значимого улучшения не произошло, и текст не разбирает, какие именно комбинации не сработали и почему. Признак «подавление тупиковых ветвей» тоже не универсален: авторы прямо говорят, что он проявляется в большинстве, а не во всех областях. Сама связка диффузионной модели с физическим расчётом по умолчанию тянет за собой брак, до 42,6% материала попадало в промежуточные, непригодные для изготовления значения плотности, и без отдельного исправления (проекции Хевисайда) результат нельзя было бы изготовить как есть. Наконец, в тексте не приведены ни время расчёта, ни вычислительные затраты, а обращения к диффузионной модели на каждой итерации оптимизации обычно недёшевы, поэтому неясно, насколько метод пригоден для повседневного инженерного использования за пределами исследовательского прототипа.