D-FINE-seg объединил детекцию и сегментацию в одном фреймворке

D-FINE-seg объединил детекцию и сегментацию в одном фреймворке

Разработчик ArgoHA представил D-FINE-seg, фреймворк компьютерного зрения для трёх задач: детекции объектов, экземплярной сегментации и семантической сегментации. Задача выбирается в конфигурации значением detect, segment или sem_seg; доступны пять размеров модели, от N до X. Детекционное ядро следует работе D-FINE, а головы сегментации, обучение, экспорт и инференс, по заявлению репозитория, реализованы заново.

Проект покрывает весь процесс: подготовку датасета, обучение с распределённым запуском, EMA, смешанной точностью, mosaic-аугментациями и оптимизатором Muon, экспорт и проверку производительности. Модели можно экспортировать в ONNX, TensorRT, OpenVINO, CoreML и LiteRT; всего заявлены шесть вариантов инференса. Для детекции и экземплярной сегментации предусмотрены предобученные на COCO веса, которые загружаются автоматически при первом запуске. Есть также трекинг ByteTrack, автоматическая разметка через SAM3, демонстрация Gradio и INT8-квантизация для OpenVINO, CoreML и LiteRT.

D-FINE-seg принимает не только обычные RGB-изображения, но и четырёхканальные массивы .npy, например RGB с тепловым, глубинным или ближним инфракрасным каналом. Дополнительные каналы подключаются после трёх RGB-плоскостей; веса входного слоя, предобученные на RGB, расширяются для такого входа. Поддержаны разметки YOLO и COCO JSON для детекции и экземплярной сегментации, а для семантической сегментации, PNG-маски классов.

Автор репозитория сообщает, что на Cityscapes D-FINE-seg превосходит YOLO26 и RF-DETR по F1 в детекции и экземплярной сегментации, а в семантической сегментации опережает YOLO26 по mIoU при задержке реального времени и в 2, 3 раза меньшем числе параметров. Для замеров использовались 500 валидационных изображений Cityscapes размером 2048×1024, TensorRT 10.13 в FP16, пакет размером 1 и RTX 5070 Ti; пороги уверенности подбирались для каждого фреймворка отдельно. Эти результаты являются заявлениями автора репозитория, а не независимой оценкой.

В документации отдельно предупреждают не запускать TensorRT-движки пакетами больше одного изображения: автор описывает ошибку TensorRT 10.13.3.9, при которой одинаковые изображения внутри одного пакета дают разные оценки и метки. После экспорта проект выполняет проверку совпадения результатов между бэкендами; для семантической сегментации сравнивается попиксельное совпадение карты классов.

Ключевые факты

  • Один код и один параметр задачи покрывают детекцию, экземплярную и семантическую сегментацию; доступны пять размеров модели от N до X.
  • Фреймворк включает обучение, экспорт в ONNX, TensorRT, OpenVINO, CoreML и LiteRT, а также проверку согласованности результатов между бэкендами.
  • Поддерживаются RGB-данные и четырёхканальные массивы с дополнительной модальностью, например тепловым, глубинным или ближним инфракрасным каналом.
  • По данным автора, на Cityscapes модель опережает YOLO26 и RF-DETR по ряду метрик и использует в 2, 3 раза меньше параметров; независимого подтверждения в материале нет.
  • Для TensorRT автор рекомендует пакет размером 1 из-за описанной нестабильности результатов при пакетном запуске в версии 10.13.3.9.

Почему это важно

D-FINE-seg собирает три распространённые задачи компьютерного зрения в одном проекте: не нужно переходить между отдельными кодовыми базами для детекции, масок отдельных объектов и попиксельной разметки сцены. Экспорт в несколько форматов и единая проверка результатов могут упростить перенос модели на разные устройства.

Кому это важно

Инструмент рассчитан на разработчиков систем компьютерного зрения, которым нужны детекция или сегментация на GPU, CPU, мобильных устройствах либо Apple Silicon. Особенно полезной может быть поддержка четырёхканального входа для задач, где к RGB добавляют тепловой, глубинный или ближний инфракрасный сигнал.

Как это применить

Нужно клонировать репозиторий, установить зависимости через uv sync, выбрать в config.yaml задачу и размер модели, подготовить разметку YOLO либо COCO JSON. Для семантической сегментации используются PNG-маски классов. Базовый цикл задан командами make split, make train, make export, make bench и make infer; для COCO JSON разбиение make split не требуется.

Можно ли доверять

Описание функций, форматов и команд можно проверить в репозитории. Сравнения с YOLO26 и RF-DETR опубликованы самим автором проекта: он раскрывает часть протокола, Cityscapes, 500 валидационных изображений, TensorRT 10.13 FP16, пакет 1 и RTX 5070 Ti, однако независимых результатов в исходном материале нет.

Риски и подводные камни

Поддерживается только 3- или 4-канальный вход: больше четырёх каналов не работают из-за ограничений используемых операций. Семантическая сегментация не поддерживает режим COCO JSON. Кроме того, автор фиксирует проблему TensorRT 10.13.3.9 при пакетном инференсе и рекомендует запускать движок с пакетом размером 1; это может ограничить пропускную способность.