Успейте опубликовать статью: прием статей до 20 апреля , публикация выпуска 30 апреля
Теория и практика науки и образования №6 (6) август 2026 г.
Технические науки
Препринт
08.08.2026
Сравнительная оценка архитектур нейросетевой сегментации человека при ограниченном объёме обучающих данных
Автор
Рыбин Даниил Константинович
Библиографическое описание
Рыбин Д.К. Сравнительная оценка архитектур нейросетевой сегментации человека при ограниченном объёме обучающих данных // Теория и практика науки и образования. — 2026. — № 6 (6). — URL: https://smart-science.net/arhiv/6/11/
Теория и практика науки и образования №6 (6) август 2026 г.
⏳ Препринт · Файл будет доступен после публикации выпуска
Аннотация
Рассматривается выбор архитектуры сегментации человека на изображении в условиях ограниченного набора обучающих данных. Пять архитектур обучены в единых условиях на объединённом наборе из примерно 5 170 изображений; качество масок оценено по коэффициентам пересечения по объединению и Сёренсена–Дайса. Установлено, что инстанционная сегментация превосходит семантическую на 18–20 процентных пунктов, а более поздние по времени создания решения уступают предшествующим: модуль контекстного разрежённого свёртывания не дал выигрыша, а вторая версия базовой архитектуры проиграла первой из-за неустойчивой сходимости. Сформулированы условия, при которых выбор архитектуры определяется не её новизной.
Ключевые слова
сегментация изображений
свёрточные нейронные сети
перенос обучения
коэффициент пересечения по объединению
инстанционная сегментация
ограниченная выборка
Abstract
The paper examines the choice of a human image segmentation architecture under a limited training dataset. Five architectures were trained under identical conditions on a combined set of approximately 5,170 images; mask quality was assessed by the intersection over union and Sørensen–Dice coefficients. It was established that instance segmentation surpasses semantic segmentation by 18–20 percentage points, while later solutions yield to earlier ones: the atrous spatial pyramid pooling module provided no gain, and the second version of the base architecture lost to the first due to unstable convergence. Conditions are formulated under which the choice of architecture is not determined by its novelty.
Keywords
image segmentation
convolutional neural networks
transfer learning
intersection over union
instance segmentation
limited sample
Введение
Сегментация человека на изображении лежит в основе прикладных задач обработки визуального содержимого: удаления и замены фона, ретуши, подготовки материалов для публикации. В отличие от обнаружения, определяющего лишь положение объекта, сегментация формирует попиксельную маску, что и позволяет корректно отделить фигуру от окружения [1], [2].
Прикладная разработка обычно опирается на готовые предобученные модели, а выбор между ними делается по публикуемым показателям, полученным на крупных наборах данных. Однако разработчик прикладной системы, как правило, располагает выборкой на несколько тысяч изображений, и перенос выводов, полученных при ином масштабе данных, требует проверки.
Прикладная разработка обычно опирается на готовые предобученные модели, а выбор между ними делается по публикуемым показателям, полученным на крупных наборах данных. Однако разработчик прикладной системы, как правило, располагает выборкой на несколько тысяч изображений, и перенос выводов, полученных при ином масштабе данных, требует проверки.
Постановка задачи
Цель исследования — установить, какая архитектура сегментации предпочтительна при ограниченном объёме обучающих данных, и проверить, сохраняется ли преимущество более поздних архитектурных решений в этих условиях.
Рассматривались три класса решений: семантическая сегментация, формирующая единую маску для всех объектов класса; инстанционная, выделяющая каждый экземпляр отдельно; и сегментация в темпе поступления кадров. Прикладная задача требует разделения перекрывающихся фигур, что делает инстанционный подход необходимым, однако его преимущество при малой выборке подлежало количественной проверке.
Рассматривались три класса решений: семантическая сегментация, формирующая единую маску для всех объектов класса; инстанционная, выделяющая каждый экземпляр отдельно; и сегментация в темпе поступления кадров. Прикладная задача требует разделения перекрывающихся фигур, что делает инстанционный подход необходимым, однако его преимущество при малой выборке подлежало количественной проверке.
Материал и метод исследования
Обучающий набор объединяет валидационную подвыборку COCO val2017, из разметки которой извлечены аннотации класса «человек», и набор Penn–Fudan Pedestrian из 170 изображений с поэкземплярными масками [3], [4]. Маски Penn–Fudan преобразованы в полигональный формат COCO, после чего источники сведены в единую коллекцию объёмом около 5 170 изображений с разбиением на обучающую и валидационную части в соотношении 80:20.
Сравнивались пять архитектур: Mask R-CNN ResNet50 FPN версий v1 и v2 [5], FCN ResNet50 [6], DeepLabV3+ ResNet50 [7] и YOLOv8n-seg [8]. Первые четыре обучались от весов, предобученных на COCO, в течение десяти эпох; YOLOv8n-seg обучалась с нуля в течение двадцати эпох, поскольку предобученные веса в условиях работы оказались недоступны. Изображения масштабировались до 448 пикселей по большей стороне с сохранением пропорций.
Качество маски оценивалось коэффициентом пересечения по объединению (1) и коэффициентом Сёренсена–Дайса (2):
Сравнивались пять архитектур: Mask R-CNN ResNet50 FPN версий v1 и v2 [5], FCN ResNet50 [6], DeepLabV3+ ResNet50 [7] и YOLOv8n-seg [8]. Первые четыре обучались от весов, предобученных на COCO, в течение десяти эпох; YOLOv8n-seg обучалась с нуля в течение двадцати эпох, поскольку предобученные веса в условиях работы оказались недоступны. Изображения масштабировались до 448 пикселей по большей стороне с сохранением пропорций.
Качество маски оценивалось коэффициентом пересечения по объединению (1) и коэффициентом Сёренсена–Дайса (2):
IoU = |M ∩ G| / |M ∪ G| = TP / (TP + FP + FN) (1)
Dice = 2|M ∩ G| / (|M| + |G|) = 2TP / (2TP + FP + FN) (2)
Dice = 2|M ∩ G| / (|M| + |G|) = 2TP / (2TP + FP + FN) (2)
где M — предсказанная маска, G — эталонная; TP — пиксели, верно отнесённые к человеку, FP — фон, ошибочно отнесённый к человеку, FN — пропущенные пиксели человека. Для бинарной маски F1-мера совпадает с коэффициентом Сёренсена–Дайса. Оба показателя лежат в диапазоне от нуля до единицы.
Результаты
Результаты обучения приведены в таблице 1.
Таблица 1
Качество сегментации по архитектурам
| Архитектура | Тип сегментации | IoU | Dice |
| Mask R-CNN v1 | инстанционная | 0,6794 | 0,7741 |
| Mask R-CNN v2 | инстанционная | 0,6065 | 0,7107 |
| FCN ResNet50 | семантическая | 0,4972 | 0,6063 |
| DeepLabV3+ ResNet50 | семантическая | 0,4660 | 0,5694 |
| YOLOv8n-seg | инстанционная | 0,2166 | 0,0832 |
Наилучший результат получен для Mask R-CNN v1: пересечение по объединению 0,6794 при коэффициенте Сёренсена–Дайса 0,7741. Функция потерь этой модели монотонно снижалась с 0,844 до 0,363. Для версии v2 при тех же условиях зафиксировано скачкообразное поведение функции потерь на восьмой и девятой эпохах и итоговое значение 0,6065.
Обсуждение результатов
Первый результат касается типа сегментации. Инстанционные модели, обученные от предобученных весов, превзошли семантические на 18–20 процентных пунктов: 0,6794 против 0,4972 у лучшей семантической модели. Различие объясняется устройством подхода: семантические модели формируют единую маску для всех людей в кадре и не разделяют перекрывающиеся фигуры, из-за чего границы между смежными объектами вносят систематическую погрешность в оценку.
Второй результат неочевиден. DeepLabV3+ уступила более простой FCN — 0,4660 против 0,4972, — несмотря на наличие модуля разрежённого свёртывания с пространственной пирамидой, предназначенного для учёта контекста разного масштаба. При ограниченной выборке дополнительные параметры этого модуля не получают достаточного подкрепления данными, и усложнение архитектуры оборачивается потерей качества.
Третий результат того же рода: вторая версия Mask R-CNN проиграла первой — 0,6065 против 0,6794. Обе версии обучались одинаково, поэтому различие относится к устойчивости сходимости, а не к предельным возможностям архитектуры. Более позднее решение оказалось чувствительнее к настройке при коротком дообучении.
Отдельно подтверждается решающая роль переноса обучения: YOLOv8n-seg, обученная с нуля вдвое дольше остальных, показала несопоставимо низкий результат. При выборке в несколько тысяч изображений наличие предобученных весов оказывается более значимым фактором, чем архитектурные различия между моделями.
Ограничения работы: обучение ограничено десятью эпохами и единственным запуском для каждой архитектуры, поэтому влияние случайной инициализации не оценивалось; гиперпараметры не подбирались отдельно под каждую модель; результат YOLOv8n-seg отражает обучение без предобучения и не характеризует архитектуру саму по себе.
Второй результат неочевиден. DeepLabV3+ уступила более простой FCN — 0,4660 против 0,4972, — несмотря на наличие модуля разрежённого свёртывания с пространственной пирамидой, предназначенного для учёта контекста разного масштаба. При ограниченной выборке дополнительные параметры этого модуля не получают достаточного подкрепления данными, и усложнение архитектуры оборачивается потерей качества.
Третий результат того же рода: вторая версия Mask R-CNN проиграла первой — 0,6065 против 0,6794. Обе версии обучались одинаково, поэтому различие относится к устойчивости сходимости, а не к предельным возможностям архитектуры. Более позднее решение оказалось чувствительнее к настройке при коротком дообучении.
Отдельно подтверждается решающая роль переноса обучения: YOLOv8n-seg, обученная с нуля вдвое дольше остальных, показала несопоставимо низкий результат. При выборке в несколько тысяч изображений наличие предобученных весов оказывается более значимым фактором, чем архитектурные различия между моделями.
Ограничения работы: обучение ограничено десятью эпохами и единственным запуском для каждой архитектуры, поэтому влияние случайной инициализации не оценивалось; гиперпараметры не подбирались отдельно под каждую модель; результат YOLOv8n-seg отражает обучение без предобучения и не характеризует архитектуру саму по себе.
Заключение
Проведено сравнение пяти архитектур сегментации человека в единых условиях обучения на объединённом наборе из примерно 5 170 изображений. Наилучшее качество показала Mask R-CNN ResNet50 FPN версии v1 при пересечении по объединению 0,6794.
Установлено, что при ограниченном объёме данных преимущество получают инстанционные архитектуры с предобученными весами, тогда как усложнение модели не гарантирует выигрыша: DeepLabV3+ уступила более простой FCN, а вторая версия базовой архитектуры — первой. Отсюда следует, что выбор модели для прикладной системы с ограниченной выборкой целесообразно основывать на собственном эксперименте в единых условиях, а не на публикуемых показателях, полученных при ином масштабе данных. Дальнейшая работа предполагает многократные запуски с различной инициализацией и раздельный подбор гиперпараметров.
Установлено, что при ограниченном объёме данных преимущество получают инстанционные архитектуры с предобученными весами, тогда как усложнение модели не гарантирует выигрыша: DeepLabV3+ уступила более простой FCN, а вторая версия базовой архитектуры — первой. Отсюда следует, что выбор модели для прикладной системы с ограниченной выборкой целесообразно основывать на собственном эксперименте в единых условиях, а не на публикуемых показателях, полученных при ином масштабе данных. Дальнейшая работа предполагает многократные запуски с различной инициализацией и раздельный подбор гиперпараметров.
***
- Szeliski R. Computer Vision: Algorithms and Applications. — 2nd ed. — Cham : Springer, 2022. — 1096 p. — DOI: 10.1007/978-3-030-34372-9.
- LeCun Y., Bengio Y., Hinton G. Deep Learning // Nature. — 2015. — Vol. 521, № 7553. — P. 436–444. — DOI: 10.1038/nature14539.
- Lin T.-Y., Maire M., Belongie S., [et al.] Microsoft COCO: Common Objects in Context // Proceedings of the European Conference on Computer Vision. — Zurich, 2014. — P. 740–755. — DOI: 10.1007/978-3-319-10602-1_48.
- Wang L., Shi J., Song G., Shen I. Object Detection Combining Recognition and Segmentation // Proceedings of the Asian Conference on Computer Vision. — Tokyo, 2007. — P. 189–199. — DOI: 10.1007/978-3-540-76386-4_17.
- He K., Gkioxari G., Dollár P., Girshick R. Mask R-CNN // Proceedings of the IEEE International Conference on Computer Vision. — Venice, 2017. — P. 2961–2969. — DOI: 10.1109/ICCV.2017.322.
- Long J., Shelhamer E., Darrell T. Fully Convolutional Networks for Semantic Segmentation // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. — Boston, 2015. — P. 3431–3440. — DOI: 10.1109/CVPR.2015.7298965.
- Chen L.-C., Zhu Y., Papandreou G., [et al.] Encoder-Decoder with Atrous Separable Convolution for Semantic Image Segmentation // Proceedings of the European Conference on Computer Vision. — Munich, 2018. — P. 801–818. — DOI: 10.1007/978-3-030-01234-2_49.
- Redmon J., Divvala S., Girshick R., Farhadi A. You Only Look Once: Unified, Real-Time Object Detection // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. — Las Vegas, 2016. — P. 779–788. — DOI: 10.1109/CVPR.2016.91.
- Ren S., He K., Girshick R., Sun J. Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks // Advances in Neural Information Processing Systems. — 2015. — Vol. 28. — P. 91–99. — DOI: 10.1109/TPAMI.2016.2577031.
📝
Опубликуйте свою статью
Препринт в течение 3-5 рабочих дней после оплаты.
Справка о публикации и электронная версия журнала включены.