Успейте опубликовать статью: прием статей до 20 апреля , публикация выпуска 30 апреля
Теория и практика науки и образования №6 (6) август 2026 г.
Технические науки
Препринт
03.08.2026
Уголовная ответственность за фальшивомонетничество
Автор
Княжев Сергей Александрович
Библиографическое описание
Княжев С. А. Устойчивость свёрточных нейронных сетей к искажениям изображений в задаче классификации бытовых отходов // Теория и практика науки и образования. — 2026. — № 6 (6). — URL: https://smart-science.net/arhiv/6/9/
Теория и практика науки и образования №6 (6) август 2026 г.
⏳ Препринт · Файл будет доступен после публикации выпуска
Аннотация
Рассматривается задача классификации изображений бытовых отходов методами глубокого обучения. Сформирован объединённый набор из 26 079 изображений семи категорий материалов с удалением дубликатов и контролем утечки данных между выборками. В одинаковых условиях обучены три свёрточные архитектуры на основе переноса обучения и оценена их устойчивость к шести типовым искажениям снимка. Установлено, что ранжирование моделей по точности на неискажённых данных не сохраняется при внесении шума: лучшая по общему качеству модель уступает более простой архитектуре. Предложены направления повышения устойчивости.
Ключевые слова
глубокое обучение
свёрточные нейронные сети
классификация изображений
сортировка отходов
перенос обучения
устойчивость модели
Abstract
The paper examines household waste image classification by deep learning methods. A combined dataset of 26,079 images across seven material categories was compiled with duplicate removal and control of data leakage between subsets. Three convolutional architectures were trained under identical conditions using transfer learning, and their robustness to six typical image distortions was evaluated. It was established that the ranking of models by accuracy on undistorted data does not hold when noise is introduced: the model with the best overall quality yields to a simpler architecture. Directions for improving robustness are proposed.
Keywords
deep learning
convolutional neural networks
image classification
waste sorting
transfer learning
model robustness
Введение
Первичная сортировка определяет эффективность переработки твёрдых коммунальных отходов: смешивание материалов усложняет технологические процессы и снижает ценность вторичного сырья [1]. Ручные и механические методы сортировки ограничены по производительности при обработке неоднородных потоков, что обусловливает развитие автоматизированных систем на основе компьютерного зрения [2], [3].
Свёрточные нейронные сети достигают высокой точности распознавания категорий отходов [4], однако публикуемые оценки качества, как правило, получены на изображениях студийного качества. В реальных условиях сортировки снимки отличаются освещением, резкостью, зашумлённостью и частичным перекрытием объектов, из-за чего обобщающая способность моделей снижается [5].
Свёрточные нейронные сети достигают высокой точности распознавания категорий отходов [4], однако публикуемые оценки качества, как правило, получены на изображениях студийного качества. В реальных условиях сортировки снимки отличаются освещением, резкостью, зашумлённостью и частичным перекрытием объектов, из-за чего обобщающая способность моделей снижается [5].
Постановка задачи
Цель исследования — сравнить свёрточные архитектуры в задаче классификации изображений бытовых отходов и оценить, сохраняется ли их ранжирование по качеству при ухудшении условий съёмки. Проверяется предположение о том, что модель, лучшая на неискажённых изображениях, остаётся лучшей и при искажениях.
Формирование набора данных
Набор сформирован объединением трёх открытых источников. Исходные категории приведены к семи целевым классам: battery, cardboard, glass, metal, organic, paper, plastic. Из 38 781 обработанного изображения 30 265 сопоставлены с целевыми классами, 8 516 исключены как нерелевантные.
Точные дубликаты выявлялись хешем SHA-256, визуально близкие изображения — перцептивным хешем dHash с оценкой расстояния Хэмминга; подозрительными считались пары с расстоянием не более двух. Пары из разных классов проверялись вручную. Изображения одной группы сходства назначались только в одну выборку, что исключает утечку данных между обучением и контролем. Итоговый набор составил 26 079 изображений, разделённых в соотношении 80:10:10 с сохранением распределения классов: 20 864, 2 607 и 2 608 изображений соответственно.
Точные дубликаты выявлялись хешем SHA-256, визуально близкие изображения — перцептивным хешем dHash с оценкой расстояния Хэмминга; подозрительными считались пары с расстоянием не более двух. Пары из разных классов проверялись вручную. Изображения одной группы сходства назначались только в одну выборку, что исключает утечку данных между обучением и контролем. Итоговый набор составил 26 079 изображений, разделённых в соотношении 80:10:10 с сохранением распределения классов: 20 864, 2 607 и 2 608 изображений соответственно.
Метод исследования
Применён перенос обучения: три архитектуры с весами, предобученными на ImageNet, с заменой выходного слоя на семиклассовый. Сравнивались ResNet-50 с остаточными связями [6], DenseNet-121 с плотной передачей признаков [7] и компактная EfficientNet-B0 [8].
Условия обучения для всех моделей совпадали: входной размер 224×224 пикселя, десять эпох, размер пакета 64, функция потерь — перекрёстная энтропия, оптимизатор AdamW, начальная скорость обучения 3·10⁻⁴. Для итоговой оценки сохранялась версия модели с минимальной ошибкой на валидационной выборке. К обучающей выборке применялись случайное кадрирование, отражение, поворот до 15 градусов и изменение яркости, контраста и насыщенности; контрольные выборки обрабатывались детерминированно.
Устойчивость проверялась на тестовой выборке, к которой применялись шесть искажений: гауссов шум, размытие, снижение и повышение яркости, снижение контраста и частичное перекрытие центральной области. Показателем служит F1-мера, усреднённая по классам, поскольку классы представлены неравномерно.
Условия обучения для всех моделей совпадали: входной размер 224×224 пикселя, десять эпох, размер пакета 64, функция потерь — перекрёстная энтропия, оптимизатор AdamW, начальная скорость обучения 3·10⁻⁴. Для итоговой оценки сохранялась версия модели с минимальной ошибкой на валидационной выборке. К обучающей выборке применялись случайное кадрирование, отражение, поворот до 15 градусов и изменение яркости, контраста и насыщенности; контрольные выборки обрабатывались детерминированно.
Устойчивость проверялась на тестовой выборке, к которой применялись шесть искажений: гауссов шум, размытие, снижение и повышение яркости, снижение контраста и частичное перекрытие центральной области. Показателем служит F1-мера, усреднённая по классам, поскольку классы представлены неравномерно.
Результаты
Качество моделей на неискажённой тестовой выборке приведено в таблице 1.
Таблица 1
Качество моделей на тестовой выборке
| Модель | Accuracy | Precision | Recall | F1-мера |
| EfficientNet-B0 | 0,9072 | 0,9131 | 0,9104 | 0,9116 |
| ResNet-50 | 0,9072 | 0,9138 | 0,9085 | 0,9108 |
| DenseNet-121 | 0,8631 | 0,8741 | 0,8651 | 0,8681 |
Наилучшее значение F1-меры получила EfficientNet-B0 — 0,9116; ResNet-50 показала близкий результат 0,9108 при совпадающей точности; DenseNet-121 уступила по всем показателям. По отдельным классам лучшие значения F1-меры получены для battery (0,9421) и organic (0,9373), наименьшие — для glass (0,8942) и plastic (0,8961). Ошибки сосредоточены между визуально близкими материалами: стекло и пластик, бумага и картон, металл и пластик.
Результаты проверки устойчивости приведены в таблице 2.
Таблица 2
Значения F1-меры при искажениях тестовых изображений
| Искажение | EfficientNet-B0 | ResNet-50 | DenseNet-121 |
| Без искажений | 0,9116 | 0,9108 | 0,8681 |
| Гауссов шум | 0,5174 | 0,6529 | 0,4659 |
| Размытие | 0,7878 | 0,6836 | 0,6779 |
| Снижение яркости | 0,8988 | 0,8831 | 0,8286 |
| Повышение яркости | 0,8623 | 0,8313 | 0,7847 |
| Снижение контраста | 0,8794 | 0,8645 | 0,8184 |
| Частичное перекрытие | 0,8883 | 0,8643 | 0,8126 |
Обсуждение результатов
Гауссов шум вызвал наиболее резкое падение качества у всех моделей. Для EfficientNet-B0 F1-мера снизилась с 0,9116 до 0,5174, то есть более чем на треть, тогда как ResNet-50 сохранила 0,6529. Таким образом, лучшая модель на неискажённых данных оказалась не лучшей при шуме, и ранжирование архитектур зависит от условий проверки. Исходное предположение подтвердилось лишь частично.
Различие объясняется устройством архитектур: остаточные связи ResNet-50 передают признаки напрямую между слоями, что ослабляет накопление шумовых возмущений при прохождении сети. Компактность EfficientNet-B0, обеспечивающая её преимущество на чистых данных, одновременно снижает избыточность представления и делает модель чувствительнее к нарушению входного сигнала.
При размытии соотношение обратное: EfficientNet-B0 сохранила 0,7878 против 0,6836 у ResNet-50. Изменение яркости, снижение контраста и частичное перекрытие повлияли умеренно — EfficientNet-B0 удержала F1-меру не ниже 0,8623, сохранив работоспособность даже при неполной видимости объекта. Отсюда следует, что выбор архитектуры определяется преобладающим типом искажений на конкретном участке сортировки: при зашумлённой съёмке предпочтительна ResNet-50, при прочих нарушениях — EfficientNet-B0.
Ограничения работы: искажения вносились программно и не воспроизводят всех особенностей промышленной съёмки; обучение ограничено десятью эпохами; аугментации, имитирующие шум и размытие, при обучении не применялись, что и объясняет уязвимость моделей именно к этим воздействиям.
Различие объясняется устройством архитектур: остаточные связи ResNet-50 передают признаки напрямую между слоями, что ослабляет накопление шумовых возмущений при прохождении сети. Компактность EfficientNet-B0, обеспечивающая её преимущество на чистых данных, одновременно снижает избыточность представления и делает модель чувствительнее к нарушению входного сигнала.
При размытии соотношение обратное: EfficientNet-B0 сохранила 0,7878 против 0,6836 у ResNet-50. Изменение яркости, снижение контраста и частичное перекрытие повлияли умеренно — EfficientNet-B0 удержала F1-меру не ниже 0,8623, сохранив работоспособность даже при неполной видимости объекта. Отсюда следует, что выбор архитектуры определяется преобладающим типом искажений на конкретном участке сортировки: при зашумлённой съёмке предпочтительна ResNet-50, при прочих нарушениях — EfficientNet-B0.
Ограничения работы: искажения вносились программно и не воспроизводят всех особенностей промышленной съёмки; обучение ограничено десятью эпохами; аугментации, имитирующие шум и размытие, при обучении не применялись, что и объясняет уязвимость моделей именно к этим воздействиям.
Заключение
Сформирован набор из 26 079 изображений семи категорий бытовых отходов с контролем дубликатов и утечки данных между выборками. В единых условиях обучены три свёрточные архитектуры; наилучшее сбалансированное качество показала EfficientNet-B0 — точность 0,9072 при F1-мере 0,9116.
Установлено, что ранжирование моделей по качеству не сохраняется при ухудшении условий съёмки: при гауссовом шуме преимущество переходит к ResNet-50. Отсюда следует, что оценка на неискажённых данных недостаточна для выбора модели в прикладной системе сортировки, а проверку устойчивости целесообразно включать в протокол сравнения архитектур. Повышение устойчивости связано с включением шума и размытия в состав обучающих аугментаций и расширением набора данных снимками, полученными в реальных условиях.
Установлено, что ранжирование моделей по качеству не сохраняется при ухудшении условий съёмки: при гауссовом шуме преимущество переходит к ResNet-50. Отсюда следует, что оценка на неискажённых данных недостаточна для выбора модели в прикладной системе сортировки, а проверку устойчивости целесообразно включать в протокол сравнения архитектур. Повышение устойчивости связано с включением шума и размытия в состав обучающих аугментаций и расширением набора данных снимками, полученными в реальных условиях.
***
- Kaza S., Yao L., Bhada-Tata P., Van Woerden F. What a Waste 2.0: A Global Snapshot of Solid Waste Management to 2050. — Washington : World Bank, 2018. — 295 p. — DOI: 10.1596/978-1-4648-1329-0.
- Gundupalli S. P., Hait S., Thakur A. A Review on Automated Sorting of Source-Separated Municipal Solid Waste for Recycling // Waste Management. — 2017. — Vol. 60. — P. 56–74. — DOI: 10.1016/j.wasman.2016.09.015.
- LeCun Y., Bengio Y., Hinton G. Deep Learning // Nature. — 2015. — Vol. 521. — P. 436–444. — DOI: 10.1038/nature14539.
- Zhang Q., Yang Q., Zhang X., [et al.] Waste Image Classification Based on Transfer Learning and Convolutional Neural Network // Waste Management. — 2021. — Vol. 135. — P. 150–157. — DOI: 10.1016/j.wasman.2021.08.038.
- Hendrycks D., Dietterich T. Benchmarking Neural Network Robustness to Common Corruptions and Perturbations // Proceedings of the International Conference on Learning Representations. — New Orleans, 2019. — P. 1–16. — DOI: 10.48550/arXiv.1903.12261.
- He K., Zhang X., Ren S., Sun J. Deep Residual Learning for Image Recognition // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. — Las Vegas, 2016. — P. 770–778. — DOI: 10.1109/CVPR.2016.90.
- Huang G., Liu Z., van der Maaten L., Weinberger K. Densely Connected Convolutional Networks // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. — Honolulu, 2017. — P. 4700–4708. — DOI: 10.1109/CVPR.2017.243.
- Tan M., Le Q. EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks // Proceedings of the 36th International Conference on Machine Learning. — Long Beach, 2019. — P. 6105–6114. — DOI: 10.48550/arXiv.1905.11946.
- Shorten C., Khoshgoftaar T. A Survey on Image Data Augmentation for Deep Learning // Journal of Big Data. — 2019. — Vol. 6, № 60. — P. 1–48. — DOI: 10.1186/s40537-019-0197-0.
📝
Опубликуйте свою статью
Препринт в течение 3-5 рабочих дней после оплаты.
Справка о публикации и электронная версия журнала включены.