Детекція обʼєктів на основі синтетичних даних: порівняльна оцінка впливу аугментацій та архітектури детектора

Ключові слова: синтетичні дані, детекція обʼєктів, YOLOv11, YOLOv11-Seg, Faster R-CNN, Mask R-CNN, Blender, автоматична анотація, компʼютерний зір, domain gap

Анотація

Робота присвячена дослідженню можливості підвищення якості роботи детекторів обʼєктів, навчених в умовах повної відсутності реальних зображень у тренувальному датасеті. Основна мета полягає у визначенні того, чи здатні аугментації, що імітують артефакти реальних камер, скорочувати розрив між синтетичними та реальними даними і покращувати показники детекції на реальних зображеннях. Для формування навчального датасету використано Blender - безкоштовний інструмент тривимірного моделювання з вбудованою підтримкою Python-скриптів, що дозволяє процедурно генерувати фотореалістичні сцени з автоматичною розміткою обʼєктів. Датасет формувався у трьох варіаціях: без аугментацій, з аугментаціями на тренувальних і валідаційних зображеннях, а також виключно з аугментаціями валідаційних зображень. До аугментацій належать: шум сенсора, JPEG-артефакти, розмиття руху та розфокусування, хроматична аберація, віньєтування та зсув експозиції. Тренування виконувалось на платформі Google Colab на датасеті з 5000 зображень із використанням бібліотек Ultralytics та Torchvision для декількох архітектур детекторів: YOLOv11, YOLOv11-Seg, Faster R-CNN та Mask R-CNN. Отримані моделі тестувались на трьох незалежних датасетах реальних зображень з ручною розміткою. Найкращий результат на реальних даних - mAP50 0.600 (YOLOv11, test1); застосування аугментацій підвищує mAP50 Faster R-CNN у 4 рази при низькій роздільній здатності (0.118 vs 0.506 на test3). Результати демонструють вплив вибору аугментаційної стратегії та архітектури детектора на якість детекції в умовах domain gap між синтетичними та реальними даними.

Посилання

1. Мумуні А., Мумуні Ф., Геррар Н. К. Огляд методів аугментації синтетичних даних у комп'ютерному зорі. Machine Intelligence Research. 2024.
2. Редмон Дж., Дівала С., Гіршік Р., Фархаді А. You Only Look Once: уніфікована детекція об'єктів у реальному часі. Матеріали IEEE конференції CVPR. 2016. С. 779–788.
3. Рен Ш., Хе К., Гіршік Р., Сунь Дж. Faster R-CNN: до детекції об'єктів у реальному часі за допомогою мереж пропозиції регіонів. Advances in Neural Information Processing Systems. 2015. Т. 28. С. 91–99.
4. Хе К., Гкіоксарі Г., Доллар П., Гіршік Р. Mask R-CNN. Матеріали IEEE ICCV. Венеція, 2017. С. 2980–2988.
5. Цю В., Юіл А. UnrealCV: підключення комп'ютерного зору до Unreal Engine. Матеріали ECCV 2016 Workshops. LNCS. Т. 9915. С. 909–916
Опубліковано
2026-09-24
Як цитувати
Фітель , Б. С., & Романишин , Ю. М. (2026). Детекція обʼєктів на основі синтетичних даних: порівняльна оцінка впливу аугментацій та архітектури детектора. КОМП’ЮТЕРНО-ІНТЕГРОВАНІ ТЕХНОЛОГІЇ: ОСВІТА, НАУКА, ВИРОБНИЦТВО, (64), 329-339. https://doi.org/10.36910/6775-2524-0560-2026-64-32
Розділ
Інформатика та обчислювальна техніка