Детекція обʼєктів на основі синтетичних даних: порівняльна оцінка впливу аугментацій та архітектури детектора
Анотація
Робота присвячена дослідженню можливості підвищення якості роботи детекторів обʼєктів, навчених в умовах повної відсутності реальних зображень у тренувальному датасеті. Основна мета полягає у визначенні того, чи здатні аугментації, що імітують артефакти реальних камер, скорочувати розрив між синтетичними та реальними даними і покращувати показники детекції на реальних зображеннях. Для формування навчального датасету використано Blender - безкоштовний інструмент тривимірного моделювання з вбудованою підтримкою Python-скриптів, що дозволяє процедурно генерувати фотореалістичні сцени з автоматичною розміткою обʼєктів. Датасет формувався у трьох варіаціях: без аугментацій, з аугментаціями на тренувальних і валідаційних зображеннях, а також виключно з аугментаціями валідаційних зображень. До аугментацій належать: шум сенсора, JPEG-артефакти, розмиття руху та розфокусування, хроматична аберація, віньєтування та зсув експозиції. Тренування виконувалось на платформі Google Colab на датасеті з 5000 зображень із використанням бібліотек Ultralytics та Torchvision для декількох архітектур детекторів: YOLOv11, YOLOv11-Seg, Faster R-CNN та Mask R-CNN. Отримані моделі тестувались на трьох незалежних датасетах реальних зображень з ручною розміткою. Найкращий результат на реальних даних - mAP50 0.600 (YOLOv11, test1); застосування аугментацій підвищує mAP50 Faster R-CNN у 4 рази при низькій роздільній здатності (0.118 vs 0.506 на test3). Результати демонструють вплив вибору аугментаційної стратегії та архітектури детектора на якість детекції в умовах domain gap між синтетичними та реальними даними.
Посилання
2. Редмон Дж., Дівала С., Гіршік Р., Фархаді А. You Only Look Once: уніфікована детекція об'єктів у реальному часі. Матеріали IEEE конференції CVPR. 2016. С. 779–788.
3. Рен Ш., Хе К., Гіршік Р., Сунь Дж. Faster R-CNN: до детекції об'єктів у реальному часі за допомогою мереж пропозиції регіонів. Advances in Neural Information Processing Systems. 2015. Т. 28. С. 91–99.
4. Хе К., Гкіоксарі Г., Доллар П., Гіршік Р. Mask R-CNN. Матеріали IEEE ICCV. Венеція, 2017. С. 2980–2988.
5. Цю В., Юіл А. UnrealCV: підключення комп'ютерного зору до Unreal Engine. Матеріали ECCV 2016 Workshops. LNCS. Т. 9915. С. 909–916




