Моделювання інтелектуальної системи виявлення громадської думки на основі методу доменно-орієнтованих семантичних структур DO-SPO
Анотація
Статтю присвячено розв’язанню задачі оптимізації машинного навчання для систем виявлення громадської думки в умовах дефіциту маркованих корпусів даних для української мови. Автороми розроблено метод доменно-орієнтованого синтезу даних (DO-SPO), який базується на ієрархічному структуруванні семантичних трійок у межах 19 стратегічних доменів, що дозволяє подолати ефекти «семантичної інверсії» та синтаксичного перенавчання моделей. Експериментальна верифікація з використанням архітектури Bi-LSTM на корпусі обсягом 200 000 одиниць продемонструвала значний приріст ефективності: точність тематичного розпізнавання зросла до 98%, а аналізу тональності — до 95%. Впровадження методу забезпечило повне усунення помилок полярності сентименту та високу стійкість класифікаторів до інформаційного шуму, що підтверджує готовність системи до практичної експлуатації у конвеєрах моніторингу суспільно-політичного дискурсу
Посилання
2. Dai H. AugGPT: Leveraging ChatGPT for text data augmentation / H. Dai [et al.] // arXiv. – 2023. – 2302.13007.
3. Ding B. Data augmentation using LLMs: Data perspectives, learning paradigms and challenges / B. Ding [et al.] // arXiv. – 2024. – 2403.02990.
4. Никитюк В. В. Application of large language models in generating Ukrainian corpora for training text classification systems / В. В. Никитюк, А. М. Долінський // Вісник ТНТУ. – 2026. – № 1. – С. 46–54.
5. Bayer M. A survey on data augmentation for text classification / M. Bayer, M. A. Kaufhold, C. Reuter // ACM Computing Surveys. – 2023. – Vol. 55, No. 7. – P. 1–39




