ОПТИМІЗАЦІЯ ГЛИБОКИХ НЕЙРОННИХ МЕРЕЖ ДЛЯ КЛАСИФІКАЦІЇ ЕМОЦІЙНОГО СТАНУ МОВЛЕННЯ З ВИКОРИСТАННЯМ ДИНАМІЧНОГО КВАНТУВАННЯ

Сергій Олександрович Жуков; Олександр Володимирович Рудзевич

doi:10.31649/2307-5376-2025-2-51-65

Автор(и)

Жуков Сергій Олександрович Вінницький національний технічний університет
Рудзевич Олександр Володимирович Вінницький національний технічний університет

DOI:

https://doi.org/10.31649/2307-5376-2025-2-51-65

Ключові слова:

емоційна тональність, розпізнавання емоцій, аудіозапис, аудіомовлення, класифікація, видобування ознак, класифікація мовлення, машинне навчання, глибоке навчання, нейронна мережа, довга короткочасна пам’ять, багатоголова увага, згортковий шар, LSTM, CNN, оптимізація нейронної мережі, динамічне квантування

Анотація

У статті представлено результати системного дослідження з аналізу емоційної тональності аудіозаписів із використанням методів глибокого навчання. Основною метою є створення моделі, здатної ефективно класифікувати емоції мовлення в умовах обмежених обчислювальних ресурсів без суттєвих втрат точності. Обґрунтовано актуальність проблеми для різних інформаційних систем реального часу, зокрема і висвітлено огляд наявних підходів з їхніми недоліками та можливостями для покращень. Далі було обрано набір даних для проведення дослідження, яким став «Emotional Speech Dataset». Для уніфікації довжини записів застосовано модифіковану стратегію заповнення нулями, що випадково розподіляє доповнення між початком і кінцем сигналу.

У процесі передобробки видобуто як часові, так і часово-частотні ознаки аудіозаписів, що забезпечило багатше представлення властивостей вхідних даних. Після цього було виконано навчання нейронних мереж з використанням елементів з довгою короткочасною пам’яттю, з блоками багатоголової уваги, а також зі згортковими шарами. Найвищу точність показала модель зі згортковими шарами, а саме близько 95% на тестувальних даних, тоді як дві інші моделі мали точність 90 та 93 % відповідно.

Для пришвидшення інференсу та зменшення розміру моделей було застосовано динамічне квантування, внаслідок чого нейронна мережа зі згортковими шарами погіршила показник точності на тестувальних даних до 92 %, однак швидкість інференсу зменшилася вчетверо і склала 0,4 мс, а обсяг пам’яті для зберігання зменшився більш ніж удесятеро і склав 74 кБ. Схожу поведінку щодо прискорення інференсу та зменшення обсягу пам’яті за рахунок пригнічення точності демонстрували і решта нейронних мереж.

Аналіз результатів тестування на помилки показав те, що всі нейронні мережі якщо й помиляються, то найчастіше при сплутуванні радісної емоції з гнівної, а також нейтральної із сумною, що вказує на потребу подальшого розширення переліку ознак, зокрема врахування тембральних характеристик і інтонаційних закономірностей.

Біографії авторів

Жуков Сергій Олександрович, Вінницький національний технічний університет

канд. техн. наук, доцент, доцент кафедри системного аналізу та інформаційних технологій

Рудзевич Олександр Володимирович, Вінницький національний технічний університет

студент групи СА-21б, факультет інтелектуальних інформаційних технологій та автоматизації

ОПТИМІЗАЦІЯ ГЛИБОКИХ НЕЙРОННИХ МЕРЕЖ ДЛЯ КЛАСИФІКАЦІЇ ЕМОЦІЙНОГО СТАНУ МОВЛЕННЯ З ВИКОРИСТАННЯМ ДИНАМІЧНОГО КВАНТУВАННЯ

Автор(и)

DOI:

Ключові слова:

Анотація

Біографії авторів

Жуков Сергій Олександрович, Вінницький національний технічний університет

Рудзевич Олександр Володимирович, Вінницький національний технічний університет

##submission.downloads##

Опубліковано

Як цитувати

Номер

Розділ

Метрики

Завантаження

Статті цього автора (авторів), які найбільше читають

Подати статтю

Інформація

Поточний номер

##plugins.block.developedBy.blockTitle##