Успейте опубликовать статью: прием статей до 20 апреля , публикация выпуска 30 апреля
Теория и практика науки и образования №5 (5) июль 2026 г.
Информатика
Препринт
20.07.2026
Разработка модели распознавания эмоций по акустическим характеристикам русской речи на основе нейронных сетей как фактор технологической конкурентоспособности
Автор
Литвинов Станислав Викторович
Библиографическое описание
Литвинов С.В. Разработка модели распознавания эмоций по акустическим характеристикам русской речи на основе нейронных сетей как фактор технологической конкурентоспособности // Теория и практика науки и образования. — 2026. — № 5 (5). — URL: https://smart-science.net/arhiv/5/15/
Теория и практика науки и образования №5 (5) июль 2026 г.
⏳ Препринт · Файл будет доступен после публикации выпуска
Аннотация
В статье представлена разработка открытой модели распознавания эмоций по акустическим характеристикам русской речи на основе нейронных сетей. Цель – создание и экспериментальная оценка модели для русского языка в условиях дефицита открытых отечественных решений. Применен датасет Dusha, сопоставлены архитектуры 2D-CNN, CNN-BiLSTM и HuBERT. Лучшая модель достигла Macro-F1 0,75. Результаты применимы в колл-центрах, антифроде и голосовых сервисах и значимы для технологической конкурентоспособности.
Ключевые слова
распознавание эмоций
акустические характеристики речи
нейронные сети
глубокое обучение
русская речь
датасет Dusha
технологическая конкурентоспособность
Abstract
The paper presents an open neural-network model for emotion recognition from acoustic features of Russian speech. The aim is to design and evaluate a model for Russian amid a shortage of open domestic solutions. The Dusha dataset is used, and 2D-CNN, CNN-BiLSTM and HuBERT are compared. The best model reaches Macro-F1 of 0.75. The results apply in call centers, anti-fraud and voice services and are relevant to technological competitiveness.
Keywords
speech emotion recognition
acoustic speech features
neural networks
deep learning
Russian speech
Russian speech
technological competitiveness
Распознавание эмоций по речи (Speech Emotion Recognition, SER) – направление на стыке цифровой обработки сигналов и машинного обучения, задача которого состоит в определении эмоционального состояния, говорящего по акустическим характеристикам голоса независимо от смысла произнесенных слов. Практическая ценность направления обусловлена широким спектром применения, например, ранняя диагностика психологических расстройств, оценка состояния клиентов и контроль качества в колл-центрах, выявление жертв телефонного мошенничества и социальной инженерии, адаптация голосовых ассистентов под настроение пользователя [3; 4].
Рынок технологий анализа эмоций демонстрирует устойчивый рост, по отраслевым оценкам, его объем увеличивается с 19 млрд долларов США в 2019 году до прогнозных 37,1 млрд к 2026 году. Но большинство представленных на рынке решений ориентированы на английский язык, распространяются на коммерческой основе и имеют закрытый исходный код. Отдельные отечественные продукты речевой аналитики определяют эмоциональную окраску преимущественно по тексту транскрибации, а не по акустике, что снижает их устойчивость при шуме, обрывочной речи и в каналах низкого качества [1; 9].
В условиях задач технологического суверенитета и импортозамещения отсутствие открытого русскоязычного решения, работающего непосредственно по звучанию голоса, представляет собой фактор, снижающий конкурентоспособность отечественных голосовых сервисов. Создание такой модели имеет не только научное, но и прикладное экономическое значение, поскольку формирует доступную технологическую основу для отраслевых продуктов.
Цель работы – разработать и экспериментально оценить модель распознавания эмоций по акустическим характеристикам русской речи на основе нейронных сетей и сравнить ее с существующими решениями. Научная новизна состоит в построении и сопоставительной оценке открытой акустической модели для русского языка на крупнейшем доступном датасете с обоснованием выбора архитектуры и параметров.
Рынок технологий анализа эмоций демонстрирует устойчивый рост, по отраслевым оценкам, его объем увеличивается с 19 млрд долларов США в 2019 году до прогнозных 37,1 млрд к 2026 году. Но большинство представленных на рынке решений ориентированы на английский язык, распространяются на коммерческой основе и имеют закрытый исходный код. Отдельные отечественные продукты речевой аналитики определяют эмоциональную окраску преимущественно по тексту транскрибации, а не по акустике, что снижает их устойчивость при шуме, обрывочной речи и в каналах низкого качества [1; 9].
В условиях задач технологического суверенитета и импортозамещения отсутствие открытого русскоязычного решения, работающего непосредственно по звучанию голоса, представляет собой фактор, снижающий конкурентоспособность отечественных голосовых сервисов. Создание такой модели имеет не только научное, но и прикладное экономическое значение, поскольку формирует доступную технологическую основу для отраслевых продуктов.
Цель работы – разработать и экспериментально оценить модель распознавания эмоций по акустическим характеристикам русской речи на основе нейронных сетей и сравнить ее с существующими решениями. Научная новизна состоит в построении и сопоставительной оценке открытой акустической модели для русского языка на крупнейшем доступном датасете с обоснованием выбора архитектуры и параметров.
Материалы и методы
Для формализации набора распознаваемых состояний использован категориальный подход на основе модели базовых эмоций П. Экмана [7], предполагающий конечный набор дискретных классов. Альтернативный многомерный подход (циркумплексная модель Дж. Рассела с осями валентности и активации [12]) информативнее, но оперирует непрерывными субъективными оценками, которые хуже обучаются по голосу и приводят к росту числа классов. Категориальная модель согласуется с разметкой используемого датасета и обеспечивает устойчивую классификацию.
В качестве источника данных выбран открытый русскоязычный датасет Dusha [6], содержащий около 350 часов аудио и более 300 тысяч записей с разметкой на четыре эмоции (радость, грусть, злость, нейтральное) и служебный класс «другое», то есть пять классов классификации. Датасет включает как студийные, так и естественные записи, что приближает условия к реальным.
Запись приводится к моно с частотой дискретизации 16 кГц, нормируется по амплитуде и обрабатывается предыскажающим фильтром с коэффициентом 0,97 для компенсации спада спектра на высоких частотах. Далее сигнал разбивается на фреймы окном Хэмминга длительностью 25 мс с шагом 10 мс, для каждого фрейма вычисляется кратковременное преобразование Фурье. Линейная шкала частот переводится на психоакустическую мел-шкалу [13], связь которой с частотой задается соотношением (1):
В качестве источника данных выбран открытый русскоязычный датасет Dusha [6], содержащий около 350 часов аудио и более 300 тысяч записей с разметкой на четыре эмоции (радость, грусть, злость, нейтральное) и служебный класс «другое», то есть пять классов классификации. Датасет включает как студийные, так и естественные записи, что приближает условия к реальным.
Запись приводится к моно с частотой дискретизации 16 кГц, нормируется по амплитуде и обрабатывается предыскажающим фильтром с коэффициентом 0,97 для компенсации спада спектра на высоких частотах. Далее сигнал разбивается на фреймы окном Хэмминга длительностью 25 мс с шагом 10 мс, для каждого фрейма вычисляется кратковременное преобразование Фурье. Линейная шкала частот переводится на психоакустическую мел-шкалу [13], связь которой с частотой задается соотношением (1):
(1)
Энергия мел-спектрограммы группируется из 128 треугольных мел-фильтров, после чего применяется логарифмирование, что соответствует логарифмическому восприятию громкости. Полученная лог-мел-спектрограмма служит входом сверточных моделей. При необходимости компактного описания используются мел-частотные кепстральные коэффициенты (MFCC), получаемые дискретным косинусным преобразованием лог-мел-спектра [5]; однако для сверточных сетей предпочтительна полная спектрограмма, сохраняющая локальную частотно-временную структуру.
Для решения задачи сопоставлены три семейства архитектур. Базовая двумерная сверточная сеть (2D-CNN) выделяет локальные частотно-временные паттерны спектрограммы [10]. Гибридная модель CNN-BiLSTM объединяет сверточное извлечение признаков с двунаправленной рекуррентной сетью долгой краткосрочной памяти [8], что позволяет учитывать продолжительную динамику и выделять эмоционально значимые участки. Третья модель основана на предобученной самоконтролем сети HuBERT, дообучаемой под пять классов [9]; она принимает на вход сырой сигнал и опирается на представления, выученные на больших массивах речи.
Формально задача сводится к поиску параметров нейросетевой модели, отображающей пространство входов в вероятностное распределение по пяти классам и максимизирующей целевую метрику качества на тестовой выборке при заданных ограничениях (2):
Для решения задачи сопоставлены три семейства архитектур. Базовая двумерная сверточная сеть (2D-CNN) выделяет локальные частотно-временные паттерны спектрограммы [10]. Гибридная модель CNN-BiLSTM объединяет сверточное извлечение признаков с двунаправленной рекуррентной сетью долгой краткосрочной памяти [8], что позволяет учитывать продолжительную динамику и выделять эмоционально значимые участки. Третья модель основана на предобученной самоконтролем сети HuBERT, дообучаемой под пять классов [9]; она принимает на вход сырой сигнал и опирается на представления, выученные на больших массивах речи.
Формально задача сводится к поиску параметров нейросетевой модели, отображающей пространство входов в вероятностное распределение по пяти классам и максимизирующей целевую метрику качества на тестовой выборке при заданных ограничениях (2):
(2)
при выполнении ограничений:
Обучение сверточных моделей проводилось оптимизатором AdamW, обучением в смешанной точности и ранней остановкой по метрике Macro-F1 на валидации. Для компенсации дисбаланса классов применена взвешенная функция перекрестной энтропии (3), в которой редкие классы получают больший вес:
- целевое значение Macro-F1 на тестовой выборке датасета Dusha не менее 0,75;
- число параметров модели не превышает 350 млн;
- пять классов в соответствии с разметкой датасета Dusha;
Обучение сверточных моделей проводилось оптимизатором AdamW, обучением в смешанной точности и ранней остановкой по метрике Macro-F1 на валидации. Для компенсации дисбаланса классов применена взвешенная функция перекрестной энтропии (3), в которой редкие классы получают больший вес:
(3)
Дополнительно на этапе обучения использована аугментация данных, добавление белого шума с отношением сигнал/шум 15–30 дБ, сдвиг тона в пределах 2 полутонов и маскирование участков спектрограммы по методу SpecAugment [11]. Обучающая выборка делилась на обучающую и валидационную части в пропорции 90/10 со стратификацией по классам; в качестве тестовой использовался официальный тестовый срез датасета.
Качество моделей оценивалось по доле верных ответов (Accuracy), а также по поклассовым показателям точности (Precision), полноты (Recall) и их гармоническому среднему F1. В качестве основной метрики выбрана Macro-F1 (4), усредняющая F1 по классам с равным весом, что корректно отражает качество на редких эмоциях в условиях дисбаланса:
Качество моделей оценивалось по доле верных ответов (Accuracy), а также по поклассовым показателям точности (Precision), полноты (Recall) и их гармоническому среднему F1. В качестве основной метрики выбрана Macro-F1 (4), усредняющая F1 по классам с равным весом, что корректно отражает качество на редких эмоциях в условиях дисбаланса:
Распределение записей по классам в обучающей, валидационной и тестовой выборках, иллюстрирующее выраженный дисбаланс, приведено на рисунке 1.
Рисунок 1. Распределение записей по классам в датасете Dusha
Результаты и обсуждение
На первом этапе исследовано влияние ключевых факторов на качество модели при фиксации прочих условий. Результаты сведены в таблице 1.
Таблица 1
Влияние архитектуры и параметров на Macro-F1
| Исследуемый фактор | Вариант | Macro-F1 |
|---|---|---|
| Архитектура | 2D-CNN (базовая) | 0,652 |
| CNN-BiLSTM | 0,727 | |
| HuBERT | 0,777 | |
| Аугментация | без аугментации | 0,671 |
| с аугментацией | 0,727 | |
| Функция потерь | обычная CE | 0,658 |
| взвешенная CE | 0,727 | |
| Число мел-каналов | 64 | 0,688 |
| 128 | 0,727 |
Каждый из факторов вносит заметный вклад. Переход от базовой сверточной сети к гибридной и далее к предобученной модели повышает качество, аугментация и взвешенная функция потерь дают значимый прирост за счет улучшения распознавания редких классов, увеличение числа мел-каналов с 64 до 128 повышает частотное разрешение и качество. Эти наблюдения подтверждают обоснованность принятых проектных решений.
Итоговые метрики трех обученных моделей на тестовой выборке приведены в таблице 2. Лучший результат показала модель на основе HuBERT.
Итоговые метрики трех обученных моделей на тестовой выборке приведены в таблице 2. Лучший результат показала модель на основе HuBERT.
Таблица 2
Метрики моделей на тестовой выборке Dusha
| Модель | Accuracy | Macro-F1 | Weighted-F1 |
| 2D-CNN | 0,703 | 0,629 | 0,712 |
| CNN-BiLSTM | 0,747 | 0,715 | 0,755 |
| HuBERT | 0,804 | 0,752 | 0,808 |
Сопоставление с известными решениями показывает, что разработанная модель находится на сопоставимом уровне качества. Так, для систем семейства Vokaturi точность оценивается в диапазоне приблизительно 66–76 %, для открытой библиотеки Aniemore на датасете RESD – около 75 %, тогда как предложенная модель достигает 75,2 % по Macro-F1. При этом сравнение носит ориентировочный характер, поскольку решения используют различные наборы классов и тестовые данные, и прямое сопоставление абсолютных значений некорректно. Близкие по постановке исследования на датасете Dusha, использующие MFCC-признаки и рекуррентные модели, подтверждают применимость данного подхода к русскоязычной речи [2].
Поклассовые показатели лучшей модели приведены в таблице 3, а нормализованная матрица ошибок – на рисунке 2.
Поклассовые показатели лучшей модели приведены в таблице 3, а нормализованная матрица ошибок – на рисунке 2.
Таблица 3
Поклассовые метрики лучшей модели (HuBERT)
| Класс | Precision | Recall | F1 |
| злость | 0,707 | 0,814 | 0,767 |
| грусть | 0,631 | 0,821 | 0,724 |
| нейтральное | 0,908 | 0,808 | 0,865 |
| радость | 0,700 | 0,755 | 0,736 |
| другое | 0,673 | 0,642 | 0,667 |
Рисунок 2. Нормализованная матрица ошибок модели HuBERT на тестовой выборке Dusha
Наибольшее качество достигается на классе «нейтральное» как наиболее частом и акустически однородном. Эмоции «злость» и «радость» распознаются уверенно благодаря выраженным акустическим коррелятам – повышению тона, интенсивности и темпа. Класс «грусть» распознается хуже вследствие акустической близости к нейтральной речи, согласно матрице ошибок, заметная доля примеров этого класса ошибочно относится к нейтральному. Наименьшее качество показывает служебный класс «другое» из-за малого объема обучающих данных.
С точки зрения отраслевого применения полученная модель закрывает обозначенный во введении прроблему, она представляет собой открытое русскоязычное решение, работающее по акустике речи и не зависящее от текстовой транскрибации. Это снижает барьеры входа для отечественных разработчиков голосовых сервисов и повышает их конкурентоспособность в сегментах клиентской аналитики, противодействия мошенничеству и интеллектуальных ассистентов.
Заключение
В работе разработана и экспериментально оценена модель распознавания эмоций по акустическим характеристикам русской речи на основе нейронных сетей. Сопоставлены три архитектуры; лучшая модель на основе HuBERT достигла целевого уровня качества по метрике Macro-F1, удовлетворяющего поставленному ограничению (не менее 0,75). Обоснованы выбор категориальной модели эмоций и датасета Dusha, конвейер извлечения признаков, а также вклад аугментации, взвешенной функции потерь и параметров спектрограммы в итоговое качество.
Теоретическая значимость результатов состоит в систематическом сопоставлении архитектур SER на крупнейшем открытом русскоязычном датасете. Практическая и экономическая значимость заключается в формировании доступной технологической основы для отечественных голосовых продуктов, что отвечает задачам импортозамещения и повышения технологической конкурентоспособности. Перспективы развития связаны с переходом к комбинированной аудио-текстовой модели, расширением набора распознаваемых эмоций и привлечением дополнительных русскоязычных данных.
Теоретическая значимость результатов состоит в систематическом сопоставлении архитектур SER на крупнейшем открытом русскоязычном датасете. Практическая и экономическая значимость заключается в формировании доступной технологической основы для отечественных голосовых продуктов, что отвечает задачам импортозамещения и повышения технологической конкурентоспособности. Перспективы развития связаны с переходом к комбинированной аудио-текстовой модели, расширением набора распознаваемых эмоций и привлечением дополнительных русскоязычных данных.
***
- Библиотека Aniemore: распознавание эмоций в речи. — URL: https://github.com/aniemore/Aniemore (дата обращения: 13.07.2026).
- Букина П. Г., Меринов А. А., Харченко С. С., Костюченко Е. Ю. Распознавание эмоциональных состояний в русскоязычной речи с использованием MFCC-признаков и BLSTM-модели для набора данных «Dusha» // Известия ЮФУ. Технические науки. — 2025. — № 6. — С. 240–248. — URL: https://izv-tn.tti.sfedu.ru/index.php/izv_tn/article/view/1282 (дата обращения: 13.07.2026).
- Зачем бизнесу речевые технологии. — 2023. — 21 февраля. — URL: https://trends.rbc.ru/trends/industry/cmrm/63ef32bf9a79475026786e70 (дата обращения: 13.07.2026).
- Плешакова Е. С., Гатауллин С. Т., Осипов А. В., Коротеев М. В., Ушакова Ю. В. Распознавание эмоций человека по голосу в борьбе с телефонным мошенничеством // Национальная безопасность / nota bene. — 2022. — № 5. — С. 11–29. — DOI: 10.7256/2454-0668.2022.5.38782. — URL: https://nbpublish.com/library_read_article.php?id=38782 (дата обращения: 13.07.2026).
- Davis S. B., Mermelstein P. Comparison of Parametric Representations for Monosyllabic Word Recognition in Continuously Spoken Sentences // IEEE Transactions on Acoustics, Speech, and Signal Processing. — 1980. — Vol. 28, № 4. — P. 357–366.
- Dusha: самый большой открытый датасет для распознавания эмоций в устной речи на русском языке. — 2023. — 8 февраля. — URL: https://habr.com/ru/companies/sberdevices/articles/715468/ (дата обращения: 13.07.2026).
- Ekman P. An Argument for Basic Emotions // Cognition and Emotion. — 1992. — Vol. 6, № 3/4. — P. 169–200.
- Hochreiter S., Schmidhuber J. Long Short-Term Memory // Neural Computation. — 1997. — Vol. 9, № 8. — P. 1735–1780.
- HuBERT Large Speech Emotion Recognition Russian DUSHA Finetuned. — URL: https://huggingface.co/xbgoose/hubert-large-speech-emotion-recognition-russian-dusha-finetuned (дата обращения: 13.07.2026).
- LeCun Y., Bengio Y., Hinton G. Deep Learning // Nature. — 2015. — Vol. 521, № 7553. — P. 436–444.
- Park D. S., Chan W., Zhang Y., [и др.] SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition. — 2019. — arXiv:1904.08779. — URL: https://arxiv.org/abs/1904.08779 (дата обращения: 13.07.2026).
- Russell J. A. A Circumplex Model of Affect // Journal of Personality and Social Psychology. — 1980. — Vol. 39, № 6. — P. 1161–1178.
- Stevens S. S., Volkmann J., Newman E. B. A Scale for the Measurement of the Psychological Magnitude Pitch // The Journal of the Acoustical Society of America. — 1937. — Vol. 8, № 3. — P. 185–190.
📝
Опубликуйте свою статью
Препринт в течение 3-5 рабочих дней после оплаты.
Справка о публикации и электронная версия журнала включены.