Учёные СПбГУ научили нейросеть говорить с правильной интонацией
Учёные Санкт-Петербургского государственного университета завершили первый этап исследования по улучшению интонации речи, которую генерируют нейросетевые модели.

О подходе рассказала доцент кафедры фонетики и методики преподавания иностранных языков СПбГУ Ульяна Кочеткова. Работа велась в рамках магистерской диссертации и была сосредоточена не на создании новой архитектуры, а на подготовке качественного обучающего материала для готовой модели Tacotron 2.
Ключевым элементом исследования стал корпус, созданный на кафедре фонетики СПбГУ ещё в 2000-х годах совместно с Центром речевых технологий. Его особенность – экспертная интонационная разметка, а не автоматическая.
Обучение модели на этом материале заметно улучшило интонацию синтезированной речи. По метрике MOS исследователи получили 4,5–4,7 балла – высокий результат при ограниченном объёме данных.
По словам учёных, большие данные хорошо справляются со звуками речи, но хуже передают тонкие интонационные нюансы. В дальнейшем команда планирует расширить эксперимент и добавить эмоциональную окраску речи.








































