bg
Новости
18:36, 06 сентября 2026
views
7

Учёные СПбГУ научили нейросеть говорить с правильной интонацией

Учёные Санкт-Петербургского государственного университета завершили первый этап исследования по улучшению интонации речи, которую генерируют нейросетевые модели.

Фото: Алексей Даничев / РИА Новости

О подходе рассказала доцент кафедры фонетики и методики преподавания иностранных языков СПбГУ Ульяна Кочеткова. Работа велась в рамках магистерской диссертации и была сосредоточена не на создании новой архитектуры, а на подготовке качественного обучающего материала для готовой модели Tacotron 2.

Ключевым элементом исследования стал корпус, созданный на кафедре фонетики СПбГУ ещё в 2000-х годах совместно с Центром речевых технологий. Его особенность – экспертная интонационная разметка, а не автоматическая.

«Прелесть нашего корпуса заключается в том, что эта интонационная аннотация была сделана экспертами. То есть размечала не сеть, это была не автоматическая разметка, а экспертная разметка – это, в общем-то, попадание в десятку», – отметила Кочеткова.

Обучение модели на этом материале заметно улучшило интонацию синтезированной речи. По метрике MOS исследователи получили 4,5–4,7 балла – высокий результат при ограниченном объёме данных.

По словам учёных, большие данные хорошо справляются со звуками речи, но хуже передают тонкие интонационные нюансы. В дальнейшем команда планирует расширить эксперимент и добавить эмоциональную окраску речи.

like
heart
fun
wow
sad
angry
Последние новости
Главное
Рекомендуем
previous
next