Лингвисты Санкт-Петербургского государственного университета усовершенствовали нейросеть, внедрив в нее интонационную модель, что сделало произношение искусственного интеллекта более естественным и привычным для человека. Эта разработка поможет улучшить системы преобразования текста в речь, используемые в голосовых помощниках и антропоморфных роботах. Результаты исследования были опубликованы в материалах International Conference on Speech and Computer, как сообщили представители СПбГУ.

Системы на основе искусственного интеллекта уже способны полностью или частично заменить человека в решении многих задач, особенно при выполнении рутинных задач, которые поддаются планированию и регламенту. Тем не менее, многие человеческие черты и свойства по-прежнему сложно внедряются в системы ИИ. В частности, интонирование — важнейший элемент речи, который отвечает за выражение эмоций и коммуникативное значение сказанного, остается проблемой для искусственного интеллекта. Например, именно интонирование позволяет отличить вопрос от повествования.

Как правило, языковые модели воспроизводят наиболее распространенные варианты произношения, но неудачное сочетание интонационного оформления может испортить общее впечатление от генерации голоса. Лингвисты СПбГУ решили эту проблему, обучив нейросеть на специально размеченном материале. Они использовали модель Tacotron2, основанную на алгоритме синтеза текста в речь, которая позволяет тонко настраивать модель и учитывать акустические признаки. При правильной отладке модель может воспроизводить особенности голоса, такие как манера произношения, тембр и акцент.

Обучение нейросети основывалось на интонационной классификации, разработанной доцентом Ниной Вольской и профессором Павлом Скрелиным. Созданная система включает широкий спектр интонационных вариантов, учитывающих мелодический диапазон и скорость произношения, что позволяет различать восклицания и акцентные выделения слов. Методика также учитывает тип предложения: вопрос, повествование, приказ или просьба, что позволяет преодолеть ограничения, связанные с неестественностью интонирования.

Для оценки успешности обучения нейросети ученые предложили 42 носителям русского языка прослушать синтезированные аудиозаписи и ответить на вопросы. В среднем участники опроса оценили аудиофайлы как естественно звучащие, лишь в некоторых случаях отметив наличие артефактов. Во втором эксперименте респондентам предложили выбрать подходящий знак препинания для прозвучавшего предложения, и легче всего они идентифицировали вопросительные фразы. Лингвисты отметили, что для дальнейшего повышения качества генерации необходимо продолжить тонкую настройку модели с учетом эмоциональных и стилистических вариантов интонационных контуров.

Источник

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *