Linguistas utilizaram uma classificação de entonação no treinamento do sistema
Pesquisadores da Universidade Estatal de São Petersburgo (SPbU) incorporaram a uma rede neural um modelo de entonação que tornou a pronúncia da inteligência artificial mais natural e próxima da fala humana. A solução poderá contribuir para o aprimoramento de sistemas de conversão de texto em voz utilizados em assistentes virtuais e robôs antropomórficos. As informações foram divulgadas no site da universidade, parceira da TV BRICS.
Em geral, os modelos de linguagem reproduzem as variantes mais comuns de pronúncia de palavras ou trechos de uma frase. A IA ainda apresenta dificuldades para reproduzir entonações capazes de transmitir nuances de significado e emoção. Além disso, uma combinação inadequada de padrões de entonação em diferentes partes de uma frase pode comprometer a percepção geral mesmo quando a geração da voz é de alta qualidade.
Para enfrentar esse problema, linguistas russos propuseram modificações que permitiram à rede neural reduzir a artificialidade e a monotonia da entonação.
O treinamento da IA foi baseado em uma classificação de entonação desenvolvida por Nina Volskaia, professora associada da SPbU, e Pavel Skrelin, professor e chefe do Departamento de Fonética e Metodologia do Ensino de Línguas Estrangeiras. O método considera diferentes tipos de enunciado, como perguntas, afirmações, ordens, pedidos e formas de tratamento, e contempla uma ampla variedade de padrões de entonação.
"Graças à estruturação adequada dos dados e ao uso de marcadores para diferentes variantes de entonação, o modelo conseguiu transmitir diversas nuances na fala, tornando o som gerado mais natural e expressivo. Essa abordagem torna o sistema de síntese mais flexível e adequado a diferentes áreas de aplicação, incluindo controle por voz e programas educacionais", explicou Uliana Kotchetkova, professora associada da SPbU.
Para avaliar os resultados do treinamento, os pesquisadores pediram a 42 falantes nativos de russo que respondessem a perguntas após ouvir gravações de áudio sintetizadas. Em média, os participantes avaliaram os arquivos como tendo uma sonoridade natural.
Os linguistas destacam que, para elevar ainda mais a qualidade da geração de voz, será necessário continuar o ajuste fino do modelo, levando em consideração diferentes variações emocionais e estilísticas.