Principal
Notícias
Vídeos
Menu
Акционерное общество "ТВ БРИКС"
tvbrics@tvbrics.com
Рубцов переулок, д.13, Москва, 105082, RU
+74996425304
Taxa de câmbio:
RUB/BRL 0,0625
0,0005
INR/BRL 0,0542
0,0001
ZAR/BRL 0,3235
0,0027
CNY/BRL 0,7714
0,0018
EGP/BRL 0,1019
0,0003
IRR/BRL 0
0,0000
AED/BRL 1,4121
0,004
SAR/BRL 1,3829
0,0039
ETB/BRL 0,0322
0,0000
USD/BRL 5,1859
0,0148
IDR/BRL 0,0003
0,0000
SPACE FOR MEDIA DIPLOMACY
06:00 «Idioma da dança»
06:00 «Idioma da dança»
Agora 16+
06:00

«Idioma da dança»

No programa está indicado o horário de Moscou. Por favor, leve em consideração a diferença de fuso horário.
06:30 Documentário «Costa de Ouro do Ártico»
Depois
06:30

Documentário «Costa de Ouro do Ártico»

16+
07:00

«BRICSreport»

16+
07:15

«BRICStrevista»

16+
Menu
En vivo «Idioma da dança»
RUB/BRL
0,0625
0,0005
INR/BRL
0,0542
0,0001
ZAR/BRL
0,3235
0,0027
CNY/BRL
0,7714
0,0018
EGP/BRL
0,1019
0,0003
IRR/BRL
0
0,0000
AED/BRL
1,4121
0,004
SAR/BRL
1,3829
0,0039
ETB/BRL
0,0322
0,0000
USD/BRL
5,1859
0,0148
IDR/BRL
0,0003
0,0000
TV BRICS Apps
Cientistas russos aprimoram capacidade de rede neural para diálogos mais naturais

Linguistas utilizaram uma classificação de entonação no treinamento do sistema

  • Fonte da imagem: Nanci Santos / iStock

Pesquisadores da Universidade Estatal de São Petersburgo (SPbU) incorporaram a uma rede neural um modelo de entonação que tornou a pronúncia da inteligência artificial mais natural e próxima da fala humana. A solução poderá contribuir para o aprimoramento de sistemas de conversão de texto em voz utilizados em assistentes virtuais e robôs antropomórficos. As informações foram divulgadas no site da universidade, parceira da TV BRICS.

Em geral, os modelos de linguagem reproduzem as variantes mais comuns de pronúncia de palavras ou trechos de uma frase. A IA ainda apresenta dificuldades para reproduzir entonações capazes de transmitir nuances de significado e emoção. Além disso, uma combinação inadequada de padrões de entonação em diferentes partes de uma frase pode comprometer a percepção geral mesmo quando a geração da voz é de alta qualidade.

Para enfrentar esse problema, linguistas russos propuseram modificações que permitiram à rede neural reduzir a artificialidade e a monotonia da entonação.

O treinamento da IA foi baseado em uma classificação de entonação desenvolvida por Nina Volskaia, professora associada da SPbU, e Pavel Skrelin, professor e chefe do Departamento de Fonética e Metodologia do Ensino de Línguas Estrangeiras. O método considera diferentes tipos de enunciado, como perguntas, afirmações, ordens, pedidos e formas de tratamento, e contempla uma ampla variedade de padrões de entonação.

"Graças à estruturação adequada dos dados e ao uso de marcadores para diferentes variantes de entonação, o modelo conseguiu transmitir diversas nuances na fala, tornando o som gerado mais natural e expressivo. Essa abordagem torna o sistema de síntese mais flexível e adequado a diferentes áreas de aplicação, incluindo controle por voz e programas educacionais", explicou Uliana Kotchetkova, professora associada da SPbU.

Para avaliar os resultados do treinamento, os pesquisadores pediram a 42 falantes nativos de russo que respondessem a perguntas após ouvir gravações de áudio sintetizadas. Em média, os participantes avaliaram os arquivos como tendo uma sonoridade natural.

Os linguistas destacam que, para elevar ainda mais a qualidade da geração de voz, será necessário continuar o ajuste fino do modelo, levando em consideração diferentes variações emocionais e estilísticas.