1. TugaTech » Software » Noticias de Software
  Login     Registar    |                      

Siga-nos


Qwen-Audio-3.0-TTS

A síntese de fala ganhou uma evolução importante em consistência e eficácia com o mais recente desenvolvimento da Alibaba Cloud. Segundo a informação disponibilizada oficialmente no portal FunAudioLLM, a tecnológica lançou o Qwen-Audio-3.0-TTS, um sistema de conversão de texto em voz direcionado para cenários de produção. O modelo aprimora de forma visível a semelhança do locutor, a naturalidade prosódica e a qualidade geral do áudio.

Esta nova ferramenta tira partido de uma arquitetura otimizada para mitigar a latência, algo essencial para plataformas digitais que dependem de interações fluidas em tempo real. O ecossistema expande a capacidade de controlo dos utilizadores através de instruções em linguagem natural livre e da inclusão de etiquetas inline detalhadas no texto, facultando ajustes precisos na entoação e no ritmo.

Otimização técnica e baixa latência

No coração do Qwen-Audio-3.0-TTS reside um tokenizer de voz operando a uma taxa de frames reduzida de 12,5 Hz, uma métrica projetada especificamente para diminuir o atraso de inferência durante a execução de tarefas. A equipa de engenharia estruturou o desenvolvimento com base num paradigma de treino progressivo dividido em cinco fases distintas, encarregue de coordenar de forma estreita a modelação de linguagem e a otimização de frequências.

Para quem desenvolve soluções suportadas por este tipo de tecnologia, estes avanços traduzem-se numa capacidade acrescida de personalização sem comprometer a estabilidade operacional. A flexibilidade da arquitetura facilita a integração do modelo numa vasta gama de cenários de implementação prática no mercado.

Suporte multilingue e robustez acústica

A plataforma assegura uma cobertura global abrangente, disponibilizando suporte para 16 línguas e 20 regiões de dialetos chineses. Outra característica de relevo é a capacidade de realizar sínteses de formato longo numa única passagem para produções com uma duração de até 3 minutos, mantendo a estabilidade de dicção e a fidelidade acústica.

O sistema demonstra ainda uma elevada resiliência perante condições sonoras adversas no quotidiano. O Qwen-Audio-3.0-TTS consegue preservar um desempenho de alto nível mesmo quando o áudio de referência fornecido apresenta ruído de fundo acentuado, reverberação ou falta de clareza na gravação original. Nos testes setoriais independentes SEED-TTS-Eval e CV3-Eval, o modelo da Alibaba alcançou marcas de topo, conquistando também a liderança da tabela classificativa da Artificial Analysis dedicada a sistemas de conversão de texto em voz.

Foto do Autor

Aficionado por tecnologia desde o tempo dos sistemas a preto e branco

Ver perfil do usuário Enviar uma mensagem privada Enviar um email Facebook do autor Twitter do autor Skype do autor

conectado
Encontrou algum erro neste artigo?

Não perca nenhuma novidade!

Junte-se a milhares de leitores e receba as últimas notícias de tecnologia, análises e dicas diretamente no seu email.

Nenhum comentário

Seja o primeiro!





Aplicações do TugaTechAplicações TugaTechDiscord do TugaTechDiscord do TugaTechRSS TugaTechRSS do TugaTechSpeedtest TugaTechSpeedtest TugatechHost TugaTechHost TugaTech