1. TugaTech » Internet e Redes » Noticias da Internet e Mercados
  Login     Registar    |                      

Siga-nos


OpenAI

O mercado da inteligência artificial assistiu a um duplo anúncio de peso no setor do processamento de áudio. A OpenAI revelou duas novas ferramentas destinadas a otimizar a conversão de fala em texto, enquanto a Alibaba contra-atacou no segmento das interações em tempo real com novos modelos de conversação direta.

OpenAI aposta em transcrição contextualizada

A tecnológica liderada por Sam Altman introduziu na sua API o GPT-Live-Transcribe e o GPT-Transcribe. O primeiro modelo foi desenhado especificamente para fluxos de trabalho que exigem baixa latência, como a legendagem ou transcrição de conversas ao vivo. Por sua vez, o GPT-Transcribe foca-se no processamento assíncrono de ficheiros de áudio já finalizados e em tarefas em lote (batch).

Uma das grandes novidades partilhadas pela OpenAI é a capacidade de os modelos utilizarem contexto livre sobre a gravação. Os programadores passam a poder fornecer palavras-chave, nomes próprios, terminologia técnica específica e os idiomas esperados para refinar o resultado. No caso da variante focada em transmissões ao vivo, o sistema consegue ainda reaproveitar o histórico das falas anteriores como base contextual.

Em termos de desempenho no benchmark interno de reconhecimento de voz (ASR), o fornecimento de contexto elevou a precisão semântica do modelo contínuo de 38,5% para 44,6%, e a do modelo assíncrono de 41,6% para 45,2%.

Já em testes com áudio real do quotidiano, a versão ao vivo registou uma taxa de erro de transcrição de 9,60% — superando os 11,65% do GPT-Realtime-Whisper. O GPT-Transcribe fixou a sua taxa de erro nos 8,98%, uma redução face aos 15,21% obtidos pelo Whisper-1. Análises independentes da Artificial Analysis apontaram ainda uma taxa de erro de palavra (WER) de 3,31% para o modelo assíncrono, que chega ao mercado com o preço de 4,50 dólares por cada 1000 minutos (cerca de 4,15 € à taxa atual).

Alibaba lidera índice de conversação direta

Do lado da gigante chinesa, o foco virou-se para os modelos Qwen-Audio-3.0-Realtime Plus e Flash, criados para permitir diálogos diretos de voz para voz. Tal como as soluções da rival norte-americana, estas novidades suportam interações em full-duplex, o que significa que o utilizador pode interromper a inteligência artificial a meio do discurso. Contam ainda com suporte a chamadas de funções (function calling) e vozes clonadas personalizadas.

Os dados da Artificial Analysis colocam o Qwen-Audio-3.0-Realtime Plus no topo do seu índice de conversação voz para voz com uma pontuação de 84,1%, ultrapassando os 79,1% alcançados pelo GPT-Realtime-2.1 High. O modelo da Alibaba destacou-se nos testes de raciocínio de fala, dinâmicas de conversação e desempenho dos agentes.

Apesar da liderança técnica na precisão e fluidez, a proposta da tecnológica asiática apresenta uma desvantagem na velocidade de resposta inicial. A mesma auditoria revela que o tempo necessário para emitir o primeiro som de áudio ronda os 4 segundos na ferramenta da Alibaba, enquanto a solução da criadora do OpenAI reage em apenas 1,14 segundos. Para quem procura implementar assistentes virtuais integrados no apoio ao cliente em Portugal, este atraso na resposta poderá ser um fator decisivo na escolha da plataforma.

Foto do Autor

Aficionado por tecnologia desde o tempo dos sistemas a preto e branco

Ver perfil do usuário Enviar uma mensagem privada Enviar um email Facebook do autor Twitter do autor Skype do autor

conectado
Encontrou algum erro neste artigo?

Não perca nenhuma novidade!

Junte-se a milhares de leitores e receba as últimas notícias de tecnologia, análises e dicas diretamente no seu email.

Nenhum comentário

Seja o primeiro!





Aplicações do TugaTechAplicações TugaTechDiscord do TugaTechDiscord do TugaTechRSS TugaTechRSS do TugaTechSpeedtest TugaTechSpeedtest TugatechHost TugaTechHost TugaTech