Método e limites do teste
Ouça a gravação e compare a referência independente com o SRT automático sem alterações. Todos os exemplos podem ser acessados sem conta.
Exemplos exibidos: posição de seleção 1 e maior taxa de erro de caracteres por idioma (menor posição em caso de empate; posição 2 se houver repetição). Os quatro diagnósticos adicionais estão separados dos 144 originais. Resultados bons e mais fracos permanecem visíveis.
Fala lida curta. Sem garantia geral de precisão, aprovação por escuta humana ou sincronização verificada. Conversas longas e vozes sobrepostas não foram testadas de forma abrangente. Este pequeno teste não comprova superioridade, certificação nem adequação geral ao uso cotidiano. Não se descarta sobreposição com dados de treinamento; faltam identificadores confiáveis dos falantes.
144 gravações originais curtas, 28,89 minutos no total: 12 de 12 saídas por idioma, sem falhas técnicas. Todas usaram o código completo de processamento em ambiente isolado; apenas um caso japonês também passou pelo envio normal e download SRT. Sem avaliação humana de escuta ou sincronização.
Seleção antes do reconhecimento: conjunto oficial de teste FLEURS, semente 20260929 e ordem SHA-256 fixa; doze gravações e frases de referência distintas por idioma. As referências não foram fornecidas ao reconhecimento. Medição: Unicode NFC, minúsculas e pontuação normalizada, sem reescrever números, negações, diacríticos ou sistemas de escrita. Algarismos, números por extenso e espaços podem aumentar o erro sem alterar o sentido. Sem classificação entre idiomas.
Qualidade padrão e detecção automática de idioma: large-v3, Beam/Best-of 3, Standalone Faster-Whisper-XXL r245.2 / Faster-Whisper 1.1.1. Pré e pós-processamento ativos, incluindo verificações CJK conforme o conteúdo. Sem tradução, melhoria de áudio opcional ou separação de falantes.
WER: taxa de erro de palavras. CER: taxa de erro de caracteres. Substituições + omissões + inserções, divididas pelo tamanho da referência. JA/ZH: apenas CER. Taxas das saídas bem-sucedidas; erros: técnicos / saída ausente. Não calcular precisão como 100 menos WER.
CSV: os 148 casos identificados separadamente. JSON: denominadores, operações de erro e distribuição (mínimo/mediana/máximo). CER ignora espaços; WER coreano usa unidades separadas por espaços. Textos e números originais continuam verificáveis.
Caso histórico de silêncio de 29/09/2026: o modelo não produziu texto. O código do produto acrescentou o texto provisório mantido aqui. O erro foi corrigido em 30/09/2026: um resultado vazio válido não cria mais uma legenda artificial. O SRT antigo documenta aquela versão; não há taxa de erro para silêncio.
As frases finais acrescentadas continuam como resultados inalterados do piloto. Sua detecção ainda é um protótipo não publicado; nenhuma melhoria medida é alegada aqui.
Resultados dos doze idiomas de áudio e taxas de erro
144 gravações originais curtas, 28,89 minutos no total: 12 de 12 saídas por idioma, sem falhas técnicas. Todas usaram o código completo de processamento em ambiente isolado; apenas um caso japonês também passou pelo envio normal e download SRT. Sem avaliação humana de escuta ou sincronização.
WER: taxa de erro de palavras. CER: taxa de erro de caracteres. Substituições + omissões + inserções, divididas pelo tamanho da referência. JA/ZH: apenas CER. Taxas das saídas bem-sucedidas; erros: técnicos / saída ausente. Não calcular precisão como 100 menos WER.