Método y límites de la prueba
Escucha la grabación y compara la referencia independiente con el SRT automático sin modificar. Todos los ejemplos están disponibles sin cuenta.
Ejemplos visibles: rango de selección 1 y el caso con mayor tasa de error de caracteres por idioma (menor rango en empate; rango 2 si coincide). Los cuatro diagnósticos adicionales se separan de los 144 originales. Se muestran resultados buenos y más débiles.
Habla leída breve. Sin garantía general de precisión, revisión auditiva humana ni sincronización verificada. Las conversaciones largas y las voces superpuestas no se han probado exhaustivamente. Esta pequeña prueba no demuestra superioridad, certificación ni idoneidad general para el uso cotidiano. No se descarta coincidencia con datos de entrenamiento; no hay identificadores fiables de hablantes.
144 grabaciones originales cortas, 28,89 minutos en total: 12 de 12 salidas por idioma, sin fallos técnicos. Todas se procesaron con el código completo en un entorno aislado; solo un caso japonés pasó además por la carga normal y la descarga SRT. Sin validación humana de escucha ni de sincronización.
Selección previa al reconocimiento: conjunto oficial de prueba FLEURS, semilla 20260929 y orden SHA-256 fijo; doce grabaciones y frases de referencia distintas por idioma. Las referencias no se proporcionaron al reconocimiento. La medición usa Unicode NFC, minúsculas y puntuación normalizada; no reescribe números, negaciones, diacríticos ni sistemas de escritura. Las cifras frente a palabras y los espacios pueden aumentar el error sin cambiar el sentido. No se clasifican los idiomas.
Calidad estándar y detección automática de idioma: large-v3, Beam/Best-of 3, Standalone Faster-Whisper-XXL r245.2 / Faster-Whisper 1.1.1. Se mantuvo el preprocesamiento y posprocesamiento, incluidas las comprobaciones CJK según el contenido. Sin traducción, mejora de audio opcional ni separación de hablantes.
WER: tasa de error de palabras. CER: tasa de error de caracteres. Sustituciones + omisiones + inserciones, dividido por el tamaño de la referencia. JA/ZH: solo CER. Tasas de salidas correctas técnicamente; errores: técnicos / salida ausente. No calcular precisión como 100 menos WER.
CSV: los 148 casos identificados por separado. JSON: denominadores, operaciones de error y distribución (mínimo/mediana/máximo). CER ignora espacios; WER coreano usa unidades separadas por espacios. Los textos y números originales se conservan.
Caso histórico de silencio del 29/09/2026: el modelo no produjo texto. El código del producto añadió el texto de ejemplo que se conserva aquí. El fallo se corrigió el 30/09/2026: un resultado vacío válido ya no genera un subtítulo artificial. El SRT antiguo documenta esa versión; no se calcula tasa de error para el silencio.
Las frases finales añadidas se conservan como resultados originales del piloto. Su detección sigue siendo un prototipo no publicado; aquí no se afirma una mejora medida.
Resultados de los doce idiomas de audio y tasas de error
144 grabaciones originales cortas, 28,89 minutos en total: 12 de 12 salidas por idioma, sin fallos técnicos. Todas se procesaron con el código completo en un entorno aislado; solo un caso japonés pasó además por la carga normal y la descarga SRT. Sin validación humana de escucha ni de sincronización.
WER: tasa de error de palabras. CER: tasa de error de caracteres. Sustituciones + omisiones + inserciones, dividido por el tamaño de la referencia. JA/ZH: solo CER. Tasas de salidas correctas técnicamente; errores: técnicos / salida ausente. No calcular precisión como 100 menos WER.