Testaufbau und Grenzen im Detail
Höre die Aufnahme an und vergleiche die unabhängige Referenz mit der unveränderten automatischen SRT. Alle Beispiele sind ohne Konto zugänglich.
Sichtbare Beispiele: je Audiosprache Auswahlrang 1 und der Fall mit der höchsten Zeichenfehlerrate (bei Gleichstand kleinster Rang; bei Doppelung Rang 2). Die vier Zusatzdiagnosen gehören nicht zu den 144 Originalaufnahmen. Gute und schwächere Ergebnisse bleiben sichtbar.
Kurze vorgelesene Sprache. Keine allgemeine Genauigkeitsgarantie, menschliche Hörabnahme oder geprüfte Synchronität. Lange Gespräche und überlappende Stimmen sind nicht umfassend geprüft. Dieser kleine Test belegt weder Überlegenheit noch eine Zertifizierung oder umfassende Alltagstauglichkeit. Mögliche Überschneidungen mit Modelltrainingsdaten sind nicht ausgeschlossen; eindeutige Sprecher-IDs fehlen.
144 kurze Originalaufnahmen, insgesamt 28,89 Minuten: je Sprache 12 von 12 Ausgaben erzeugt, ohne technischen Fehllauf. Alle wurden mit dem vollständigen Verarbeitungscode isoliert getestet; nur ein japanischer Fall zusätzlich über regulären Upload und SRT-Download. Keine menschliche Hör- oder Timingabnahme.
Auswahl vor der Erkennung: offizieller FLEURS-Testsplit, Startwert 20260929, feste SHA-256-Reihenfolge; zwölf unterschiedliche Aufnahmen und Referenzsätze je Sprache. Referenzen wurden nicht an die Erkennung übergeben. Messung: Unicode NFC, Kleinschreibung und vereinheitlichte Interpunktion; Zahlen, Negationen, Diakritika und Schriftsysteme werden nicht inhaltlich umgeschrieben. Zahlwort/Ziffer und Wortabstände können die Fehlerraten erhöhen, ohne dass sich der Sinn ändert. Keine Rangliste zwischen Sprachen.
Standardqualität und automatische Spracherkennung: large-v3, Beam/Best-of 3, Standalone Faster-Whisper-XXL r245.2 / Faster-Whisper 1.1.1. Vor- und Nachbearbeitung einschließlich inhaltsabhängiger CJK-Prüfung blieben aktiv. Keine Übersetzung, optionale Audioverbesserung oder Sprechertrennung.
WER: Wortfehlerrate. CER: Zeichenfehlerrate. Ersetzungen + Auslassungen + Ergänzungen, geteilt durch Referenzumfang. JA/ZH: nur CER. Raten nur für erfolgreiche Ausgaben; Fehler: technisch / fehlende Ausgabe. Keine Genauigkeit aus 100 minus WER.
CSV: alle 148 Fälle getrennt gekennzeichnet. JSON: Nenner, Fehleroperationen und Verteilung (Minimum/Median/Maximum). CER ignoriert Leerzeichen; koreanische WER verwendet Leerraumeinheiten. Originaltexte und Zahlen bleiben nachvollziehbar.
Historischer Stillefall vom 29.09.2026: Das Modell lieferte keinen Text. Erst der Produktcode ergänzte den hier unverändert gezeigten Platzhalter. Dieser Fehler wurde am 30.09.2026 behoben: Gültige leere Erkennung erzeugt heute keinen künstlichen Cue. Die alte SRT dokumentiert den damaligen Stand; für Stille gibt es keine Fehlerrate.
Die sichtbaren zusätzlichen Schlussformeln bleiben unveränderte Pilotresultate. Ihre Erkennung ist weiterhin ein unveröffentlichter Prototyp; keine Verbesserung wird hier als gemessen dargestellt.
Ergebnisse aller zwölf Audiosprachen und Fehlerraten
144 kurze Originalaufnahmen, insgesamt 28,89 Minuten: je Sprache 12 von 12 Ausgaben erzeugt, ohne technischen Fehllauf. Alle wurden mit dem vollständigen Verarbeitungscode isoliert getestet; nur ein japanischer Fall zusätzlich über regulären Upload und SRT-Download. Keine menschliche Hör- oder Timingabnahme.
WER: Wortfehlerrate. CER: Zeichenfehlerrate. Ersetzungen + Auslassungen + Ergänzungen, geteilt durch Referenzumfang. JA/ZH: nur CER. Raten nur für erfolgreiche Ausgaben; Fehler: technisch / fehlende Ausgabe. Keine Genauigkeit aus 100 minus WER.