테스트 방법과 한계 자세히 보기
녹음을 듣고 독립적인 참조문과 수정하지 않은 자동 SRT를 비교하세요. 모든 예시는 계정 없이 이용할 수 있습니다.
언어별 선택 순위 1과 문자 오류율이 가장 높은 사례를 표시합니다. 동률이면 낮은 순위, 중복이면 순위 2를 사용합니다. 추가 진단 4개는 원본 144개와 별도입니다. 좋은 결과와 약한 결과를 모두 표시합니다.
짧은 낭독 음성 시험입니다. 일반적인 정확도 보장, 사람의 청취 승인 또는 동기화 검증은 없습니다. 긴 대화와 겹치는 음성은 포괄적으로 시험하지 않았습니다. 이 소규모 테스트는 우월성, 인증 또는 폭넓은 일상 용도 적합성을 입증하지 않습니다. 모델 학습 데이터와의 중복을 배제할 수 없으며 신뢰할 수 있는 화자 ID가 없습니다.
짧은 원본 녹음 144개, 총 28.89분입니다. 언어별 12개 모두 기술 오류 없이 출력되었습니다. 전체 처리 코드를 격리 환경에서 실행했으며 일본어 한 사례만 일반 업로드와 SRT 다운로드도 확인했습니다. 사람의 청취 또는 동기화 검수는 없습니다.
인식 전에 공식 FLEURS 테스트 분할에서 시드 20260929와 고정 SHA-256 순서로 언어별 서로 다른 녹음과 참조 문장 12개를 선택했습니다. 참조문은 인식에 제공하지 않았습니다. 평가는 Unicode NFC, 소문자 변환, 문장부호 정규화를 사용하며 숫자, 부정, 발음 구별 기호와 문자 체계를 의미에 따라 바꾸지 않습니다. 숫자 표기와 띄어쓰기는 의미가 같아도 오류율을 높일 수 있습니다. 언어 간 순위를 매기지 않습니다.
표준 품질 및 자동 언어 감지: large-v3, Beam/Best-of 3, Standalone Faster-Whisper-XXL r245.2 / Faster-Whisper 1.1.1. 내용 기반 CJK 검사를 포함한 전처리와 후처리를 유지했습니다. 번역, 선택적 오디오 개선 또는 화자 분리는 사용하지 않았습니다.
WER은 단어 오류율, CER은 문자 오류율입니다. 대체·삭제·삽입 합계를 참조 길이로 나눕니다. 일본어·중국어는 CER만 표시합니다. 비율은 출력 성공 사례 기준이며 오류는 기술 오류 / 출력 누락입니다. 100−WER을 정확도로 표시하지 않습니다.
CSV에는 148개 사례가 구분되어 있습니다. JSON에는 분모, 오류 연산 및 분포(최소/중앙값/최대)가 있습니다. CER은 공백을 제외하며 한국어 WER은 공백 단위를 사용합니다. 원문과 숫자를 확인할 수 있습니다.
2026년 9월 29일의 과거 무음 사례에서 모델은 텍스트를 생성하지 않았지만 제품 코드가 여기에 그대로 보존한 임시 문구를 추가했습니다. 이 오류는 2026년 9월 30일 수정되었습니다. 현재 유효한 빈 인식 결과는 가짜 자막을 만들지 않습니다. 옛 SRT는 당시 기록이며 무음의 오류율은 계산하지 않습니다.
추가된 맺음말은 수정하지 않은 파일럿 결과로 남아 있습니다. 해당 문구 감지는 아직 비공개 프로토타입이며 여기서 측정된 개선을 주장하지 않습니다.