허깅페이스 ASR 리더보드, 힌디어·인도 영어 첫 추가
최근 30일 조회수 — 좋아요 —핵심 요약
허깅페이스가 오픈 ASR 리더보드에 화자 다양성을 반영한 인도 영어·힌디어 Monsoon 데이터셋을 처음 추가했다.
허깅페이스가 오픈 ASR 리더보드(Open ASR Leaderboard)에 처음으로 글로벌 사우스 언어를 추가했다. 인도 영어(Monsoon en-IN)와 힌디어(Monsoon hi-IN) 두 개 평가셋이며, 힌디어는 이 리더보드의 다국어 탭에 오른 첫 인도계 언어(Indic language)다. 5억 명 이상이 쓰는 언어인데도 지금까지 다국어 탭은 유럽 언어로만 채워져 있었다.
이번 추가의 배경에는 벤치마크 자체에 대한 문제의식이 있다. 허깅페이스 블로그에 따르면 리더보드에서 좋은 점수를 받은 모델은 채택되고 개선되는 반면, 리더보드가 측정하지 않는 능력은 그대로 방치되는 경향이 있다. 최근 오픈 ASR 리더보드는 비공개 홀드아웃 스플릿 도입, 벤치마크 피팅(모델이 오디오만으로 전사하는 대신 정답 텍스트를 그대로 재현하는 정도) 분석, 정답 변형을 부당하게 감점하지 않도록 정규화 규칙 정비 등으로 단어 오류율(WER) 하나의 신뢰도를 높여왔다. 다만 그렇게 다듬어도 결국 하나의 숫자라는 한계는 남는다. 인용된 선행 연구들은 상용 음성인식 시스템의 오류율이 흑인 화자에게서 백인 화자보다 약 두 배 높게 나타나고, 성별·연령·억양에 따라서도 차이가 벌어진다고 밝힌 바 있다. 리더보드의 테스트셋은 무엇을 말했는지는 기록하지만 누가 말했는지는 거의 기록하지 않기 때문에, 이런 격차는 애초에 드러나지 않는다.
Monsoon 데이터셋은 이 문제를 정면으로 겨냥해 설계됐다. 지리, 연령, 성별, 어휘, 기기, 음향 환경, 발화 유형, 발화 속도, 동일 오디오에 대한 복수의 정답 전사 존재 여부까지 아홉 개 축을 따라 변주를 준 것이 핵심이다. 수집 방식도 여기에 맞췄다. 소수 지역에서 긴 세션을 녹음하는 대신 수백 개 구(district)에서 화자를 모았고, 지급 장비 대신 참여자 본인의 휴대폰과 통신 환경으로 실내외에서 녹음했다. 프롬프트는 의견·논쟁·서술·회상을 유도하는 일상 주제로 구성해 고유명사, 숫자, 즉흥적 표현이 자연스럽게 섞이게 했다. 연령과 성별은 화자별로 기록하고 검증했다.
전체 구성은 4개 스플릿, 2개 언어, 4,888명의 화자로 이뤄져 있으며 화자 중복은 없다. 화자당 12개 속성이 함께 기록됐다. 인도 영어 공개 스플릿은 5.62시간, 1,444명 화자, 428개 구, 556개 기기로 구성됐고 비공개 스플릿은 5.58시간, 1,405명 화자다. 힌디어는 공개 스플릿이 1.33시간, 468명 화자, 202개 구, 315개 기기이며, 비공개 스플릿은 4.47시간, 1,571명 화자로 공개 스플릿보다 규모가 크다. 두 언어 모두 대화체 즉흥 발화를 단일 채널로 분리해 클립당 한 명의 화자만 담기게 했다. 전사 방식에도 차이가 있는데, 인도 영어는 비유창성까지 포함해 정규화한 반면 힌디어는 여러 정서법 변형을 인정하는 격자(lattice) 방식을 썼다.
각 스플릿은 자체 채점이 가능한 공개 버전과, 벤치마크 특화 최적화를 제한하기 위해 비공개로 남겨둔 버전으로 나뉜다. 공개 자료에는 이번 설계의 세부 근거로 언급된 복수 정답 전사 처리 방식에 대한 설명이 이어지는데, 해당 부분의 구체적 내용은 이번 자료에 담기지 않았다.
읽기 목록은 이 브라우저에 저장됩니다.
출처
- The Open ASR Leaderboard Adds Its First Global South Language — Hugging Face Blog
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.