TII, 에미리트 방언 특화 7B 모델 공개
최근 30일 조회수 — 좋아요 —핵심 요약
팔콘-에미리트-7B는 현지 방언의 어휘와 말투, 문화적 맥락을 학습해 일상 대화 이해를 강화했다.

아랍에미리트 기술혁신연구소(TII)가 에미리트 아랍어의 어휘와 말투, 문화적 맥락을 학습한 70억 매개변수 언어모델 ‘팔콘-에미리트-7B(Falcon-Emirati-7B)’를 공개했다. 뉴스와 교과서에서 쓰는 현대표준아랍어(MSA) 중심 모델이 일상 대화의 속뜻을 놓치는 문제를 줄이려는 모델이다.1
아랍어는 하나의 표준어만으로 설명하기 어렵다. 아랍에미리트에서는 대화와 유머, 협상, 이야기 대부분이 걸프 방언의 하나인 에미리트 아랍어로 이뤄진다. 특히 나바티 시와 속담, 짧은 일화는 공동체가 공유하는 문화적 배경에 기대기 때문에 단어를 정확히 번역해도 뜻이 전달되지 않을 수 있다. TII는 팔콘-에미리트-7B가 원어민처럼 에미리트 방언을 이해하고 생성하도록 어휘·어조·문화 지식을 강화했다고 설명했다.1
기반은 범용 아랍어 모델군 ‘팔콘-H1-아랍어(Falcon-H1-Arabic)’다. 이 모델군은 각 블록에서 상태공간모델인 맘바(Mamba)와 트랜스포머 어텐션을 병렬로 실행한 뒤 결과를 합치는 하이브리드 구조를 쓴다. 맘바의 긴 문맥 처리 효율과 어텐션의 장거리 관계 파악 능력을 함께 노린 설계다. 30억·70억·340억 매개변수 모델로 구성되며, 최대 12만8,000개와 25만6,000개 토큰의 문맥 길이를 지원한다. 학습 자료에는 현대표준아랍어뿐 아니라 걸프·레반트·이집트·마그레브 방언, 영어와 다국어 데이터도 포함됐다.1
TII가 70억 매개변수 모델을 택한 기준은 성능과 비용의 균형이다. 회사 설명으로는 340억 모델이 품질을 더 높일 가능성은 있지만 방언 특화 대화 모델로 학습하고 서비스하기에는 비용이 크고, 30억 모델은 문화와 언어의 세부를 담을 여유가 부족했다.1
다만 방언 특화는 단순한 추가 학습으로 끝나지 않는다. 에미리트 아랍어는 주로 말로 쓰여 온라인 문어 자료가 적고, 관용구와 시적 표현도 직역하기 어렵다. 방언 자료의 적정량이나 표준어와의 혼합 비율, 지속 사전학습·지도 미세조정·선호도 최적화 가운데 어떤 단계가 가장 효과적인지 확립된 방법도 없다. TII 역시 여러 데이터 조합과 학습 단계를 시행착오로 비교하고, 사람의 판단과 벤치마크 점수를 함께 활용했다고 밝혔다.1
Footnotes
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Falcon-Emirati: When an LLM Learns the Dialect, the Culture, and the Nuance — Hugging Face Blog
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.