Web Analytics
29 Ağustos 2026, Cumartesi

Open ASR Leaderboard'e İlk Global South Dili Hindi Eklendi

29.08.2026 05:16 Denizli Haber
0
Open ASR Leaderboard'e İlk Global South Dili Hindi Eklendi

Voice Arena ve Hugging Face iş birliğiyle hazırlanan Monsoon veri setleri, Open ASR Leaderboard'e Indian English ve Hindi için toplam 4.888 konuşmacıdan oluşan dört yeni split ekledi. Hindi, leaderboard'de yer alan ilk Indic dili olurken, setler coğrafi, demografik ve cihaz çeşitliliğini artırarak daha güvenilir ve tarafsız ASR değerlendirmesi sağlıyor.

Voice Arena ve Hugging Face ortaklığıyla Open ASR Leaderboard'e Monsoon en-IN ve Monsoon hi-IN adlı yeni değerlendirme setleri eklendi. Bu hamleyle Hindi, leaderboard'in multilingual sekmesinde yer alan ilk Indic dili oldu. Toplam 4.888 konuşmacı içeren dört split, speaker-disjoint yapıya sahip ve her biri public ile private olarak ayrıldı.

Public split'ler kendi kendine skorlama için açıkken, private split'ler benchmark-specific optimizasyonu önlemek amacıyla withheld tutuluyor. Indian English setleri ana leaderboard'de Voice Arena Monsoon adıyla varsayılan sütunda yer alıyor ve her modelin headline Average WER skoruna katkıda bulunuyor. Hindi setleri ise Multilingual tab'da, yalnızca tüm seçili dilleri destekleyen modeller arasında karşılaştırma yapıyor.

Monsoon Veri Setlerinin Bileşimi ve Kapsamı

Open ASR Leaderboard'e İlk Global South Dili Hindi Eklendi

Monsoon en-IN public split 5.62 saatlik ses, 1.444 konuşmacı, 428 district ve 24 eyalet/birlik toprağı kapsıyor. Monsoon hi-IN public split ise 1.33 saatlik ses, 468 konuşmacı, 202 district ve 11 eyalet/birlik toprağı içeriyor. Private split'lerle birlikte toplam süre yaklaşık 17 saat ve 4.888 unique konuşmacıya ulaşıyor.

Her split'te konuşmacı başına ortalama segment sayısı 1.46-1.61 arasında değişiyor; konuşmacıların yarısından fazlası yalnızca tek segment katkıda bulunuyor. En üstteki 10 konuşmacının toplam süre içindeki payı %2.8 ile %6.8 arasında kalıyor. Kullanılan cihaz modeli sayısı 315 ile 582 arasında değişirken, hiçbir model %2.1'in üzerinde pay almıyor.

Hindi için Orthografik Varyasyon ve OIWER Metriği

Hindi setlerinde standart WER yerine AI4Bharat tarafından tanıtılan Orthographically-Informed Word Error Rate (OIWER) kullanılıyor. Bunun nedeni, günlük konuşmada sık görülen kod-karışımı, yerleşmemiş Devanagari yazımları ve birleşik kelime tercihleri nedeniyle tek bir referansla adil skorlamanın mümkün olmaması. Her transcript span'ı için kabul edilen birden fazla yazım varyantını içeren lattice referansları hazırlandı.

Bu lattice'ler, birden fazla ASR çıktısı ve dil modeli önerileri temel alınarak yerel dilbilimciler tarafından manuel olarak oluşturuldu. OIWER, hipotezi her span'daki kabul edilen setle karşılaştırarak yalnızca gerçek tanıma hatalarını cezalandırıyor. Tek referanslı skorlamayla karşılaştırıldığında sıralamaların değiştiği gözlendi.

Veriler, coğrafya, yaş, cinsiyet, meslek, eğitim, medeni durum, gelir grubu, cihaz üreticisi ve model gibi 12 metadata alanıyla birlikte yayınlandı. Bu sayede bölge, aksan, cihaz ve demografik özelliklere göre hata analizi yapılabiliyor. Leaderboard'de 4.81-4.99 WER aralığında yer alan modellerin bölgesel varyasyonlarda 0.46 ile 1.68 puan arasında fark gösterdiği örnek analizler paylaşıldı.

Toplanan veriler Voice Arena topluluğu aracılığıyla yüzlerce district'ten gönüllü katkılarla elde edildi. Katılımcılar kendi cihaz ve internet bağlantılarını kullandı; konuşmalar spontan, çift kanallı ve günlük konular üzerine yapıldı. Kalite kontrolü için dil tanıma, cinsiyet sınıflandırma, SNR ve DNSMOS gibi otomatik kontroller uygulandı. Transkriptler, yerel dilbilimciler tarafından beş seviyeli doğrulama protokolüyle hazırlandı.

Kaynak: Hugging Face Blog — 28.08.2026 03:00

Diğer Haberler