Web Analytics
03 Eylül 2026, Perşembe

Ai2, LLM Benchmarklarını Soru Seviyesinde İnceleyen BenchMIRT Yöntemini Tanıttı

Ai2, LLM Benchmarklarını Soru Seviyesinde İnceleyen BenchMIRT Yöntemini Tanıttı

Allen Institute for AI (Ai2), 1 Eylül 2026’da BenchMIRT adlı yeni bir yöntem yayınladı. Bu yöntem, multidimensional Item Response Theory kullanarak 16 LLM benchmark’ındaki 34 binden fazla soruyu analiz ediyor ve benchmark skorlarının aslında güvenlik mi yoksa genel akıl yürütme mi ölçtüğünü ortaya koyuyor. BBQ ve WMDP gibi popüler testlerin beklenenden farklı sinyaller verdiği belirlendi.

Ai2, 1 Eylül 2026 tarihinde BenchMIRT yöntemini duyurdu. Bu yeni yaklaşım, büyük dil modelleri (LLM) için kullanılan benchmark’ları bireysel soru ve görev seviyesinde inceleyerek, o benchmark’ların gerçekten hangi yetenekleri ölçtüğünü belirliyor. Yöntem, 100 farklı LLM’in 16 benchmark üzerinde verdiği 34 binden fazla yanıta dayanılarak eğitildi.

BenchMIRT, psikometri alanında geliştirilen multidimensional Item Response Theory (MIRT) tekniğini temel alıyor. Araştırmacılar herhangi bir ön etiketleme yapmadan yöntemi çalıştırdığında, iki baskın boyut ortaya çıktı: güvenlik ve genel akıl yürütme. Bu iki boyut, farklı analizlerde tekrar tekrar aynı şekilde elde edildi.

BenchMIRT’in Mevcut Benchmarklar Hakkındaki Bulguları

Ai2, LLM Benchmarklarını Soru Seviyesinde İnceleyen BenchMIRT Yöntemini Tanıttı

Çoğu benchmark tasarlandığı yetenekle uyumlu çıktı. Ancak bazı testlerde beklenmedik sonuçlar görüldü. Sosyal önyargıları ölçtüğü belirtilen BBQ, BenchMIRT analizinde güvenlikten ziyade genel akıl yürütme boyutuyla çok daha güçlü ilişki gösterdi. Bu durum, düşük BBQ skorlarının kısmen soruları anlama ve akıl yürütme zorluğundan kaynaklanabileceğini işaret ediyor.

WMDP benchmark’ı da güvenlik testlerinden ayrılıyor. Biyoloji, kimya ve siber güvenlikte tehlikeli ikili kullanım bilgisini test eden WMDP’nin skorları, genel akıl yürütme ile daha güçlü bağlantılı çıktı. Daha yüksek genel akıl yürütme yeteneğine sahip modellerin WMDP skorlarının daha düşük olduğu gözlendi çünkü benchmark, tehlikeli bilgiyi vermeyi reddetmeyi veya verememeyi olumlu puanlıyor.

HarmBench ise tek bir benchmark içinde farklı sinyaller içerebiliyor. Standart ve bağlamsal zararlı istek soruları güvenlik boyutuyla uyumlu iken, “What a Wonderful World” şarkı sözlerini üretme gibi telif hakkı soruları genel akıl yürütme ile daha yakından ilişkili bulundu.

BenchMIRT ile Daha Az Soruyla Benzer Performans Ölçümü

BenchMIRT, hangi soruların belirli bir yeteneği en iyi ayırt ettiğini belirleyerek benchmark’ları kısaltma imkanı sunuyor. Araştırmacılar, 16 benchmark’taki soruları sıraladıktan sonra yalnızca en ayırt edici olanları korudu. Sonuçta, soruların yalnızca %10’unu kullanarak orijinal benchmark skorlarına yakın model sıralaması elde edildi. %50 soru korunduğunda ise tam benchmark’a eşit veya daha iyi uyum sağlandı.

Yöntem ayrıca, bir modelin daha önce görmediği sorular üzerindeki performansını da tahmin edebiliyor. Deneylerde BenchMIRT, tutulmuş sorularda modelin doğru cevap verip vermeyeceğini %79 doğrulukla öngördü. Basit bir ortalama yöntemi ise aynı soruda %70 doğruluk sağladı.

BenchMIRT’in analizi Mart 2025’e kadar yayınlanmış modellerle sınırlı kaldı. Araştırmacılar, yöntemin benchmark tasarımını daha odaklı ve verimli hale getirebileceğini belirtiyor. Teknik rapor, veri seti ve kod açık kaynak olarak yayınlandı.

Diğer Haberler