Web Analytics
06 Eylül 2026, Pazar

BenchMIRT Yöntemi, LLM Benchmark'larının Gerçekte Ne Ölçtüğünü Soru Düzeyinde Analiz Ediyor

06.09.2026 00:04
2
BenchMIRT Yöntemi, LLM Benchmark'larının Gerçekte Ne Ölçtüğünü Soru Düzeyinde Analiz Ediyor

Ai2 tarafından geliştirilen BenchMIRT, 16 benchmark ve 34 binden fazla soru üzerinde eğitilen yeni bir yöntemle, benchmark sorularının yalnızca %10'unu kullanarak modellerin güvenlik ve akıl yürütme yeteneklerindeki sıralamayı korurken, gözlemlenmemiş sorular için %79 doğrulukla tahmin yapabiliyor.

Ai2 tarafından Hugging Face Blog'da duyurulan BenchMIRT, büyük dil modelleri (LLM) benchmark'larını bireysel soru ve görev düzeyinde denetleyen yeni bir yöntem olarak tanıtıldı. Yöntem, benchmark sorularının yalnızca %10'unu tutarak güvenlik veya akıl yürütme yeteneği konusunda modellerin güçlü ve zayıf sıralamasını neredeyse aynı şekilde korumaktadır. Ayrıca BenchMIRT, gözlemlenmemiş bir benchmark sorusu için modelin doğru cevap verip vermeyeceğini %79 doğrulukla tahmin edebilmektedir.

BenchMIRT'in Teknik Temeli ve Eğitim Verisi

BenchMIRT, psikometri alanında kullanılan Item Response Theory (IRT) tekniğinden esinlenerek multidimensional IRT (MIRT) ile birden fazla yeteneği ayırır. Yöntem, hem model hem de soru düzeyinde analiz yapar. 100 LLMden elde edilen benchmark sonuçları, 16 benchmark ve 34 binden fazla soru üzerinde eğitilmiştir. Bu benchmark'lardan 6'sı genel akıl yürütmeyi ölçen MMLU-Pro, GPQA, MATH ve BBH gibi setleri, diğer 10'u ise Ai2'nin Olmo 3 safety suite'ini içeren HarmBench, StrongReject, WildJailbreak, BBQ, WMDP ve XSTest'i kapsar. BenchMIRT'e benchmark'ların hangi yetenekleri ölçtüğü önceden söylenmemiştir.

Benchmark'larda Keşfedilen Boyutlar ve Bulgular

Analiz, bağımsız olarak güvenlik ve genel akıl yürütme olmak üzere iki baskın boyut ortaya çıkarmıştır. Bu boyutlar tekrarlanan analizlerde de stabil kalmıştır. Birçok benchmark'ta BenchMIRT, tasarlanan odak noktasını doğrulamıştır. Ancak BBQ, sosyal önyargı değerlendirmesi olmasına rağmen BenchMIRT analizinde genel akıl yürütme ile çok daha güçlü ilişki göstermiştir. WMDP skorları da güvenlikten ziyade genel akıl yürütme ile daha yakından ilişkili bulunmuştur; güçlü akıl yürütme, tehlikeli bilgi sağlamayı reddetme nedeniyle WMDP skorlarını düşürmektedir.

HarmBench'in standart ve bağlamsal soruları güvenlik boyutuyla, telif hakkı soruları ise genel akıl yürütme ile daha yakından ilişkili çıkmıştır. Bu bulgular, tek bir benchmark skorunun birden fazla sinyali birleştirebileceğini ve BenchMIRT'in bunları ayırarak yorumlamayı kolaylaştırdığını göstermektedir.

BenchMIRT ile Daha Az Soru ve Tahmin Yeteneği

BenchMIRT, soruların ayırt ediciliğini belirleyerek benchmark'larda en bilgilendirici soruları seçer. 16 benchmark'ta soruların yalnızca %10'unun tutulması, modellerin güvenlik veya akıl yürütme yeteneklerindeki sıralamayı neredeyse tamamen korumuştur. %50'sinin tutulması ise tam setten bile daha yakın sonuçlar verebilmiştir. Yöntem ayrıca, bir modelin daha önce gözlemlenmemiş bir soruya doğru cevap verip vermeyeceğini %79 doğrulukla öngörebilmektedir; bu oran, benchmark ortalamasına dayalı basit yaklaşımdaki %70'ten yüksektir.

Analiz, Mart 2025'e kadar yayınlanan modellerle yapılmıştır ve farklı benchmark setleri farklı yetenek boyutları ortaya çıkarabilir. BenchMIRT, benchmark'ların bireysel sorularını inceleyerek daha hedefli tasarım ve verimli değerlendirme için bir adım olarak sunulmaktadır.

Diğer Haberler