Web Analytics
29 Ağustos 2026, Cumartesi

4 Bitlik QAH Modeli, Sıkıştırılmış 60B GPT-OSS’in bfloat16 Versiyonunu 7 Benchmark’ta Geçti

29.08.2026 05:17 Denizli Haber
0
4 Bitlik QAH Modeli, Sıkıştırılmış 60B GPT-OSS’in bfloat16 Versiyonunu 7 Benchmark’ta Geçti

Multiverse Computing’in Quantization-Aware Healing (QAH) yöntemi, yapısal sıkıştırma ve 4-bit kuantizasyon sonrası orijinal tam boyutlu modelden doğrudan distilasyon yaparak, 60B parametreli MXFP4 modelin kendi bfloat16 recovered versiyonunu 9 benchmark’in 7’sinde geride bırakmasını sağladı. Yöntem, QAT’ye göre daha hızlı ve daha stabil sonuç veriyor.

Multiverse Computing’in 25 Ağustos 2026’da yayınladığı araştırmaya göre, Quantization-Aware Healing (QAH) adlı yeni iyileştirme yöntemi, hem yapısal olarak sıkıştırılmış hem de 4-bit kuantize edilmiş büyük dil modellerinin performansını önemli ölçüde artırıyor. GPT-OSS 120B modelinin 60B parametreye indirgenmiş ve MXFP4 hassasiyetine kuantize edilmiş hali, QAH ile iyileştirildikten sonra kendi bfloat16 recovered checkpoint’ini 9 benchmark’in 7’sinde geçti.

GPT-OSS 120B Modeli Üzerinde QAH Sonuçları

4 Bitlik QAH Modeli, Sıkıştırılmış 60B GPT-OSS’in bfloat16 Versiyonunu 7 Benchmark’ta Geçti

Araştırmacılar, GPT-OSS 120B modelini önce 60B parametreye sıkıştırdı, bfloat16 ile iyileştirdi ve ardından QAH ile MXFP4’e dönüştürdü. Karşılaştırmada kullanılan benchmark sonuçları şöyle:

  • AA-LCR (long-context reasoning): 60B bfloat16 35.3, 60B MXFP4 QAH 42.7 (+7.4)
  • AIME 2025 (math): 60B bfloat16 70.7, 60B MXFP4 QAH 76.3 (+5.6)
  • Aider (agentic coding): 60B bfloat16 38.2, 60B MXFP4 QAH 40.9 (+2.7)
  • τ²-bench (tool use): 60B bfloat16 59.4, 60B MXFP4 QAH 61.7 (+2.3)
  • GPQA Diamond: 60B bfloat16 65.7, 60B MXFP4 QAH 67.4 (+1.7)
  • IFBench: 60B bfloat16 58.4, 60B MXFP4 QAH 59.9 (+1.5)
  • LiveCodeBench: 60B bfloat16 65.5, 60B MXFP4 QAH 66.5 (+1.0)
  • MMLU-Pro: 60B bfloat16 74.0, 60B MXFP4 QAH 73.8 (−0.2)
  • SciCode: 60B bfloat16 35.6, 60B MXFP4 QAH 34.2 (−1.4)

QAH modeli ayrıca orijinal 120B öğretmenini LiveCodeBench’te geçti (66.5’e karşı 66.0) ve GPQA Diamond’da 1.6 puan geride kaldı. En büyük iyileşmeler, sıkıştırmadan en çok etkilenen long-context reasoning ve matematik alanlarında görüldü.

QAH ile QAT Karşılaştırması

Araştırmacılar aynı koşullar altında QAH’yi quantization-aware training (QAT) ile karşılaştırdı. 9B GPT-OSS modelinin MXFP4 versiyonu üzerinde MMLU-Pro, LiveCodeBench ve GPQA Diamond ortalaması izlendi. QAH yaklaşık 100 adımda 54.9 puana ulaşırken QAT 700 adımda 54.6 puana çıktı. QAH zirvede stabil kalırken, QAT 1200. adımda yaklaşık 19 puan kaybetti. Bu fark, QAH’nin sabit öğretmen dağılımı kullanan KL divergence kaybından kaynaklanıyor; QAT’nin cross-entropy kaybı ise modelin zamanla yeteneklerini erozyona uğratıyor.

Uzun Bağlam Desteği ve Pratik Etkiler

QAH, 32 bin token’a kadar bağlamı desteklemek için chunked KL-divergence loss’u kullanıyor. Bu yöntem, tam kelime dağarcığı matrisini bellekte tutmadan KL hesaplaması yapıyor ve sabit GPU bellek bütçesi içinde uzun dokümanlarla çalışmayı mümkün kılıyor. Araştırma, QAH’nin 4-bit modelin ağırlık belleğini bfloat16’ya göre yaklaşık 4 kat azalttığını ve 120B modele göre token başına hesaplamayı yarıya indirdiğini belirtiyor. Böylece daha küçük donanımda daha yüksek doğruluk elde edilebiliyor.

Multiverse Computing, bu çalışmayı daha önce yayınladıkları verimli distilasyon makalesiyle birlikte sunuyor. Tam teknik detaylar, healing pipeline’ı ve dağıtık eğitim bulguları ilgili akademik makalede yer alıyor.

Kaynak: Hugging Face Blog — 25.08.2026 14:39

Diğer Haberler