GRPO İnce Ayarı ile 350M Parametreli Modelin IFStruct Performansı %29.7'ye Yükseldi
LiquidAI tarafından geliştirilen LFM2.5-350M modeli, TRL kütüphanesiyle uygulanan GRPO ince ayarı sonucunda IFStruct benchmark'ında %22.6'dan %29.7'ye performans artışı gösterdi. Yaklaşık 500 örnek ve 100 eğitim adımıyla tamamlanan süreç, JSON formatında %13.9 puanlık iyileşme sağladı.
LiquidAI tarafından geliştirilen LFM2.5-350M modeli, Group Relative Policy Optimization (GRPO) yöntemiyle ince ayarlandıktan sonra IFStruct benchmark'ında %29.7 başarı oranına ulaştı. Temel modelin %22.6 olan performansı, TRL kütüphanesi kullanılarak gerçekleştirilen 100 adımlık eğitimle %7.1 puan yükseldi.
IFStruct, LLM'lerin yapılandırılmış çıktı uyumluluğunu test eden açık kaynaklı bir benchmark'tır. Liquid4All/ifstruct deposunda yer alan benchmark, LiquidAI/ifstruct-v1.0 veri setini kullanır. Temel model değerlendirmesi, BF16 GGUF formatındaki LiquidAI/LFM2.5-350M-GGUF ile llama.cpp üzerinden yerel olarak çalıştırıldı ve 2000 örnekte 452/2000 (%22.6) geçme oranı elde edildi. Bu sonuç, IFStruct blogunda raporlanan %21.1 değerine yakındır.
LFM2.5-350M Modeli ve GRPO Eğitim Süreci

Eğitim için nvidia/Nemotron-RL-instruction_following-structured_outputs veri setinden yaklaşık 500 örnek kullanıldı. Veri seti, her prompt için hedef JSON Schema ve beklenen alan sayısını içerir. Dağılım farklarını kapatmak amacıyla prompt'ların %40'ına "fenced code block içinde döndür" talimatı eklendi, %20'si ise top-level array görevlerine dönüştürüldü.
Modelde LoRA adaptörü uygulandı. LFM2.5'in hybrid attention/convolution mimarisi nedeniyle target_modules olarak q_proj, k_proj, v_proj, out_proj, in_proj, w1, w2 ve w3 modülleri seçildi. Bu sayede yaklaşık 6 milyon parametre (%1.66) eğitildi. Üç ödül fonksiyonu tanımlandı: json_format_reward, field_count_reward ve schema_validation_reward. Bunlar sırasıyla 1.0, 0.5 ve 2.0 ağırlıklarıyla birleştirildi.
Eğitim GRPOConfig ile 100 adım boyunca sürdürüldü. Parametreler arasında learning_rate=5e-5, num_generations=8, per_device_train_batch_size=4 ve gradient_accumulation_steps=8 yer aldı. Eğitim sonrası LoRA adaptörü temel modelle birleştirilerek merged checkpoint olarak kaydedildi ve BF16 GGUF formatına dönüştürüldü.
İnce Ayar Sonrası Performans Karşılaştırması
GRPO ile ince ayarlanmış model aynı llama.cpp servisi üzerinden yeniden değerlendirildi. Sonuçlar şöyle:
- Genel başarı: %22.6 → %29.7
- JSON: %18.0 → %31.9 (+13.9 puan)
- Bare list: %16.6 → %29.7 (+13.1 puan)
- Wrapper key: %28.5 → %29.7
Bu iyileşmeler, eğitimin odaklandığı JSON formatı ve bare list uyumuna paraleldir. YAML performansı ise %27.2'den %27.5'e minimal artış gösterdi. İnce ayarlı 350M model, Qwen3.5-2B'nin %33.15 skoruna yaklaşırken, daha büyük modellere göre maliyet avantajı sunuyor.
Model, 16 GB'lık ücretsiz Colab veya Kaggle GPU'larda çalıştırılabilecek ölçekte tasarlandı. Tüm kod ve notebook GitHub üzerinden erişilebilir durumda. Süreç, görev odaklı ince ayarın küçük modellerin yapılandırılmış çıktı güvenilirliğini önemli ölçüde artırabileceğini gösteriyor.