Surya Narreddi’nin Viral Suluboya Modeli TRL ve OpenEnv ile Açık Kaynak Olarak Yeniden Üretildi
Surya Narreddi’nin 1.5 milyondan fazla görüntülenen suluboya videosunun ardından Sergio Paniego, aynı fikri TRL ve OpenEnv kullanarak tamamen açık kaynaklı olarak yeniden üretti. Hugging Face üzerinde üç farklı ödül karışımıyla eğitilen modeller, referans pool’daki 178 el ile derecelendirilmiş resimle şekillendirildi.
Surya Narreddi’nin 23 Ağustos’ta yayınladığı, dil modeli ile JavaScript ve p5.brush kütüphanesi kullanarak suluboya resimler oluşturan video, 1.5 milyondan fazla görüntülenme aldı. Sergio Paniego bu fikri TRL ve OpenEnv ile açık kaynaklı olarak yeniden üretti. Tüm bileşenler – referans pool, RL ortamı, eğitim script’leri ve eğitilmiş modeller – Hugging Face Hub’da yayınlandı.
Paniego’nun reprodüksiyonu, Surya Narreddi’nin orijinal blogunda açıklanan yöntemi adım adım takip ederek yalnızca zorunlu durumlarda değişiklik yaptı. Proje, Hugging Face Jobs üzerinde Qwen/Qwen3.5-35B-A3B modeli ile LoRA eğitimi şeklinde yürütüldü. Tüm pipeline, eğitim Jobs’ta, RL ortamı ve HPSv3 scorer Spaces’te, pairwise judge ise Inference Providers üzerinden çalıştırıldı.
Ödül Fonksiyonu ve Referans Pool

Ödül fonksiyonu dört bileşenden oluşuyor: derlemenin başarılı olması (ağırlık 0.05), kod uzunluğu (0.05), pairwise judge ile referanslara karşı karşılaştırma ve HPSv3 estetik puanı. Pool, iNaturalist’ten alınmış açık lisanslı hibiscus fotoğraflarından dört farklı açık model (GLM-5.2 64, Kimi-K3 57, Qwen3-Coder-Next 35, Qwen3.5-122B-A10B 22 resim) ile üretildi. Toplam 178 resim, “love” ve “okay” olarak iki seviyede derecelendirildi.
p5.brush kütüphanesinden yalnızca 10 metod (scaleBrushes, noStroke, fill, noFill, fillBleed, fillTexture, beginShape, vertex, endShape, circle) kullanılabildi. Bu kısıtlama suluboya görünümünü korumak için uygulandı. Pairwise judge, Qwen3-VL-30B-A3B-Instruct modeli ile referans havuzundan rastgele seçilen dört resim karşısında aday resmin kazanma oranını hesaplıyor.
Üç Farklı Ödül Karışımıyla Yapılan Eğitimler
Üç ayrı run gerçekleştirildi:
- judge-led: pairwise judge 0.60, HPSv3 0.30, 110 adım
- hps-led: pairwise judge 0.30, HPSv3 0.60, 110 adım
- hps-only: pairwise judge 0.00, HPSv3 0.90, 60 adım
Mean grup ödülü değişimleri şöyle oldu: hps-only run’unda 0.58’den 0.71’e (+0.13), judge-led’de 0.45’ten 0.72’ye (+0.27), hps-led’de 0.57’den 0.82’ye (+0.24). Bir eğitim adımı 15-18 dakika sürdü; 110 adımlık eğitim H200 GPU’da yaklaşık 34 saat aldı.
Modellerin Öğrendikleri ve Yayınlanan Artefaktlar
Eğitim ilerledikçe modeller düşük kaliteli resimleri azaltmayı öğrendi. Pairwise judge ağırlığı arttıkça pigment kullanımı ve stil benzerliği de yükseldi. Tüm run’ların rollouts veri setleri, adapter modelleri ve her resmin sketch’iyle birlikte watercolour-gallery üzerinden taranabiliyor. Yayınlanan koleksiyon “Paint with Code” adını taşıyor ve şu modelleri içeriyor: watercolour-grpo-hps-only, watercolour-grpo-judge-led, watercolour-grpo-hps-led.
Sergio Paniego, projenin tüm bileşenlerini açık kaynak olarak paylaştı. Bu sayede aynı yöntemle farklı konular veya stiller için yeni pool’lar oluşturmak mümkün hale geldi. Orijinal fikir Surya Narreddi’ye, kullanılan p5.brush kütüphanesi ise Alejandro Campos Uribe’ye ait.