Web Analytics
28 Ağustos 2026, Cuma

Google DeepMind Dünyanın İlk Çift Kör AI Değerlendirmesini Başlattı

28.08.2026 05:10 Denizli Haber
1
Google DeepMind Dünyanın İlk Çift Kör AI Değerlendirmesini Başlattı

Google DeepMind, 27 Ağustos 2026’da Singapore AI Safety Institute, OpenMined, AVERI ve MLCommons ile iş birliği yaparak Gemini Flash Lite modelini kriptografik olarak güvenli bir ortamda çift kör yöntemle test etti. Bu pilot, benchmark contamination riskini ortadan kaldırarak değerlendirme güvenilirliğini artırıyor.

Google DeepMind, 27 Ağustos 2026 tarihinde dünyanın ilk çift kör AI değerlendirme pilotunu duyurdu. Bu çalışma, Gemini Flash Lite modelini gizli benchmark’lar karşısında test etmek için kriptografik olarak güvenli bir “kutuda” yürütüldü. Singapore AI Safety Institute, OpenMined, AVERI ve MLCommons ile ortaklaşa gerçekleştirilen pilot, model ağırlıkları ile test verilerinin karşılıklı gizliliğini koruyor.

Çift kör AI değerlendirme pilotunun işleyişi

Google DeepMind Dünyanın İlk Çift Kör AI Değerlendirmesini Başlattı

Çift kör değerlendirme, geleneksel ikilemi ortadan kaldırıyor. Daha önce ya değerlendiriciler test prompt’larını model sağlayıcıya vermek zorunda kalıyor ya da model sağlayıcı ağırlıkları paylaşıyordu. Google Cloud Confidential Space içinde Confidential Computing altyapısı kullanılarak hem model ağırlıkları hem de test verileri kriptografik olarak korunuyor. Değerlendirici Gemini Flash Lite’ın ağırlıklarını göremiyor; Google ise test sorularını göremiyor. Bu sayede benchmark contamination önleniyor.

Pilot, sıfır günlükleme protokolleri ve sözleşmesel önlemlerin ötesinde teknik ve kriptografik güvenceler getiriyor. Özellikle siber güvenlik ve hükümet kurumları tarafından kullanılan yüksek hassasiyetli değerlendirmeler için önem taşıyor. Google, kendi iç testlerinin yanı sıra dış ortaklarla çalışarak modellerindeki olası kör noktaları tespit etmeyi hedefliyor.

Pilotun araştırma ve sektör için hedefi

Bu yaklaşım, politika yapıcıların, araştırmacıların ve işletmelerin AI benchmark’larına olan güvenini artırmayı amaçlıyor. Modellerin test sorularını önceden “görmesi” sonucu şişirilmiş skorlar oluşmasını engelliyor. Kriptografik kanıtlar, veri egemenliğini ve güvenliğini korurken bağımsız kurumların ileri seviye modelleri sıkı şekilde test etmesine olanak tanıyor.

Pilotun sonuçları, sektörde daha güvenli ve güvenilir AI sistemleri geliştirilmesine katkı sağlayabilir. Google DeepMind, metodoloji ve bulguları içeren teknik raporu kamuoyuyla paylaştı. Bu çalışma, AI denetiminde yeni bir standart oluşturma potansiyeli taşıyor.

  • 27 Ağustos 2026 tarihinde duyuruldu
  • Gemini Flash Lite modeli test edildi
  • Confidential Computing ile kriptografik koruma sağlandı
  • Dört uluslararası kurumla ortaklık kuruldu
  • Benchmark contamination riski teknik olarak azaltıldı

Kaynak: Google DeepMind — 27.08.2026 15:59

Diğer Haberler