Web Analytics
21 Eylül 2026, Pazartesi

Araştırma: SynthID metin filigranı modellerin güvenlik davranışını ve araç çağrılarını değiştiriyor

Araştırma: SynthID metin filigranı modellerin güvenlik davranışını ve araç çağrılarını değiştiriyor

Lasso Security araştırmacısı Andrea Siposova'nın altı açık ağırlıklı model üzerindeki testleri, Google'ın açık kaynak SynthID-Text filigranının zararlı istemlere verilen yanıtları değiştirdiğini gösterdi. Bulgulara göre filigran, modelin normalde reddedeceği zararlı istekleri bazı modellerde yanıtlamasına yol açabiliyor ve bir yapay zekâ ajanının hangi aracı çağıracağını etkileyebiliyor.

Google tarafından geliştirilen ve açık kaynak olarak yayımlanan SynthID-Text metin filigranının, dil modellerinin güvenlik davranışını değiştirebildiği ortaya çıktı. Lasso Security'de yapay zekâ güvenliği araştırmacısı olan Andrea Siposova'nın testleri, filigranın yalnızca kelime seçimini değil, modellerin çağırdığı araçları ve eğitimle edindikleri güvenlik kurallarına uyma olasılığını da etkilediğini gösterdi. Bulgular, zararlı bir istemin filigran devredeyken normalde reddedilecekken bazen yerine getirilebildiğini ortaya koyuyor.

İnceleme, yeni bir Avrupa Birliği yasasına yanıt olarak yapay zekâ platformlarının ürettikleri içeriği filigranlamak için yeni düzenekler kurduğu bir dönemde yayımlandı. Anthropic, gelecekteki Claude modellerinin SynthID-Text kullanacağını açıkladı.

SynthID-Text nasıl çalışıyor ve turnuva örneklemesi ne yapıyor

SynthID-Text, üretilen metnin yapay zekâ kaynaklı olduğunun tespit edilmesini sağlayan bir köken (provenance) sinyali yerleştiriyor. Yöntem, normal örnekleme sürecine rastgele tohum üretici, örnekleme algoritması ve puanlama fonksiyonu ekliyor. Modelin bir sonraki kelimeyi seçmek için kullandığı keyfi rastgele sayı üreteci yerine gizli bir anahtar devreye giriyor. Örneğin en olası seçim "cloudy" iken anahtar bunu "overcast"e çevirebiliyor. Kelime seçimi yine rastgele kalıyor; ancak anahtarı bilen kişiler kelime dizisini inceleyerek bu anahtarın kullanılma olasılığını tespit edebiliyor.

Yöntemin öne çıkan bileşeni turnuva örneklemesi (tournament sampling). Sistem, sıradaki kelime için çok sayıda token adayını değerlendiriyor ve gizli anahtarla bunlara olasılık puanları atıyor. İki token bir turda yarışıyor; gizli puanı yüksek olan bir sonraki tura geçiyor. Süreç, nihai kazanan token belirlenene kadar sürüyor.

Lasso Security testlerinde altı açık ağırlıklı modelde reddetme davranışı değişti

Siposova, SynthID-Text'in "bozulma yaratmayan" (non-distortionary) yapılandırmasını Hugging Face'in değiştirilmemiş SynthIDTextWatermarkLogitsProcessor bileşeni üzerinden test etti. Altı açık ağırlıklı modele zararlı istemler verildi ve yanıtlar filigran kullanılan ve kullanılmayan durumlarda karşılaştırıldı. Filigran, zararlı isteklere verilen yanıtları değiştirdi; etki özellikle istem enjeksiyonu (prompt injection) teknikleriyle birleştirildiğinde belirginleşti.

Siposova bulgularını şöyle aktardı: "Filigran, çıplak zararlı istemlerde reddetme davranışını değiştiriyor, ancak etki aynı istemler istem enjeksiyonu tekniğiyle eşleştirildiğinde daha belirgin. Birkaç modelde filigran, modelin normalde reddedeceği zararlı isteklere yanıt verme olasılığını artırıyor."

Model reddi ve ajan araç çağrıları: "sampling drift"

Değişiklikler yalnızca LLM yanıtlarını değil, modele dayanan yapay zekâ ajanlarının sonraki eylemlerini de etkiliyor. Model düzeyinde bu, modelin zararlı bir isteği reddedip etmemesini ve bu reddin istem enjeksiyonu altında sürüp sürmemesini değiştirebiliyor. Ajan düzeyinde ise aynı örneklenen tokenler hangi aracın çağrılacağını ve araca hangi argümanların aktarılacağını belirleyebiliyor. Siposova, istem enjeksiyonunun bu iki düzlemi birbirine bağladığını, zayıflayan bir reddin model araçlar üzerinden eylemde bulunabildiğinde daha ağır sonuçlar doğurduğunu belirtiyor ve bu davranışsal etkiye "sampling drift" adını veriyor.

Model yanıtları ayrıca hangi gizli anahtarın kullanıldığına göre farklı davrandı. Filigran, hangi tekil araç çağrılarının doğru olduğunu değiştirdi; bu değişim bazen genel doğruluk skorunun ima ettiğinden çok daha büyük oldu. Sonuçları gösteren şekillerde dikey çizgiler filigransız doğruluğu, çubuklar filigran uygulandığındaki değişimi gösteriyor; turuncu doğrudan hataya, mavi hatadan doğruya geçişleri temsil ediyor. Anahtar etkisini gösteren şekilde her nokta bir anahtarı temsil ediyor; sıfırın sağındaki noktalar filigransız duruma kıyasla artan zararlı uyumu, solundakiler azalan uyumu gösteriyor. Turuncu noktalar 10 ek anahtarı, siyah elmas ise ana deneyde kullanılan rastgele seçilmiş anahtarı temsil ediyor.

Claude modelleri ve Hugging Face uygulaması: araştırmanın sınırları

Araştırmanın sınırları bulunuyor. Testler Claude modellerinin filigran altındaki yanıtlarının nasıl değiştiğini ölçmüyor. Bunun yerine altı açık ağırlıklı model kullanıldı; böylece araştırmacı, turnuva örneklemesi sırasında token örneklemesini açıp kapatabilirken diğer ayarları sabit tutabildi. Deneyler SynthID-Text turnuva örneklemesinin Hugging Face uygulamasını test etti, Claude modellerinin kullanacağı özel uygulamayı değil. Yine de sonuçlar, filigran yaklaşımının en azından bazı biçimlerinin model ve ajan güvenliğini etkileyebileceğini gösteriyor.

  • Filigran, altı açık ağırlıklı modelde zararlı istemlere verilen yanıtları değiştirdi.
  • Etki, istem enjeksiyonu teknikleriyle birleştirildiğinde daha belirgin hale geldi.
  • Filigran hangi tekil araç çağrılarının doğru olduğunu değiştirdi; bu değişim bazen genel doğruluk skorunun ima ettiğinden büyük oldu.
  • Sonuçlar, gizli anahtarın seçimine göre farklılaştı.
  • Claude modellerinin filigran altındaki davranışı ve Claude'un kullanacağı özel uygulama test edilmedi.

Habere göre kırmızı takım hackleme çalışmalarının, SynthID devreye girdiğinde platformların beklendiği gibi davrandığından emin olmak için stres testi yapması önemli olacak.

Diğer Haberler