Google DeepMind, test istemlerini veya model ağırlıklarını ifşa etmeden Gemini Flash Lite modellerini değerlendirmek için kriptografik çift kör kıyaslama (benchmarking) kullanan bir pilot çalışma başlattı. Değerlendirme Google Cloud'un Confidential Space içinde gerçekleştiriliyor; böylece değerlendirici modeli asla görmüyor, model de soruları asla görmüyor. Bu yaklaşım, yapay zeka performans raporlarına yeniden güvenilirlik kazandırabilir.

Kıyaslama kirlenmesi neden önemlidir

Eğer bir model, daha sonra bir kıyaslamada yer alacak verilerle eğitilirse, puanı akıl yürütmeyi ölçmeyi bırakıp ezberlemeye dönüşür. Dolayısıyla, kirlenmiş bir testteki mükemmel bir sonuç, gerçek yetenek hakkında hiçbir şey söylemez. Araştırmacılar uzun süredir bir paradoksla karşı karşıya: Bir kıyaslamayı doğrulamak için model sağlayıcısına test verilerini teslim edip erken ifşa riskini göze almak ya da tescilli ağırlıkları korumak için dış erişimi reddedip denetimi doğrulanmamış bırakmak zorundalar. Anthropic'in Fable 5 modelinin ARC-AGI kıyaslamasında değerlendirilmesinde yaşanan son gecikme, katı veri saklama politikalarının bağımsız değerlendirmeyi nasıl engelleyebileceğini gösteriyor.

Kriptografik bir çözüm

Bu pilot çalışma, hukuki sözleşmelerin ve "sıfır günlük tutma" (zero-logging) vaatlerinin yerini teknik bir koruma ile değiştiriyor. Confidential Space, Gemini Flash Lite modelini çalıştıran donanım düzeyinde izole edilmiş bir enclave oluşturur. Değerlendirici, enclave'in modelin açamayacağı kriptografik bir "kutu" içine mühürlediği test paketini yükler. Aynı zamanda, modelin ağırlıkları enclave içinde şifreli kalır ve değerlendirici için görünmez olur. Enclave, modelin çıkarım (inference) sırasında istemlere asla erişmediğine dair matematiksel bir kanıt oluşturur. Sonuç, gerçekten çift kör bir çalışma olur: Her iki taraf da sırlarını saklarken, üçüncü bir taraf doğrulanabilir bir performans metriği alır.

Kimler kazanacak

  • Düzenleyiciler ve denetçiler, artık sağlayıcıları ticari sırlarını ifşa etmeye zorlamadan yetenek kanıtı talep edebilirler.
  • Siber güvenlik, savunma veya gizli verilerle uğraşan herhangi bir alandaki işletmeler, veri sızıntısı riski almadan yapay zeka araçlarını test edebilirler.
  • Model geliştiricileri, rekabet avantajlarını korurlar; artık açıklık ile koruma arasında bir seçim yapmak zorunda değillerdir.

Eğer bu yaklaşım ölçeklenirse, sınır modellerin (frontier models) sertifikalandırılması için varsayılan yöntem haline gelebilir ve endüstriyi güvene dayalı düzenlemelerden matematik temelli garantilere taşıyabilir.

Olası zorluklar

Sistem Google Cloud'un gizli bilgi işlem (confidential computing) yığınına dayanıyor, bu nedenle diğer bulut sağlayıcılarını tercih eden kuruluşlar entegrasyon engelleriyle karşılaşabilir. Modelleri bir enclave içinde çalıştırmak gecikmeye (latency) neden olur ve mevcut donanım hızlandırıcılarını sınırlar, bu da kıyaslama puanlarını etkileyebilir. Ayrıca, kriptografik kanıt modelin istemleri görmediğini garanti etse de, test başladıktan sonra ince ayar (fine-tuning) yapılması gibi diğer manipülasyonları engellemez. Eleştirmenler, çözümün daha geniş olan yeniden üretilebilirlik (reproducibility) sorununun yalnızca dar bir kısmını ele aldığını savunabilir.

Bundan sonra ne takip edilmeli

  • Pilot çalışmanın ötesindeki benimsenme – Diğer yapay zeka laboratuvarları ve bulut sağlayıcıları, modelin platformlar arasında denetlenebilir olup olmadığını test etmek için uyumlu enclave'ler oluşturabilir.
  • Standart belirleyici kuruluşlar – Yapay zeka güvenliği grupları, çift kör kriptografik denetimleri sertifikasyon çerçevelerinin bir parçası olarak kodifiye edebilir.
  • Performans ödünleşimleri – Gerçek dünya kıyaslama çalışmaları, gizli yürütmenin (confidential execution) getirdiği ek yükün büyük ölçekli modeller için kabul edilebilir olup olmadığını ortaya koyacaktır.

Özetle

Hem test verilerini hem de modeli karşılıklı olarak opak bir kriptografik ortamın içine kilitleyerek, Google DeepMind'ın pilot çalışması güvenilir yapay zeka kıyaslaması için somut bir yol sunuyor. Yöntem her denetim zorluğunu ortadan kaldırmıyor ancak taraflardan birini en değerli varlıklarından vazgeçmeye zorlamadan, yanlılığın en bariz kaynağını —kıyaslama kirlenmesini— ortadan kaldırıyor. Eğer topluluk bu tekniği benimserse, gelecekteki yapay zeka ilerleme raporları nihayet olduğu gibi kabul edilebilir.