Koruma katmanları
Geçiş noktasında çalışan koruma katmanları: girdi maskeleme her istekte, yanıt maskeleme isteğe bağlı; prompt injection ve halüsinasyon korumaları yakında.
Gateway’den geçen her istek, dış modele çıkmadan önce koruma katmanlarından geçer. Bugün çalışan katmanlar maskelemeye dayanır; aynı geçiş noktasına eklenecek iki katman daha var.
| Katman | Ne yapar | Durum |
|---|---|---|
| Girdi maskeleme | İsteğin içindeki kişisel veriyi model görmeden maskeler | Açık (varsayılan) |
| Yanıt maskeleme | Modelin döndürdüğü kişisel veriyi istemciye geçmeden maskeler | İsteğe bağlı |
| Prompt injection koruması | Modeli verilen talimatların dışına çıkarmayı amaçlayan girdileri işaretler | Yakında |
| Halüsinasyon koruması | Modelin dayanağı olmayan yanıtlarını işaretler | Yakında |
Girdi maskeleme
Varsayılan ve her istekte çalışan katman budur. Metin dış modele iletilmeden
taranır, tespit edilen her kişisel veri <PERSON_1> gibi bir yer tutucuyla
değiştirilir ve modele yalnız maskeli metin gider.
Kapsam 26 kategoridir; KVKK’nın 6. maddesindeki özel nitelikli veriler de buradadır. Tam liste ve sentetik örnekler için Kategoriler, yer tutucu biçimi için Kavramlar.
Maskeleme tamamlanamazsa istek dış modele gitmez ve Gateway 502 döndürür. “Maskesiz de olsa gönder” diye bir seçenek yoktur.
Yanıt maskeleme
Girdi her istekte maskelenir; yanıt tarafı kurum talep ettiğinde açılır. Model yanıtında kişisel veri üretirse ya da girdideki bir değeri yinelerse, bu değerler istemciye dönmeden maskelenir.
Streaming yanıtlarda uygulanmaz: gerçek zamanlı akışı bozmamak için yanıt olduğu gibi geçer ve bu durum denetim izine işlenir.
Maskelemeyi kapatmak
Maskeleme sanal anahtar bazında kapatılabilir; o anahtardan gelen istekler doğrudan dil modeline gider ve Gateway o anahtar için yalnız bir yapay zekâ ağ geçidi gibi davranır. Aynı kurumda maskeli ve maskesiz anahtarlar yan yana çalışabilir.
Yakında eklenecek katmanlar
İki katman geliştirme aşamasındadır. İkisi de aynı geçiş noktasında, maskeleme ile aynı akışta çalışacak şekilde tasarlanıyor.
Prompt injection koruması. Kullanıcı girdisine gizlenmiş, modeli kendisine verilen talimatların dışına çıkarmayı amaçlayan denemeleri işaretler. Tipik örnek, görünüşte sıradan bir metnin içine yerleştirilmiş “önceki talimatları yok say” türü yönergelerdir.
Halüsinasyon koruması. Modelin, dayanağı olmayan bir yanıtı emin bir dille verdiği durumları işaretler. Kişisel veri sızıntısından farklı bir risktir: burada sorun verinin dışarı çıkması değil, içeri yanlış bilginin girmesidir.
Yayına alındıklarında bu sayfa güncellenir ve Sürüm notları sayfasına tarihli bir giriş düşülür.