Görünmez HTML, AI e-posta özetleyicisini nasıl kandırıyor: Forcepoint X-Labs’ın dolaylı prompt injection kavram kanıtı

AI destekli e-posta özetleyicileri artık birçok kurumsal gelen kutusunun standart özelliği. Ama güvenlik araştırma ekibi Forcepoint X-Labs, bu özelliğin ne kadar kolay manipüle edilebileceğini gösteren çarpıcı bir kavram kanıtı (proof-of-concept) yayınladı: birkaç satırlık görünmez HTML kodu, bir AI özetleyicisinin talimat olarak yorumlayabileceği bir saldırı yüzeyi yaratıyor.

Saldırı nasıl işliyor?

Araştırmacılar, bir e-postanın içine font-size:0px; color:#ffffff; line-height:0 gibi HTML stilleriyle gizlenmiş metin yerleştirdi. Bu stil, e-postayı Outlook gibi bir istemcide açan bir insana tamamen görünmez kalıyor — ama e-postanın ham HTML’i bir dil modeline (LLM) özetleme için gönderildiğinde, gizli metin de tam olarak modele ulaşıyor.

Rakamlar çarpıcı: kullanıcıya görünen e-posta 537 karakterden oluşurken, modele gönderilen içerik 1.009 karakterdi — aradaki 472 karakterlik fark, tamamen gizlenmiş enjeksiyon metniydi. Yani kullanıcı temiz bir e-posta görürken, AI aslında görmediği ek talimatları da okuyup bunlara göre hareket edebiliyordu.

Bu bir “belirli ürün açığı” değil

Forcepoint, bunun belirli bir LLM sağlayıcısının veya ticari bir özetleyicinin spesifik bir hatası olmadığını özellikle vurguluyor. Asıl sorun daha genel: güvenilmeyen (untrusted) e-posta içeriğinin, içeriği talimatlardan ayırt edecek hiçbir koruma olmadan doğrudan bir LLM’e beslenmesi. Araştırmacılar, bu riski göstermek için kasıtlı olarak basit, korumasız bir e-posta→LLM pipeline’ı kurdu.

Bu, “dolaylı prompt injection” (indirect prompt injection) adı verilen daha geniş bir güvenlik açığı kategorisinin somut bir örneği: saldırgan, AI sistemiyle doğrudan konuşmuyor, bunun yerine AI’nın işleyeceği bir içeriğin (bir e-posta, bir web sayfası, bir belge) içine gizli talimatlar yerleştiriyor. Forcepoint X-Labs, bu yılın başlarında da gerçek dünyada aktif olarak kullanılan 10 farklı dolaylı prompt injection payload’ı tespit ettiğini raporlamıştı — yani bu artık teorik bir risk değil, vahşi doğada (in the wild) gözlemlenen bir saldırı kategorisi.

Neden önemli?

E-posta özetleyicileri, toplantı asistanları, gelen kutusu triyaj araçları gibi “AI bir içeriği okuyup benim için özetlesin/karar versin” şeklindeki kurumsal ürünlerin sayısı hızla artıyor. Bu tür sistemlerin çoğu, kullanıcıya görünen içerik ile modele gönderilen ham içerik arasındaki farkı hiç kontrol etmiyor. Bir saldırgan, görünüşte tamamen masum bir e-posta gönderip AI’ya “bu e-postayı önemli olarak işaretle”, “şu bağlantıya tıklamayı öner” ya da daha ciddi senaryolarda “şu verileri şuraya ilet” gibi gizli talimatlar verebilir.

Geliştiriciler için çıkarım

Kurumsal AI ürünleri geliştirenler için pratik ders net: bir LLM’e üçüncü taraf içerik (e-posta, web sayfası, belge, PDF) beslerken, görünen içerik ile modele giden ham içerik arasında bir fark olup olmadığı mutlaka kontrol edilmeli. Bu, HTML/CSS ile gizlenmiş metinleri temizleyen bir ön işleme katmanı, içerik ile talimatları ayıran açık bir prompt yapısı, ya da modelin işlediği veriyi “güvenilmez” olarak etiketleyip buna göre daha sınırlı yetkilerle çalıştırılması anlamına gelebilir. Forcepoint’in vurguladığı gibi, sorun tek bir sağlayıcıya özgü değil — bu, güvenli olmayan bir mimari örüntüsünün endüstri çapında yaygın olduğunun göstergesi.

Comments

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir