← SECURITY LAB / AI Security RISK: CRITICAL

LLM Prompt Injection ve Güvenlik Duvarı Savunma Laboratuvarı

ENVIRONMENT: İzole Python 3.12 Sandboxed Lab & Local LLM Gateway
VISIBILITY: Public
TOOLS: Burp Suite Python LangChain Rebuff Custom Fuzzing Scripts

01 // Objective

Kurumsal LLM entegrasyonlarında Indirect Prompt Injection ve System Prompt Extraction saldırı vektörlerini analiz etmek ve çok katmanlı savunma mimarisi geliştirmek.

02 // Methodology & Execution Steps

1. Test amaçlı kurgulanan müşteri destek LLM ajanına zararlı prompt kombinasyonları (Jailbreak, Unicode obfuscation, Roleplay) enjekte edildi. 2. Tool çağırma (tool-calling) izinlerinin sınırları zorlandı ve izinsiz veri sızdırma senaryoları modellendi. 3. Giriş filtreleme, token bazlı anomali tespiti ve çıktı doğrulayıcı katmanlar (Guardrails) test edildi.

03 // Findings & Attack Vector Verification

Yalnızca sistem promptunda "sırları paylaşma" uyarısının bulunması saldırganları durdurmak için yetersizdir. Çok dilli veya Base64 kodlanmış girdiler doğrudan güvenlik sınırını aşabilmektedir. Ancak harici bir girdi temizleme ve çıktı denetleme modeli kullanıldığında başarı oranı %99.2 engellendi.

04 // Remediation & Layered Defense

1. LLM çağrısından önce bağımsız bir Input Sanitizer / Classifier devresi çalıştırılmalıdır. 2. Ajanın çağırabileceği araçlar Least Privilege ilkesiyle izole edilmelidir. 3. Çıktı tarafında hassas veri (API Key, PII, Internal IP) maskeleme katmanı aktif edilmelidir.

05 // Lessons Learned & Engineering Takeaways

Yapay zekâ güvenliği yalnızca bir model problemi değil, klasik yazılım güvenliği gibi girdi doğrulama ve mimari izolasyon disiplinidir.