AI Guardrails
Yapay zekâ korkuluklarının güvenlik, gizlilik, izleme ve insan gözetimi için katmanlı denetimlerle sistemleri nasıl koruduğunu ve bir YOLO26 görsel yapay zekâ örneğini öğren.
AI korumaları, yapay zekâ sistemlerini tanımlanmış güvenlik, gizlilik ve operasyonel sınırlar içinde tutan teknik ve kurumsal kontrollerdir. Zararlı çıktılar, prompt injection, yetkisiz eylemler ve hassas verilerin açığa çıkması gibi riskleri azaltırlar. Daha kapsamlı AI safety yaklaşımından farklı olarak korumalar, model çıkarımından önce, çıkarım sırasında ve sonrasında uygulanan özel güvenlik önlemleridir. NIST Üretken Yapay Zekâ Profili, bu kontrollerin AI yaşam döngüsünün tamamı boyunca yönetilmesini önerir. (nist.gov)
AI Korumaları Nasıl Çalışır?#
Korumalar, tek bir filtre her hata senaryosunu ele alamayacağı için birbiriyle tamamlayıcı birkaç katman kullanır:
- Girdi Doğrulama ve İçerik Filtreleme: İstemleri, görüntüleri, dosyaları ve API isteklerini kötü amaçlı talimatlar, yasaklanmış içerikler veya veri gizliliği ihlalleri açısından tarar.
- Ajan Araç Kontrolleri: Bir AI agent'ın hangi araçlara erişebileceğini kısıtlar, izinleri sınırlar ve ödeme işlemleri veya veritabanı değişiklikleri gibi yüksek etkili eylemler için onay alınmasını gerektirir.
- Güvenli AI Mimarisi: Yalnızca sistem istemlerine güvenmek yerine kimlik kontrollerini, altyapı güvenliğini, model korumalarını ve insan gözetimini bir araya getirir.
- Çıktı Doğrulama: Yanıtların, alt sistemlerdeki yazılımlar tarafından kullanılmadan önce gerekli şemalara, politikalara, güven sınırlarına ve iş kurallarına uyduğunu kontrol eder.
- Üretim İzleme: Beklenmeyen davranışları, hataları ve veri kaymasını tespit eder. Ultralytics Platformu, uç nokta durumu, gecikme, istek, hata ve günlük sinyalleri üzerinden dağıtım izlemeyi destekler.
Güncel araştırmalar ölçülebilir değerlendirmeyi vurgular. GuardBench, çok sayıda güvenlik veri kümesini kapsayan geniş ölçekli bir kıyaslama sundu; ACL 2025 guardrails eğitimi ise katmanlı savunmaları, güvenlik değerlendirmesini ve otomatik AI red teaming uygulamasını öne çıkardı. (aclanthology.org)
Gerçek Dünya Uygulamaları#
- Ulaşım güvenliği: Bir görüntü sistemi yayaları ve araçları tespit edebilir; ancak tespitler onaylanmış bir eşik değerin altına düştüğünde otomatik hareketi engelleyebilir. Bu, NHTSA otomatik araç güvenliği kılavuzunda teşvik edilen güvenli arıza davranışını destekler.
- Tıbbi görüntüleme: Tanı yazılımı, belirsiz bulguları otonom kararlar vermek yerine klinisyenlere yönlendirebilir. FDA Dijital Sağlık Mükemmeliyet Merkezi, ilgili tıbbi yazılımlar için gözetim sağlar; sağlık hizmetlerinde bilgisayarlı görü ise klinik riski azaltmak için genellikle insan incelemesinden yararlanır.
Görüntü Tabanlı AI Örneği#
Bu örnek, düşük-güven düzeyine sahip tespitlerin alt sistem mantığına otomatik olarak ulaşmasını engellemek için Ultralytics YOLO26 kullanır:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg", conf=0.25)[0]
approved = [box for box in result.boxes if float(box.conf) >= 0.70]
if len(approved) != len(result.boxes):
print("Guardrail: send frame for human review")Bu eşik yalnızca bir katmandır; üretim sistemleri bunu doğrulama veri kümeleri, günlük kaydı, erişim kontrolleri ve insan döngüde makine öğrenmesi ile birleştirmelidir.
Güncel En İyi Uygulamalar#
Derinlemesine savunma kullan, hem hatalı onayları hem de gereksiz retleri test et ve güvenli bir geri dönüş durumu koru. Korumalar da uyarlanabilir olmalıdır: AGrail araştırması ajanlar için gelişen kontrolleri incelerken LS-Guard modele özgü koruma önerir. MrGuard tarafından gösterildiği üzere çok dilli testler de önemlidir. Daha güçlü kısıtlamalar kullanılabilirliği azaltabilir; bu nedenle ekipler korumaları tek seferlik bir yapılandırma olarak görmek yerine güvenliği, gecikmeyi ve görev tamamlamayı sürekli ölçmelidir. (aclanthology.org)









