AI Guardrails
Yapay zeka güvenlik bariyerlerinin; güvenlik, gizlilik, emniyet, izleme ve insan denetimi için katmanlı kontrollerle sistemleri nasıl koruduğunu ve bir YOLO26 görsel yapay zeka örneğini öğren.
AI guardrails, yapay zeka sistemlerini tanımlanan güvenlik, emniyet, gizlilik ve operasyonel sınırlar içinde tutan teknik ve örgütsel kontrollerdir. Zararlı çıktılar, prompt injection, yetkisiz eylemler ve hassas verilerin ifşası gibi riskleri azaltırlar. Daha geniş kapsamlı AI safety kavramından farklı olarak guardrails; model çıkarımından önce, çıkarım sırasında ve sonrasında uygulanan spesifik koruma önlemleridir. NIST Generative AI Profile, bu kontrollerin eksiksiz AI yaşam döngüsü boyunca yönetilmesini önerir. (nist.gov)
AI Korumaları Nasıl Çalışır#
Korumalar birbirini tamamlayan birkaç katman kullanır çünkü hiçbir tekil filtre her hata modunu ele alamaz:
- Input Validation And Content Filtering: İstekleri, görselleri, dosyaları ve API isteklerini kötü amaçlı yönergeler, yasaklı içerik veya data privacy ihlalleri açısından tarar.
- Agent Tool Controls: Bir AI agent tarafından hangi araçlara erişilebileceğini kısıtlar, izinleri sınırlar ve ödemeler veya veritabanı değişiklikleri gibi yüksek etkili eylemler için onay gerektirir.
- Secure AI Architecture: Yalnızca sistem prompt'larına güvenmek yerine kimlik kontrollerini, altyapı güvenliğini, model korumalarını ve insan denetimini birleştirir.
- Output Validation: Yanıtların, sonraki aşamadaki yazılımlar tarafından kullanılmadan önce gerekli şemalara, politikalara, güven sınırlarına ve iş kurallarına uyup uymadığını kontrol eder.
- Production Monitoring: Beklenmeyen davranışları, hataları ve data drift durumlarını tespit eder. Ultralytics Platform, uç nokta sağlığı, gecikme, istek, hata ve günlük kaydı sinyalleri aracılığıyla dağıtım izlemeyi destekler.
Son dönemdeki araştırmalar ölçülebilir değerlendirmenin altını çizmektedir. GuardBench, çok sayıda güvenlik veri kümesini kapsayan büyük ölçekli bir kıyaslama sunarken, ACL 2025 guardrails tutorial katmanlı savunmaları, güvenlik değerlendirmesini ve otomatik AI red teaming süreçlerini öne çıkarmıştır. (aclanthology.org)
Gerçek Dünya Uygulamaları#
- Ulaşım güvenliği: Bir görme sistemi yayaları ve araçları tespit edebilir, ancak tespitler onaylanan bir eşiğin altına düştüğünde otomatik hareketi önleyebilir. Bu, NHTSA automated vehicle safety guidance tarafından teşvik edilen arıza emniyetli davranışı destekler.
- Tıbbi görüntüleme: Teşhis yazılımı, özerk kararlar almak yerine belirsiz bulguları klinisyenlere yönlendirebilir. FDA Digital Health Center of Excellence, ilgili tıbbi yazılımlar için denetim sağlarken, computer vision in healthcare alanı klinik riski azaltmak için genellikle insan incelemesinden yararlanır.
Vision AI Örneği#
Bu örnek, düşük confidence değerine sahip tespitlerin alt akıştaki mantığa otomatik olarak ulaşmasını önlemek için Ultralytics YOLO26 kullanır:
from ultralytics import YOLO
model = YOLO("yolo26n.pt")
result = model("https://ultralytics.com/images/bus.jpg", conf=0.25)[0]
approved = [box for box in result.boxes if float(box.conf) >= 0.70]
if len(approved) != len(result.boxes):
print("Guardrail: send frame for human review")Bu eşik yalnızca tek bir katmandır; üretim sistemleri bunu doğrulama veri kümeleri, günlük kaydı, erişim kontrolleri ve human-in-the-loop machine learning ile birleştirmelidir.
Güncel En İyi Uygulamalar#
Derinlemesine savunma kullan, hem yanlış onayları hem de gereksiz reddedilmeleri test et ve güvenli bir yedek durum koru. Guardrails aynı zamanda uyum sağlamalıdır: AGrail research aracılar için gelişen kontrolleri incelerken, LS-Guard modele özel koruma önermektedir. MrGuard tarafından gösterildiği gibi çok dilli testler de önemlidir. Daha sıkı kısıtlamalar kullanılabilirliği azaltabilir; bu nedenle ekipler guardrails yapılandırmasını tek seferlik bir işlem olarak ele almak yerine güvenliği, gecikmeyi ve görev tamamlama oranını sürekli olarak ölçmelidir. (aclanthology.org)






