Constitutional AI
Entdecke, wie Constitutional AI Modelle mithilfe ethischer Prinzipien an menschlichen Werten ausrichtet. Erfahre, wie du Sicherheitsprüfungen in der Computer Vision mit Ultralytics YOLO26 implementierst.
Verfassungsbasierte KI ist eine Methode zum Training von Systemen der künstlichen Intelligenz, bei der diese durch eine Reihe übergeordneter Prinzipien – eine „Verfassung“ – an menschliche Werte ausgerichtet werden, anstatt sich ausschließlich auf umfangreiches menschliches Feedback zu einzelnen Ausgaben zu stützen. Dieser Ansatz bringt dem KI-Modell im Wesentlichen bei, sein eigenes Verhalten anhand einer vordefinierten Reihe von Regeln zu kritisieren und zu überarbeiten, etwa „sei hilfreich“, „sei harmlos“ und „vermeide Diskriminierung“. Indem diese ethischen Richtlinien direkt in den Trainingsprozess eingebettet werden, können Entwickler Systeme erstellen, die sicherer, transparenter und leichter skalierbar sind als Systeme, die auf manuellem bestärkendem Lernen aus menschlichem Feedback (RLHF) beruhen.
Der Mechanismus der verfassungsbasierten KI#
Die zentrale Innovation der verfassungsbasierten KI liegt in ihrem zweistufigen Trainingsprozess, der die Ausrichtung von Modellen automatisiert. Im Gegensatz zum herkömmlichen überwachten Lernen, bei dem Menschen jede richtige Antwort kennzeichnen müssen, verwendet die verfassungsbasierte KI das Modell selbst zur Erstellung von Trainingsdaten.
-
Phase des überwachten Lernens: Das Modell generiert Antworten auf Eingaben und kritisiert anschließend seine eigene Ausgabe anhand der Verfassungsprinzipien. Es überarbeitet die Antwort, um sie besser an den Regeln auszurichten. Dieser verfeinerte Datensatz wird anschließend zur Feinabstimmung des Modells verwendet, sodass es lernt, die Richtlinien von sich aus zu befolgen.
-
Phase des bestärkenden Lernens: Diese Phase, die häufig als bestärkendes Lernen aus KI-Feedback (RLAIF) bezeichnet wird, ersetzt den menschlichen Annotator. Die KI generiert Antwortpaare und wählt die Antwort aus, die der Verfassung am besten entspricht. Diese Präferenzdaten trainieren ein Belohnungsmodell, das anschließend mithilfe von Standardtechniken des bestärkenden Lernens die gewünschten Verhaltensweisen verstärkt.
Bedeutung für Computer Vision#
Obwohl die verfassungsbasierte KI im Kontext von großen Sprachmodellen (LLM) entstand, die von Organisationen wie Anthropic entwickelt wurden, gewinnen ihre Prinzipien zunehmend auch für umfassendere Aufgaben des maschinellen Lernens an Bedeutung, darunter Computer Vision (CV).
- Ethische Bildgenerierung: Tools der generativen KI zur Erstellung von Bildern können „verfassungsbasiert“ trainiert werden, um Eingaben abzulehnen, die gewalttätige, hasserfüllte oder urheberrechtlich geschützte Bilder erzeugen würden. Dadurch wird sichergestellt, dass bereits die Modellgewichte Sicherheitsvorgaben enthalten und die Erstellung schädlicher visueller Inhalte verhindern.
- Sicherheitskritische Bildverarbeitungssysteme: Bei autonomen Fahrzeugen kann ein „verfassungsbasierter“ Ansatz hierarchische Regeln für die Entscheidungsfindung festlegen. Beispielsweise kann eine Regel wie „Die Sicherheit von Menschen hat Vorrang vor der Effizienz des Verkehrs“ das Modell bei der Analyse komplexer Straßenszenen anleiten und sicherstellen, dass die Ergebnisse der Objekterkennung unter Vorrang der Sicherheit interpretiert werden.
Implementierung von Richtlinienprüfungen in der Bildverarbeitung mit KI#
Während das vollständige Training verfassungsbasierter KI komplexe Feedbackschleifen umfasst, können Entwickler das Konzept der „Verfassungsprüfungen“ während der Inferenz anwenden, um Ausgaben anhand von Sicherheitsrichtlinien zu filtern. Das folgende Beispiel zeigt, wie Ultralytics YOLO26 zur Erkennung von Objekten eingesetzt und eine Sicherheitsregel angewendet wird, um Erkennungen mit geringer Konfidenz zu filtern und so eine Zuverlässigkeitsverfassung nachzuahmen.
from ultralytics import YOLO
# Load the YOLO26 model (latest stable Ultralytics release)
model = YOLO("yolo26n.pt")
# Run inference on an image
results = model("https://ultralytics.com/images/bus.jpg")
# Apply a "constitutional" safety check: Only accept high-confidence detections
for result in results:
# Filter boxes with confidence > 0.5 to ensure reliability
safe_boxes = [box for box in result.boxes if box.conf > 0.5]
print(f"Safety Check Passed: {len(safe_boxes)} reliable objects detected.")
# Further processing would only use 'safe_boxes'Verfassungsbasierte KI im Vergleich zu herkömmlichem RLHF#
Es ist wichtig, verfassungsbasierte KI vom standardmäßigen bestärkenden Lernen aus menschlichem Feedback (RLHF) zu unterscheiden.
- Skalierbarkeit: RLHF erfordert umfangreiche menschliche Arbeit zur Bewertung von Modellausgaben, was teuer und langsam ist. Verfassungsbasierte KI automatisiert diesen Prozess mit KI-Agenten und ist dadurch hochgradig skalierbar.
- Transparenz: Bei RLHF lernt das Modell aus einem undurchsichtigen „Belohnungssignal“ (einer Bewertung), wodurch schwer nachvollziehbar ist, warum ein Verhalten bevorzugt wurde. Bei der verfassungsbasierten KI macht das während der Kritikphase eingesetzte Chain-of-Thought-Prompting die Schlussfolgerungen explizit und auf bestimmte schriftlich festgelegte Prinzipien zurückführbar.
- Konsistenz: Menschliche Bewerter können uneinheitlich oder voreingenommen sein. Eine schriftliche Verfassung bietet eine stabile Grundlage für KI-Ethik und verringert die Subjektivität im Ausrichtungsprozess.
Die Zukunft der Ausrichtung#
Da sich Modelle in Richtung künstlicher allgemeiner Intelligenz (AGI) weiterentwickeln, wächst die Bedeutung robuster Ausrichtungsstrategien wie der verfassungsbasierten KI. Diese Methoden sind unerlässlich, um aufkommende Standards von Einrichtungen wie dem NIST AI Safety Institute einzuhalten.
Die Ultralytics-Plattform bietet Tools zur Verwaltung der Daten-Governance und zur Modellüberwachung und erleichtert dadurch die Entwicklung verantwortungsvoller KI-Systeme. Indem Organisationen diese ethischen Überlegungen in den gesamten Lebenszyklus der KI-Entwicklung integrieren – von der Datenerfassung bis zur Bereitstellung von Modellen –, können sie Risiken mindern und sicherstellen, dass ihre Technologien einen positiven Beitrag zur Gesellschaft leisten.









