ReAct Prompting
Entdecke ReAct-Prompting zum Entwickeln autonomer KI-Agenten. Erfahre, wie Schlussfolgern und Handeln mit LLMs und Computer-Vision-Werkzeugen wie Ultralytics YOLO26 zusammenspielen.
ReAct-Prompting (Reasoning and Acting, also Schlussfolgern und Handeln) ist ein fortgeschrittenes Paradigma des Prompt-Engineering, mit dem große Sprachmodelle (LLMs) schrittweise Schlussfolgerungen dynamisch mit aufgabenspezifischen Aktionen verknüpfen können. Die Technik wurde in der einflussreichen wissenschaftlichen Arbeit aus dem Jahr 2022 „ReAct: Reasoning und Handeln in Sprachmodellen verbinden“ vorgestellt und verwandelt ein statisches Sprachmodell in einen interaktiven KI-Agenten. Indem das Modell explizit Überlegungen zu einem Problem formuliert und Aktionen ausführt, um externe Informationen abzurufen, verbessert das ReAct-Framework die Faktentreue und Entscheidungsfähigkeit in komplexen Arbeitsabläufen der künstlichen Intelligenz erheblich.
So funktionieren Schlussfolgern und Handeln#
Bei herkömmlichen Interaktionen erzeugt ein Modell eine Antwort ausschließlich auf Grundlage seines internen Wissens, was häufig zu Halluzinationen in LLMs führt. Die ReAct-Architektur löst dieses Problem, indem sie die KI mithilfe einer kontinuierlichen Schleife aus Gedanken, Aktionen und Beobachtungen in externen Umgebungen verankert.
Bei einer Anfrage formuliert das Modell zunächst einen „Gedanken“, um seine Strategie darzulegen. Anschließend löst es eine „Aktion“ aus, etwa eine Suchmaschinenabfrage, eine Datenbankinteraktion oder den Aufruf einer Bildverarbeitungs-API über ein Verfahren namens Funktionsaufruf. Die Umgebung liefert eine „Beobachtung“ mit Fakten. Das Modell wertet diese neuen Informationen aus, aktualisiert seine Schlussfolgerungen und wiederholt den Zyklus, bis es eine endgültige Antwort gefunden hat. Diese in der Anleitung zum Prompt-Engineering über ReAct ausführlicher beschriebene Methode ähnelt der menschlichen Problemlösung und ermöglicht hochgradig transparente und kontrollierbare Agenten.
Anwendungen in der Praxis#
ReAct-Prompting eignet sich besonders für Szenarien, die iterative Problemlösung und den Einsatz von Tools in mehreren Schritten erfordern. Damit ist es eine grundlegende Technik für moderne agentische KI-Systeme.
- Automatisierte Kundenservice-Agenten: In Unternehmen nutzen IT-Helpdesk-Agenten ReAct, um Benutzerprobleme zu lösen. Meldet ein Benutzer einen Netzwerkausfall, schlussfolgert der Agent, dass er den Serverstatus prüfen muss. Er führt eine Aktion aus, indem er eine Diagnose-API anpingt, wertet das Ergebnis aus und eskaliert das Ticket oder stellt anhand der abgerufenen Fakten eine Anleitung zur Fehlerbehebung bereit. Dadurch werden herkömmliche Pipelines für Retrieval-Augmented Generation (RAG) effizienter.
- Dynamische visuelle Analyse: Systeme für maschinelles Sehen nutzen ReAct für komplexe visuelle Frage-Antwort-Aufgaben. Ein für die Lagerverwaltung zuständiger Roboteragent könnte ein Regal betrachten, daraus schließen, dass er bestimmte Artikel zählen muss, ein Objekterkennungsmodell aufrufen und die zurückgegebenen Begrenzungsrahmen verwenden, um die Zählung abzuschließen. Diese Verbindung schließt die Lücke zwischen textbasiertem Schlussfolgern und räumlichem Verständnis.
ReAct mit maschinellem Sehen implementieren#
Für Entwickler, die Python verwenden, koordinieren ReAct-Agenten häufig Wahrnehmungsmodelle, um mit der physischen Welt zu interagieren. Der folgende konzeptionelle Code zeigt, wie eine ReAct-Schleife zum Schlussfolgern nahtlos ein Ultralytics YOLO26-Modell als externes Tool einsetzen kann, um eine Umgebung zu beobachten und darüber zu berichten.
from ultralytics import YOLO
def vision_tool(image_path: str) -> str:
"""Action tool for a ReAct agent to detect objects in an image."""
model = YOLO("yolo26n.pt") # Load highly efficient YOLO26 nano model
results = model(image_path)
# Format the observation for the LLM's reasoning loop
detected_classes = [model.names[int(c)] for c in results[0].boxes.cls]
return f"Observation: Found {len(detected_classes)} objects: {', '.join(detected_classes)}"
# Simulated ReAct agent executing an action
agent_observation = vision_tool("https://ultralytics.com/images/bus.jpg")
print(agent_observation)Mit der Ultralytics Platform, die umfassende Lösungen für die moderne KI-Bereitstellung bietet, lassen sich Datensätze und Experimente für diese Bildverarbeitungstools vollständig optimiert verwalten. Wer diese Agenten von Grund auf selbst entwickeln möchte, kann sich auch mit der grundlegenden Logik im offiziellen ReAct-Repository vertraut machen.
Verwandte Konzepte unterscheiden#
Um robuste multimodale Architekturen wie in aktueller wissenschaftlicher Forschung zur Ausrichtung zu entwerfen, musst du ReAct von verwandten Entwurfsmustern unterscheiden:
- Im Vergleich zu Chain-of-Thought-Prompting: Chain-of-Thought (CoT) regt ein Modell dazu an, schrittweise zu denken, stützt sich dabei aber ausschließlich auf statisches, internes Wissen. ReAct erweitert CoT um dynamische „Aktionen“, die während des Schlussfolgerungsprozesses neue externe Beobachtungen sammeln.
- Im Vergleich zu Prompt-Chaining: Beim Prompt-Chaining wird eine Abfolge separater LLM-Aufrufe fest vorgegeben, wobei die Ausgabe eines Schritts automatisch in den nächsten einfließt. ReAct ist ein autonomeres Paradigma: Ein einzelner Agent entscheidet anhand laufender Beobachtungen dynamisch, welche Tools oder aufeinanderfolgenden Aktionen er einsetzt, statt einem starren, verketteten Skript zu folgen.
Indem ReAct logisches Schlussfolgern mit der Ausführung spezialisierter externer Tools wie multimodalen Modellen verbindet, ermöglicht es die Entwicklung leistungsfähiger, vielseitig einsetzbarer KI-Systeme.









