WM—01 · WatermelonsonVom Wrapper zu koordinierten Agents2026

Die
LL(M)Leiter.

Vom Modellaufruf zu Systemen, die abrufen, handeln und delegieren.

Einfache API- und Tool-Demos

07Koordination
06State & Memory
05Der Harness
04MCP
03Tool Calling
02Kontext
01Der Wrapper
Ali Karpuzoglu · watermelonson.com→ weiter · ← zurück · n Notizen
EinführungVom Wrapper zu koordinierten Agents2023–2026

Ali Karpuzoglu

Senior AI Engineer & Technical Lead. Master in Autonomous Systems.

Head of Development bei einem KI-Bildungs-Startup, 2023–2026. Ein Teil meiner Arbeit: Agents bauen.

Heute: die Architektur hinter LLM-Anwendungen, von einem Request bis zu koordinierter Arbeit.

Einführung
Die ZeitleisteVom Wrapper zu koordinierten Agents2023–2026

Die Schichten überlappen.

WannEin nützlicher WegpunktWas es zeigt
Vor 2023RAG-Forschung (2020); ReAct (2022)Retrieval und Reasoning/Action-Loops gab es vor dem Wrapper-Boom.
2023Chat-Anwendungen; Function Calling; AutoGenModell-APIs werden zum üblichen Einstieg. Multi-Agent-Experimente laufen bereits.
Ende 2024MCP erscheintEin gemeinsames Protokoll für Tools und Kontext über Anwendungen hinweg.
2025–2026Diese Fähigkeiten kombiniertRuntime-Kontrolle, Kontext, wiederverwendbare Integrationen und Koordination greifen ineinander.
Die Zeitleiste
01 · Der WrapperText rein, Text rausAnfang 2023

Ein vertrauter Anfang

Anfrage →
Antwort.

Ein UI nimmt die Eingabe entgegen. Eure Anwendung ergänzt Anweisungen, ruft ein Modell auf und zeigt die Antwort. Alles Anwendungsspezifische muss im Request mitgeschickt werden.

Dieses Beispiel ist zustandslos. Die Anwendung muss die Historie mitliefern.

Die nächste Frage: Wie wird die Antwort nützlich für eure Dokumente, eure Nutzer und eure aktuellen Daten?

systemYou are a concise assistant.
userIn two sentences: what is an LLM agent?
Modell
assistantAn LLM agent is a system that uses a language model to reason, plan and act toward a goal…
01 · Der Wrapper
01 · Der WrapperLive · ein Aufruf, sonst nichts
01_call.py
02 · KontextVom Wrapper zu koordinierten Agents2023–2026

Gebt dem Modell die relevanten Informationen.

Frage → relevantes Material abrufen → Kontext zusammenstellen → Modell → Antwort

Anweisungen

Was die Anwendung vom Modell will.

Abgerufene Informationen

Relevante Passagen, Datensätze oder Suchergebnisse, mit Quellen.

Gespräch

Die Historie, die man braucht, um diesen Request zu verstehen.

Retrieval-Augmented Generation: Informationen abrufen und die Antwort darauf stützen.

02 · Kontext
02 · KontextVom Wrapper zu koordinierten Agents2023–2026

Wählt aus, was das Modell sieht.

BedarfAufgabe der Anwendung
Relevante BelegeNützliche Passagen auswählen; Quellenangaben behalten.
Platz zum ArbeitenBudget für Anweisungen, Historie, Tool-Ergebnisse und die Antwort.
Lange GesprächeHistorie auswählen, kürzen oder zusammenfassen; wichtige Fakten bewahren.
Kontinuität über SessionsNützlichen Zustand speichern und bei Bedarf abrufen.

Mehr Kontext kann helfen. Irrelevanter oder zu viel Kontext kann aber verdecken, was zählt.

02 · Kontext
03 · Tool CallingDas Modell fordert eine Aktion an2023 → · 02_tools.py

Function Calling · noch kein Framework

Das Modell fordert an. Die Runtime führt aus.

Modell
entscheidet
Tool-Request
now()
eure Seite des Zauns
ihrführt es aus
Ergebnis
Datum und Uhrzeit
nochmal

Wir fragen das Modell und geben ihm die Tool-Schemas neben den Messages mit.

Hat es kein Tool angefordert, hat es geantwortet, und wir sind fertig.

Sonst führen wir das Tool auf unserer Seite aus und geben das Ergebnis als Message zurück. Das Modell führt nie ein Tool aus, das ihr definiert habt.

Dann geht es in die nächste Runde. Das Modell wählt den nächsten Schritt anhand des Ergebnisses. Das ist ein minimaler Agent-Loop.

# this loop is the agent
for turn in range(1, 9):
    resp = client.chat.completions.create(
        model=args.be.model, messages=messages, tools=TOOLS,
    )
    msg = resp.choices[0].message
    messages.append(msg.model_dump(exclude_none=True))
    # no tool wanted → it answered
    if not msg.tool_calls:
        break
    # we execute, not the model
    for call in msg.tool_calls:
        result = dispatch(call.function.name,
                          call.function.arguments)
        messages.append({"role": "tool",
                         "tool_call_id": call.id,
                         "content": result})
03 · Der Loop
03 · Tool CallingLive · seht zu, wie das messages-Array wächst
02_tools.py
03 · Tool CallingWas es gekostet hat

Die Decke

Zu viel
Verkabelung.

Jeder externe Dienst braucht einen Adapter: Tool-Beschreibung, Argumente, Ausführung, Ergebnisse. Verschiedene Anwendungen wiederholen diese Arbeit womöglich.

Gemeinsame Bibliotheken helfen. Ein gemeinsames Protokoll lässt kompatible Anwendungen eine Integration über dieselbe Schnittstelle wiederverwenden. Genau da sitzt MCP.

03 · Was es gekostet hat
04 · MCPEine wiederverwendbare IntegrationsgrenzeNovember 2024 →

Model Context Protocol

Ihr zeigt auf einen Server, und die Tools erscheinen.

Der Host entdeckt Tool-Schemas über MCP und gibt ausgewählte Tools ans Modell. Der Loop aus Entscheidung, Aktion, Ergebnis bleibt gleich.

Der Server implementiert die Integration. Kompatible Anwendungen können sie wiederverwenden. MCP unterstützt auch Resources und Prompts.

mcp server lokal oder remote

nowCurrent local date and time. list_filesList files in the sandbox directory. read_fileRead a sandbox file by name. word_countCount words in a sandbox file. echoEcho text back. Filler tool. upperUppercase some text. Filler tool. reverseReverse some text. Filler tool. addAdd two numbers. Filler tool.
initialize() list_tools() zur Laufzeit

Tools des Loops 0

now list_files read_file word_count echo upper reverse add
Diese Demo lädt alle acht Schemas vorab
04 · MCP
04 · MCPLive · alle acht Tools, dann ein Filter
03_mcp.py · mcp_server.py
04 · MCPVom Wrapper zu koordinierten Agents2023–2026

APIs für LLMs?

Eine brauchbare Analogie. Genauer: MCP ist eine Standardschnittstelle, über die LLM-Anwendungen Tools und Kontext entdecken und nutzen, oft mit bestehenden APIs dahinter.

MCP liefertHost / Runtime entscheidet
Tool-Discovery und -AufrufWelche Tools in den Kontext des Modells kommen und welche Aufrufe erlaubt sind.
Resources und PromptsWann Daten oder Anweisungen hineinkommen.
Eine lokale oder Remote-VerbindungCredentials, Scopes, Isolation und Verbindungsregeln.

Tool-Suche und verzögertes Laden ersparen es, jedes Schema in jeden Request zu packen.

04 · MCP
05 · Der HarnessAgent ≠ größeres Modell

Das Modell entscheidet.
Der Harness führt Regie.

Nutzereingabe

KontextEingabe + Historie + Skills
ModellEntscheidet nächste Aktion
ToolsFühren freigegebene Aktion aus
Tool-ErgebnisseAns Gespräch anhängen

ProviderBindet das Modell an

Hooks + PermissionsPrüfen / erlauben / blocken

After-Tool-Hook

Nächster Aufruf

↑ Endantwort → Nutzer

SteeringNeue Vorgabe → Kontext

CallbacksEvents → Streaming-UI, Logs, Metriken
Harness-PolicyBudgets · Iterationslimits · Stop / Pause
PluginsBündeln Tools, Hooks & Konfiguration
SkillsLiefern Aufgabenanweisungen & Ressourcen
Ein Agent-Run · wiederholte Modellaufrufe
05 · BausteineVom Wrapper zu koordinierten Agents2023–2026

Wo die Begriffe hingehören.

BegriffRolle im System
AgentEin modellgesteuerter Loop, der mit Kontext und verfügbaren Aktionen eine Aufgabe verfolgt.
Harness / RuntimeFührt den Loop aus und verwaltet Ausführung, Zustand, Limits und Permissions.
Framework / SDKWiederverwendbarer Code zum Bauen von Agents, Runtimes und Workflows.
SkillAufgabenanweisungen und zugehörige Ressourcen, geladen wenn relevant.
PluginEin host-spezifisches Paket aus Erweiterungen: Tools, Skills oder Integrationen.
05 · Bausteine
05 · ZustandVom Wrapper zu koordinierten Agents2023–2026

Transkripte allein reichen nur so weit.

Arbeitskontext

Was dieser Modellaufruf sieht: Anweisungen, ausgewählte Historie, Ergebnisse.

Dauerhaftes Wissen

Informationen, die für später aufbewahrt und bei Bedarf abgerufen werden.

Ausführungszustand

Was angefordert wurde, was fertig ist und wo es weitergeht.

Die Anwendung entscheidet, was bleibt, was geteilt wird und was jeder Agent bekommt.

05 · Zustand
06 · Mehrere AgentsVom Wrapper zu koordinierten Agents2023–2026

Teilt die Arbeit auf.

Spezialisierung

Andere Anweisungen, Tools oder Zugriffe für andere Zuständigkeiten.

Getrennter Kontext

Jeder Spezialist bekommt nur das Material für seinen Auftrag.

Parallele Arbeit

Unabhängige Recherchen können gleichzeitig laufen.

Jeder Spezialist ist ein weiterer Agent-Loop. Mehrere Agents können dasselbe Modell nutzen - müssen aber nicht

06 · Mehrere Agents
06 · KoordinationVom Wrapper zu koordinierten Agents2023–2026

Wer wählt den nächsten Schritt?

MusterKontrolleTradeoff
Agents als ToolsEin Parent delegiert begrenzte Aufgaben und nutzt die Ergebnisse.Klare Verantwortung; Parent-Kontext und Synthese können zum Engpass werden.
Graph / WorkflowExplizite Abhängigkeiten, bedingte Verzweigungen, mögliche Schleifen.Klare Struktur; Routing und Zustand brauchen trotzdem sorgfältiges Design.
Handoffs / SwarmAgents wählen selbst, welcher Spezialist übernimmt.Flexibles Routing; wiederholte Handoffs verschwenden Arbeit und Budget.
06 · Koordination
06 · BeispielVom Wrapper zu koordinierten Agents2023–2026

Eine Rückerstattung, von Anfang bis Ende.

Parent-AgentAufgabe, Delegation, Synthese
↓ begrenzte Aufträge   ·   ↑ Befunde + Belege
Konto-AbfrageBestellhistorie + ErstattungsregelnMCP-Client → interne Systeme
LieferprüfungSendungsverfolgung + AusnahmenExterne Tools, nur lesend
Entscheiden & handelnBelege → Vorschlag → Freigabe → Erstattung
Runtime um jeden Loop: Kontext · Permissions · Zustand · Budgets · Events
06 · Beispiel
06 · BeispielVom Wrapper zu koordinierten Agents2023–2026

Folgt den Informationen und der Kontrolle.

SchrittWas bewegt sichWer kontrolliert es
1 · ZuweisenFrage, relevanter Kontext, erwartetes Ergebnis, erlaubte ToolsParent wählt Aufgaben; Runtime erzwingt Zugriffe.
2 · RecherchierenTool-Requests → Ausführung → BelegeJeder Spezialist fährt seinen eigenen Loop.
3 · ZurückgebenBefunde, Quellenangaben, Unsicherheit, BlockerSpezialist gibt ein Ergebnis an den Parent zurück.
4 · EntscheidenEin Vorschlag mit Belegen, und was er kosten würdeAbhängige Arbeit startet nach den Befunden.
5 · Handeln oder eskalierenDie Erstattung, oder ein Mensch, der sie freigibtRuntime sichert den einen folgenreichen Aufruf ab.
06 · Beispiel
06 · TradeoffsVom Wrapper zu koordinierten Agents2023–2026

Delegation kostet selbst Arbeit.

KostenDesign-Antwort
Wiederholter Kontext und ModellaufrufeBegrenzte Arbeit delegieren; nur Relevantes weitergeben.
Verlorene Details bei HandoffsExplizite Ergebnisformate, Belege und Artefakt-Referenzen nutzen.
Widersprüchliche Änderungen oder EntscheidungenVerantwortung festlegen; Schreibzugriffe isolieren; Änderungen abgleichen.
Schleifen, Fehler, AbbruchGemeinsame Budgets, Timeouts und klare Abschlussregeln erzwingen.

Gegen eine Single-Agent-Baseline vergleichen: Qualität, Laufzeit, Kosten, Fehlerrate.

06 · Tradeoffs
07 · Komplexität wählenVom Wrapper zu koordinierten Agents2023–2026

Evaluiert das System, das ihr betreiben werdet.

Ergebnis

Hat es die Aufgabe gelöst? Checks und eine klare Bewertungsrubrik nutzen.

Ausführung

Waren Aktionen erlaubt, Pflichtschritte erledigt, Fehler behandelt?

Kosten & Zuverlässigkeit

Wiederholte Runs, lange Sessions, Latenz und Gesamtverbrauch messen.

Runtime-Regeln günstig testen. Aufgabenerfolg mit dem Modell und der Konfiguration aus dem Deployment evaluieren.

07 · Komplexität wählen
07 · Komplexität wählenVom Wrapper zu koordinierten Agents2023–2026

Nutzt die Teile, die die Aufgabe braucht.

Form der AufgabeEin vernünftiger Startpunkt
Eine begrenzte TransformationEin Modellaufruf.
Eine Antwort auf Basis eurer DatenRetrieval plus Generierung.
Eine bekannte Abfolge von SchrittenEin expliziter Workflow.
Aktionen hängen davon ab, was gefunden wirdEin Agent-Loop mit eingegrenzten Tools.
Trennbare Arbeit oder getrennte ZuständigkeitenKoordinierte Agents, gemessen an einer einfacheren Baseline.
07 · Komplexität wählen
Das ganze BildVom Wrapper zu koordinierten Agents2023–2026

Was hat sich um das Modell herum verändert?

Request → Kontext → Modell → Aktion → Ergebnis → nächste Entscheidung

Verbindungen

Tools führen Aktionen aus. MCP standardisiert den Zugang zu Integrationen.

Ausführung

Der Harness steuert den Loop. Skills und Plugins liefern wiederverwendbare Fähigkeiten.

Koordination

Mehrere Loops tauschen Aufträge und Ergebnisse aus, unter einer Orchestrierungs-Policy.

Die Architektur wächst um die Arbeit herum, die sie erledigen soll.

Das ganze Bild
FragenVom Wrapper zu koordinierten Agents2023–2026

Von einer Antwort zu koordinierter Arbeit.

Was muss das Modell wissen? Was darf es tun? Wer entscheidet, was als Nächstes passiert?

Ali Karpuzoglu · watermelonson.com

Fragen

Die Demos in diesem Browser ausführen

Richtet die Demo-Buttons auf einen beliebigen OpenAI-kompatiblen Chat-Completions-Endpoint. Requests gehen direkt von dieser Seite an den Endpoint; der Key bleibt in diesem Tab. Der Browser-Port kann 01_call, 02_tools und 03_mcp; die anderen Sprossen spielen ihre Aufnahmen ab.