MCP: Was ist das? Das Model Context Protocol erklärt
MCP (Model Context Protocol) ist der offene Standard, den Anthropic im November 2024 veröffentlicht und im Dezember 2025 der Agentic AI Foundation (Linux Foundation) anvertraut hat. Er ermöglicht einer KI, externe Werkzeuge und Daten über einen Host, einen Client und einen Server zu nutzen – eine Architektur, die allen kompatiblen Anwendungen gemeinsam ist.
MCP, kurz für Model Context Protocol, ist ein offener Standard, der es einer KI-Anwendung ermöglicht, externe Werkzeuge und Daten zu nutzen: eine Datei zu lesen, eine Datenbank abzufragen oder im Web zu suchen. Anthropic veröffentlichte ihn im November 2024; OpenAI, Google und Microsoft übernahmen ihn 2025. Mit Stand vom 20. September 2026 ist dies der übliche Weg, einen Assistenten mit dem Rest Ihres Systems zu verbinden, auch mit einem Modell, das auf Ihrem eigenen Rechner läuft. Diese Seite erklärt das Prinzip, die Begriffe und die tatsächlichen Kosten von MCP auf lokaler Hardware.
#MCP in einem Absatz
Ein Sprachmodell allein kann nur Text erzeugen, der auf dem Gelernten und dem Inhalt des Prompts basiert. Um Ihren Kalender einzusehen, die Unternehmensdatenbank abzufragen oder ein Dokument zu öffnen, braucht es eine Brücke nach außen. Vor MCP baute jede Anwendung ihre eigenen Brücken: ein Plugin-Format pro Assistent, ein anderes pro Code-Editor, ein weiteres pro Agenten-Framework. MCP ersetzt all das durch eine einzige Spezifikation. Der Entwickler eines Tools schreibt einen MCP-Server, und jede kompatible Anwendung kann ihn nutzen. Der übliche Vergleich ist USB-C: ein Anschluss, viele Geräte.
Im Dezember 2025 übertrug Anthropic das Protokoll an die Agentic AI Foundation, die bei der Linux Foundation angesiedelt ist. MCP gehört daher nicht mehr einem einzelnen Anbieter, was zum Teil erklärt, warum es so schnell Verbreitung findet.
- Die offizielle Spezifikation des Model Context Protocol
- Die ursprüngliche Ankündigung von Anthropic (November 2024)
#Host, Client, Server: Wer macht was
Agenten, die auf Ihrem Rechner handeln: agentisches Cline, MCP, n8n + Ollama und lokale Automatisierungen.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
| Element | Was es ist | Beispiele |
|---|---|---|
| Host | Die KI-Anwendung, mit der Sie sprechen | Claude Desktop, ein Code-Editor-Assistent, Open WebUI, LM Studio |
| Client | Der Connector innerhalb des Hosts, einer pro verbundenem Server | Integriert im Host, unsichtbar für den Benutzer |
| Server | Ein kleines Programm, das Funktionen im MCP-Format bereitstellt | Dateisystem, GitHub, PostgreSQL, Web-Suche, Ihre interne API |
Die ausgetauschten Nachrichten verwenden JSON-RPC 2.0. Beim Start fragt jeder Client seinen Server, was er kann. Der Server antwortet mit einer Liste von Fähigkeiten, jeweils mit einem Namen, einer Beschreibung in Alltagssprache und einem JSON-Schema, das die zugehörigen Parameter beschreibt. Der Host übermittelt diese Beschreibungen an das Modell. Wenn das Modell ein Tool für nützlich hält, erzeugt es einen strukturierten Aufruf; der Client leitet ihn an den Server weiter, der ihn ausführt und das Ergebnis in die Unterhaltung zurückgibt.
#Was kann ein MCP-Server anbieten?
| Primitive | Gesteuert von | Rolle | Beispiel |
|---|---|---|---|
| Tools | Das Modell | Aktionen und Recherchen in Echtzeit | creer_ticket, executer_requete, chercher_web |
| Ressourcen (resources) | L'application | Nur lesbare Daten zum Laden in den Kontext | Eine Datei, ein Grundschema, eine Wiki-Seite |
| Prompts | L'utilisateur | Wiederverwendbare Anweisungsvorlagen | „Diese Pull Request prüfen“, mit Parametern |
In der Praxis bieten die meisten Server nur Tools an, und das ist es, was üblicherweise mit „MCP“ gemeint ist. Das Protokoll sieht auch Funktionen in der anderen Richtung vor: Sampling, bei dem ein Server den Host auffordert, mit dessen Modell Text generieren zu lassen, und Elicitation, bei der ein Server den Benutzer während der Ausführung nach einer fehlenden Information fragt, statt zu scheitern oder zu raten.
#Einführung und Governance, ein Jahr später
Der Umbruch vollzog sich innerhalb weniger Monate. Im März 2025 schrieb Sam Altman, dass die Nutzer MCP liebten und OpenAI die Unterstützung dafür in seine Produkte integriere; ChatGPT, das Agents SDK und die Responses API integrierten MCP anschließend. Im April 2025 bestätigte Demis Hassabis, dass Gemini und die Tools von Google DeepMind MCP unterstützen würden, und bezeichnete das Protokoll als aufkommenden Standard für das Zeitalter der Agenten. Microsoft folgte mit der Integration in Copilot Studio und anschließend mit der Ankündigung einer sicheren, nativen Unterstützung in Windows 11.
Am 9. Dezember 2025 gründete die Linux Foundation die Agentic AI Foundation (AAIF): Anthropic, Block und OpenAI sind die Gründungsmitglieder; AWS, Bloomberg, Cloudflare und Google sind ihr beigetreten. MCP, Googles A2A-Protokoll und ein Projekt von Block sind dort nebeneinander angesiedelt, unter derselben neutralen Governance wie Kubernetes oder PyTorch. Dieser Wechsel greift eine häufige Kritik aus dem Jahr 2025 auf: ein „offener“ Standard, bei dem dennoch ein einziger Anbieter die Kontrolle über die Entscheidungen behielt. Für Leser, die einen lokalen Stack aufbauen, hat das zwei konkrete Folgen: ein geringeres Risiko, dass eine einseitige Entscheidung von Anthropic einen bestehenden Server funktionsunfähig macht, und mehr aktive Mitwirkende, die die offiziellen Software Development Kits (SDKs) für Python, TypeScript, Java, C# und Rust pflegen, die von Community-Servern verwendet werden.
#Lokal oder remote: die beiden Transportwege
- stdio
- Der Host startet den Server als lokalen Unterprozess und kommuniziert mit ihm über die Standardeingabe und die Standardausgabe. Nichts läuft über das Netzwerk. Dies ist der Modus der meisten Desktop-Installationen und die naheliegende Wahl für eine private Konfiguration.
- Streamable HTTP
- Der Server läuft wie ein Webdienst, gegebenenfalls auf einem anderen Rechner, mit herkömmlicher Authentifizierung. Dieser Transport hat die frühere Kombination aus HTTP und SSE in den Überarbeitungen der Spezifikation von 2025 ersetzt.
#MCP, Funktionsaufruf, API: Die Unterschiede
| Was es ist | Wer definiert das | |
|---|---|---|
| REST-API | Die Art und Weise, wie ein Dienst seine Funktionen für Programme bereitstellt | Jeder Dienst auf seine Weise |
| Function calling | Die beim Training erworbene Fähigkeit, einen strukturierten Aufruf statt Text zu erzeugen | Jeder Modellanbieter, mit ähnlichen, aber unterschiedlichen Formaten |
| MCP | Eine standardisierte Methode, um Tools anwendungsübergreifend zu finden, zu beschreiben und aufzurufen | Eine einzige offene Spezifikation |
MCP ersetzt Function Calling nicht, sondern baut darauf auf. Das Modell muss weiterhin einen korrekten Tool-Aufruf erzeugen können. MCP standardisiert alles rund um diesen Schritt: wie Tools aufgelistet, beschrieben, autorisiert und ausgeführt werden. Ein MCP-Server ist sehr oft eine dünne Schicht über einer bestehenden API.
#MCP mit einem lokalen Modell: die tatsächlichen Kosten
MCP ist unabhängig vom Modell. Mit einem kompatiblen Host und einem lokalen Modell, das für Tool-Aufrufe trainiert wurde, läuft die gesamte Schleife auf Ihrem Rechner. Zwei Einschränkungen fallen dann deutlich stärker ins Gewicht als in der Cloud.
Erste Einschränkung: Toolbeschreibungen verbrauchen Kontext, und Kontext verbraucht VRAM. Jedes verbundene Tool fügt bei jedem Gesprächsschritt seinen Namen, seine Beschreibung und sein Schema in den Prompt ein. Rechnen Sie mit 100 bis 300 Tokens pro Tool und 10 bis 30 Tools pro verbreitetem Server. Schon mit einigen wenigen Servern werden mehrere Tausend Tokens verbraucht, bevor Sie ein Wort eingegeben haben. Bei einem Cloud-Anbieter ist das ein Posten auf der Rechnung. Auf Ihrer GPU belegt der KV-Cache dafür einen Teil des VRAM, dessen Kapazität nicht mitwächst.
| Konfiguration | Tokens für Definitionen | KV-Cache, Qwen 3 8B | KV-Cache, Qwen 3 32B |
|---|---|---|---|
| 1 Server, 8 Werkzeuge | ≈ 1 600 | ≈ 0,2 GB | ≈ 0,4 GB |
| 3 Server, 30 Tools | ≈ 6 000 | ≈ 0,9 GB | ≈ 1,6 GB |
| 6 Server, 80 Werkzeuge | ≈ 16 000 | ≈ 2,4 GB | ≈ 4,2 GB |
Auf einer Grafikkarte mit 16 GB, auf der ein 13 GB großes Modell läuft, machen 2,4 GB an Tool-Beschreibungen den Unterschied zwischen einer funktionierenden Sitzung und einem Speicherfehler. Die Faustregel für den lokalen Betrieb: Verbinden Sie nur die Server, die für die aktuelle Aufgabe nützlich sind, und bevorzugen Sie solche, die wenige gut beschriebene Tools bereitstellen, gegenüber solchen, die ihre gesamte API zugänglich machen.
Zweite Einschränkung: Kleine Modelle treffen schlechtere Entscheidungen. Das richtige Tool unter dreißig auszuwählen und dessen Schema korrekt auszufüllen, ist eine Fähigkeit, die von der Modellgröße und dem Training abhängt. Bei weniger als etwa 8 Milliarden Parametern treten Fehler bei der Toolauswahl und erfundene Parameter häufig auf.
- Tutorial: Verbinden von MCP-Servern mit Ollama
- MCP und Plugins in LM Studio
- Die besten lokalen LLM für Agenten und Tool-Aufrufe
- Kosten für den Kontext reduzieren: Quantisierung des KV-Caches
#Sicherheit: Was Tutorials vergessen
Ein MCP-Server ist ein Programm, das mit Ihren Berechtigungen läuft und Text verarbeitet, den ein Modell erzeugt hat. Drei Risiken sollten Sie verstehen, bevor Sie irgendetwas installieren.
- Prompt-Injektion
- Wenn ein Tool Inhalte von außen zurückgibt (eine Webseite, eine E-Mail, einen Kommentar), können diese Inhalte Anweisungen für das Modell enthalten. Ein Modell, das nicht vertrauenswürdigen Text liest und handeln kann, ist ein Angriffsziel.
- Tool-Poisoning
- Ein bösartiger Server kann in der Beschreibung seiner eigenen Werkzeuge Anweisungen verstecken, die das Modell liest und die der Benutzer normalerweise nie zu sehen bekommt.
- Zu weitreichende Berechtigungen
- Ein Dateiserver, der auf Ihr persönliches Verzeichnis verweist, gewährt dem Modell Zugriff auf dieses Verzeichnis.
Die Gegenmaßnahmen sind unspektakulär: Server aus bekannten Quellen installieren, den Umfang der Befugnisse jedes Servers so eng wie möglich begrenzen, für alles, was Daten schreibt oder sendet, weiterhin eine Bestätigung verlangen und vermeiden, innerhalb derselben Sitzung den Zugriff auf private Daten mit dem Lesen nicht vertrauenswürdiger Inhalte zu kombinieren.
#Brauchen Sie das?
| Ihre Situation | Fazit |
|---|---|
| Sie sprechen mit dem Modell und fügen den benötigten Inhalt ein | Nein. MCP fügt zusätzliche Komponenten hinzu, die Sie nicht verwenden werden. |
| Sie möchten, dass der Assistent Dateien liest, eine Datenbank abfragt oder im Web sucht | Ja. Das ist die übliche Methode im Jahr 2026. |
| Sie entwickeln ein internes Tool, das aus jeder KI-Anwendung heraus genutzt werden kann | Ja. Ein MCP-Server statt einer eigenen Integration für jede Anwendung. |
| Sie betreiben ein kleines Modell mit 8 GB VRAM | Mit Vorsicht: maximal ein oder zwei leichte Server. |
Ein konkretes Beispiel: Der QuelLLM-Katalog selbst ist über einen Open-Source-MCP-Server verfügbar. Ein damit verbundener Assistent beantwortet die Frage „Welches Modell passt auf eine Grafikkarte mit 16 GB?“ anhand aktueller Daten und nicht aus seinem Gedächtnis.
- Die öffentliche API und der MCP-Server von QuelLLM
- Das Kit für lokale Agenten: Einen Agenten mit Werkzeugen von Anfang bis Ende aufbauen
#FAQ
Was bedeutet MCP?+
Was ist ein MCP-Server?+
Ist MCP ausschließlich für Claude vorgesehen?+
Funktioniert MCP mit Ollama oder LM Studio?+
Ist MCP gefährlich?+
Wer ist heute für die Governance von MCP verantwortlich?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.