Mittelstufe 11 Min.IDE

IntelliJ und JetBrains + Ollama: der lokale KI-Assistent in der eigenen IDE

IntelliJ (oder PyCharm, WebStorm, GoLand…) mit Ollama zu verbinden, bringt Ihnen einen Code-Assistenten nach Art von Copilot, der auf Ihrem Rechner läuft: Chat zu Ihrem Projekt, Codevervollständigung am Zeilenende, Refactoring – ohne dass eine einzige Zeile an einen Server eines Drittanbieters gesendet wird. Dieser Leitfaden hilft Ihnen, unter den mit Ollama kompatiblen Plugins auszuwählen, zeigt, wie Sie alles über einen „AI-Proxy“ verbinden, und erläutert, welche Code-Modelle Sie je nach Grafikkarte wählen sollten.

Von Thomas P.·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum ein lokales LLM in Ihrer IDE?

Cloud-Assistenten (GitHub Copilot, JetBrains AI, Cursor) sind praktisch, senden aber den Kontext Ihres Codes – manchmal die gesamte Datei, manchmal das gesamte Repository – an entfernte Server. Bei Code, der einer Geheimhaltungsvereinbarung (NDA) unterliegt, bei proprietärer Software oder einfach aus Prinzip ist das ein Ausschlusskriterium. Ein lokales LLM, das an IntelliJ angebunden ist, löst das Problem an der Wurzel: Das Modell läuft auf Ihrer GPU, der Prompt und die Vervollständigung verlassen den Rechner niemals.

Das andere Argument sind die Kosten. Für ein Copilot- oder JetBrains-AI-Abonnement zahlen Sie Monat für Monat, auf unbestimmte Zeit. Sobald Ollama installiert und ein Code-Modell heruntergeladen ist, können Sie Code vervollständigen und chatten — ohne Kontingent, ohne Abrechnung pro Token, auch offline. Der Kompromiss liegt in der Qualität: Ein kleines lokales Modell erreicht nicht das Niveau eines führenden Cloud-Modells, aber Qwen 3.8 27B oder Devstral 24B kommen ihm bei der Codevervollständigung und beim alltäglichen Chat nahe.

Datenschutz
Der Code, die Prompts und die Antworten bleiben lokal. In der Cloud wird nichts protokolliert.
Kein Abonnement
Keine laufenden Kosten nach dem Download des Modells. Unbegrenzte Nutzung.
Hors-ligne
Funktioniert im Zug, in einem isolierten Netzwerk oder hinter einem Unternehmensproxy mit strengen Beschränkungen.
Modellsteuerung
Sie wählen die Größe und die Quantisierung und können das Modell je nach Aufgabe wechseln.

#Die JetBrains-Plugins, die mit Ollama sprechen

Das Kit „Copilote Local“

Dieser Guide führt Sie zum Modell. Das Kit führt Sie zum Copiloten, der in Ihrem Editor Code schreibt.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Das JetBrains-Ökosystem bietet keine durchgängige native Unterstützung für Ollama: Dafür wird ein Plugin aus dem Marketplace benötigt. Drei Optionen decken nahezu alle Anforderungen ab, jede mit einer anderen Stärke.

ProxyAI (ehemals CodeGPT)
Die umfassendste Lösung für den lokalen Einsatz. Chat, Inline-Vervollständigung, Bearbeitung einer Auswahl und ein integrierter Ollama-Konnektor. Das ist der im Titel erwähnte „AI-Proxy“: Er bildet die Brücke zwischen der IDE und dem Ollama-Daemon.
Continue
Open Source, über eine Konfigurationsdatei umfassend konfigurierbar. Chat, Autovervollständigung und Aktionen am Code, mit erstklassiger Unterstützung für Ollama als Provider. Ideal, wenn Sie die Einstellungen jedes Modells fein anpassen möchten.
JetBrains AI Assistant
Der offizielle Assistent von JetBrains. Seit 2025 lässt er sich für den Offline-Modus mit einem lokalen Modell über Ollama oder LM Studio verbinden. Praktisch, wenn Sie beim hauseigenen Tool bleiben möchten, aber weniger flexibel bei der lokalen Codevervollständigung.
i
Ein Daemon, mehrere Clients
Alle diese Plugins verbinden sich mit demselben Ollama-Endpunkt (http://localhost:11434). Sie können zwei parallel installieren – beispielsweise ProxyAI für den Chat und Continue für die Codevervollständigung –, solange beide denselben Server verwenden. Ollama lädt das Modell nur einmal in den VRAM.

#Voraussetzungen

Es wird vorausgesetzt, dass Ollama bereits installiert ist und funktioniert. Darüber hinaus benötigen Sie nur eine aktuelle JetBrains-IDE und mindestens ein bereits heruntergeladenes Code-Modell.

Eine JetBrains-IDE ab Version 2024.1
IntelliJ IDEA, PyCharm, WebStorm, GoLand, Rider, PhpStorm… Die oben genannten Plugins lassen sich in der gesamten Produktpalette über denselben Marketplace installieren.
Ollama funktionsfähig
Der Daemon ist installiert und unter http://localhost:11434 erreichbar. Testen Sie dies mit ollama list, bevor Sie irgendetwas konfigurieren.
Ein Chat- und Code-Modell
qwen3.5:9b ist ein guter, vielseitiger Ausgangspunkt (256k Kontext, Vision). Mit Q4_K_M passt das Modell in etwa 6,6 GB VRAM.
Eine GPU wird empfohlen
Die Vervollständigung muss in weniger als einer Sekunde antworten, um nützlich zu sein. Eine RTX 3060 mit 12 GB lässt ein 7B-Modell problemlos laufen; ohne GPU sollten Sie sich auf den Chat beschränken und auf Autovervollständigung verzichten.
Terminal — Ollama vorbereiten
# Vérifier que le daemon répond
ollama list

# Modèle de code polyvalent (chat + edit)
ollama pull qwen3.5:9b

# Tester l'API que les plugins vont utiliser
curl http://localhost:11434/api/tags

#ProxyAI + Ollama konfigurieren

ProxyAI (ehemals CodeGPT) ist der kürzeste Weg zu einem vollständigen lokalen Assistenten in JetBrains. Die Ollama-Anbindung unterstützt Chat, das Bearbeiten ausgewählter Textstellen und die Codevervollständigung, ohne API-Schlüssel oder Konto.

  1. 01
    Plugin installieren
    Settings → Plugins → Marketplace, suchen Sie nach „ProxyAI“ (oder je nach Version „CodeGPT“) und installieren Sie das Plugin. Starten Sie die IDE neu, wenn Sie dazu aufgefordert werden.
  2. 02
    Ollama als Anbieter auswählen
    Settings → Tools → ProxyAI → Providers. Wählen Sie Ollama (Local) als Anbieter statt einer der Cloud-Optionen (OpenAI, Anthropic…).
  3. 03
    Die Server-URL überprüfen
    Das Feld Base URL muss auf http://localhost:11434 zeigen. Wenn Ollama auf einem anderen Rechner im Netzwerk läuft, ersetzen Sie localhost durch dessen IP-Adresse.
  4. 04
    Modell auswählen
    Wählen Sie in der Modellliste das Modell aus, das Sie heruntergeladen haben (z. B. qwen3.5:9b). ProxyAI fragt Ollama ab, um die verfügbaren Modelle aufzulisten.
  5. 05
    Den Chat testen
    Öffnen Sie das ProxyAI-Panel (Symbol in der Seitenleiste) und stellen Sie eine Frage zu einer geöffneten Datei. Die Antwort muss lokal eintreffen, ohne Warnung vor einer externen Verbindung.
→
Kontext im Chat hinzufügen
Wählen Sie Code aus, bevor Sie den Chat öffnen, oder verwenden Sie den Befehl zum Hinzufügen einer Datei zum Kontext: Das Modell antwortet dann gezielt zu Ihrem konkreten Code statt ohne Bezug dazu. Kleine Modelle haben ein begrenztes Kontextfenster – fügen Sie nicht das gesamte Projekt auf einmal hinzu, sondern konzentrieren Sie sich auf die relevanten Dateien.

#Continue und der native AI Assistant

Wenn Sie lieber jedes Detail selbst einstellen, stellt Continue seine Konfiguration in einer Datei statt in Menüs bereit. Darin werden der Provider Ollama, das Chatmodell und – separat – das Modell für die Codevervollständigung ausdrücklich angegeben. Das erfordert mehr Text, ist aber wesentlich präziser, insbesondere wenn Sie der automatischen Vervollständigung ein kleines, schnelles Modell und dem Chat ein größeres zuweisen möchten.

Continue — config.json (Auszug)
{
  "models": [
    {
      "title": "Qwen 3.5 9B",
      "provider": "ollama",
      "model": "qwen3.5:9b",
      "apiBase": "http://localhost:11434"
    }
  ],
  "tabAutocompleteModel": {
    "title": "Autocomplete",
    "provider": "ollama",
    "model": "qwen2.5-coder:7b-base",
    "apiBase": "http://localhost:11434"
  }
}

Bei JetBrains AI Assistant ist das Vorgehen stärker vorgegeben: Aktivieren Sie in den Einstellungen des Assistenten die Nutzung lokaler Modelle und richten Sie die Verbindung zu Ollama ein. Das ist nützlich, wenn Sie bei einem einzigen Tool bleiben möchten, aber der native Assistent ist vor allem für die JetBrains-Cloud ausgelegt; seine lokale Codevervollständigung ist weniger ausgereift als die von ProxyAI oder Continue. Für einen ernsthaften, zu 100 % lokalen Einsatz empfehlen wir eher diese beiden.

#Welche Code-Modelle passen zu Ihrer VRAM-Kapazität?

Die Regel ist einfach: Je größer das Modell, desto besser sind seine Antworten, aber desto mehr VRAM verbraucht es und desto langsamer antwortet es. Die Modellfamilien Qwen 3.5 / Qwen 3.8 decken das gesamte Spektrum ab und gelten 2026 als Maßstab für lokale KI beim Programmieren; Devstral 24B (Spezialist für Programmieragenten) und Granite 4.2 sind gute Alternativen. Hier sind die Richtwerte für die Quantisierung Q4_K_M (der beste Kompromiss zwischen Größe und Qualität).

Leichtes 3B-Modell — ~2 GB VRAM
granite4.2:3b. Für schnelle Fehlerbehebung und einfache Fragen, sehr ressourcensparend. Läuft sogar auf einer kleinen GPU oder für nicht interaktive Aufgaben auf der CPU.
Vielseitiges 9B-Modell — ~6,6 GB VRAM
qwen3.5:9b. Der ausgewogene Mittelweg: solide Leistungen bei Chat, Bearbeitung und Refactoring, 256k Kontext und Bildverarbeitung. Geeignet für eine RTX 3060 mit 12 GB oder eine 4070 mit 12 GB.
Komfortabel mit 12B — ~7,6 GB VRAM
gemma4:12b. Deutlich besser beim logischen Schlussfolgern und bei Refactorings über mehrere Dateien hinweg, multimodal und unter der Apache-2.0-Lizenz. Läuft problemlos auf einer RTX 4080 mit 16 GB.
High-End 27B — ~18 GB VRAM
qwen3.8:27b. Für lokales Programmieren am nächsten am Niveau der Cloud-Modelle (262k Kontext, Vision). Benötigt eine RTX 4090 mit 24 GB oder einen Mac mit Apple Silicon und mindestens 32 GB vereinheitlichtem Speicher. Tipp: Stellen Sie den Reasoning-Modus auf „low“; standardmäßig neigt das Modell dazu, zu lange nachzudenken.
i
Zwei Modelle, zwei Rollen
Beim Chat ist Latenz tolerierbar, bei der Vervollständigung nicht. Deshalb trennt man häufig die Rollen: ein leistungsfähiges Modell (Gemma 4 12B oder Qwen 3.8 27B) für Chat und Bearbeitung und ein dediziertes Basismodell (qwen2.5-coder:7b-base) für die Autovervollständigung während des Tippens. Ollama hält beide im Speicher, solange sie in den VRAM passen.

#Lokale Codevervollständigung: auf FIM achten

Die Codevervollständigung nach dem Vorbild von Copilot basiert auf „fill-in-the-middle“ (FIM): Das Modell muss mitten im Code ergänzen und dabei wissen, was VOR und NACH dem Cursor steht. Nicht alle Modelle unterstützen das. Instruct-Varianten sind für Chats trainiert, nicht für FIM — verwenden Sie für die automatische Codevervollständigung die speziell dafür konzipierten Base-Varianten.

Terminal – Completion-Modelle (base = FIM)
# Modèle base de référence pour le FIM (autocomplétion inline)
ollama pull qwen2.5-coder:7b-base

# En Q4_K_M il tient dans ~4,7 Go et reste LA référence 2026 pour la complétion
ollama list
Basismodell, kein Instruct-Modell
Wählen Sie für die Codevervollständigung qwen2.5-coder:7b-base, das auch 2026 die Referenz für FIM geblieben ist. Ein Instruct-Modell erzeugt zu wortreiche Vervollständigungen oder solche, die nicht dem vorgesehenen Format entsprechen.
Geschwindigkeit geht vor
Bei der Autovervollständigung ist Geschwindigkeit wichtiger als die Qualität im Detail. Ein darauf spezialisiertes Basismodell, das in weniger als einer halben Sekunde antwortet, ist nützlicher als ein großes Chat-Modell, das 2 Sekunden benötigt.
GPU fast obligatorisch
Ohne Hardwarebeschleunigung kommt die Autovervollständigung zu spät, um mit dem Tippen Schritt zu halten. Nutzen Sie die lokale KI dann nur für den Chat.
!
Langsame oder inkonsistente Codevervollständigung?
Zwei typische Ursachen: Ein Instruct-Modell wird verwendet, obwohl ein Basismodell erforderlich ist (FIM schlägt fehl), oder ein Modell ist zu groß für die GPU und wird teilweise auf die CPU ausgelagert. Prüfen Sie den Modell-Tag (-base) und überwachen Sie den VRAM mit nvidia-smi, während Sie tippen.

#Was lokale KI in der IDE noch nicht leistet

Lokale KI hat Fortschritte gemacht, doch gegenüber erstklassigen Cloud-Assistenten bestehen weiterhin Unterschiede. Es ist sinnvoll, diese zu kennen, um die eigenen Erwartungen darauf abzustimmen und Enttäuschungen zu vermeiden.

Multi-Datei-Reasoning
Große Repositories überschreiten das Kontextfenster lokaler Modelle. Das Modell sieht die Dateien, die Sie ihm geben, nicht Ihre gesamte Architektur. Copilot Workspace oder Cursor indexieren das gesamte Projekt; lokal ist das noch mit viel Handarbeit verbunden.
Erweiterte Agent-Modi
Befehle ausführen zu lassen, Tests zu starten und in einer Schleife zu iterieren (wie bei Cline/Cursor Agent) erfordert ein Modell, das Werkzeuge zuverlässig einsetzen kann. Kleine lokale Modelle scheitern daran häufig; Sie sollten ein spezialisiertes Coding-Modell anstreben (Devstral 24B, Qwen3-Coder 30B oder GLM 4.7 Flash) und Fehlschläge in Kauf nehmen.
Die pure Qualität bei komplexem Code
Bei anspruchsvollen algorithmischen Aufgaben oder neueren Frameworks, die in den Trainingsdaten wenig vertreten sind, bleibt ein lokales Modell mit 8 bis 12 Milliarden Parametern hinter einem Spitzenmodell aus der Cloud zurück.
Die ausgereifte Produktintegration
Automatische Erkennung der Programmiersprache, zahlreiche kontextbezogene Aktionen, Bearbeitung von PRs … die lokalen Werkzeuge holen auf, bleiben aber noch einen Schritt hinter dem ausgereiften Nutzungserlebnis kommerzieller Assistenten zurück.

In der Praxis ist die lokale Ausführung besonders gut bei der Codevervollständigung, beim Chat über eine Datei, bei der Erklärung von Code und beim gezielten Refactoring. Bei aufwendigen agentischen Aufgaben und der Analyse eines gesamten Repositorys behält die Cloud den Vorteil — daher lohnt es sich, beide Optionen beizubehalten und Anfragen je nach Vertraulichkeit des Codes entsprechend weiterzuleiten.

#Fehlerbehebung

Das Plugin listet keine Modelle auf
Das Plugin erreicht Ollama nicht. Prüfen Sie, ob der Daemon läuft (ollama list) und ob die URL http://localhost:11434 lautet. Wenn Ollama auf einem anderen Rechner läuft, starten Sie es mit OLLAMA_HOST=0.0.0.0 und verwenden Sie dessen IP-Adresse als Ziel.
« Connection refused »
Ollama wurde nicht gestartet, oder eine Firewall blockiert Port 11434. Testen Sie mit curl http://localhost:11434/api/tags auf demselben Rechner, auf dem die IDE läuft.
Das Modell erscheint nicht in der Liste
Der Tag stimmt nicht überein. Kopieren Sie den genauen Namen, der von ollama list zurückgegeben wird, einschließlich Tag (qwen3.5:9b und nicht qwen3.5).
Sehr langsame Antworten
Das Modell wird teilweise auf die CPU ausgelagert. Wechseln Sie zu einem kleineren Modell oder zu Q4_K_M und überprüfen Sie mit nvidia-smi, ob die GPU tatsächlich genutzt wird.
Leere oder unsinnige Codevervollständigung
Sie verwenden ein Instruct-Modell für FIM. Wechseln Sie zu einer -base-Variante (qwen2.5-coder:7b-base).
Die IDE verlangsamt sich während der Generierung
Zwei geladene Modelle lasten den VRAM vollständig aus. Verkleinern Sie eines der Modelle oder aktivieren Sie jeweils nur ein Plugin.

#Weiterführende Informationen

Der lokale Assistent in der IDE ist nur so gut wie der Daemon und die GPU, die ihn betreiben. Diese Anleitungen ergänzen die Einrichtung.

Ollama installieren
Die Grundlage: den Daemon installieren und starten, der Ihre Coding-Modelle auf Port 11434 bereitstellt.
Kostenloser Copilot lokal: Cline, Tabby & CodeGeeX in VS Code
Das Gegenstück für VS Code, um Ansätze und Plugins verschiedener Editoren zu vergleichen.
Ollama in Claude Code und Cursor verwenden
Um dieselben lokalen Modelle in anderen Assistenten zu integrieren und je nach Aufgabe zwischen lokalem und Cloud-Modus zu wählen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.