IntelliJ und JetBrains + Ollama: der lokale KI-Assistent in der eigenen IDE
IntelliJ (oder PyCharm, WebStorm, GoLand…) mit Ollama zu verbinden, bringt Ihnen einen Code-Assistenten nach Art von Copilot, der auf Ihrem Rechner läuft: Chat zu Ihrem Projekt, Codevervollständigung am Zeilenende, Refactoring – ohne dass eine einzige Zeile an einen Server eines Drittanbieters gesendet wird. Dieser Leitfaden hilft Ihnen, unter den mit Ollama kompatiblen Plugins auszuwählen, zeigt, wie Sie alles über einen „AI-Proxy“ verbinden, und erläutert, welche Code-Modelle Sie je nach Grafikkarte wählen sollten.
#Warum ein lokales LLM in Ihrer IDE?
Cloud-Assistenten (GitHub Copilot, JetBrains AI, Cursor) sind praktisch, senden aber den Kontext Ihres Codes – manchmal die gesamte Datei, manchmal das gesamte Repository – an entfernte Server. Bei Code, der einer Geheimhaltungsvereinbarung (NDA) unterliegt, bei proprietärer Software oder einfach aus Prinzip ist das ein Ausschlusskriterium. Ein lokales LLM, das an IntelliJ angebunden ist, löst das Problem an der Wurzel: Das Modell läuft auf Ihrer GPU, der Prompt und die Vervollständigung verlassen den Rechner niemals.
Das andere Argument sind die Kosten. Für ein Copilot- oder JetBrains-AI-Abonnement zahlen Sie Monat für Monat, auf unbestimmte Zeit. Sobald Ollama installiert und ein Code-Modell heruntergeladen ist, können Sie Code vervollständigen und chatten — ohne Kontingent, ohne Abrechnung pro Token, auch offline. Der Kompromiss liegt in der Qualität: Ein kleines lokales Modell erreicht nicht das Niveau eines führenden Cloud-Modells, aber Qwen 3.8 27B oder Devstral 24B kommen ihm bei der Codevervollständigung und beim alltäglichen Chat nahe.
- Datenschutz
- Der Code, die Prompts und die Antworten bleiben lokal. In der Cloud wird nichts protokolliert.
- Kein Abonnement
- Keine laufenden Kosten nach dem Download des Modells. Unbegrenzte Nutzung.
- Hors-ligne
- Funktioniert im Zug, in einem isolierten Netzwerk oder hinter einem Unternehmensproxy mit strengen Beschränkungen.
- Modellsteuerung
- Sie wählen die Größe und die Quantisierung und können das Modell je nach Aufgabe wechseln.
#Die JetBrains-Plugins, die mit Ollama sprechen
Dieser Guide führt Sie zum Modell. Das Kit führt Sie zum Copiloten, der in Ihrem Editor Code schreibt.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Das JetBrains-Ökosystem bietet keine durchgängige native Unterstützung für Ollama: Dafür wird ein Plugin aus dem Marketplace benötigt. Drei Optionen decken nahezu alle Anforderungen ab, jede mit einer anderen Stärke.
- ProxyAI (ehemals CodeGPT)
- Die umfassendste Lösung für den lokalen Einsatz. Chat, Inline-Vervollständigung, Bearbeitung einer Auswahl und ein integrierter Ollama-Konnektor. Das ist der im Titel erwähnte „AI-Proxy“: Er bildet die Brücke zwischen der IDE und dem Ollama-Daemon.
- Continue
- Open Source, über eine Konfigurationsdatei umfassend konfigurierbar. Chat, Autovervollständigung und Aktionen am Code, mit erstklassiger Unterstützung für Ollama als Provider. Ideal, wenn Sie die Einstellungen jedes Modells fein anpassen möchten.
- JetBrains AI Assistant
- Der offizielle Assistent von JetBrains. Seit 2025 lässt er sich für den Offline-Modus mit einem lokalen Modell über Ollama oder LM Studio verbinden. Praktisch, wenn Sie beim hauseigenen Tool bleiben möchten, aber weniger flexibel bei der lokalen Codevervollständigung.
#Voraussetzungen
Es wird vorausgesetzt, dass Ollama bereits installiert ist und funktioniert. Darüber hinaus benötigen Sie nur eine aktuelle JetBrains-IDE und mindestens ein bereits heruntergeladenes Code-Modell.
- Eine JetBrains-IDE ab Version 2024.1
- IntelliJ IDEA, PyCharm, WebStorm, GoLand, Rider, PhpStorm… Die oben genannten Plugins lassen sich in der gesamten Produktpalette über denselben Marketplace installieren.
- Ollama funktionsfähig
- Der Daemon ist installiert und unter http://localhost:11434 erreichbar. Testen Sie dies mit ollama list, bevor Sie irgendetwas konfigurieren.
- Ein Chat- und Code-Modell
- qwen3.5:9b ist ein guter, vielseitiger Ausgangspunkt (256k Kontext, Vision). Mit Q4_K_M passt das Modell in etwa 6,6 GB VRAM.
- Eine GPU wird empfohlen
- Die Vervollständigung muss in weniger als einer Sekunde antworten, um nützlich zu sein. Eine RTX 3060 mit 12 GB lässt ein 7B-Modell problemlos laufen; ohne GPU sollten Sie sich auf den Chat beschränken und auf Autovervollständigung verzichten.
#ProxyAI + Ollama konfigurieren
ProxyAI (ehemals CodeGPT) ist der kürzeste Weg zu einem vollständigen lokalen Assistenten in JetBrains. Die Ollama-Anbindung unterstützt Chat, das Bearbeiten ausgewählter Textstellen und die Codevervollständigung, ohne API-Schlüssel oder Konto.
- 01Plugin installierenSettings → Plugins → Marketplace, suchen Sie nach „ProxyAI“ (oder je nach Version „CodeGPT“) und installieren Sie das Plugin. Starten Sie die IDE neu, wenn Sie dazu aufgefordert werden.
- 02Ollama als Anbieter auswählenSettings → Tools → ProxyAI → Providers. Wählen Sie Ollama (Local) als Anbieter statt einer der Cloud-Optionen (OpenAI, Anthropic…).
- 03Die Server-URL überprüfenDas Feld Base URL muss auf http://localhost:11434 zeigen. Wenn Ollama auf einem anderen Rechner im Netzwerk läuft, ersetzen Sie localhost durch dessen IP-Adresse.
- 04Modell auswählenWählen Sie in der Modellliste das Modell aus, das Sie heruntergeladen haben (z. B. qwen3.5:9b). ProxyAI fragt Ollama ab, um die verfügbaren Modelle aufzulisten.
- 05Den Chat testenÖffnen Sie das ProxyAI-Panel (Symbol in der Seitenleiste) und stellen Sie eine Frage zu einer geöffneten Datei. Die Antwort muss lokal eintreffen, ohne Warnung vor einer externen Verbindung.
#Continue und der native AI Assistant
Wenn Sie lieber jedes Detail selbst einstellen, stellt Continue seine Konfiguration in einer Datei statt in Menüs bereit. Darin werden der Provider Ollama, das Chatmodell und – separat – das Modell für die Codevervollständigung ausdrücklich angegeben. Das erfordert mehr Text, ist aber wesentlich präziser, insbesondere wenn Sie der automatischen Vervollständigung ein kleines, schnelles Modell und dem Chat ein größeres zuweisen möchten.
Bei JetBrains AI Assistant ist das Vorgehen stärker vorgegeben: Aktivieren Sie in den Einstellungen des Assistenten die Nutzung lokaler Modelle und richten Sie die Verbindung zu Ollama ein. Das ist nützlich, wenn Sie bei einem einzigen Tool bleiben möchten, aber der native Assistent ist vor allem für die JetBrains-Cloud ausgelegt; seine lokale Codevervollständigung ist weniger ausgereift als die von ProxyAI oder Continue. Für einen ernsthaften, zu 100 % lokalen Einsatz empfehlen wir eher diese beiden.
#Welche Code-Modelle passen zu Ihrer VRAM-Kapazität?
Die Regel ist einfach: Je größer das Modell, desto besser sind seine Antworten, aber desto mehr VRAM verbraucht es und desto langsamer antwortet es. Die Modellfamilien Qwen 3.5 / Qwen 3.8 decken das gesamte Spektrum ab und gelten 2026 als Maßstab für lokale KI beim Programmieren; Devstral 24B (Spezialist für Programmieragenten) und Granite 4.2 sind gute Alternativen. Hier sind die Richtwerte für die Quantisierung Q4_K_M (der beste Kompromiss zwischen Größe und Qualität).
- Leichtes 3B-Modell — ~2 GB VRAM
- granite4.2:3b. Für schnelle Fehlerbehebung und einfache Fragen, sehr ressourcensparend. Läuft sogar auf einer kleinen GPU oder für nicht interaktive Aufgaben auf der CPU.
- Vielseitiges 9B-Modell — ~6,6 GB VRAM
- qwen3.5:9b. Der ausgewogene Mittelweg: solide Leistungen bei Chat, Bearbeitung und Refactoring, 256k Kontext und Bildverarbeitung. Geeignet für eine RTX 3060 mit 12 GB oder eine 4070 mit 12 GB.
- Komfortabel mit 12B — ~7,6 GB VRAM
- gemma4:12b. Deutlich besser beim logischen Schlussfolgern und bei Refactorings über mehrere Dateien hinweg, multimodal und unter der Apache-2.0-Lizenz. Läuft problemlos auf einer RTX 4080 mit 16 GB.
- High-End 27B — ~18 GB VRAM
- qwen3.8:27b. Für lokales Programmieren am nächsten am Niveau der Cloud-Modelle (262k Kontext, Vision). Benötigt eine RTX 4090 mit 24 GB oder einen Mac mit Apple Silicon und mindestens 32 GB vereinheitlichtem Speicher. Tipp: Stellen Sie den Reasoning-Modus auf „low“; standardmäßig neigt das Modell dazu, zu lange nachzudenken.
#Lokale Codevervollständigung: auf FIM achten
Die Codevervollständigung nach dem Vorbild von Copilot basiert auf „fill-in-the-middle“ (FIM): Das Modell muss mitten im Code ergänzen und dabei wissen, was VOR und NACH dem Cursor steht. Nicht alle Modelle unterstützen das. Instruct-Varianten sind für Chats trainiert, nicht für FIM — verwenden Sie für die automatische Codevervollständigung die speziell dafür konzipierten Base-Varianten.
- Basismodell, kein Instruct-Modell
- Wählen Sie für die Codevervollständigung qwen2.5-coder:7b-base, das auch 2026 die Referenz für FIM geblieben ist. Ein Instruct-Modell erzeugt zu wortreiche Vervollständigungen oder solche, die nicht dem vorgesehenen Format entsprechen.
- Geschwindigkeit geht vor
- Bei der Autovervollständigung ist Geschwindigkeit wichtiger als die Qualität im Detail. Ein darauf spezialisiertes Basismodell, das in weniger als einer halben Sekunde antwortet, ist nützlicher als ein großes Chat-Modell, das 2 Sekunden benötigt.
- GPU fast obligatorisch
- Ohne Hardwarebeschleunigung kommt die Autovervollständigung zu spät, um mit dem Tippen Schritt zu halten. Nutzen Sie die lokale KI dann nur für den Chat.
#Was lokale KI in der IDE noch nicht leistet
Lokale KI hat Fortschritte gemacht, doch gegenüber erstklassigen Cloud-Assistenten bestehen weiterhin Unterschiede. Es ist sinnvoll, diese zu kennen, um die eigenen Erwartungen darauf abzustimmen und Enttäuschungen zu vermeiden.
- Multi-Datei-Reasoning
- Große Repositories überschreiten das Kontextfenster lokaler Modelle. Das Modell sieht die Dateien, die Sie ihm geben, nicht Ihre gesamte Architektur. Copilot Workspace oder Cursor indexieren das gesamte Projekt; lokal ist das noch mit viel Handarbeit verbunden.
- Erweiterte Agent-Modi
- Befehle ausführen zu lassen, Tests zu starten und in einer Schleife zu iterieren (wie bei Cline/Cursor Agent) erfordert ein Modell, das Werkzeuge zuverlässig einsetzen kann. Kleine lokale Modelle scheitern daran häufig; Sie sollten ein spezialisiertes Coding-Modell anstreben (Devstral 24B, Qwen3-Coder 30B oder GLM 4.7 Flash) und Fehlschläge in Kauf nehmen.
- Die pure Qualität bei komplexem Code
- Bei anspruchsvollen algorithmischen Aufgaben oder neueren Frameworks, die in den Trainingsdaten wenig vertreten sind, bleibt ein lokales Modell mit 8 bis 12 Milliarden Parametern hinter einem Spitzenmodell aus der Cloud zurück.
- Die ausgereifte Produktintegration
- Automatische Erkennung der Programmiersprache, zahlreiche kontextbezogene Aktionen, Bearbeitung von PRs … die lokalen Werkzeuge holen auf, bleiben aber noch einen Schritt hinter dem ausgereiften Nutzungserlebnis kommerzieller Assistenten zurück.
In der Praxis ist die lokale Ausführung besonders gut bei der Codevervollständigung, beim Chat über eine Datei, bei der Erklärung von Code und beim gezielten Refactoring. Bei aufwendigen agentischen Aufgaben und der Analyse eines gesamten Repositorys behält die Cloud den Vorteil — daher lohnt es sich, beide Optionen beizubehalten und Anfragen je nach Vertraulichkeit des Codes entsprechend weiterzuleiten.
#Fehlerbehebung
- Das Plugin listet keine Modelle auf
- Das Plugin erreicht Ollama nicht. Prüfen Sie, ob der Daemon läuft (ollama list) und ob die URL http://localhost:11434 lautet. Wenn Ollama auf einem anderen Rechner läuft, starten Sie es mit OLLAMA_HOST=0.0.0.0 und verwenden Sie dessen IP-Adresse als Ziel.
- « Connection refused »
- Ollama wurde nicht gestartet, oder eine Firewall blockiert Port 11434. Testen Sie mit curl http://localhost:11434/api/tags auf demselben Rechner, auf dem die IDE läuft.
- Das Modell erscheint nicht in der Liste
- Der Tag stimmt nicht überein. Kopieren Sie den genauen Namen, der von ollama list zurückgegeben wird, einschließlich Tag (qwen3.5:9b und nicht qwen3.5).
- Sehr langsame Antworten
- Das Modell wird teilweise auf die CPU ausgelagert. Wechseln Sie zu einem kleineren Modell oder zu Q4_K_M und überprüfen Sie mit nvidia-smi, ob die GPU tatsächlich genutzt wird.
- Leere oder unsinnige Codevervollständigung
- Sie verwenden ein Instruct-Modell für FIM. Wechseln Sie zu einer -base-Variante (qwen2.5-coder:7b-base).
- Die IDE verlangsamt sich während der Generierung
- Zwei geladene Modelle lasten den VRAM vollständig aus. Verkleinern Sie eines der Modelle oder aktivieren Sie jeweils nur ein Plugin.
#Weiterführende Informationen
Der lokale Assistent in der IDE ist nur so gut wie der Daemon und die GPU, die ihn betreiben. Diese Anleitungen ergänzen die Einrichtung.
- Ollama installieren
- Die Grundlage: den Daemon installieren und starten, der Ihre Coding-Modelle auf Port 11434 bereitstellt.
- Kostenloser Copilot lokal: Cline, Tabby & CodeGeeX in VS Code
- Das Gegenstück für VS Code, um Ansätze und Plugins verschiedener Editoren zu vergleichen.
- Ollama in Claude Code und Cursor verwenden
- Um dieselben lokalen Modelle in anderen Assistenten zu integrieren und je nach Aufgabe zwischen lokalem und Cloud-Modus zu wählen.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.