Tabby: Lokale Code-Autovervollständigung installieren selbst gehostet
Cline und Aider bieten Chat und einen Agentenmodus, aber keine Inline-Autovervollständigung mit „grauem Text“, der während der Eingabe erscheint – das Markenzeichen von GitHub Copilot. Tabby schließt genau diese Lücke: Es ist ein selbst gehosteter Open-Source-Server zur Codevervollständigung (Apache 2.0), der in Docker auf Ihrer GPU läuft und Fill-In-the-Middle-Vorschläge direkt im Editor anbietet. Dieser Leitfaden zeigt Schritt für Schritt, wie Sie Tabby installieren, ein StarCoder- oder Qwen-Coder-Modell konfigurieren, den Token generieren und VS Code sowie JetBrains anbinden. Außerdem zeigt er, wie eine einzige GPU ein ganzes Team versorgen kann – ohne dass Ihr Code jemals Ihre Infrastruktur verlässt.
#Warum Tabby anstatt Cline
Tabby und Cline sind keine Konkurrenten: Sie ergänzen sich. Cline (und Aider) eignet sich hervorragend für dialogorientierte Chats und den Agentenmodus mit mehreren Dateien, aber keines der beiden Tools bietet eine zeilenweise Autovervollständigung während des Tippens. Tabby hingegen macht genau das – und macht es sehr gut. Die erfolgreiche Kombination im Jahr 2026: Cline zum Diskutieren und Refaktorieren, Tabby für den grau dargestellten Vorschlag, der während des Tippens erscheint.
- Grauer Inline-Text
- Der Vorschlag erscheint direkt nach dem Cursor in grauer Farbe. Drücken Sie Tab, um ihn zu akzeptieren, Escape, um ihn zu ignorieren. Genau wie die UX von Copilot.
- 100 % selbst gehostet
- Der Server läuft bei Ihnen (Docker). Kein Codeausschnitt wird an Dritte gesendet – ideal für NDAs und Code in regulierten Branchen.
- Multi-utilisateurs
- Im Gegensatz zu einer rein lokalen Erweiterung ist Tabby ein Server: Eine einzige GPU kann ein ganzes Team über das Netzwerk bedienen.
- Telemetrie deaktivierbar
- Tabby sendet standardmäßig anonyme Statistiken; eine Umgebungsvariable deaktiviert dies vollständig. Der von Ihnen eingegebene Quellcode wird niemals übermittelt.
#Voraussetzungen
Dieser Guide führt Sie zum Modell. Das Kit führt Sie zum Copiloten, der in Ihrem Editor Code schreibt.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
- Docker
- Tabby wird als Container bereitgestellt. Docker Desktop für Windows/macOS, Docker Engine für Linux.
- NVIDIA-GPU (empfohlen)
- Mit dem NVIDIA Container Toolkit für den Zugriff auf CUDA. Tabby läuft auch auf CPU, aber die Inline-Latenz wird unangenehm.
- ~6 GB VRAM
- Ausreichend für ein quantisiertes Vervollständigungsmodell mit 1–3 Milliarden Parametern. Mehr VRAM bedeutet ein größeres Modell oder mehr Entwickler, die es gleichzeitig nutzen können.
- Ein Editor
- VS Code oder eine JetBrains-IDE (IntelliJ, PyCharm, WebStorm usw.). Die Tabby-Erweiterung ist für beide verfügbar.
#Welches Completion-Modell?
Die Inline-Autovervollständigung unterliegt einer Einschränkung, die es beim Chat nicht gibt: der Latenz. Der Vorschlag muss innerhalb weniger Hundert Millisekunden erscheinen, sonst tippen Sie schneller, als er angezeigt wird. Deshalb bevorzugt man kompakte Fill-In-the-Middle-Modelle (FIM) in der -base-Variante statt der großen Instruct-Modelle für den Chat.
| VRAM | Vervollständigungsmodell | Hinweis |
|---|---|---|
| 4–6 GB | StarCoder2 3B | Reaktionsschnell, mehrsprachig, eine gute Standardwahl für Tabby. |
| 6–8 GB | Qwen2.5-Coder 1.5B / 3B (base) | FIM hervorragend, sehr schnell, FR/Python/TS. |
| 8–12 GB | Qwen2.5-Coder 7B (Basismodell) | DIE FIM-Referenz 2026 (4,7 GB): präzise Vorschläge, weiterhin geringe Latenz. |
| 12 GB+ | StarCoder2 7B / Qwen-Coder 7B | Damit mehrere Entwickler denselben Server gemeinsam nutzen können. |
#1. Tabby in Docker starten
Der Tabby-Server wird mit GPU-Zugriff, einem persistenten Volume für die Daten und einem ausgewählten Modell zur Vervollständigung gestartet. Über Port 8080 sind die Weboberfläche und die API erreichbar.
- 01Den Start überprüfenBeim ersten Start lädt Tabby das Modell herunter (das dauert einige Minuten). Verfolgen Sie die Logs mit docker logs -f tabby, bis die Meldung erscheint, dass der Server auf Port 8080 lauscht.
- 02Webinterface öffnenRufen Sie http://localhost:8080 auf. Beim ersten Zugriff werden Sie aufgefordert, ein Administratorkonto zu erstellen (E-Mail-Adresse + Passwort). Das erfolgt lokal: Diese Zugangsdaten bleiben in Ihrem Volume ~/.tabby.
- 03Die Codevervollständigung testenDie Registerkarte „Playground“ der Benutzeroberfläche ermöglicht es, zu prüfen, ob das Modell antwortet, noch bevor ein Editor angebunden wird.
#2. Den Zugriffstoken erstellen
Die Editoren authentifizieren sich mit einem Token beim Tabby-Server. So lässt sich im Team feststellen, wer sich verbindet, und ein Zugang widerrufen, ohne den gesamten Betrieb zu beeinträchtigen.
- 01In die Einstellungen gehenÖffnen Sie in der Weboberfläche (http://localhost:8080) den Bereich Konten/Sicherheit. Dort wird das Token des aktuellen Benutzers angezeigt.
- 02Token kopierenRufen Sie die Zeichenfolge ab (oft mit dem Präfix auth_). Die Erweiterungen für VS Code und JetBrains werden nach genau dieser Zeichenfolge fragen.
- 03Neu generieren, wenn nötigFalls der Token offengelegt wird oder ein Mitarbeiter ausscheidet, generieren Sie den Token über die Benutzeroberfläche neu: Der alte Token wird sofort ungültig.
#3. VS Code anbinden
- 01Die Erweiterung installierenExtensions (Ctrl+Shift+X) → nach „Tabby“ suchen (Herausgeber: TabbyML) → Install.
- 02Endpoint angebenBeim ersten Start fragt die Erweiterung nach der Server-URL. Geben Sie http://localhost:8080 (oder die IP-Adresse des gemeinsam genutzten Servers im Netzwerk) ein.
- 03Den Token einfügenGeben Sie das im vorherigen Schritt kopierte Zugriffstoken ein. Das Tabby-Symbol in der Statusleiste sollte grün werden (verbunden).
- 04CoderGeben Sie Code ein: Der ausgegraute Vorschlag erscheint hinter dem Cursor. Drücken Sie Tab, um ihn anzunehmen, oder tippen Sie weiter, um ihn zu ignorieren.
#4. JetBrains anbinden
Dieselbe Konfiguration funktioniert in der gesamten JetBrains-Produktpalette: IntelliJ IDEA, PyCharm, WebStorm, GoLand, Rider usw. Die Tabby-Erweiterung ist ein einziges Plugin, das mit der Plattform kompatibel ist.
- 01Plugin installierenSettings → Plugins → Marketplace → nach „Tabby“ suchen → Install, anschließend die IDE neu starten.
- 02Verbindung konfigurierenSettings → Tools → Tabby: Geben Sie den Endpunkt (http://localhost:8080) und das Zugriffstoken ein.
- 03PrüfenDer Tabby-Indikator in der Statusleiste bestätigt die Verbindung. Die Inline-Vorschläge erscheinen wie in VS Code.
#5. Tabby auf Ihre Ollama-Instanz ausrichten
Wenn Sie Ollama bereits für Cline oder Aider betreiben, müssen Sie keine zweite Inferenz-Engine laden: Tabby kann über das OpenAI-kompatible Protokoll ein Ollama-Backend nutzen. So verwenden Sie einen einzigen Modellserver gemeinsam für Autovervollständigung und Chat.
In Tabby wird das HTTP-Backend anstelle eines lokalen Modells angegeben. Die Konfiguration erfolgt in der Datei config.toml im Datenvolume (~/.tabby/config.toml), in der die Engine für die Codevervollständigung auf die Ollama-API ausgerichtet wird.
#6. GPU zwischen mehreren Entwicklern teilen
Das ist der entscheidende Vorteil von Tabby gegenüber einer rein lokalen Erweiterung: ein einziger Server, eine einzige GPU, mehrere Entwickler. Sie installieren Tabby auf einem Rechner mit GPU (einem dedizierten Arbeitsplatzrechner oder einem Team-Server), und jeder Entwickler richtet seinen Editor so ein, dass er sich mit dieser Netzwerkadresse verbindet.
- Im Netzwerk zugänglich machen
- Port 8080 muss von den Rechnern der Entwickler aus erreichbar sein. Intern genügt die lokale IP-Adresse des Servers (http://192.168.x.x:8080).
- Ein Token pro Dev
- Erstellen Sie in der Benutzeroberfläche für jeden Entwickler ein Konto/Token. So bleibt die Nachvollziehbarkeit erhalten, und Sie können einzelne Zugänge widerrufen.
- Die GPU dimensionieren
- Ein kompaktes Modell zur Codevervollständigung (1,5B–3B) bedient mehrere Entwickler parallel, ohne an seine Kapazitätsgrenze zu stoßen. Da die Vervollständigungen kurz sind, überschneiden sich die Anfragen nur selten.
- Reverse Proxy + HTTPS
- Für den Zugriff von außerhalb des LAN betreiben Sie Tabby hinter einem Reverse-Proxy (Caddy, Nginx) mit TLS. Machen Sie Port 8080 niemals ungeschützt über das Internet zugänglich.
#Leistungseinstellungen und Fehlerbehebung
- Zu hohe Latenz
- Wechseln Sie zu einem Modell eine Größenstufe darunter (3B → 1.5B), überprüfen Sie, ob --device cuda tatsächlich aktiv ist (kein CPU-Fallback), und begrenzen Sie die maximale Länge der Vorschläge.
- Keine Vorschläge
- Prüfen Sie das Statussymbol der Erweiterung (Token und Endpunkt korrekt) und ob der Container läuft (docker ps). Mit dem Web-Playground lässt sich eingrenzen, ob das Problem auf der Server- oder auf der Editorseite liegt.
- Themenfremde Vorschläge
- Fast immer liegt es an einem falschen FIM-prompt_template oder einer instruct-Variante statt -base. Wechseln Sie zurück zu einem Basismodell und zur passenden FIM-Vorlage.
- Indexierung des Repositoriums (RAG)
- Tabby kann Ihren Code indexieren, um stärker kontextbezogene Vorschläge zu liefern. Aktivieren Sie die Indexierung in der Oberfläche, wenn die GPU noch Reserven hat; deaktivieren Sie sie, wenn sich die Latenz verschlechtert.
- GPU-Speicher vollständig belegt
- Wenn mehrere Modelle parallel betrieben werden (Tabby + Cline über Ollama), quantisieren Sie den KV-Cache und überwachen Sie den VRAM mit nvidia-smi.
#Häufig gestellte Fragen
Ersetzt Tabby Cline oder Copilot?+
Ist eine GPU für Tabby notwendig?+
Wird mein Code irgendwohin gesendet?+
Kann ich mein bestehendes Ollama wiederverwenden?+
Wie viele Entwickler kann ein einziger Tabby-Server bedienen?+
#Fazit
Sie haben nun einen zu 100 % selbst gehosteten Server für die automatische Codevervollständigung: Tabby in Docker auf Ihrer GPU, ein StarCoder- oder Qwen-Coder-Modell mit Fill-In-the-Middle, ein Zugriffstoken und ausgegraute Vorschläge im Copilot-Stil sowohl in VS Code als auch in JetBrains – mit dem zusätzlichen Vorteil, dass Sie ein ganzes Team über eine einzige GPU versorgen können. Mit Cline für Chat und Agentenfunktionen ist die Lösung komplett, und Ihr Code verlässt nie Ihre Infrastruktur. Wenn Sie sich stundenlange Konfigurationsarbeit (FIM-Templates, Ollama-Konfigurationen, Modelle nach Rolle) sparen möchten, bietet der kostenpflichtige Leitfaden „Lokaler Code-Copilot“ ein schlüsselfertiges Paket aus Ollama + Cline + Aider, das sich für die Inline-Codevervollständigung um Tabby ergänzen lässt.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.