Einsteiger 10 Min.Oberflächen

Jan: die Open-Source-Alternative zu ChatGPT, 100% locale

Jan (jan.ai) ist eine freie Desktop-Anwendung unter der AGPL-Lizenz, die ChatGPT ähnelt, aber vollständig auf Ihrem Gerät läuft. Kein Konto, kein Cloud-Service, keine versteckte Telemetrie – nur eine Binärdatei zum Installieren und Open-Weight-Modelle zum Laden. Dieses Tutorial zum lokalen Einsatz von Jan AI behandelt die Installation, den ersten Chat, den OpenAI-kompatiblen API-Server und einen ehrlichen Vergleich mit LM Studio und Msty.

Von Mohamed Meguedmi·Aktualisierung 2026-08-27·Unter Windows, macOS und Linux getestet

#Warum Jan?

Drei Dinge heben Jan im überfüllten Markt der Desktop-LLM-Clients hervor. Erstens ist Jan tatsächlich Open Source: Code auf GitHub (menloresearch/jan), AGPL-3.0-Lizenz, reproduzierbarer Build. LM Studio und Msty sind kostenlos, aber ihr Quellcode ist nicht offen. Wenn Ihnen die Transparenz der Binärdatei wichtig ist, die ständig auf Ihrem Rechner läuft, ist Jan der einzige der drei, der dieses Kriterium erfüllt.

Zweitens ist die Offline-first-Philosophie radikal. Jan stellt beim Start keinerlei Netzwerkanfragen. Keine automatische Update-Prüfung, keine Telemetrie, kein verstecktes „Nach-Hause-Telefonieren“. Modelle werden nur auf Anfrage von Hugging Face heruntergeladen, Punkt. Sie können Jan auf einem vollständig vom Netzwerk isolierten Rechner verwenden, ohne dass dabei etwas nicht mehr funktioniert.

Drittens ist die Architektur sauber: Jan ist ein Electron-Frontend auf Basis von Cortex, einer separaten Inferenz-Engine (früher Nitro). Cortex verwendet llama.cpp als Backend und stellt eine REST-API bereit. Sie können den Cortex-Server also ohne das Jan-Frontend nutzen oder andere Clients mit Cortex verbinden. Das ist modularer als das monolithische LM Studio.

i
In einem Satz
Jan = eine ausgereifte Electron-Benutzeroberfläche + Cortex (llama.cpp-Engine) + ein Hugging-Face-Modellstore. Stellen Sie sich ein „ChatGPT für den Desktop“ vor, das Ihr WLAN nie verlässt.

#Voraussetzungen

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen
System
Windows 10/11 (x64), macOS 12+ (Intel oder Apple Silicon), Linux (deb, AppImage oder rpm).
RAM
8 GB als absolutes Minimum (2B–3B-Modelle), 16 GB für komfortable Nutzung (8–9B-Modelle in Q4), 32 GB oder mehr für 24B-Modelle und darüber hinaus.
Festplattenspeicher
Rechnen Sie mit 5 GB für Jan + Cortex und anschließend mit 2 bis 40 GB pro Modell, je nach Größe. Ein eigener Ordner auf einer SSD ist ideal.
GPU (optional, aber empfohlen)
NVIDIA mit CUDA für Windows/Linux, Metal automatisch auf Apple Silicon. Ohne GPU läuft Jan auf CPU – langsam, aber funktional für kleine Modelle.
→
Der richtige Richtwert für den VRAM-Bedarf
Q4_K_M ist die Standardquantisierung bei Jan. In diesem Format: 3B ≈ 2 GB VRAM · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB. Wenn das Modell mehr Speicher benötigt, als Ihr VRAM bietet, lagert Jan Teile davon in den RAM aus (starker Einbruch der Tokens pro Sekunde).

#1. Installation

Laden Sie das Installationsprogramm von der offiziellen Website herunter. Jan wird als 1-Klick-Installer präsentiert – keine Arbeit auf der Kommandozeile, keine Python-Abhängigkeiten zu verwalten.

Offizielle Website
https://jan.ai
!
Immer von jan.ai oder der offiziellen GitHub-Seite
Das offizielle Repository ist github.com/menloresearch/jan (ehemals janhq/jan). Laden Sie Jan nur von der offiziellen Website oder aus signierten GitHub-Releases herunter. Seien Sie vorsichtig bei vorkompilierten Forks, die auf Websites Dritter verbreitet werden.
  1. 01
    Installationsprogramm starten
    Doppelklicken Sie auf die .exe-Datei (Windows), die .dmg-Datei (macOS) oder die .AppImage-Datei (Linux). Machen Sie unter Linux die AppImage bei Bedarf mit chmod +x Jan-*.AppImage ausführbar.
  2. 02
    Erster Start
    Jan erstellt seinen Datenordner (~/jan unter macOS/Linux, %APPDATA%\Jan unter Windows). Dort werden die Modelle, die Unterhaltungen und die Konfiguration gespeichert. Denken Sie daran, wenn Sie den Ordner auf einer zusätzlichen SSD ablegen möchten.
  3. 03
    Cortex überprüfen
    Beim Start führt Jan den Cortex-Dienst im Hintergrund aus. Wenn sich ein Firewall-Fenster öffnet, erlauben Sie die lokale Verbindung (Cortex lauscht auf 127.0.0.1, nicht im Netzwerk).
  4. 04
    Onboarding
    Jan bietet Ihnen ein Modell für den Einstieg an (typischerweise ein kleines Qwen- oder Granite-Modell). Sie können es annehmen, um es innerhalb von 2 Minuten auszuprobieren, oder mit „skip“ überspringen, um selbst ein Modell im Hub auszuwählen.

#2. Erstes Modell

Jan integriert einen Modell-Hub, der auf Hugging Face verweist und vorbereitete und getestete GGUF-Versionen anbietet. Öffnen Sie den Tab "Hub" in der linken Seitenleiste, um den Katalog anzusehen.

Zum Einstieg drei solide Optionen für Französisch, je nach verfügbarem VRAM:

Kleine Konfiguration (8 GB RAM, keine GPU)
Granite 4.2 3B Q4_K_M (≈2,2 GB). Sehr ressourcensparend, ausreichend für Gespräche, das Zusammenfassen eines kurzen Textes und Brainstorming. Ordentlicher Durchsatz in Tokens pro Sekunde auf der CPU. Noch leichter: Qwen 3.5 2B (≈1,9 GB).
Standardkonfiguration (16 GB RAM, GPU 6–8 GB)
Qwen 3.5 9B Q4_K_M (≈6,6 GB). DIE Wahl für 8 GB im Jahr 2026: 256k Kontext, Vision, ein hervorragender Kompromiss für FR/EN bei den meisten alltäglichen Anwendungen.
Komfortkonfiguration (32 GB RAM, GPU 12 GB+)
Gemma 4 12B (multimodal, ≈7,6 GB) oder Mistral Small 24B in Q4_K_M (≈14 GB, gut auf Französisch). Deutlich bessere Fähigkeiten zum logischen Denken als Modelle mit 8–9 Milliarden Parametern.

Klicken Sie auf der Modellseite auf „Download“. Jan zeigt den Fortschritt an und speichert die GGUF-Datei in seinem Ordner data. Nach dem Download trägt die Schaltfläche die Beschriftung „Use“ – ein Klick genügt, und das Modell wird in den Speicher geladen.

→
Ein bereits vorhandenes GGUF-Modell importieren
Wenn Sie bereits lokale GGUF-Dateien haben (über huggingface-cli heruntergeladen oder aus einer Installation Ollama/LM Studio abgerufen), können Sie diese in Jan über Einstellungen → Meine Modelle → Import importieren. Jan dupliziert die Dateien nicht, er verweist auf die Datei.

#3. Erste Schritte

Die Benutzeroberfläche von Jan folgt dem vertrauten Aufbau von ChatGPT: links eine Seitenleiste mit den Gesprächen, in der Mitte der Chatbereich und rechts ein Bereich mit kontextbezogenen Einstellungen. Drei Dinge sollten Sie kennen, um produktiv zu arbeiten:

Threads
Jede Konversation ist ein eigenständiger "Thread" mit einem eigenen zugewiesenen Modell. Sie können mehrere Threads parallel öffnen (nützlich, um die Antwort eines 7B und eines 14B auf die gleiche Frage zu vergleichen).
Assistenten
Registerkarte Assistants: Erstellen Sie Personas mit System-Prompt, Temperatur und vorab zugewiesenem Modell. Praktisch, um einen „Code-Assistenten“ (Qwen3-Coder, Temperatur 0.2) und einen „Schreib-Assistenten“ (Mistral Small, Temperatur 0.8) getrennt zu nutzen.
Generierungsparameter
Rechtes Bedienfeld – Temperatur, top-p, top-k, maximale Tokenzahl, Häufigkeitsstrafe. Pro Thread anpassbar. Das Kontextfenster (n_ctx) wird auf Modellebene unter Settings → My Models eingestellt.
i
Gespeichnete Gespräche im Klartext
Standardmäßig speichert Jan Ihre Threads als lesbare JSON-Dateien im Ordner data. Keine Verschlüsselung. Wenn Sie sensible Daten verarbeiten, verschlüsseln Sie das Laufwerk (LUKS, FileVault, BitLocker) oder legen Sie den Jan-Ordner auf einem verschlüsselten Volume ab.

#4. Erweiterungen und Cortex

Jan hat eine erweiterungsbasierte Architektur. Die wichtigsten Bausteine sind selbst interne Erweiterungen (Inference Cortex Extension, Model Extension usw.), wodurch sie sich langfristig austauschen lassen. Aus Nutzersicht ist das Ökosystem für Erweiterungen von Drittanbietern noch jünger als das von VS Code, aber einige davon sind einen Blick wert:

Alternative Inferenz-Engines
Neben dem standardmäßig verwendeten Cortex/llama.cpp können Sie Erweiterungen aktivieren, die auf einen entfernten, OpenAI-kompatiblen Endpunkt zugreifen (Ollama, vLLM oder sogar OpenAI in der Cloud, wenn Sie bereit sind, auf einen rein lokalen Betrieb zu verzichten).
Cortex als eigenständige Anwendung
Cortex wird mit Jan geliefert, kann aber allein betrieben werden. cortex run qwen3.5:2b in der CLI startet einen Server auf dem Standardport ohne das Front-End Jan. Nützlich für Skripte oder die Bereitstellung auf einem headless-Server.
Konfigurierbarer Model Hub
Sie können benutzerdefinierte Modellquellen (ein privates HF-Repository, einen internen Mirror) hinzufügen, indem Sie die Hub-Einstellungen bearbeiten. Praktisch in Unternehmen, um intern feinabgestimmte Modelle zu verteilen.
Cortex über die CLI ohne Jan
# Lancer le serveur Cortex seul
cortex start

# Lister les modèles disponibles
cortex models list

# Charger et servir un modèle
cortex run qwen3.5:9b-gguf-q4-km

#5. API-Server-Modus

Der Servermodus von Jan stellt eine OpenAI-kompatible API im lokalen Netzwerk bereit. Damit wird Jan von einem einfachen Chat-Client zu einem echten Backend für Ihre Skripte, Ihre n8n-Automatisierungen oder einen VS-Code-Copiloten über Continue.dev.

  1. 01
    Server aktivieren
    Settings → Local API Server. Aktivieren Sie "Start Local API Server". Jan startet Cortex im Servermodus standardmäßig auf Port 1337 (anpassbar).
  2. 02
    Das bereitgestellte Modell auswählen
    Alle heruntergeladenen Modelle werden bereitgestellt. Jedes hat eine Kennung, die im Feld "model" der Anfragen verwendet werden kann (sichtbar in der Spalte ID unter My Models).
  3. 03
    Schneller Test mit curl
    Prüfen Sie mit einem Standardaufruf von /v1/chat/completions, ob der Server antwortet. Die Syntax ist identisch mit der von OpenAI.
Test der OpenAI-kompatiblen API
curl http://localhost:1337/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.5:9b-gguf-q4-km",
    "messages": [{"role": "user", "content": "Bonjour, qui es-tu ?"}],
    "temperature": 0.7
  }'
!
Der Server lauscht standardmäßig nur lokal
Jan bindet an 127.0.0.1 und ist daher aus dem Netzwerk nicht erreichbar. Um den Zugriff von anderen Rechnern aus zu ermöglichen (Team, Familie), ändern Sie die Bind-Adresse in den Einstellungen auf 0.0.0.0 – fügen Sie dann aber eine Authentifizierung hinzu (Reverse-Proxy mindestens mit Basic-Auth), da Jan keine native Authentifizierung hat.
Python-Client über das OpenAI-SDK
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1337/v1",
    api_key="jan-local",  # n'importe quelle string, Jan ne vérifie pas
)

response = client.chat.completions.create(
    model="qwen3.5:9b-gguf-q4-km",
    messages=[
        {"role": "system", "content": "Tu réponds toujours en français."},
        {"role": "user", "content": "Explique-moi ce qu'est un LLM en deux phrases."},
    ],
)
print(response.choices[0].message.content)

#Jan vs LM Studio vs Msty

Die drei Apps sind Desktop-Clients für lokale LLMs mit einer übersichtlichen Benutzeroberfläche und einem lokalen API-Server. Der Teufel steckt im Detail.

Jan
Open Source (AGPL), konsequent offline-first, modulare Architektur mit Cortex als separater Engine. Kleinerer Modellkatalog als bei LM Studio. Ideal für alle, die freie Software und Überprüfbarkeit wollen.
LM Studio
Closed Source, aber kostenlos. Der umfangreichste Hugging-Face-Katalog der drei (Live-Suche in HF). MCP-Unterstützung, natives MLX auf dem Mac, Multi-Token Prediction. Mehr Funktionen, aber undurchsichtig.
Msty
Closed Source, Freemium (kostenpflichtige Aurum-Version). Am besten für RAG: Dokumenten-Workspaces, split chat (zwei Modelle nebeneinander vergleichen), Knowledge Stacks. Schwächer im reinen Chat, stärker auf einen „persönlichen Agenten“ ausgerichtet.
→
So wählen Sie aus
Sie wollen überprüfbare Open-Source-Software und Einfachheit: Jan. Sie wollen die größtmögliche Auswahl an Modellen und erweiterten Einstellungen: LM Studio. Sie wollen RAG für Ihre Dokumente, ohne zu programmieren: Msty. Keines dieser Programme hindert Sie daran, auch die anderen zu nutzen — sie können sogar parallel laufen (mit unterschiedlichen Ports).

#Fehlerbehebung

Das Modell wird nicht geladen / OOM
Prüfen Sie den verfügbaren VRAM und RAM. Verringern Sie unter Settings → My Models → [Modell] → Edit Parameters den Wert von n_gpu_layers, um weniger Schichten auf die GPU auszulagern. Oder wechseln Sie zu einer Quantisierung mit geringerem Speicherbedarf (Q4_K_S statt Q4_K_M oder IQ3_M).
Sehr wenige Tokens pro Sekunde
Überprüfen Sie, ob die GPU tatsächlich genutzt wird: Öffnen Sie bei NVIDIA während einer Generierung nvidia-smi; dort muss zu sehen sein, dass Jan oder cortex-server VRAM belegt. Auf Apple Silicon ist Metal standardmäßig aktiviert, ohne dass Einstellungen nötig sind.
Cortex startet nicht (Windows)
Visual C++ Redistributable fehlt. Installieren Sie vc_redist x64 von Microsoft. Prüfen Sie außerdem, dass kein anderer Prozess Port 1337 belegt (ändern Sie bei Bedarf den Port in den Einstellungen).
Linux: AppImage startet nicht
Installieren Sie libfuse2 (sudo apt install libfuse2 unter Ubuntu 22.04+). Starten Sie zur Fehlersuche das AppImage aus einem Terminal, um die Fehlermeldungen zu sehen.
Modell-Download bleibt bei 99 % hängen
Beenden Sie Jan und starten Sie es neu. Jan setzt den Download fort. Wenn das Problem weiterhin besteht, laden Sie die GGUF-Datei manuell von Hugging Face herunter und importieren Sie sie über Settings → My Models → Import.
Antworten auf Englisch trotz eines französischen Prompts
Das Modell ist für einen konsistenten zweisprachigen Betrieb nicht leistungsfähig genug. Fügen Sie im Assistenten einen expliziten System-Prompt „Antworte immer auf Französisch“ hinzu, oder wechseln Sie zu einem Modell, das Französisch gut beherrscht (Mistral Small 24B, Qwen 3.5, Gemma 4).

#Weiterführende Informationen

Je nachdem, wohin Sie nun gehen wollen:

Jan mit seinen direkten Konkurrenten vergleichen
„Ollama vs LM Studio vs Jan vs GPT4All“ bietet eine detaillierte Vergleichstabelle, die Ihnen hilft, das passende Tool für Ihr Profil auszuwählen.
Verstehen Sie die Quantisierungen Q4/Q5/Q8
„Die Quantisierung (Q4, Q5, Q8, FP16) wählen“ erklärt die Kompromisse zwischen Qualität und Speicherbedarf – hilfreich, um im Hub von Jan eine fundierte Wahl zu treffen.
RAG mit Ihren Dokumenten nutzen
Jan verfügt über keine solide native RAG-Funktion. „Lokales RAG mit Ollama ohne Programmieren (Open WebUI, AnythingLLM)“ zeigt No-Code-Alternativen, die sich auch an den API-Server von Jan anbinden lassen.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.