Einsteiger 11 Min.Andere Tools

GPT4All: Erste pas

Direkte Antwort

GPT4All ist eine kostenlose Desktop-Anwendung (MIT-Lizenz, von Nomic), die ein Sprachmodell auf Ihrem Computer ausführt, ohne dass eine GPU oder ein Konto erforderlich ist. Sie installieren die Anwendung, laden ein GGUF-Modell herunter und chatten. Die neueste Version, 3.10.0, stammt vom Februar 2025: Sie funktioniert, aber ihr Modellkatalog ist veraltet und LocalDocs bleibt eingeschränkt. Ein guter Einstieg auf einem Rechner mit bescheidener Ausstattung; ansonsten lohnt sich ein Vergleich mit Jan oder LM Studio.

GPT4All (häufig als „GPT for All“ eingegeben) ist eine der ältesten lokalen Chat-Anwendungen für ein breites Publikum. Dieser Leitfaden erklärt, was sie heute leistet, wie Sie sie installieren und ein erstes Modell laden, was LocalDocs und der lokale Server tatsächlich taugen und in welchen Fällen Sie besser eine andere Lösung wählen.

Von Mohamed Meguedmi·Aktualisierung 2026-09-30·Unter Windows, macOS und Linux getestet

#Was GPT4All ist und wie es 2026 darum steht

GPT4All wird von Nomic AI entwickelt. Das offizielle Repository beschreibt es als Tool, das Sprachmodelle unter Wahrung der Privatsphäre auf Desktop-Computern und Laptops ausführt, ohne API-Aufrufe und ohne eine GPU vorauszusetzen. Das Repository hat etwa 77.000 Sterne und steht unter der MIT-Lizenz. Die Anwendung basiert auf llama.cpp und kann Modelle im GGUF-Format laden.

Zunächst sollten Sie den aktuellen Stand des Projekts kennen. Die letzte veröffentlichte Version ist 3.10.0 vom 25. Februar 2025, also mehr als eineinhalb Jahre vor diesem Artikel. Die ursprüngliche Website gpt4all.io leitet inzwischen auf eine Seite von Nomic weiter, auf der dessen Plattform für Unternehmen im Mittelpunkt steht. Die Anwendung bleibt nutzbar, und nichts deutet darauf hin, dass sie nicht mehr funktioniert. Sie sollten jedoch weder neue Funktionen noch eine aktuelle Inferenz-Engine erwarten.

!
Praktische Konsequenz: Die Kompatibilität mit neueren Modellen ist nicht garantiert
GPT4All basiert auf einer llama.cpp-Engine, die auf dem Stand ihrer letzten Version eingefroren ist. Modelle, die seit Februar 2025 veröffentlicht wurden, können Architekturen verwenden, die diese Engine nicht kennt. Die Hugging-Face-Suche der Anwendung zeigt Ihnen neuere Modelle an, ohne zu garantieren, dass sie sich laden lassen: Testen Sie ein Modell immer, bevor Sie sich darauf verlassen, und bleiben Sie bei bewährten Modellfamilien (Llama 3, Mistral, Phi-3), wenn Sie Überraschungen vermeiden möchten.

#1. Installation

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Die Installationsprogramme finden Sie auf der Seite des offiziellen Repositorys nomic-ai/gpt4all (Windows, Windows ARM, macOS, Ubuntu). Laden Sie sie ausschließlich von dieser Quelle herunter: Die Seite, die unter der früheren Adresse gpt4all.io aufgerufen wird, ist nicht mehr die Website der Software. Die vom Repository angegebenen Voraussetzungen: für Windows und Linux ein Intel Core i3 der zweiten Generation, AMD Bulldozer oder besser; der Linux-Build ist ausschließlich für x86-64 verfügbar; für macOS Monterey 12.6 oder neuer, mit besseren Ergebnissen auf Apple-Silicon-Chips der M-Serie.

Installationsvoraussetzungen je nach System
SystemInstallerIm Repository angegebene Voraussetzungen
WindowsWindows-Installer (und ARM-Version)Intel Core i3 2. Generation, AMD Bulldozer oder besser; ARM: Snapdragon, SQ1, SQ2
macOSmacOS-InstallerMonterey 12.6 oder neuer; Apple Silicon empfohlen
LinuxUbuntu-InstallerNur x86-64-Prozessoren, keine ARM-Plattformen

#2. Erstes Modell

Beim ersten Start schlägt die Anwendung ein Standardmodell vor. Die Dokumentation empfiehlt, mit Llama 3 zu beginnen, das über die Schaltfläche zum Hinzufügen eines Modells heruntergeladen wird. Sie erläutert, dass GPT4All über eine llama.cpp-Engine auf Modelle von Hugging Face zugreift und dass die meisten die Dateiendung .gguf haben.

  1. 01
    Models öffnen
    Im linken Menü klicken Sie auf Models, dann auf + Add Model, um auf die Seite Explore Models zu gelangen.
  2. 02
    Ein Modell suchen
    Suchen Sie unter den online verfügbaren Modellen oder sortieren Sie die Ergebnisse nach Popularität, Downloads oder Datum über das Rädchen-Symbol.
  3. 03
    Herunterladen
    Klicken Sie auf Download. Die Datei wird auf Ihrem Laufwerk gespeichert; eine Registrierung ist nicht erforderlich.
  4. 04
    Laden und chatten
    Gehen Sie zu Chats, klicken Sie auf Load Default Model (Llama 3 oder das Modell, das Sie gerade heruntergeladen haben) und stellen Sie Ihre erste Frage.

Die folgende Tabelle übernimmt die Beispiele aus der offiziellen Dokumentation mit den Arbeitsspeicherangaben des Herausgebers. Die Spalte „Lizenz“ ist wichtig: GPT4All listet Modelle mit sehr unterschiedlichen Bedingungen auf, darunter eines unter einer nicht kommerziellen Lizenz.

Beispielmodelle aus der GPT4All-Dokumentation
ModellDateiBenötigter RAMGrößeLizenz
Llama 3 Instruct4,66 GB8 GB8 Milliarden, q4_0Meta Llama 3 Lizenz
Nous Hermes 2 Mistral DPO4,11 GB8 GB7 Milliarden, q4_0Apache 2.0
Phi-3 Mini Instruct2,18 GB4 GB4 Milliarden, q4_0MIT
Mini Orca (Small)1,98 GB4 GB3 Milliarden, q4_0CC-BY-NC-SA-4.0 (nichtkommerzielle Nutzung)

Wo befinden sich die Modelle? Der Downloadordner lässt sich in den Einstellungen festlegen und befindet sich standardmäßig unter AppData\Local\nomic.ai\GPT4All unter Windows, unter Library/Application Support/nomic.ai/GPT4All unter macOS und unter .local/share/nomic.ai/GPT4All unter Linux. Ein Modell mit 4 bis 5 GB belegt ebenso viel Speicherplatz auf dem Laufwerk: Wenn Ihr Systemlaufwerk klein ist, legen Sie diesen Ordner vor dem Herunterladen mehrerer Modelle auf ein zweites Laufwerk.

#GPT4All auf Französisch

Die Anwendung bietet Einstellungen für die Sprache und das Gebietsschema der Benutzeroberfläche. Bei den Antworten hängt alles vom Modell ab: Llama 3 und von Mistral abgeleitete Modelle verstehen und schreiben Französisch, allerdings mit unterschiedlicher Qualität. Verlassen Sie sich nicht auf eine englischsprachige Rangliste: Stellen Sie drei Fragen aus Ihrem Fachgebiet auf Französisch und beurteilen Sie die Antwort. Wenn Sie hauptsächlich Französisch verwenden, sind die Mistral- und Qwen-Modelle aus dem QuelLLM-Katalog bessere Kandidaten, sofern sie sich in der auf einem festen Versionsstand verbliebenen Engine laden lassen.

#Viel RAM beim CPU-Betrieb: Was das verändert

Ein Rechner mit 256 GB Arbeitsspeicher ohne Grafikkarte kann sehr große Modelle laden, aber die Generationsgeschwindigkeit hängt von der Speicherbandbreite ab, nicht von der Kapazität. Theoretische Größenordnung: Die Obergrenze in Tokens pro Sekunde ergibt sich aus der Bandbreite in GB/s geteilt durch die Größe der Modellgewichte in GB. Als rein rechnerisches Beispiel: 80 GB/s geteilt durch 40 GB Modellgewichte ergeben höchstens 2 Tokens pro Sekunde. Das ist keine Messung, sondern lediglich eine Obergrenze.

Die einzige Einstellung, die helfen kann, ist die Anzahl der CPU-Threads. In den erweiterten Einstellungen hat GPT4All sie standardmäßig auf 4 gesetzt; laut Dokumentation können mehr Threads die Antworten beschleunigen. Erhöhen Sie die Anzahl schrittweise und lassen Sie dabei einige Kerne für das System frei. Wenn Sie eine Grafikkarte haben, lässt sich das verwendete Gerät auf Auto, Metal, CPU oder GPU einstellen.

#3. Der Chat und die wichtigen Einstellungen

Die Oberfläche ist wie eine Messaging-App aufgebaut: die Unterhaltung in der Mitte, das Nachrichtenfeld unten und die Modelloptionen in den Einstellungen. Drei Standardwerte verdienen Aufmerksamkeit. Die Kontextlänge beträgt 2.048 Tokens, was für ein langes Dokument sehr kurz ist. Die Temperatur liegt bei 0,7. Die Anzahl der Schichten im Grafikspeicher ist auf 32 festgelegt und je nach Grafikkarte anzupassen.

→
Erhöhen Sie die Kontextlänge, bevor Sie einen langen Text einfügen
Bei 2.048 Tokens reicht eine Seite Text aus, um das Kontextfenster zu füllen. Erhöhen Sie den Wert in den Modelleinstellungen und behalten Sie dabei den Speicherverbrauch im Blick: Ein längerer Kontext verbraucht mehr RAM und verlangsamt die Generierung.

#4. LocalDocs: der integrierte RAG mit seinen Grenzen

Mit LocalDocs können Sie mit Ihren Dateien chatten, ohne eine Zeile Code zu schreiben. Sie erstellen eine Sammlung, indem Sie einen Ordner angeben; die Anwendung zerlegt Ihre Dateien in Textausschnitte und indexiert sie mit den Embedding-Modellen von Nomic, die auf Ihrem Rechner ausgeführt werden. In einem Chat aktivieren Sie die Sammlung. Das Modell erhält dann in seinem Prompt die Textausschnitte, die Ihrer Frage semantisch ähneln, und die Quellen werden unter der Antwort angezeigt.

  1. 01
    Sammlung erstellen
    Öffnen Sie LocalDocs, geben Sie der Sammlung einen Namen und wählen Sie den Ordner aus, danach klicken Sie auf Create Collection.
  2. 02
    Auf die Indexierung warten
    Der Fortschritt wird angezeigt; eine grüne Anzeige mit der Aufschrift Ready signalisiert den Abschluss. Sie können bereits die fertig indexierten Dateien abfragen.
  3. 03
    In einem Chat aktivieren
    Öffnen Sie LocalDocs über die Schaltfläche rechts oben im Chat und setzen Sie anschließend ein Häkchen bei der Sammlung.
  4. 04
    Quellen prüfen
    Klicken Sie unter der Antwort auf Sources, um zu sehen, welche Dateien verwendet wurden.

#Was LocalDocs nicht macht

Drei dokumentierte Einschränkungen erklären die Enttäuschungen. Erstens werden standardmäßig die Dateitypen .txt, .pdf, .md und .rst indexiert: Eine Word-Datei muss vorher konvertiert werden. Zweitens ist jeder Auszug standardmäßig 512 Zeichen lang, und die Anwendung fügt pro Anfrage höchstens drei davon in den Kontext ein: Das Modell sieht bei jeder Frage also nur etwa 1.500 Zeichen Ihrer Dokumente. Schließlich beantwortet dieser Ansatz eine gezielte Frage („Was steht in Klausel 4?“) gut, eignet sich aber schlecht für die Zusammenfassung einer ganzen Dokumentensammlung.

In den erweiterten Einstellungen lassen sich die Größe und die Anzahl der Auszüge erhöhen, allerdings mit dem folgenden Vorbehalt aus der Dokumentation: Das kann die Zuverlässigkeit der Antworten verbessern, verlangsamt aber die Generierung und beansprucht Kontext, der standardmäßig bereits auf 2.048 Tokens begrenzt ist. Wenn Sie mit einer echten Dokumentensammlung chatten möchten, ist ein Tool wie AnythingLLM oder Open WebUI besser geeignet.

#5. Der lokale OpenAI-kompatible Server

GPT4All verfügt über einen OpenAI-kompatiblen API-Server, der standardmäßig deaktiviert ist. Zum Aktivieren: Einstellungen, Anwendung, Abschnitt „Erweitert“, dann das Kontrollkästchen „Enable Local API Server“ aktivieren. Der Server lauscht auf Port 4891 ausschließlich auf localhost (127.0.0.1) und akzeptiert nur HTTP, nicht HTTPS. Die Basisadresse ist http://localhost:4891/v1.

Aufrufbeispiel aus der offiziellen Dokumentation
curl -X POST http://localhost:4891/v1/chat/completions -d '{
  "model": "Phi-3 Mini Instruct",
  "messages": [{"role":"user","content":"Who is Lionel Messi?"}],
  "max_tokens": 50,
  "temperature": 0.28
}'

Die verfügbaren Endpunkte sind /v1/models, /v1/models/nom-du-modèle, /v1/completions und /v1/chat/completions. Der Modellname in der Anfrage muss dem in der Anwendung angezeigten Namen entsprechen. Ein dokumentierter Tipp: LocalDocs lässt sich über die Benutzeroberfläche (nicht über die API) für den Server-Chat aktivieren, und die verwendeten Referenzen werden in der Antwort unter choices[0].references zurückgegeben.

#Vertraulichkeit: drei Einstellungen, die Sie kennen sollten

Standardmäßig bleibt alles auf Ihrem Gerät. Drei Optionen ändern dies, und Sie sollten wissen, wo sie zu finden sind. Die Option Datalake, die Ihre Interaktionen anonym mit der GPT4All-Community teilt, ist standardmäßig deaktiviert. Die Option „Use Nomic Embed API“, die LocalDocs-Sammlungen außerhalb des Geräts über die Nomic-API erstellt, ist standardmäßig deaktiviert und erfordert einen Schlüssel. Wenn Sie schließlich eine „Model API“ hinzufügen (einen Schlüssel eines entfernten Anbieters), werden Ihre Prompts an diesen Anbieter gesendet, wie die Dokumentation unmissverständlich klarstellt.

#Vorteile, Grenzen und Alternativen

GPT4All oder eine Alternative je nach Ihrer Situation
Ihre SituationIst GPT4All geeignet?Alternative, die Sie sich ansehen sollten
Rechner mit bescheidener Ausstattung, erster Versuch, ohne KommandozeileJa, das ist sein AnwendungsfallJan, wenn Sie ein aktiveres Projekt wünschen
Mit einigen Text- oder PDF-Dateien chattenJa für gezielte FragenAnythingLLM für eine echte Dokumentenbasis
Sehr aktuelle Modelle (2025 und später)Nicht garantiert, Inferenz-Engine auf eingefrorenem StandLM Studio oder Ollama, regelmäßig aktualisiert
Gemeinsamer Server für ein TeamNein: Nur localhost, HTTPOllama und Open WebUI
Stärken
Kurzer Zyklus: 'Herunterladen und chatten', kein Konto erforderlich, LocalDocs ohne Code, OpenAI-kompatibler Server, funktioniert ohne GPU.
Nachteile
Seit Februar 2025 unveränderte Engine, Standardkontext von 2.048 Tokens, LocalDocs auf drei Auszüge mit jeweils 512 Zeichen begrenzt, alternder Katalog.
Häufig gestellte Fragen
Ist GPT4All kostenlos und funktioniert es offline?+
Ja: Der Code steht unter der MIT-Lizenz, und die Anwendung erfordert weder ein Konto noch ein Abonnement. Sobald ein Modell heruntergeladen wurde, funktioniert sie ohne Internetverbindung. Achten Sie lediglich auf die Optionen, die Daten senden: Datalake, die Embedding-API von Nomic und Verbindungen zu Anbietern entfernter Modelle. Diese Optionen sind standardmäßig deaktiviert oder müssen ausdrücklich gewählt werden.
Wird GPT4All 2026 noch gepflegt?+
Die letzte veröffentlichte Version, 3.10.0, stammt vom Februar 2025, und die ursprüngliche Website leitet auf eine Unternehmensplattform von Nomic weiter. Die Anwendung funktioniert, allerdings sind keine neuen Funktionen angekündigt. Für eine langfristige Nutzung mit aktuellen Modellen wählen Sie lieber eine regelmäßig aktualisierte Anwendung wie LM Studio oder Jan.
Welche Modelle mit GPT4All nutzen?+
Beginnen Sie mit den Modellen, die die Dokumentation nennt: Llama 3 Instruct (4,66 GB, 8 GB RAM), Nous Hermes 2 Mistral DPO oder Phi-3 Mini für einen kleinen Rechner. Die Kompatibilität neuerer GGUF-Modelle ist nicht garantiert, da die Engine auf einem festen Entwicklungsstand bleibt. Prüfen Sie die Lizenz: Einige der aufgeführten Modelle sind ausschließlich für die nichtkommerzielle Nutzung vorgesehen.
Funktioniert GPT4All auf Französisch?+
Die Oberfläche bietet eine Spracheinstellung, und Llama 3 sowie von Mistral abgeleitete Modelle schreiben mit unterschiedlicher Qualität auf Französisch. Testen Sie drei Fragen aus Ihrem Fachgebiet, bevor Sie sich für ein Modell entscheiden. Wenn Französisch Priorität hat, vergleichen Sie diese mit Mistral- und Qwen-Modellen aus einem aktuellen Katalog.
Verändert eine Maschine mit 256 GB RAM etwas?+
Sie ermöglicht das Laden sehr großer Modelle, aber beim Betrieb auf der CPU hängt die Geschwindigkeit von der Speicherbandbreite ab, nicht von der Kapazität. Die theoretische Obergrenze ergibt sich aus dieser Bandbreite geteilt durch die Modellgröße. Erhöhen Sie in den erweiterten Einstellungen die Anzahl der Threads, die standardmäßig auf 4 eingestellt ist, und testen Sie mit einem mittelgroßen Modell.
Wie kann ich meine Dokumente mit GPT4All abfragen?+
Erstellen Sie eine LocalDocs-Sammlung, indem Sie einen Ordner mit .txt-, .pdf-, .md- oder .rst-Dateien auswählen, warten Sie auf die Statusanzeige Ready und aktivieren Sie die Sammlung anschließend in einem Chat. Das Modell erhält pro Frage höchstens drei Auszüge mit jeweils 512 Zeichen: Das eignet sich für präzise Fragen, nicht für die Zusammenfassung eines gesamten Dokumentenordners.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.