GPT4All: Erste pas
GPT4All ist eine kostenlose Desktop-Anwendung (MIT-Lizenz, von Nomic), die ein Sprachmodell auf Ihrem Computer ausführt, ohne dass eine GPU oder ein Konto erforderlich ist. Sie installieren die Anwendung, laden ein GGUF-Modell herunter und chatten. Die neueste Version, 3.10.0, stammt vom Februar 2025: Sie funktioniert, aber ihr Modellkatalog ist veraltet und LocalDocs bleibt eingeschränkt. Ein guter Einstieg auf einem Rechner mit bescheidener Ausstattung; ansonsten lohnt sich ein Vergleich mit Jan oder LM Studio.
GPT4All (häufig als „GPT for All“ eingegeben) ist eine der ältesten lokalen Chat-Anwendungen für ein breites Publikum. Dieser Leitfaden erklärt, was sie heute leistet, wie Sie sie installieren und ein erstes Modell laden, was LocalDocs und der lokale Server tatsächlich taugen und in welchen Fällen Sie besser eine andere Lösung wählen.
#Was GPT4All ist und wie es 2026 darum steht
GPT4All wird von Nomic AI entwickelt. Das offizielle Repository beschreibt es als Tool, das Sprachmodelle unter Wahrung der Privatsphäre auf Desktop-Computern und Laptops ausführt, ohne API-Aufrufe und ohne eine GPU vorauszusetzen. Das Repository hat etwa 77.000 Sterne und steht unter der MIT-Lizenz. Die Anwendung basiert auf llama.cpp und kann Modelle im GGUF-Format laden.
Zunächst sollten Sie den aktuellen Stand des Projekts kennen. Die letzte veröffentlichte Version ist 3.10.0 vom 25. Februar 2025, also mehr als eineinhalb Jahre vor diesem Artikel. Die ursprüngliche Website gpt4all.io leitet inzwischen auf eine Seite von Nomic weiter, auf der dessen Plattform für Unternehmen im Mittelpunkt steht. Die Anwendung bleibt nutzbar, und nichts deutet darauf hin, dass sie nicht mehr funktioniert. Sie sollten jedoch weder neue Funktionen noch eine aktuelle Inferenz-Engine erwarten.
#1. Installation
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Die Installationsprogramme finden Sie auf der Seite des offiziellen Repositorys nomic-ai/gpt4all (Windows, Windows ARM, macOS, Ubuntu). Laden Sie sie ausschließlich von dieser Quelle herunter: Die Seite, die unter der früheren Adresse gpt4all.io aufgerufen wird, ist nicht mehr die Website der Software. Die vom Repository angegebenen Voraussetzungen: für Windows und Linux ein Intel Core i3 der zweiten Generation, AMD Bulldozer oder besser; der Linux-Build ist ausschließlich für x86-64 verfügbar; für macOS Monterey 12.6 oder neuer, mit besseren Ergebnissen auf Apple-Silicon-Chips der M-Serie.
| System | Installer | Im Repository angegebene Voraussetzungen |
|---|---|---|
| Windows | Windows-Installer (und ARM-Version) | Intel Core i3 2. Generation, AMD Bulldozer oder besser; ARM: Snapdragon, SQ1, SQ2 |
| macOS | macOS-Installer | Monterey 12.6 oder neuer; Apple Silicon empfohlen |
| Linux | Ubuntu-Installer | Nur x86-64-Prozessoren, keine ARM-Plattformen |
#2. Erstes Modell
Beim ersten Start schlägt die Anwendung ein Standardmodell vor. Die Dokumentation empfiehlt, mit Llama 3 zu beginnen, das über die Schaltfläche zum Hinzufügen eines Modells heruntergeladen wird. Sie erläutert, dass GPT4All über eine llama.cpp-Engine auf Modelle von Hugging Face zugreift und dass die meisten die Dateiendung .gguf haben.
- 01Models öffnenIm linken Menü klicken Sie auf Models, dann auf + Add Model, um auf die Seite Explore Models zu gelangen.
- 02Ein Modell suchenSuchen Sie unter den online verfügbaren Modellen oder sortieren Sie die Ergebnisse nach Popularität, Downloads oder Datum über das Rädchen-Symbol.
- 03HerunterladenKlicken Sie auf Download. Die Datei wird auf Ihrem Laufwerk gespeichert; eine Registrierung ist nicht erforderlich.
- 04Laden und chattenGehen Sie zu Chats, klicken Sie auf Load Default Model (Llama 3 oder das Modell, das Sie gerade heruntergeladen haben) und stellen Sie Ihre erste Frage.
Die folgende Tabelle übernimmt die Beispiele aus der offiziellen Dokumentation mit den Arbeitsspeicherangaben des Herausgebers. Die Spalte „Lizenz“ ist wichtig: GPT4All listet Modelle mit sehr unterschiedlichen Bedingungen auf, darunter eines unter einer nicht kommerziellen Lizenz.
| Modell | Datei | Benötigter RAM | Größe | Lizenz |
|---|---|---|---|---|
| Llama 3 Instruct | 4,66 GB | 8 GB | 8 Milliarden, q4_0 | Meta Llama 3 Lizenz |
| Nous Hermes 2 Mistral DPO | 4,11 GB | 8 GB | 7 Milliarden, q4_0 | Apache 2.0 |
| Phi-3 Mini Instruct | 2,18 GB | 4 GB | 4 Milliarden, q4_0 | MIT |
| Mini Orca (Small) | 1,98 GB | 4 GB | 3 Milliarden, q4_0 | CC-BY-NC-SA-4.0 (nichtkommerzielle Nutzung) |
Wo befinden sich die Modelle? Der Downloadordner lässt sich in den Einstellungen festlegen und befindet sich standardmäßig unter AppData\Local\nomic.ai\GPT4All unter Windows, unter Library/Application Support/nomic.ai/GPT4All unter macOS und unter .local/share/nomic.ai/GPT4All unter Linux. Ein Modell mit 4 bis 5 GB belegt ebenso viel Speicherplatz auf dem Laufwerk: Wenn Ihr Systemlaufwerk klein ist, legen Sie diesen Ordner vor dem Herunterladen mehrerer Modelle auf ein zweites Laufwerk.
#GPT4All auf Französisch
Die Anwendung bietet Einstellungen für die Sprache und das Gebietsschema der Benutzeroberfläche. Bei den Antworten hängt alles vom Modell ab: Llama 3 und von Mistral abgeleitete Modelle verstehen und schreiben Französisch, allerdings mit unterschiedlicher Qualität. Verlassen Sie sich nicht auf eine englischsprachige Rangliste: Stellen Sie drei Fragen aus Ihrem Fachgebiet auf Französisch und beurteilen Sie die Antwort. Wenn Sie hauptsächlich Französisch verwenden, sind die Mistral- und Qwen-Modelle aus dem QuelLLM-Katalog bessere Kandidaten, sofern sie sich in der auf einem festen Versionsstand verbliebenen Engine laden lassen.
#Viel RAM beim CPU-Betrieb: Was das verändert
Ein Rechner mit 256 GB Arbeitsspeicher ohne Grafikkarte kann sehr große Modelle laden, aber die Generationsgeschwindigkeit hängt von der Speicherbandbreite ab, nicht von der Kapazität. Theoretische Größenordnung: Die Obergrenze in Tokens pro Sekunde ergibt sich aus der Bandbreite in GB/s geteilt durch die Größe der Modellgewichte in GB. Als rein rechnerisches Beispiel: 80 GB/s geteilt durch 40 GB Modellgewichte ergeben höchstens 2 Tokens pro Sekunde. Das ist keine Messung, sondern lediglich eine Obergrenze.
Die einzige Einstellung, die helfen kann, ist die Anzahl der CPU-Threads. In den erweiterten Einstellungen hat GPT4All sie standardmäßig auf 4 gesetzt; laut Dokumentation können mehr Threads die Antworten beschleunigen. Erhöhen Sie die Anzahl schrittweise und lassen Sie dabei einige Kerne für das System frei. Wenn Sie eine Grafikkarte haben, lässt sich das verwendete Gerät auf Auto, Metal, CPU oder GPU einstellen.
#3. Der Chat und die wichtigen Einstellungen
Die Oberfläche ist wie eine Messaging-App aufgebaut: die Unterhaltung in der Mitte, das Nachrichtenfeld unten und die Modelloptionen in den Einstellungen. Drei Standardwerte verdienen Aufmerksamkeit. Die Kontextlänge beträgt 2.048 Tokens, was für ein langes Dokument sehr kurz ist. Die Temperatur liegt bei 0,7. Die Anzahl der Schichten im Grafikspeicher ist auf 32 festgelegt und je nach Grafikkarte anzupassen.
#4. LocalDocs: der integrierte RAG mit seinen Grenzen
Mit LocalDocs können Sie mit Ihren Dateien chatten, ohne eine Zeile Code zu schreiben. Sie erstellen eine Sammlung, indem Sie einen Ordner angeben; die Anwendung zerlegt Ihre Dateien in Textausschnitte und indexiert sie mit den Embedding-Modellen von Nomic, die auf Ihrem Rechner ausgeführt werden. In einem Chat aktivieren Sie die Sammlung. Das Modell erhält dann in seinem Prompt die Textausschnitte, die Ihrer Frage semantisch ähneln, und die Quellen werden unter der Antwort angezeigt.
- 01Sammlung erstellenÖffnen Sie LocalDocs, geben Sie der Sammlung einen Namen und wählen Sie den Ordner aus, danach klicken Sie auf Create Collection.
- 02Auf die Indexierung wartenDer Fortschritt wird angezeigt; eine grüne Anzeige mit der Aufschrift Ready signalisiert den Abschluss. Sie können bereits die fertig indexierten Dateien abfragen.
- 03In einem Chat aktivierenÖffnen Sie LocalDocs über die Schaltfläche rechts oben im Chat und setzen Sie anschließend ein Häkchen bei der Sammlung.
- 04Quellen prüfenKlicken Sie unter der Antwort auf Sources, um zu sehen, welche Dateien verwendet wurden.
#Was LocalDocs nicht macht
Drei dokumentierte Einschränkungen erklären die Enttäuschungen. Erstens werden standardmäßig die Dateitypen .txt, .pdf, .md und .rst indexiert: Eine Word-Datei muss vorher konvertiert werden. Zweitens ist jeder Auszug standardmäßig 512 Zeichen lang, und die Anwendung fügt pro Anfrage höchstens drei davon in den Kontext ein: Das Modell sieht bei jeder Frage also nur etwa 1.500 Zeichen Ihrer Dokumente. Schließlich beantwortet dieser Ansatz eine gezielte Frage („Was steht in Klausel 4?“) gut, eignet sich aber schlecht für die Zusammenfassung einer ganzen Dokumentensammlung.
In den erweiterten Einstellungen lassen sich die Größe und die Anzahl der Auszüge erhöhen, allerdings mit dem folgenden Vorbehalt aus der Dokumentation: Das kann die Zuverlässigkeit der Antworten verbessern, verlangsamt aber die Generierung und beansprucht Kontext, der standardmäßig bereits auf 2.048 Tokens begrenzt ist. Wenn Sie mit einer echten Dokumentensammlung chatten möchten, ist ein Tool wie AnythingLLM oder Open WebUI besser geeignet.
#5. Der lokale OpenAI-kompatible Server
GPT4All verfügt über einen OpenAI-kompatiblen API-Server, der standardmäßig deaktiviert ist. Zum Aktivieren: Einstellungen, Anwendung, Abschnitt „Erweitert“, dann das Kontrollkästchen „Enable Local API Server“ aktivieren. Der Server lauscht auf Port 4891 ausschließlich auf localhost (127.0.0.1) und akzeptiert nur HTTP, nicht HTTPS. Die Basisadresse ist http://localhost:4891/v1.
Die verfügbaren Endpunkte sind /v1/models, /v1/models/nom-du-modèle, /v1/completions und /v1/chat/completions. Der Modellname in der Anfrage muss dem in der Anwendung angezeigten Namen entsprechen. Ein dokumentierter Tipp: LocalDocs lässt sich über die Benutzeroberfläche (nicht über die API) für den Server-Chat aktivieren, und die verwendeten Referenzen werden in der Antwort unter choices[0].references zurückgegeben.
#Vertraulichkeit: drei Einstellungen, die Sie kennen sollten
Standardmäßig bleibt alles auf Ihrem Gerät. Drei Optionen ändern dies, und Sie sollten wissen, wo sie zu finden sind. Die Option Datalake, die Ihre Interaktionen anonym mit der GPT4All-Community teilt, ist standardmäßig deaktiviert. Die Option „Use Nomic Embed API“, die LocalDocs-Sammlungen außerhalb des Geräts über die Nomic-API erstellt, ist standardmäßig deaktiviert und erfordert einen Schlüssel. Wenn Sie schließlich eine „Model API“ hinzufügen (einen Schlüssel eines entfernten Anbieters), werden Ihre Prompts an diesen Anbieter gesendet, wie die Dokumentation unmissverständlich klarstellt.
#Vorteile, Grenzen und Alternativen
| Ihre Situation | Ist GPT4All geeignet? | Alternative, die Sie sich ansehen sollten |
|---|---|---|
| Rechner mit bescheidener Ausstattung, erster Versuch, ohne Kommandozeile | Ja, das ist sein Anwendungsfall | Jan, wenn Sie ein aktiveres Projekt wünschen |
| Mit einigen Text- oder PDF-Dateien chatten | Ja für gezielte Fragen | AnythingLLM für eine echte Dokumentenbasis |
| Sehr aktuelle Modelle (2025 und später) | Nicht garantiert, Inferenz-Engine auf eingefrorenem Stand | LM Studio oder Ollama, regelmäßig aktualisiert |
| Gemeinsamer Server für ein Team | Nein: Nur localhost, HTTP | Ollama und Open WebUI |
- Stärken
- Kurzer Zyklus: 'Herunterladen und chatten', kein Konto erforderlich, LocalDocs ohne Code, OpenAI-kompatibler Server, funktioniert ohne GPU.
- Nachteile
- Seit Februar 2025 unveränderte Engine, Standardkontext von 2.048 Tokens, LocalDocs auf drei Auszüge mit jeweils 512 Zeichen begrenzt, alternder Katalog.
- Ollama vs LM Studio vs Jan vs GPT4All
- Jan: Die Open-Source-Alternative zu ChatGPT
- Erste Schritte mit LM Studio
- AnythingLLM: Produktionsreifes RAG lokal
- Open WebUI mit Ollama: der komplette Guide
- Quelle: Repository GPT4All
- Quelle: GPT4All-Dokumentation, Modelle
- Quelle: GPT4All-Dokumentation, Einstellungen
Ist GPT4All kostenlos und funktioniert es offline?+
Wird GPT4All 2026 noch gepflegt?+
Welche Modelle mit GPT4All nutzen?+
Funktioniert GPT4All auf Französisch?+
Verändert eine Maschine mit 256 GB RAM etwas?+
Wie kann ich meine Dokumente mit GPT4All abfragen?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.