Einsteiger 8 minOllama

Ollama Cloud: Preise, Bewertungen und Beschränkungen (2026)

Ollama Cloud bietet eine einfache Lösung: Die Ausführung von Modellen, die zu groß für Ihre lokale Maschine sind — mit 120B, 480B, 671B Parametern — auf den Servern von Ollama. Dies erfolgt mit der gleichen CLI wie die lokale Version. Das ist praktisch. Doch zwei grundlegende Dinge ändern sich: Ihre Prompts verlassen Ihren Rechner, und Sie zahlen nach der Nutzung. Dieser Leitfaden erklärt genau, was das bedeutet, wie viel es kostet und warum sich für die meisten Anwendungsfälle ein selbst gehosteter Ansatz bevorzugen lässt.

Von Mohamed Meguedmi·Aktualisierung 2026-09-05·Unter Windows, macOS und Linux getestet
i
Kurz gesagt
Ollama Cloud führt auf den Servern von Ollama Modelle aus, die für Ihren Rechner zu groß sind (120B, 480B, 671B), mit derselben CLI wie beim lokalen Betrieb. · Das Angebot reicht von einem monatlichen Pauschaltarif mit einem Stundenkontingent bis zur Abrechnung nach Inferenzdauer bei intensiver Nutzung – prüfen Sie die Preise auf ollama.com/cloud, sie ändern sich. · Anders als beim lokalen Betrieb verlassen Ihre Prompts Ihren Rechner und werden über Server geleitet, die überwiegend in den USA stehen. · Für regelmäßige Nutzung oder sensible Daten ist Self-Hosting weiterhin deutlich vorzuziehen.

#Was Ollama Cloud ist

Seit 2025 bietet Ollama ein kostenpflichtiges Angebot namens Ollama Cloud an. Damit lassen sich Modelle auf der GPU-Infrastruktur von Ollama aufrufen, und zwar mit genau denselben Befehlen wie bei einem lokalen Modell. Das Versprechen: riesige Modelle mit offenen Gewichten (Hunderte Milliarden Parameter) auszuführen, ohne einen Mac Studio Ultra oder einen H100-Cluster zu benötigen.

Konkret installieren Sie Ollama wie gewohnt, authentifizieren sich und laden ein mit "cloud" gekennzeichnetes Modell herunter (z. B. gpt-oss:120b-cloud). Die Inferenz erfolgt nicht mehr auf Ihrer GPU, sondern auf den Servern von Ollama — Ihr Rechner sendet nur die Prompt-Tokens und empfängt die Antwort-Tokens.

Beispiel für einen Cloud-Aufruf (allgemeine Syntax)
# Authentification (une seule fois)
ollama signin

# Lancer un modèle hébergé
ollama run gpt-oss:120b-cloud
i
Das ist keine „lokale Cloud“
Ollama Cloud ist kein hybrider Modus, der einen Teil des Modells bei Ihnen ausführt. Die Inferenz erfolgt vollständig auf entfernten Servern: Ihre Prompts werden über das Internet gesendet, wie bei der OpenAI- oder Anthropic-API. Die einzige „lokale“ Komponente ist die CLI.

#Welche Modelle laufen in der Cloud?

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

Der Cloud-Katalog zielt genau auf Modelle ab, die sich lokal nur schlecht ausführen lassen. Er entwickelt sich weiter, aber das Prinzip bleibt gleich: Open-Weight- oder offene Modelle, die sehr groß sind, oder multimodale Modelle mit hohem VRAM-Bedarf.

Modelle mit 100 Milliarden Parametern oder mehr
Modelle wie gpt-oss:120b, qwen3-coder:480b, kimi-k2 — sie benötigen in Q4 60 bis 250 GB VRAM, was eine einzelne Workstation nicht leisten kann.
MoE-Frontier-Modelle
DeepSeek V3/V4, Llama 4 Maverick: die vollständigen Versionen, nicht die 7B/32B-Distillationen, die lokal installiert werden.
Ressourcenintensive Spezialmodelle
Riesige Coding-Modelle, Reasoning-Modelle („thinking“) mit langem Kontext, Vision-Modelle für hohe Auflösungen.

Die „normalen“ Modelle (Mistral 7B, Llama 3.1 8B, Qwen 14B, Phi-4 usw.) bleiben für den lokalen Betrieb empfehlenswert: Sie passen auf eine RTX 3060 mit 12 GB oder ein MacBook Air, und es bringt keinen Vorteil, sie extern zu betreiben.

#Preise und Grenzen

Ollama Cloud positioniert sich zwischen einem monatlichen Pauschalabonnement (mit einem Kontingent an Anfragen pro Stunde) und einem verbrauchsabhängigen Abrechnungsmodell für intensive Nutzung. Die genauen Preise ändern sich – prüfen Sie sie auf ollama.com/cloud, bevor Sie sich festlegen –, aber einige Konstanten verdienen Beachtung.

Stundenquoten
Die Basistarife begrenzen die Anzahl der Anfragen pro Stunde oder pro Tag. Für die Nutzung im Chat durch einen Menschen reichen diese Limits bequem aus; ein Skript, das 10.000 Dokumente durchläuft, erreicht sie jedoch schnell.
Abrechnung nach Inferenzdauer
Sehr große Modelle werden manchmal nach der verbrauchten GPU-Zeit abgerechnet. Eine Anfrage mit langem Kontext (32k Tokens, tiefgehendes Schlussfolgern) kostet zwangsläufig mehr als ein „bonjour“.
Standardmäßig wird kein Preis pro Token angezeigt
Anders als bei OpenAI oder Anthropic wird die API-Nutzung bei Ollama Cloud nicht durchgehend pro Token abgerechnet. Dadurch lässt sich das Budget weniger genau planen.
Kein SLA für Privatkunden
Das Angebot ist noch jung. Zum Zeitpunkt, an dem diese Zeilen geschrieben werden, gibt es keine Verfügbarkeitsgarantie, die mit denen der großen Cloud-Anbieter vergleichbar wäre.
!
Die „fast kostenlos“-Falle
Ein kostenloses Kontingent oder ein günstiger Einstiegsplan verleitet dazu, alles über die Cloud laufen zu lassen. Sobald Sie jedoch Prozesse automatisieren (Batch-Verarbeitung, ein Agent in einer Schleife, RAG über 100 000 Chunks), steigen die Kosten schnell, und die Netzwerklatenz kommt bei jedem Aufruf hinzu.

#Vertraulichkeit: Was sich wirklich ändert

Hier wird der Unterschied zum Selbstbetrieb strukturell und ist nicht bloß eine Randerscheinung. Wenn Sie Ollama lokal nutzen, verlassen Ihre Prompts niemals den Port 11434 auf localhost — das lässt sich an der Firewall überprüfen. In der Cloud werden sie über das Internet übertragen und auf der Infrastruktur eines Drittanbieters verarbeitet.

Ihre Prompts verlassen Ihren Kontrollbereich
Alle übermittelten Daten – Vertragsauszüge, proprietärer Quellcode, Patientenakten, E-Mails – verlassen Ihren Rechner. Für eine Anwaltskanzlei, einen Arzt, eine Personalabteilung oder ein Forschungs- und Entwicklungslabor ist das ein Ausschlusskriterium.
Richtlinie zur Datenaufbewahrung
Ollama gibt an, seine Modelle nicht mit Ihren Prompts zu trainieren. Die Aufbewahrung für Debugging, Missbrauchserkennung oder Protokollierung variiert jedoch je nach Tarif. Lesen Sie die Nutzungsbedingungen, bevor Sie sensible Daten senden.
DSGVO und Hosting
Die Server von Ollama Cloud befinden sich überwiegend in den USA. Bei europäischen personenbezogenen Daten wirft das Fragen zur Übermittlung in Länder außerhalb der EU auf, die durch Selbsthosting auf einen Schlag entfallen.
Kein Infrastruktur-Audit möglich
Lokal können Sie den Port 11434 mit tcpdump überwachen und nachweisen, dass keine Daten nach außen gesendet werden. Bei einem Cloud-Dienst müssen Sie dem Anbieter vertrauen – es gibt keine technische Möglichkeit zu überprüfen, was protokolliert wird.
→
Der Test mit tcpdump
Bei einer selbst gehosteten Ollama-Instanz starten Sie `sudo tcpdump -i any port 443`, während Sie das Modell verwenden. Es dürfen keine ausgehenden Pakete erscheinen. Bei Ollama Cloud sehen Sie Datenverkehr zu den Servern von ollama.com. Der Nachweis der Vertraulichkeit ist binär und beobachtbar.

#Alternativen zum Selbsthosten für jedes Cloud-Modell

Für fast alle in der Cloud angebotenen Modelle gibt es eine lokale Alternative, die entweder gleichwertig (kleineres Modell derselben Familie) oder akzeptabel (anderes vergleichbares Open-Weight-Modell) ist. Hier sind die nützlichen Zuordnungen.

gpt-oss:120b-cloud → llama3.1:8b oder qwen2.5:14b lokal
Für 90 % der Chat-Anwendungen reicht ein 8B–14B-Modell in Q4 auf einer RTX 3060 mit 12 GB aus. Der Unterschied zeigt sich vor allem bei Aufgaben mit langen Schlussfolgerungsketten oder solchen, die enzyklopädisches Wissen erfordern.
qwen3-coder:480b-cloud → qwen2.5-coder:14b oder 32b
Das 32B-Modell in Q4 (≈19 GB VRAM) läuft auf einer RTX 4090 oder einem Mac M-Max. Für die automatische Codevervollständigung in einer IDE reicht das mehr als aus — siehe den Leitfaden zu Continue.dev.
deepseek-v3:671b-cloud → deepseek-r1:32b oder 70b, destilliert
Die destillierten Versionen von DeepSeek R1 erreichen auf gängigen Benchmarks 80–90 % der Denkleistung des vollständigen Modells und laufen dabei lokal auf einer 4090 oder einem Mac Studio.
Riesige Vision-Modelle → qwen2.5-vl:7b oder llama3.2-vision:11b
Für OCR, Bild-Tagging und Bildbeschreibungen laufen diese beiden Modelle mit 8–12 GB VRAM. Siehe den Leitfaden zu lokalen multimodalen LLMs mit Bildverarbeitung.
Langer Kontext mit 1 Mio. Tokens → lokale Modelle mit 128k Kontext + Chunking
Nur sehr wenige reale Anwendungsfälle erfordern 1M Tokens auf einmal. Eine gute RAG-Pipeline mit Chunking und Reranker verarbeitet riesige Korpora mit einem lokalen Modell mit 32k Kontext.
i
Die Qualitätsdifferenz verringert sich jedes Quartal
Ein 14B-Modell aus dem Jahr 2026 übertrifft ein 70B-Modell aus dem Jahr 2024 bei den meisten Benchmarks. Die Begründung „Ich brauche ein 400B-Modell“ wird immer seltener. Bevor Sie für Cloud-Dienste zahlen, prüfen Sie wirklich, ob nicht ein lokales 14B-Modell ausreicht – Sie werden oft überrascht sein.

#Entscheidungstabelle

Um zwischen Ollama Cloud und Self-Hosting zu entscheiden, stellen Sie sich diese fünf Fragen in der angegebenen Reihenfolge. Die erste Frage, deren Antwort „self-host“ lautet, entscheidet die Wahl.

1. Sind die Daten sensibel?
Proprietärer Code, Kundendaten, Gesundheit, Recht, Personalwesen, Forschung und Entwicklung → selbst hosten, Punkt.
2. Unterliegen Sie der DSGVO oder einer branchenspezifischen Regulierung?
Krankenhaus, Bank, öffentlicher Sektor, europäische Daten → selbst hosten oder eine dedizierte souveräne Cloud nutzen (nicht Ollama Cloud).
3. Ist das Aufrufvolumen vorhersehbar und hoch?
Mehr als einige Tausend Aufrufe pro Tag → eine GPU für 1.500 € amortisiert sich gegenüber einer variablen Cloud-Rechnung in wenigen Monaten.
4. Müssen Sie offline arbeiten können?
Standort ohne zuverlässige Verbindung, Vorführungen vor Ort, Einhaltung von Air-Gap-Anforderungen → Selbsthosting zwingend erforderlich.
5. Brauchen Sie unbedingt ein Modell mit mindestens 100 Milliarden Parametern?
Wenn ja, und nur wenn ja, und erst nachdem Sie ein lokales 32B-Modell getestet haben: Dann kommt Ollama Cloud als Option infrage.
→
Praktische Regel
Wenn Sie unsicher sind, beginnen Sie zunächst lokal mit einem 14B-Q4-Modell. Sie werden schnell erkennen, ob die Grenzen dieses Modells wirklich Ihr Nutzungsszenario blockieren – in 80 % der Fälle nicht. Der Cloud-Service bleibt die Ausnahme, nicht die Regel.

#Wann die eine, wann die andere Lösung verwenden

#Die wenigen sinnvollen Einsatzfälle für Ollama Cloud

Punktuelle Bewertung eines riesigen Modells
Sie möchten in 10 Minuten testen, ob sich ein 480B-Coding-Modell lohnt, bevor Sie in einen Rechner investieren — die Cloud verhindert einen Impulskauf.
Kundendemo ohne Hardware vor Ort
Ein Verkäufer, der einen Proof of Concept auf seinem Laptop zeigt, ohne einen Mac Studio mitzubringen.
Eine einzelne, sehr anspruchsvolle Aufgabe
Ein 500-seitiger Bericht, der einmal pro Quartal zusammengefasst werden soll, mit langem Kontext und keinerlei vertraulichen Daten darin.
Lernen und Erkundung
Entdecken, was ein Modell mit 670 Milliarden Parametern leisten kann, um anschließend zum lokalen Betrieb zurückzukehren und zu wissen, welches Ziel man anstreben sollte.

#Fälle, in denen ein selbstbetriebener Server vorteilhaft ist

Jede regelmäßige Nutzung
Programmierassistent für den Alltag, interner Teamchat, RAG auf Basis von Unternehmensdokumenten — gleichbleibende Rechnungsbeträge sind wichtig.
Jegliche Nutzung mit sensiblen Daten
Keine Diskussion: Inhalte aus den Bereichen Recht, Gesundheit, Personalwesen, Finanzen sowie Forschung und Entwicklung und proprietärer Code bleiben lokal.
Jeder automatisierte Einsatz
Batch-Pipelines, Agenten, die in Schleifen laufen, n8n, ETL-Skripte: Die Cloud-Kontingente werden gesprengt, die Kosten werden unvorhersehbar.
Alle offline- oder edge-basierten Anwendungen
Raspberry Pi in der Werkstatt, Laptop unterwegs, Standort ohne zuverlässigen Internetzugang.
Jeder Bedarf an Personalisierung
Fine-Tuning, ein benutzerdefiniertes Modelfile, Systemprompts für das Team, eine tiefgehende Integration mit Ihren Tools – die Cloud ermöglicht das nicht.
!
Die Lock-in-Falle
Sobald sich ein Team daran gewöhnt hat, ein bestimmtes Cloud-Modell aufzurufen, ist der Ausstieg schmerzhaft: darauf abgestimmte Prompts, Ausgabeformate und besondere Verhaltensweisen. Von Anfang an in Self-Hosting zu investieren, vermeidet diese Abhängigkeit — und spart Geld, wenn die Preise steigen.

#Weiterführende Informationen

Wenn Sie zu dem Schluss kommen, dass Self-Hosting für Ihren Fall der richtige Weg ist (was wahrscheinlich ist), helfen Ihnen diese Anleitungen, einen guten Einstieg zu finden:

Die richtige GPU wählen
Die Anleitung „GPU für die lokale KI auswählen“ erläutert die Abwägungen zwischen VRAM, Budget und Leistung, vom RTX 3060 12 GB bis zum Mac Studio Ultra.
Quantisierung verstehen
Der Leitfaden „Quantisierung wählen (Q4, Q5, Q8, FP16)“ erklärt, wie Sie ein 32B-Modell auf einer GPU mit 16 GB unterbringen, ohne die Qualität zu beeinträchtigen.
Operative Vertraulichkeit
Die Datenschutz-Checkliste enthält konkrete Prüfungen, mit denen Sie sicherstellen können, dass kein Datenpaket Ihren Rechner verlässt – ein Nachweis anhand der Fakten.
Häufige Fragen zu Ollama Cloud
Ist Ollama Cloud kostenlos?+
Es gibt einen kostenlosen Tarif, allerdings mit engen Nutzungsgrenzen (wenige Modelle gleichzeitig und Kontingente, die pro Sitzung und pro Woche erneuert werden). Für eine intensivere Nutzung bietet Ollama kostenpflichtige Tarife mit monatlichem Abonnement an, die mehr gleichzeitige Modelle und größere Kontingente ermöglichen. Die genauen Preise ändern sich: Prüfen Sie vor dem Abschluss immer die offizielle Seite ollama.com/pricing, statt sich auf einen festen Betrag zu verlassen.
Wie kann Ollama ohne Cloud verwendet werden?+
Nichts ändert sich: Die klassische lokale Installation von Ollama funktioniert genau wie zuvor, ohne Konto oder Abonnement. Die Cloud ist eine optionale Funktion, die nur aktiviert wird, wenn Sie ausdrücklich ein mit „cloud“ gekennzeichnetes Modell auswählen und sich authentifizieren. Solange Sie Standardmodelle (Llama, Mistral, Qwen usw.) verwenden, läuft alles lokal; nach dem Herunterladen des Modells ist keine Verbindung erforderlich.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.