Ollama Cloud: Preise, Bewertungen und Beschränkungen (2026)
Ollama Cloud bietet eine einfache Lösung: Die Ausführung von Modellen, die zu groß für Ihre lokale Maschine sind — mit 120B, 480B, 671B Parametern — auf den Servern von Ollama. Dies erfolgt mit der gleichen CLI wie die lokale Version. Das ist praktisch. Doch zwei grundlegende Dinge ändern sich: Ihre Prompts verlassen Ihren Rechner, und Sie zahlen nach der Nutzung. Dieser Leitfaden erklärt genau, was das bedeutet, wie viel es kostet und warum sich für die meisten Anwendungsfälle ein selbst gehosteter Ansatz bevorzugen lässt.
#Was Ollama Cloud ist
Seit 2025 bietet Ollama ein kostenpflichtiges Angebot namens Ollama Cloud an. Damit lassen sich Modelle auf der GPU-Infrastruktur von Ollama aufrufen, und zwar mit genau denselben Befehlen wie bei einem lokalen Modell. Das Versprechen: riesige Modelle mit offenen Gewichten (Hunderte Milliarden Parameter) auszuführen, ohne einen Mac Studio Ultra oder einen H100-Cluster zu benötigen.
Konkret installieren Sie Ollama wie gewohnt, authentifizieren sich und laden ein mit "cloud" gekennzeichnetes Modell herunter (z. B. gpt-oss:120b-cloud). Die Inferenz erfolgt nicht mehr auf Ihrer GPU, sondern auf den Servern von Ollama — Ihr Rechner sendet nur die Prompt-Tokens und empfängt die Antwort-Tokens.
#Welche Modelle laufen in der Cloud?
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Erstattung binnen 30 Tagen
Der Cloud-Katalog zielt genau auf Modelle ab, die sich lokal nur schlecht ausführen lassen. Er entwickelt sich weiter, aber das Prinzip bleibt gleich: Open-Weight- oder offene Modelle, die sehr groß sind, oder multimodale Modelle mit hohem VRAM-Bedarf.
- Modelle mit 100 Milliarden Parametern oder mehr
- Modelle wie gpt-oss:120b, qwen3-coder:480b, kimi-k2 — sie benötigen in Q4 60 bis 250 GB VRAM, was eine einzelne Workstation nicht leisten kann.
- MoE-Frontier-Modelle
- DeepSeek V3/V4, Llama 4 Maverick: die vollständigen Versionen, nicht die 7B/32B-Distillationen, die lokal installiert werden.
- Ressourcenintensive Spezialmodelle
- Riesige Coding-Modelle, Reasoning-Modelle („thinking“) mit langem Kontext, Vision-Modelle für hohe Auflösungen.
Die „normalen“ Modelle (Mistral 7B, Llama 3.1 8B, Qwen 14B, Phi-4 usw.) bleiben für den lokalen Betrieb empfehlenswert: Sie passen auf eine RTX 3060 mit 12 GB oder ein MacBook Air, und es bringt keinen Vorteil, sie extern zu betreiben.
#Preise und Grenzen
Ollama Cloud positioniert sich zwischen einem monatlichen Pauschalabonnement (mit einem Kontingent an Anfragen pro Stunde) und einem verbrauchsabhängigen Abrechnungsmodell für intensive Nutzung. Die genauen Preise ändern sich – prüfen Sie sie auf ollama.com/cloud, bevor Sie sich festlegen –, aber einige Konstanten verdienen Beachtung.
- Stundenquoten
- Die Basistarife begrenzen die Anzahl der Anfragen pro Stunde oder pro Tag. Für die Nutzung im Chat durch einen Menschen reichen diese Limits bequem aus; ein Skript, das 10.000 Dokumente durchläuft, erreicht sie jedoch schnell.
- Abrechnung nach Inferenzdauer
- Sehr große Modelle werden manchmal nach der verbrauchten GPU-Zeit abgerechnet. Eine Anfrage mit langem Kontext (32k Tokens, tiefgehendes Schlussfolgern) kostet zwangsläufig mehr als ein „bonjour“.
- Standardmäßig wird kein Preis pro Token angezeigt
- Anders als bei OpenAI oder Anthropic wird die API-Nutzung bei Ollama Cloud nicht durchgehend pro Token abgerechnet. Dadurch lässt sich das Budget weniger genau planen.
- Kein SLA für Privatkunden
- Das Angebot ist noch jung. Zum Zeitpunkt, an dem diese Zeilen geschrieben werden, gibt es keine Verfügbarkeitsgarantie, die mit denen der großen Cloud-Anbieter vergleichbar wäre.
#Vertraulichkeit: Was sich wirklich ändert
Hier wird der Unterschied zum Selbstbetrieb strukturell und ist nicht bloß eine Randerscheinung. Wenn Sie Ollama lokal nutzen, verlassen Ihre Prompts niemals den Port 11434 auf localhost — das lässt sich an der Firewall überprüfen. In der Cloud werden sie über das Internet übertragen und auf der Infrastruktur eines Drittanbieters verarbeitet.
- Ihre Prompts verlassen Ihren Kontrollbereich
- Alle übermittelten Daten – Vertragsauszüge, proprietärer Quellcode, Patientenakten, E-Mails – verlassen Ihren Rechner. Für eine Anwaltskanzlei, einen Arzt, eine Personalabteilung oder ein Forschungs- und Entwicklungslabor ist das ein Ausschlusskriterium.
- Richtlinie zur Datenaufbewahrung
- Ollama gibt an, seine Modelle nicht mit Ihren Prompts zu trainieren. Die Aufbewahrung für Debugging, Missbrauchserkennung oder Protokollierung variiert jedoch je nach Tarif. Lesen Sie die Nutzungsbedingungen, bevor Sie sensible Daten senden.
- DSGVO und Hosting
- Die Server von Ollama Cloud befinden sich überwiegend in den USA. Bei europäischen personenbezogenen Daten wirft das Fragen zur Übermittlung in Länder außerhalb der EU auf, die durch Selbsthosting auf einen Schlag entfallen.
- Kein Infrastruktur-Audit möglich
- Lokal können Sie den Port 11434 mit tcpdump überwachen und nachweisen, dass keine Daten nach außen gesendet werden. Bei einem Cloud-Dienst müssen Sie dem Anbieter vertrauen – es gibt keine technische Möglichkeit zu überprüfen, was protokolliert wird.
#Alternativen zum Selbsthosten für jedes Cloud-Modell
Für fast alle in der Cloud angebotenen Modelle gibt es eine lokale Alternative, die entweder gleichwertig (kleineres Modell derselben Familie) oder akzeptabel (anderes vergleichbares Open-Weight-Modell) ist. Hier sind die nützlichen Zuordnungen.
- gpt-oss:120b-cloud → llama3.1:8b oder qwen2.5:14b lokal
- Für 90 % der Chat-Anwendungen reicht ein 8B–14B-Modell in Q4 auf einer RTX 3060 mit 12 GB aus. Der Unterschied zeigt sich vor allem bei Aufgaben mit langen Schlussfolgerungsketten oder solchen, die enzyklopädisches Wissen erfordern.
- qwen3-coder:480b-cloud → qwen2.5-coder:14b oder 32b
- Das 32B-Modell in Q4 (≈19 GB VRAM) läuft auf einer RTX 4090 oder einem Mac M-Max. Für die automatische Codevervollständigung in einer IDE reicht das mehr als aus — siehe den Leitfaden zu Continue.dev.
- deepseek-v3:671b-cloud → deepseek-r1:32b oder 70b, destilliert
- Die destillierten Versionen von DeepSeek R1 erreichen auf gängigen Benchmarks 80–90 % der Denkleistung des vollständigen Modells und laufen dabei lokal auf einer 4090 oder einem Mac Studio.
- Riesige Vision-Modelle → qwen2.5-vl:7b oder llama3.2-vision:11b
- Für OCR, Bild-Tagging und Bildbeschreibungen laufen diese beiden Modelle mit 8–12 GB VRAM. Siehe den Leitfaden zu lokalen multimodalen LLMs mit Bildverarbeitung.
- Langer Kontext mit 1 Mio. Tokens → lokale Modelle mit 128k Kontext + Chunking
- Nur sehr wenige reale Anwendungsfälle erfordern 1M Tokens auf einmal. Eine gute RAG-Pipeline mit Chunking und Reranker verarbeitet riesige Korpora mit einem lokalen Modell mit 32k Kontext.
#Entscheidungstabelle
Um zwischen Ollama Cloud und Self-Hosting zu entscheiden, stellen Sie sich diese fünf Fragen in der angegebenen Reihenfolge. Die erste Frage, deren Antwort „self-host“ lautet, entscheidet die Wahl.
- 1. Sind die Daten sensibel?
- Proprietärer Code, Kundendaten, Gesundheit, Recht, Personalwesen, Forschung und Entwicklung → selbst hosten, Punkt.
- 2. Unterliegen Sie der DSGVO oder einer branchenspezifischen Regulierung?
- Krankenhaus, Bank, öffentlicher Sektor, europäische Daten → selbst hosten oder eine dedizierte souveräne Cloud nutzen (nicht Ollama Cloud).
- 3. Ist das Aufrufvolumen vorhersehbar und hoch?
- Mehr als einige Tausend Aufrufe pro Tag → eine GPU für 1.500 € amortisiert sich gegenüber einer variablen Cloud-Rechnung in wenigen Monaten.
- 4. Müssen Sie offline arbeiten können?
- Standort ohne zuverlässige Verbindung, Vorführungen vor Ort, Einhaltung von Air-Gap-Anforderungen → Selbsthosting zwingend erforderlich.
- 5. Brauchen Sie unbedingt ein Modell mit mindestens 100 Milliarden Parametern?
- Wenn ja, und nur wenn ja, und erst nachdem Sie ein lokales 32B-Modell getestet haben: Dann kommt Ollama Cloud als Option infrage.
#Wann die eine, wann die andere Lösung verwenden
#Die wenigen sinnvollen Einsatzfälle für Ollama Cloud
- Punktuelle Bewertung eines riesigen Modells
- Sie möchten in 10 Minuten testen, ob sich ein 480B-Coding-Modell lohnt, bevor Sie in einen Rechner investieren — die Cloud verhindert einen Impulskauf.
- Kundendemo ohne Hardware vor Ort
- Ein Verkäufer, der einen Proof of Concept auf seinem Laptop zeigt, ohne einen Mac Studio mitzubringen.
- Eine einzelne, sehr anspruchsvolle Aufgabe
- Ein 500-seitiger Bericht, der einmal pro Quartal zusammengefasst werden soll, mit langem Kontext und keinerlei vertraulichen Daten darin.
- Lernen und Erkundung
- Entdecken, was ein Modell mit 670 Milliarden Parametern leisten kann, um anschließend zum lokalen Betrieb zurückzukehren und zu wissen, welches Ziel man anstreben sollte.
#Fälle, in denen ein selbstbetriebener Server vorteilhaft ist
- Jede regelmäßige Nutzung
- Programmierassistent für den Alltag, interner Teamchat, RAG auf Basis von Unternehmensdokumenten — gleichbleibende Rechnungsbeträge sind wichtig.
- Jegliche Nutzung mit sensiblen Daten
- Keine Diskussion: Inhalte aus den Bereichen Recht, Gesundheit, Personalwesen, Finanzen sowie Forschung und Entwicklung und proprietärer Code bleiben lokal.
- Jeder automatisierte Einsatz
- Batch-Pipelines, Agenten, die in Schleifen laufen, n8n, ETL-Skripte: Die Cloud-Kontingente werden gesprengt, die Kosten werden unvorhersehbar.
- Alle offline- oder edge-basierten Anwendungen
- Raspberry Pi in der Werkstatt, Laptop unterwegs, Standort ohne zuverlässigen Internetzugang.
- Jeder Bedarf an Personalisierung
- Fine-Tuning, ein benutzerdefiniertes Modelfile, Systemprompts für das Team, eine tiefgehende Integration mit Ihren Tools – die Cloud ermöglicht das nicht.
#Weiterführende Informationen
Wenn Sie zu dem Schluss kommen, dass Self-Hosting für Ihren Fall der richtige Weg ist (was wahrscheinlich ist), helfen Ihnen diese Anleitungen, einen guten Einstieg zu finden:
- Die richtige GPU wählen
- Die Anleitung „GPU für die lokale KI auswählen“ erläutert die Abwägungen zwischen VRAM, Budget und Leistung, vom RTX 3060 12 GB bis zum Mac Studio Ultra.
- Quantisierung verstehen
- Der Leitfaden „Quantisierung wählen (Q4, Q5, Q8, FP16)“ erklärt, wie Sie ein 32B-Modell auf einer GPU mit 16 GB unterbringen, ohne die Qualität zu beeinträchtigen.
- Operative Vertraulichkeit
- Die Datenschutz-Checkliste enthält konkrete Prüfungen, mit denen Sie sicherstellen können, dass kein Datenpaket Ihren Rechner verlässt – ein Nachweis anhand der Fakten.
Ist Ollama Cloud kostenlos?+
Wie kann Ollama ohne Cloud verwendet werden?+
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.