Falcon H1 lokal: der Mamba-Hybrid aus den Emiraten
Falcon H1 ist die Open-Weight-Modellfamilie des Technology Innovation Institute in Abu Dhabi und die erste Modellfamilie von TII, die klassische Attention und Mamba-Schichten in jedem Block kombiniert. Dieser Leitfaden erklärt, was diese hybride Architektur verändert, welche Größe von Falcon H1 Sie je nach Ihrem VRAM lokal installieren sollten, wie Sie den Speichervorteil bei langen Kontexten messen und ob es sich lohnt, Mistral Small oder Qwen3 in Ihrem Ollama-Stack zu ersetzen.
#Warum sich für Falcon H1 interessieren
Die ersten Falcon-Modelle hatten 2023 die Open-Weight-Landschaft geprägt, bevor sie von Llama, Mistral und dann Qwen überholt wurden. Falcon H1, im Mai 2025 vom Technology Innovation Institute (TII) in Abu Dhabi veröffentlicht, verfolgt einen anderen Ansatz: Statt klassischen Transformern hinterherzulaufen, setzt TII auf eine andere Architektur, die Attention und Zustandsraummodelle (Mamba-2) kombiniert. So entstehen kompakte Modelle, die mit doppelt so großen Konkurrenzmodellen mithalten können.
Für den lokalen Einsatz bietet die Modellreihe drei Vorteile. Sie deckt alle Konfigurationen ab, von 0,5 Milliarden Parametern für einen Raspberry Pi oder einen alten Laptop bis zu 34 Milliarden für eine RTX 4090 oder einen Mac mit gemeinsamem Speicher. Die angegebene Kontextlänge erreicht 256.000 Tokens, und die hybride Architektur macht diesen Kontext lokal tatsächlich nutzbar, wo ein klassischer Transformer den VRAM auslastet. Schließlich wurde Falcon H1 von Grund auf in 18 Sprachen trainiert, darunter Französisch und Arabisch. Das macht es zu einem ernstzunehmenden Kandidaten für französischsprachige Texte, ohne auf ein Modell mit Schwerpunkt auf Englisch oder Chinesisch zurückgreifen zu müssen.
#Der Attention-Mamba-Hybrid kurz erklärt
Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.
- Lebenslanger Online-Zugang
- PDF + Dateien
- Lebenslange Updates
Ein klassischer Transformer beruht vollständig auf dem Attention-Mechanismus. Bei jedem neuen Token liest das Modell den gesamten Kontext erneut und speichert für jedes vorherige Token ein Paar Vektoren: den bekannten KV-Cache. Dieser Speicherbedarf wächst linear mit der Länge des Gesprächs oder des Dokuments. Er ist es, und nicht die Modellgewichte, der beim Laden eines langen Berichts die Speicherkapazität Ihrer Grafikkarte überschreitet.
Mamba gehört zu einer anderen Familie, den Zustandsraummodellen (state space models). Eine Mamba-Schicht liest die Vergangenheit nicht erneut: Sie hält einen rekurrenten Zustand fester Größe aufrecht, der das Vorangegangene zusammenfasst, ähnlich wie ein modernisiertes rekurrentes Netzwerk. Der Speicherbedarf pro Token ist konstant, und der Durchsatz bleibt unabhängig von der Kontextlänge stabil. Der bekannte Nachteil ist, dass weiter zurückliegende Details weniger präzise abgerufen werden: Ein reines Mamba-Modell findet eine bestimmte Zahl, die auf Seite 40 versteckt ist, weniger zuverlässig wieder.
Hybride Modelle streben das Beste aus beiden Welten an. Während IBM Granite 4 oder Jamba abwechselnd Mamba- und Attention-Schichten verwenden, setzt Falcon H1 auf eine parallele Anordnung: In jedem Block arbeiten Attention-Köpfe und Mamba-2-Köpfe nebeneinander mit derselben Eingabe, und ihre Ausgaben werden vor der nächsten Schicht konkateniert. TII hat das Verhältnis zwischen beiden zugunsten der Mamba-Kanäle angepasst. Dadurch bleibt der Speicherbedarf der Attention deutlich unter dem eines Transformers vergleichbarer Größe, während genügend Attention erhalten bleibt, um ein exaktes Detail wiederzufinden.
- Klassischer Transformer (Mistral, Qwen, Llama)
- 100 % Attention. Maximale Qualität beim Abrufen von Informationen aus dem Kontext, aber der KV-Cache wächst proportional zur Kontextlänge: Jenseits einiger Zehntausend Tokens steigt der VRAM-Bedarf stark an.
- Reines Mamba (Falcon Mamba 7B)
- Konstanter Speicherbedarf pro Token, sehr schnell bei langen Datenströmen. Details aus weit zurückliegenden Abschnitten werden weniger zuverlässig abgerufen, und die Softwareunterstützung ist noch uneinheitlich.
- Hybrider sequentieller Ansatz (Granite 4, Jamba)
- Überwiegend Mamba-Schichten, zwischen denen Attention-Schichten liegen. Gute Speicherersparnis, eine in den Runtimes einfach zu implementierende Architektur.
- Parallele Hybridarchitektur (Falcon H1)
- Attention und Mamba-2 in jedem Block, mit verketteten Ausgaben. Das Modell entscheidet in jeder Schicht, was es dem präzisen und was dem komprimierten Gedächtnis anvertraut.
#Verfügbare Größen: von 0,5B bis 34B
TII veröffentlicht Falcon H1 in sechs Größen, jeweils als Base-Version (vortrainiert) und als Instruct-Version (Chat). Für die Nutzung mit Ollama oder LM Studio sind nur die Instruct-Versionen für Sie relevant. Alle haben dieselbe Architektur und denselben mehrsprachigen Tokenizer.
- Falcon H1 0.5B
- Das kleinste Modell. Für eingebettete Systeme, einen Pipeline-Test oder einen Raspberry Pi. Erwarten Sie von ihm keine anspruchsvollen Schreibaufgaben.
- Falcon H1 1.5B
- Klassifikation, einfache Extraktion, automatische Vervollständigung. Läuft auf jeder neueren CPU mit weniger als 2 GB Speicher.
- Falcon H1 1.5B-Deep
- Genauso viele Parameter wie das 1.5B-Modell, aber deutlich mehr und schmalere Schichten. TII positioniert es auf dem Niveau von Modellen mit 7 bis 10 Milliarden Parametern. Das ist die Variante, die Sie auf einem Laptop ohne GPU ausprobieren sollten.
- Falcon H1 3B
- Der Kompromiss für eine Grafikkarte mit 4 bis 6 GB oder einen Mac mit 16 GB. Zusammenfassungen, Chat auf Französisch, leichtgewichtiges RAG.
- Falcon H1 7B
- Das Herzstück der Modellreihe. Kann mit Qwen3 8B mithalten und übertrifft die 7B-Modelle der vorherigen Generation. Eine RTX 3060 12GB kann das Modell mit einem großzügigen Kontext ausführen.
- Falcon H1 34B
- Das High-End-Modell. TII vergleicht es mit Qwen3 32B, Gemma 3 27B und Llama 4 Scout. Erfordert mindestens 24 GB VRAM in Q4 oder einen Mac mit 48 GB vereinheitlichtem Speicher für einen komfortablen Betrieb.
Die Variante 1.5B-Deep verdient eine Erwähnung. TII hat auf ein schmales, aber sehr tiefes Modell gesetzt, mit fast dreimal so vielen Schichten wie die Standardvariante 1.5B. Das Ergebnis ist pro Token langsamer, da jede Schicht nacheinander ausgeführt wird, aber deutlich leistungsfähiger. Auf der CPU, wo die Speicherbandbreite alles begrenzt, bietet es oft das beste Verhältnis von Qualität zu Speicherbedarf pro Gigabyte in der gesamten Reihe.
#Voraussetzungen und VRAM
Softwareseitig benötigen Sie eine aktuelle Ollama-Version. Die Unterstützung für die Architektur falcon-h1 wurde im Sommer 2025 in llama.cpp hinzugefügt und von Ollama in den danach veröffentlichten Versionen übernommen. Eine ältere Ollama-Version verweigert das Laden des Modells mit einer Fehlermeldung zu einer unbekannten Architektur. Der Daemon lauscht standardmäßig auf http://localhost:11434; Open WebUI oder LM Studio lassen sich ohne besondere Einstellungen damit verbinden.
- 0,5B und 1,5B in Q4_K_M
- Weniger als 1,5 GB. Reiner CPU-Betrieb mit 4 GB freiem RAM. Keine GPU erforderlich.
- 3B in Q4_K_M
- ≈ 2 GB VRAM. Jede Karte ab 4 GB oder 8 GB RAM im CPU-Modus.
- 7B in Q4_K_M
- ≈ 5 GB VRAM für die Gewichte. Eine RTX 3060 12GB oder RTX 4070 12GB bietet komfortabel Platz, mit Spielraum für einen Kontext von 32K Tokens oder mehr.
- 7B in Q8_0
- ≈ 8 GB. Für eine RTX 4080 mit 16 GB oder einen Mac mit 24 GB, wenn Sie bei der Extraktion maximale Genauigkeit wünschen.
- 34B in Q4_K_M
- ≈ 20 GB. Bei einer RTX 4090 mit 24 GB wird es knapp; die Kontextlänge muss im Blick behalten werden. Ein M4 Pro mit 48 GB oder ein Mac Studio bietet deutlich mehr Spielraum.
- 34B in Q8_0
- ≈ 36 GB. Für Macs mit 64 GB RAM oder mehr oder für Systeme mit zwei Grafikkarten reserviert.
#Falcon H1 abhängig vom verfügbaren VRAM lokal installieren
TII veröffentlicht für jede Modellgröße offizielle GGUF-Dateien auf Hugging Face in Repositories mit dem Namen tiiuae/Falcon-H1-<taille>-Instruct-GGUF. Ollama kann eine GGUF-Datei mit dem Präfix hf.co direkt von Hugging Face abrufen; die gewünschte Quantisierung wird nach dem Doppelpunkt angegeben. Prüfen Sie dabei auf ollama.com/library, ob seit der Erstellung dieses Leitfadens ein offizieller Tag falcon-h1 erschienen ist; falls ja, bevorzugen Sie ihn, da er eine validierte Chat-Vorlage enthält.
- 01Ollama aktualisierenFühren Sie den offiziellen Installer oder Ihren Paketmanager erneut aus und überprüfen Sie anschließend die Version. Das ist der Schritt, den alle überspringen und dessen Auslassen die meisten Fehler beim Laden erklärt.
- 02Die Größe nach dem verfügbaren VRAM auswählen12 GB oder weniger: 7B in Q4_K_M. 4 bis 6 GB: 3B. Keine GPU: 1.5B-Deep. 24 GB oder ein Mac mit 48 GB: 34B. Laden Sie nicht mehrere Größen gleichzeitig herunter; jede GGUF-Datei ist 1 bis 20 GB groß.
- 03Die GGUF-Datei von Hugging Face herunterladenVerwenden Sie ollama pull mit dem hf.co-Pfad des Repositorys und dem Quantisierungs-Tag. Ollama lädt die Datei herunter, liest ihre Metadaten und generiert daraus die Chat-Vorlage.
- 04Eine Sitzung starten und auf Französisch testenollama run öffnet einen interaktiven Chat. Stellen Sie eine echte Aufgabe, etwa die Zusammenfassung eines Textes oder die Extraktion von Feldern, statt eines Rätsels. Überprüfen Sie, dass das Modell auf Französisch antwortet, ohne ins Englische abzurutschen.
- 05Die GPU/CPU-Verteilung prüfenollama ps zeigt den Prozentsatz des auf die GPU geladenen Modells an. Wenn sich ein Teil auf der CPU befindet, verringern Sie die Größe oder die Quantisierung, sonst bricht der Durchsatz ein.
Der vollständige Name mit dem Präfix hf.co ist umständlich einzugeben und in Open WebUI schlecht lesbar. Erstellen Sie mit einem Modelfile einen lokalen Alias: Dabei können Sie zugleich den Kontext und einen System-Prompt auf Französisch festlegen, und das Modell erscheint in allen Ihren Oberflächen unter einem kurzen Namen.
Für den Einsatz in Anwendungen stellt Ollama seine HTTP-API auf demselben Port bereit, mit einem OpenAI-kompatiblen Endpunkt. Jeder vorhandene Client funktioniert, wenn Sie die Basis-URL und den Modellnamen ändern.
#Der gemessene Speichervorteil bei langen Kontexten
Das ist das zentrale Versprechen von Falcon H1 im lokalen Betrieb, und es lässt sich in zehn Minuten überprüfen. Das Verfahren ist einfach: Dasselbe Modell mit zwei Kontextgrößen laden und den von ollama ps gemeldeten belegten Speicher vergleichen. Bei einem klassischen Transformer steigt der Speicherverbrauch beim Wechsel von 8K auf 64K Tokens um mehrere Gigabyte. Bei Falcon H1 gibt es ebenfalls einen Anstieg, da der Attention-Anteil weiterhin einen KV-Cache benötigt, doch dieser Anstieg ist deutlich geringer.
Zwei Hinweise zum Verständnis der Zahlen. Erstens reserviert Ollama den KV-Cache im Voraus für den gesamten angeforderten Kontext: Der angezeigte Speicherbedarf spiegelt daher die reservierte Kapazität wider, nicht den Speicher, den Ihr Prompt tatsächlich nutzt. Zweitens wird die Quantisierung des KV-Caches, sofern Sie sie in der Ollama-Konfiguration aktiviert haben, auch auf den Attention-Anteil von Falcon H1 angewendet. Das verringert den gemessenen Unterschied weiter, ändert aber nichts an der Schlussfolgerung: Bei gleicher VRAM-Kapazität kann Falcon H1 einen deutlich längeren Kontext verarbeiten als ein Transformer gleicher Größe.
In der Praxis lässt Falcon H1 7B in Q4_K_M auf einer Grafikkarte mit 12 GB Platz für einen Kontext von 64K Tokens, ohne Teile auf die CPU auszulagern. Bei Qwen3 8B oder Mistral 7B müssen Sie dagegen den KV-Cache quantisieren oder den Kontext auf etwa 32K begrenzen. Auch der Generierungsdurchsatz nimmt mit zunehmender Kontextfüllung deutlich weniger ab: Der Mamba-Anteil verarbeitet jedes neue Token in konstanter Zeit.
#Im Vergleich mit Mistral Small und Qwen3: das Fazit
Die Frage, die sich alle stellen: Sollte man sein gewohntes Modell ersetzen? Die Antwort hängt von der Größe ab, denn Falcon H1 spielt je nach Variante in einer anderen Liga.
- Falcon H1 7B gegen Qwen3 8B
- Die Qualität ist insgesamt vergleichbar. Qwen3 behält einen Vorteil beim Programmieren und beim strukturierten Schlussfolgern, während Falcon H1 auf Französisch natürlicher wirkt und vor allem deutlich sparsamer ist, sobald der Kontext länger wird. Bei Dokumentzusammenfassungen und französischsprachigem Chat mit 12 GB hat Falcon H1 die Nase vorn. Zum Programmieren bleiben Sie bei Qwen3.
- Falcon H1 7B gegen Mistral Small 3.2
- Die Modelle gehören nicht zur selben Klasse: Mistral Small hat 24 Milliarden Parameter und benötigt 14 bis 15 GB in Q4. Wenn Sie genügend VRAM haben, bleibt Mistral Small bei den meisten Aufgaben besser. Falcon H1 7B ist die richtige Wahl, wenn die Grafikkarte 12 GB hat oder der Kontext 32K überschreiten muss.
- Falcon H1 34B gegen Mistral Small 3.2
- Ein interessanter Vergleich. Falcon H1 34B ist bei Wissens- und Reasoning-Benchmarks stärker und kommt mit sehr langen Kontexten besser zurecht, benötigt aber in Q4 5 GB mehr Speicher und kann keine Bilder verarbeiten. Mistral Small passt auf eine Grafikkarte mit 16 GB, kann Bilder lesen, steht unter Apache 2.0 und profitiert von einem ausgereifteren Ökosystem, insbesondere beim Function Calling.
- Falcon H1 34B gegen Qwen3 32B
- Bei vergleichbarer VRAM-Kapazität bleibt Qwen3 32B die Referenz für Code und Agenten. Falcon H1 34B ist für lange Dokumente auf Französisch oder Arabisch vorzuziehen, ebenso auf einem Mac, dessen Unified Memory die 20 GB des Modells problemlos aufnehmen kann.
Das Fazit lässt sich in einem Satz zusammenfassen: Falcon H1 ist das beste Modell zum Installieren, wenn der Speicherbedarf bei langen Kontexten Ihr Problem ist oder Französisch und Arabisch Ihre Arbeitssprachen sind. Es ist nicht das beste Allround-Modell, und sein Ökosystem ist nicht so ausgereift wie das von Mistral oder Qwen. Auf einer Workstation mit 24 GB bleibt Mistral Small die verlässliche Wahl für einen Assistenten im Alltag; Falcon H1 34B installiert man zusätzlich für große Dokumente.
#Falcon-LLM-Lizenz: vor dem Deployment lesen
Falcon H1 wird unter der Falcon-LLM-Lizenz von TII veröffentlicht. Sie ist von Apache 2.0 abgeleitet und erlaubt die kommerzielle Nutzung, Änderungen und Weiterverbreitung, ergänzt diese jedoch um eine Richtlinie zur zulässigen Nutzung und einige Pflichten zur Namensnennung. Sie bietet nicht die uneingeschränkte Freiheit von Apache 2.0, wie sie Mistral Small oder Granite bieten, ist aber auch keine restriktive Lizenz wie die von Llama mit ihren Schwellenwerten für Nutzerzahlen.
Bei persönlicher oder interner Nutzung stellt sich die Frage nicht. Nehmen Sie sich bei einem kommerziellen Produkt, das weiterverbreitet wird, zehn Minuten Zeit, um den Text auf der TII-Website zu lesen und zu prüfen, dass Ihr Anwendungsfall nicht zu den ausgeschlossenen Nutzungen gehört. Der Katalog dieser Website gibt für jeden Falcon-Eintrag die Lizenz an; deren Version kann sich von einer Generation zur nächsten ändern.
#Fehlerbehebung
- Fehler unknown model architecture falcon-h1
- Ihre Version von Ollama, LM Studio oder llama.cpp ist zu alt, um die hybride Architektur zu erkennen. Aktualisieren Sie die Software, starten Sie den Daemon neu und führen Sie den Pull erneut aus. Es gibt keinen anderen Workaround: Die Mamba-2-Schichten lassen sich ohne Unterstützung durch die Engine nicht laden.
- Der Pull von hf.co scheitert oder findet den Tag nicht
- Prüfen Sie die genaue Schreibweise des Repositorys und der Quantisierung auf der Hugging-Face-Seite, insbesondere die Groß-/Kleinschreibung von Q4_K_M. Wenn das Repository das gewünschte Tag nicht anbietet, öffnen Sie die Registerkarte Files, um die Liste der verfügbaren GGUF-Dateien zu lesen.
- Englische Antworten, obwohl Sie auf Französisch schreiben
- Fügen Sie einen Systemprompt hinzu, der die Sprache vorgibt, wie im Modelfile weiter oben. Der mehrsprachige Tokenizer von Falcon H1 kommt sehr gut mit Französisch zurecht, aber die Instruct-Variante orientiert sich ohne entsprechende Anweisung manchmal an der vorherrschenden Sprache ihrer Daten.
- Sehr geringer Durchsatz bei 34B
- ollama ps zeigt wahrscheinlich eine teilweise Verteilung auf die CPU. Bei 24 GB verringern Sie den Kontext auf 16K oder wechseln Sie zu Q4_K_S. Erhöhen Sie auf dem Mac das Limit des zuweisbaren GPU-Speichers, wenn das System zu viel davon reserviert.
- Höherer Speicherverbrauch als erwartet bei langem Kontext
- Das ist normal: Ollama reserviert den Aufmerksamkeits-KV-Cache für den gesamten angegebenen Kontext, selbst wenn dieser leer ist. Vergleichen Sie mit einem anderen Modell immer bei gleicher Kontextlänge und aktivieren Sie die Quantisierung des KV-Caches, wenn Sie noch etwas mehr Speicher sparen möchten.
- Falsche Chat-Vorlage, sichtbare Tags in den Antworten
- Ollama erzeugt das Template aus den Metadaten der GGUF-Datei. Wenn Tags erscheinen, laden Sie die offizielle GGUF-Datei von TII herunter statt einer Konvertierung von einem Drittanbieter, oder legen Sie TEMPLATE ausdrücklich in Ihrem Modelfile fest.
#Weiterführende Informationen
Falcon H1 erschließt sich vollständig, sobald Sie die Konzepte von Kontext und Speicher beherrschen, die das Modell nutzt. Diese Leitfäden der Website ergänzen den vorliegenden Leitfaden:
- Das Kontextfenster verstehen
- Was 8K, 32K oder 256K Tokens bedeuten, wie viel VRAM dafür benötigt wird und warum der KV-Cache der wahre Engpass klassischer Transformer ist.
- Den KV-Cache quantisieren, um VRAM zu sparen
- Der andere Hebel, um den Kontext zu verlängern, kombinierbar mit der hybriden Architektur von Falcon H1.
- Granite 4 von IBM lokal
- Der andere aktuelle Mamba-Hybrid mit sequentieller Architektur und Apache 2.0-Lizenz. Der Vergleich mit Falcon H1 hilft, die Entscheidungen von TII zu verstehen.
- Quantisierung wählen (Q4, Q5, Q8, FP16)
- Um zwischen Q4_K_M und Q8_0 für jede Größe von Falcon H1 entsprechend Ihrer VRAM zu wählen.
Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.