Mittelstufe 10 Min.Edge

LFM2 von Liquid AI: die alternative Architektur für l'edge

LFM2 von Liquid AI ist nicht einfach ein weiterer Transformer: Es ist eine Familie kleiner Modelle (350 Millionen bis 8 Milliarden Parameter), die auf einer hybriden Architektur basiert, bei der die meisten Schichten kurze Konvolutionen statt Attention verwenden. Das von Liquid AI angegebene Ergebnis: Decoding und Prefill sind auf der CPU bei gleicher Modellgröße etwa doppelt so schnell wie bei Qwen3, während der Speicherbedarf mit zunehmendem Kontext nur wenig steigt. Dieser Leitfaden erklärt, was diese Architektur tatsächlich verändert, wie sich LFM2 mit Ollama oder llama.cpp installieren lässt, welche Geschwindigkeit ohne GPU zu erwarten ist und bei welchen Anwendungen diese Wahl einen klassischen Transformer übertrifft.

Von Thomas P.·Aktualisierung 2026-09-24·Unter Windows, macOS und Linux getestet

#LFM2 von Liquid AI: Warum ein für die CPU konzipiertes Modell?

Liquid AI ist ein aus dem MIT (CSAIL) hervorgegangenes Unternehmen, das 2023 mit einem Schwerpunkt auf „liquid neural networks“ und Modellen mit kontinuierlichem Zustand gegründet wurde. Nach einer ersten, geschlossenen Generation LFM1 veröffentlichte das Unternehmen im Juli 2025 die Gewichte seiner zweiten Generation LFM2 in drei Größen: 350M, 700M und 1,2B Parameter. Weitere Varianten folgten (2,6B, eine MoE-Version 8B-A1B, Bild- und Audiomodelle, anschließend die Generation LFM2.5). Der rote Faden bleibt derselbe: Diese Modelle sind für die Ausführung direkt auf dem Gerät gedacht, also auf einem Telefon, einem Laptop ohne Grafikkarte, einem Mini-PC oder einer Embedded-Platine.

Fast alle kleinen offenen Modelle, die Sie kennen (Qwen3, Gemma 3, Llama 3.2, SmolLM), sind klassische Transformer: Jede Schicht berechnet Attention über den gesamten Kontext. Das funktioniert auf GPUs sehr gut, aber auf CPUs muss für jedes generierte Token ein Schlüssel-Wert-Cache (KV-Cache) erneut gelesen werden, der mit dem Gespräch wächst, und der Prefill eines langen Prompts ist aufwendig. LFM2 setzt genau an diesen beiden Punkten an, indem es die meisten Attention-Schichten durch Blöcke mit kurzen Faltungen ersetzt, die deutlich weniger Speicher und Bandbreite benötigen.

Ziel
Inferenz auf dem Gerät: x86- oder ARM-CPU, NPU, integrierte GPU. Eine dedizierte GPU ist nicht die primäre Zielhardware, auch wenn sie funktioniert.
Zahlenbasiertes Versprechen
Liquid AI kündigt ein Decoding und Prefilling an, das bis zu 2-mal schneller ist als Qwen3 bei vergleichbarer Größe auf der CPU (veröffentlichte Messungen auf einem AMD Ryzen AI 9 HX 370 und einem Samsung Galaxy S24 Ultra).
Qualität
Bei gleicher Parameterzahl liegt LFM2 in Benchmarks zu Wissen, Anweisungsbefolgung und Mathematik auf dem Niveau konkurrierender Transformer-Modelle oder etwas darüber; die 1,2B-Variante kann auf MMLU und IFEval mit Qwen3-1,7B mithalten.
Lizenz
LFM Open License v1.0: Die kommerzielle Nutzung ist unterhalb einer jährlichen Umsatzschwelle von 10 Millionen US-Dollar frei; oberhalb dieser Schwelle müssen Sie Liquid AI kontaktieren. Das ist keine Apache-2.0-Lizenz; lesen Sie den Lizenztext vor einem Einsatz im Unternehmen noch einmal durch.

#Was die hybride LFM-Architektur verändert

Das Lokale-KI-Paket

Ihr privates, kostenloses ChatGPT auf Ihrem Rechner in einer Stunde – mit LM Studio, Ollama, Open WebUI und Ihren Dokumenten, ganz ohne Cloud.

  • Lebenslanger Online-Zugang
  • PDF + Dateien
  • Erstattung binnen 30 Tagen

LFM2 stapelt 16 Blöcke. Zehn davon sind Faltungsblöcke mit kurzer Reichweite und doppeltem Gating (double-gated short-range convolution), sechs sind Attention-Blöcke mit gruppierten Queries (grouped query attention, GQA), wie in einem modernen Transformer. Liquid AI beschreibt diese Faltungsblöcke als LIV-Operatoren (linear input-varying): Die an jeder Position angewendeten Gewichte hängen von der Eingabe ab. Dadurch erhält der Block eine Form von Selektivität, die der von Zustandsraummodellen (Mamba) oder modernen RNNs ähnelt, ohne deren komplexen rekurrenten Zustand.

Konkret betrachtet ein Faltungsblock nur wenige benachbarte Tokens. Sein Rechenaufwand pro Token ist konstant, unabhängig vom bereits erzeugten Kontext, und er muss nichts in einem KV-Cache speichern. Nur die sechs Aufmerksamkeitsblöcke halten einen Cache vor, gegenüber 28 oder 36 Schichten bei einem Transformer vergleichbarer Größe. Zwei direkte Folgen beim Betrieb auf der CPU:

Schnellere Decodierung
Beim Generieren eines Tokens werden vor allem die Gewichte und der KV-Cache erneut aus dem RAM gelesen. Wenn weniger Cache erneut gelesen werden muss, wird die Speicherbandbreite, die bei einer CPU den eigentlichen Engpass darstellt, besser genutzt.
Effizienter Prefill
Die Verarbeitung eines Prompts mit 4.000 Tokens (eines Dokuments für RAG oder eines Chatverlaufs) verursacht im Verhältnis weniger Aufwand als bei einem vollständigen Transformer, da zehn von sechzehn Blöcken mit einem lokalen Fenster arbeiten.
Stabiler Speicherbedarf
Der Speicherverbrauch steigt mit zunehmender Kontextlänge nur langsam: Der KV-Cache der sechs Schichten bleibt klein, was auf einem Smartphone oder einer Platine mit 4 oder 8 GB gemeinsam genutztem RAM wichtig ist.
Nativer Kontext 32k
LFM2 wurde mit einem Kontextfenster von 32.768 Tokens trainiert (128k bei einigen neueren Varianten), ausreichend für einfache Zusammenfassungs- und RAG-Aufgaben.

Für das Training der ersten LFM2-Generation verwendete Liquid AI etwa 10.000 Milliarden Tokens. Der Datenmix bestand überwiegend aus englischen Daten, zu etwa 20 % aus mehrsprachigen Daten (darunter Französisch, Deutsch, Spanisch, Arabisch, Chinesisch, Japanisch und Koreanisch) und zu einem kleinen Teil aus Code. Hinzu kam eine Distillation aus dem internen LFM1-7B. Deshalb kann ein LFM2-1,2B ein ordentliches Gespräch auf Französisch führen, was bei Modellen dieser Größe keineswegs selbstverständlich ist.

i
Hybrider Ansatz, keine Revolution
LFM2 verzichtet nicht auf Attention: Die sechs GQA-Blöcke behalten die Fähigkeit, zwei weit auseinanderliegende Passagen des Kontexts miteinander zu verknüpfen. Es ist derselbe Kompromiss wie bei Jamba (Mamba + Attention) oder den neueren Granite-4-Modellen von IBM, nur auf deutlich kleinere Modellgrößen angewendet. Der Unterschied liegt im Verhältnis und im gewählten Faltungsoperator.

#Die Familie LFM2: Größen und Varianten

Alle Varianten teilen dieselbe Grundarchitektur und dasselbe Chatformat (im_start/im_end-Tags im Stil von ChatML). Hier sind die für den Edge-Einsatz relevanten Varianten mit der ungefähren Größe der GGUF-Datei in Q4_K_M. Diese entspricht ungefähr dem RAM, den die Modellgewichte beim Betrieb auf der CPU belegen.

LFM2-350M
Etwa 250 MB in Q4. Klassifikation, Extraktion, kurze Textüberarbeitung. Läuft auf fast jedem Gerät, einschließlich eines Raspberry Pi oder eines alten Laptops.
LFM2-700M
Etwa 450 MB in Q4. Ein guter Kompromiss für ein aktuelles Smartphone oder einen sehr schlanken Assistenten.
LFM2-1.2B
Etwa 730 MB in Q4. Das Referenzmodell der Familie: Chat, Zusammenfassung, einfaches RAG, Tool-Aufrufe. Dieses Modell wird in diesem Leitfaden installiert.
LFM2-2.6B
Etwa 1,5 GB in Q4. Ende 2025 veröffentlicht, deutlich stärker beim logischen Schlussfolgern und bei mehrsprachigen Aufgaben, läuft weiterhin problemlos auf einem Laptop ohne GPU.
LFM2-8B-A1B
Mixture of Experts: insgesamt 8,3 Milliarden Parameter, etwa 1,5 Milliarden aktive Parameter pro Token. Rund 5 GB in Q4: Der RAM-Bedarf entspricht dem eines 8B-Modells, die Geschwindigkeit bleibt jedoch die eines kleinen Modells.
Spezialvarianten
LFM2-VL (Vision, 450M und 1,6B), LFM2-Audio sowie feinabgestimmte Versionen für die Datenextraktion, RAG oder Tool-Aufrufe. Die Modellgeneration LFM2.5 (ab Januar 2026) übernimmt die Architektur mit verlängertem Training; der Katalog der Website führt die zugehörigen Modellprofile auf, darunter die 2,6B- und 7B-Versionen.
→
Welches Modell wählen?
Auf einem Laptop oder Mini-PC mit 8 GB RAM: Beginnen Sie mit dem 1,2B-Modell und wechseln Sie zum 2,6B-Modell, wenn die Qualität nicht ausreicht. Bei 16 GB RAM ist das 8B-A1B-Modell am leistungsfähigsten und bleibt dennoch schnell. Auf einem Telefon oder Raspberry Pi: 350M oder 700M.

#Voraussetzungen

Nichts Exotisches. Entscheidend ist eine aktuelle Version der Inferenz-Engine: Die Unterstützung für die LFM2-Architektur wurde im Juli 2025 zu llama.cpp und mit Version 4.54 zu Hugging Face Transformers hinzugefügt. Die seitdem veröffentlichten Versionen von Ollama und LM Studio übernehmen diese Unterstützung, sofern Sie die Programme aktualisieren.

Rechner
Jeder neuere PC oder Mac. Eine CPU mit 4 Kernen und 8 GB RAM reichen für das 1,2B-Modell aus; rechnen Sie für das 8B-A1B-Modell mit 16 GB.
Ollama aktuell
Ollama lauscht standardmäßig auf http://localhost:11434. Aktualisieren Sie Ollama, bevor Sie das Modell herunterladen: Eine Version von vor dem Sommer 2025 wird die GGUF-Datei mit einer Fehlermeldung zu einer unbekannten Architektur ablehnen.
Oder llama.cpp
Eine aktuelle Binärdatei (selbst kompiliert oder aus den GitHub-Releases heruntergeladen) bietet Zugriff auf llama-cli, llama-server und vor allem llama-bench zur Messung der Geschwindigkeit.
Python optional
Um die ursprünglichen Gewichte (nicht quantisiert) mit Transformers ≥ 4.54 zu verwenden, beispielsweise für Fine-Tuning oder einen Export in ein mobiles SDK.

#LFM2 lokal installieren und testen

Liquid AI veröffentlicht seine Modelle auf Hugging Face unter der Organisation LiquidAI, mit jeweils einem Repository für die Originalgewichte (LiquidAI/LFM2-1.2B) und einem Repository mit bereits quantisierten GGUF-Dateien (LiquidAI/LFM2-1.2B-GGUF) pro Modellgröße. Am einfachsten laden Sie diese GGUF-Datei direkt mit Ollama herunter, ohne ein Modelfile zu verwenden.

  1. 01
    Ollama aktualisieren
    Führen Sie unter Linux das offizielle Installationsskript erneut aus; unter macOS und Windows aktualisiert sich die Anwendung automatisch oder über ihr Menü. Überprüfen Sie die Version mit ollama --version.
  2. 02
    Die GGUF-Datei von Hugging Face herunterladen
    Die Syntax hf.co/organisation/dépôt:quantification funktioniert mit jedem öffentlichen GGUF-Repository. Für LFM2-1.2B in Q4_K_M beträgt die Downloadgröße etwa 730 MB.
  3. 03
    Ersten Chat starten
    ollama run ouvre une session interactive. Posez une question en français pour vérifier la qualité de la langue avant de creuser.
  4. 04
    Die CPU-Nutzung zum Vergleich erzwingen
    Wenn Ihr Gerät eine GPU hat, können Sie diese für dieses Modell deaktivieren, indem Sie den Parameter num_gpu auf 0 setzen, und das tatsächliche Verhalten im reinen CPU-Modus beobachten.
  5. 05
    Eine Oberfläche anbinden
    Das Modell erscheint sofort in Open WebUI, LM Studio oder jedem OpenAI-kompatiblen Client, der auf Port 11434 eingestellt ist.
Terminal — Ollama
# Vérifier la version (doit être récente, été 2025 ou plus)
ollama --version

# Tirer LFM2-1.2B quantifié en Q4_K_M depuis Hugging Face
ollama pull hf.co/LiquidAI/LFM2-1.2B-GGUF:Q4_K_M

# Premier chat
ollama run hf.co/LiquidAI/LFM2-1.2B-GGUF:Q4_K_M

# Même chose en CPU pur, même si un GPU est présent
ollama run hf.co/LiquidAI/LFM2-1.2B-GGUF:Q4_K_M
>>> /set parameter num_gpu 0
>>> Résume en trois phrases ce qu'est un modèle de langage.

Der Name hf.co/LiquidAI/LFM2-1.2B-GGUF:Q4_K_M ist umständlich einzutippen; erstellen Sie mit ollama cp einen lokalen Alias, um den einfachen Namen lfm2:1.2b zu erhalten. Für die anderen Größen ersetzen Sie 1.2B durch 350M, 700M oder 2.6B. Für das MoE verwenden Sie das Repository LiquidAI/LFM2-8B-A1B-GGUF.

Terminal — Alias und API
# Alias court
ollama cp hf.co/LiquidAI/LFM2-1.2B-GGUF:Q4_K_M lfm2:1.2b

# Appel API (compatible avec n'importe quel client Ollama)
curl http://localhost:11434/api/chat -d '{
  "model": "lfm2:1.2b",
  "messages": [{"role": "user", "content": "Explique la différence entre RAM et VRAM en deux phrases."}],
  "options": {"temperature": 0.3, "min_p": 0.15, "repeat_penalty": 1.05},
  "stream": false
}'
→
Die von Liquid AI empfohlenen Einstellungen
Die offizielle Modellbeschreibung empfiehlt temperature 0.3, min_p 0.15 und repetition_penalty 1.05. Mit den Standardwerten von Ollama (temperature 0.8) gerät ein 1,2B-Modell leichter in Wiederholungsschleifen oder schweift vom Thema ab. Legen Sie diese drei Parameter in einem Modelfile fest, wenn Sie LFM2 im Produktivbetrieb verwenden.

Wenn Sie llama.cpp lieber direkt nutzen, akzeptiert der Befehl llama-cli dasselbe Hugging-Face-Repository mit der Option -hf. Das ist auch die bevorzugte Lösung für einen minimalistischen Server auf einem ARM-Board, auf dem llama-server weniger Ressourcen benötigt als Ollama.

Terminal — llama.cpp
# Chat interactif, téléchargement automatique du GGUF
llama-cli -hf LiquidAI/LFM2-1.2B-GGUF:Q4_K_M -cnv \
  --temp 0.3 --min-p 0.15 --repeat-penalty 1.05 -t 8

# Serveur API OpenAI-compatible sur le port 8080
llama-server -hf LiquidAI/LFM2-1.2B-GGUF:Q4_K_M -c 8192 -t 8

Schließlich reicht für ein Python-Skript mit den ursprünglichen Gewichten in bfloat16 Transformers aus. Rechnen Sie mit etwa 2,5 GB RAM für das 1,2B-Modell in bf16; auf der CPU ist dieser Weg deutlich langsamer als llama.cpp und dient ausschließlich der Entwicklung.

Python — Transformers ≥ 4.54
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "LiquidAI/LFM2-1.2B"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype="bfloat16")

messages = [{"role": "user", "content": "Qu'est-ce qu'un modèle hybride convolution + attention ?"}]
inputs = tok.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt")
out = model.generate(inputs, max_new_tokens=200, do_sample=True, temperature=0.3, min_p=0.15, repetition_penalty=1.05)
print(tok.decode(out[0][inputs.shape[1]:], skip_special_tokens=True))

#Geschwindigkeit im reinen CPU-Betrieb: die tatsächlichen Zahlen

Auf der CPU zählen zwei Werte: die Prefill-Geschwindigkeit (pro Sekunde verarbeitete Prompt-Tokens, was die Wartezeit bis zum ersten Wort bestimmt) und die Generierungsgeschwindigkeit (pro Sekunde erzeugte Tokens). Das geeignete Werkzeug für eine saubere Messung ist llama-bench, das mit llama.cpp geliefert wird: Es isoliert die beiden Phasen und wiederholt die Messungen. Erzwingen Sie mit -ngl 0 die CPU-Nutzung, auch wenn eine GPU vorhanden ist.

Terminal — messen
# Télécharger le GGUF une fois (llama-cli -hf le met en cache) puis :
llama-bench -m ~/.cache/llama.cpp/LiquidAI_LFM2-1.2B-GGUF_LFM2-1.2B-Q4_K_M.gguf \
  -ngl 0 -t 8 -p 512 -n 128

# Sortie : une ligne pp512 (prefill) et une ligne tg128 (génération), en tokens/s

# Comparer avec un transformer de taille voisine
llama-bench -m ~/.cache/llama.cpp/Qwen_Qwen3-1.7B-GGUF_Qwen3-1.7B-Q4_K_M.gguf -ngl 0 -t 8 -p 512 -n 128

Die folgenden Größenordnungen entsprechen dem, was man mit llama.cpp in Q4_K_M auf gängigen Rechnern beobachtet, wenn alle physischen Kerne genutzt werden. Sie ersetzen Ihre eigene Messung nicht: Die Speicherbandbreite (DDR4 gegenüber DDR5, Anzahl der Kanäle) kann zwischen zwei PCs derselben Generation zu Ergebnissen führen, die sich um den Faktor zwei unterscheiden.

Moderner Laptop (8 Kerne, DDR5)
LFM2-1.2B: 40 bis 70 Tokens/s bei der Generierung, mehrere hundert Tokens/s in der Prefill-Phase. Das 350M-Modell überschreitet 100 Tokens/s. Das 2,6B-Modell erreicht ungefähr 25 bis 40 Tokens/s.
Desktop-PC mit 4 bis 6 Kernen, DDR4
LFM2-1.2B: 20 bis 35 Tokens/s, deutlich über der Lesegeschwindigkeit. Ein Qwen3-1,7B kommt auf demselben Rechner eher auf 12 bis 20 Tokens/s.
Mac Apple Silicon (nur CPU)
Dank des vereinheitlichten Speichers mit einem DDR5-Laptop vergleichbar; in der Praxis werden Sie Metal zur Beschleunigung nutzen, aber LFM2 läuft auf einem MacBook Air auch allein auf der CPU noch angenehm.
Raspberry Pi 5 (8 GB)
LFM2-1.2B: 8 bis 12 Tokens pro Sekunde; LFM2-350M: 25 bis 35 Tokens pro Sekunde. Dies ist der Bereich, in dem der Unterschied zu einem klassischen Transformer am deutlichsten sichtbar ist.
LFM2-8B-A1B
Mit 16 GB DDR5-RAM können Sie mit 30 bis 50 Tokens/s rechnen: Pro Token sind nur 1,5 Milliarden Parameter aktiv, aber die 5 GB Modellgewichte müssen in den Speicher passen.

Den Unterschied im praktischen Einsatz macht der Prefill. Bei einem Transformer mit 1,7 Milliarden Parametern dauert es auf der CPU oft 15 bis 30 Sekunden, ein Dokument mit 4.000 Tokens zu verarbeiten, bevor die erste Antwort kommt; LFM2-1.2B verkürzt diese Wartezeit in den von Liquid AI veröffentlichten Tests um einen Faktor von nahezu zwei. Dadurch wird lokales RAG auf der CPU wirklich nutzbar, statt lediglich möglich zu sein.

!
Die Thread-Anzahl entspricht nicht einfach „allen Kernen“
Bei einer hybriden CPU (Intel Core mit P- und E-Kernen, Apple Silicon) verschlechtert es oft die Geschwindigkeit, -t auf die Gesamtzahl der logischen Kerne zu setzen. Testen Sie ausschließlich mit der Anzahl der leistungsstarken Kerne (zum Beispiel -t 8 bei einem 8P+16E) und vergleichen Sie: Der Unterschied kann bis zu 30 % betragen.

#Für welche Einsatzzwecke ist LFM2 vorzuziehen?

LFM2 ist kein Ersatz für Qwen3-8B oder Gemma 3 12B. Auf einer GPU mit VRAM ist ein größeres Transformer-Modell intelligenter, Punkt. Der Nutzen von LFM2 zeigt sich, sobald die Hardware den begrenzenden Faktor darstellt: keine GPU, wenig RAM, ein Akku, der geschont werden muss, oder ein Anfragevolumen, das bei gleichbleibenden Kosten bewältigt werden muss.

Assistent auf einem Laptop ohne GPU
Flüssiges Chatten auf einem Ultraportable, ohne dass der Lüfter hochdreht. Das 1,2B- oder das 2,6B-Modell antwortet schneller, als man lesen kann.
Batchverarbeitung auf CPU-Server
Tickets klassifizieren, Felder extrahieren, Produktbeschreibungen umschreiben: Tausende kurze Anfragen pro Stunde auf einer VM ohne GPU, mit dem 350M oder dem 700M.
Leichter lokaler RAG
Schnelles Prefill + 32k Kontext: Notizen oder interne Dokumentation indexieren und auf der CPU in wenigen Sekunden antworten.
Eingebettete Systeme und Hausautomation
Raspberry Pi, Industrie-Mini-PC, Smart-Home-Box: einen transkribierten Sprachbefehl interpretieren, eine kurze Antwort generieren, ein Tool aufrufen.
Mobil
Liquid AI bietet sein SDK LEAP (Liquid Edge AI Platform) für iOS und Android sowie die App Apollo an, um Modelle auf Mobilgeräten zu testen. GGUF funktionieren auch in Apps basierend auf llama.cpp.
Tool-Aufrufe
Die instructive Varianten von LFM2 unterstützen native Function Calling mit speziellen Markierungen, wodurch es zu einem kleinen Agentenrouter wird.

Behalten Sie dagegen einen klassischen Transformer bei, wenn Sie eine GPU und VRAM zum Ausnutzen haben, wenn die Aufgabe lange Schlussfolgerungsketten erfordert (Mathematik, komplexer Code) oder wenn Sie auf ein sehr umfangreiches Ökosystem feinabgestimmter Modelle angewiesen sind: Qwen und Llama haben auf diesem Gebiet weiterhin einen Vorsprung.

i
Und im Vergleich zu SmolLM3, Gemma 3 1B oder Qwen3-0.6B?
Bei gleicher Größe schneidet LFM2 in Benchmarks im Allgemeinen etwas besser ab und ist auf der CPU deutlich schneller. Der Nachteil ist die LFM Open License, die für ein großes Unternehmen weniger Freiheiten bietet als Apache 2.0, sowie ein jüngeres Ökosystem: weniger Fine-Tuning-Versionen aus der Community und weniger Erfahrungsberichte.

#Beschränkungen und Troubleshooting

Fehler „unknown model architecture: lfm2“
Ihre Engine ist zu alt. Aktualisieren Sie Ollama oder LM Studio oder kompilieren Sie llama.cpp aus einer Version neu, die nach Juli 2025 erschienen ist.
Antworten, die sich ständig wiederholen
Senken Sie die Temperatur auf 0,3 und aktivieren Sie min_p mit 0.15 und repeat_penalty mit 1.05, den von Liquid AI empfohlenen Werten. Kleine Modelle reagieren empfindlich auf die Standardeinstellungen.
Enttäuschende Geschwindigkeit
Prüfen Sie mit ollama ps, ob das Modell vollständig geladen ist, reduzieren Sie die Anzahl der Threads auf die Anzahl der leistungsstarken Kerne und schließen Sie Anwendungen, die die Speicherbandbreite auslasten (zum Beispiel einen Browser mit Dutzenden von Tabs).
Schlechtes Französisch
Das 350M-Modell bleibt im Französischen eingeschränkt; wechseln Sie zum 1,2B- oder 2,6B-Modell, die mit einem in der Praxis besser nutzbaren mehrsprachigen Anteil trainiert wurden.
Zu aggressive Quantisierung
Bei einem Modell mit 350M oder 700M wird die Qualität durch Q4 stärker beeinträchtigt als bei einem 7B. Wählen Sie Q8_0 für kleinere Modelle: Die Datei bleibt klein (unter 800 MB für das 700M).
Lizenz bei Unternehmenseinsatz
Oberhalb der in der LFM Open License festgelegten Umsatzschwelle erfordert die kommerzielle Nutzung eine Vereinbarung mit Liquid AI. Prüfen Sie dies vor dem produktiven Einsatz.

#Weiterführende Informationen

LFM2 entfaltet sein Potenzial besonders in einem Setup ohne GPU oder auf einem kleinen Rechner. Diese Leitfäden auf unserer Website ergänzen den vorliegenden Leitfaden:

LLM lokal ohne GPU (CPU)
Empfohlene Modelle nach RAM-Kapazität und CPU-Benchmarks in Tokens/s, um LFM2 im Vergleich zu den Alternativen einzuordnen.
GGUF-Modell von Hugging Face in Ollama importieren
Alles zur hf.co-Syntax, zu Modelfiles und Aliasnamen – hilfreich, um die empfohlenen Parameter für LFM2 fest einzustellen.
LLM auf Raspberry Pi 5
Der klassische Anwendungsfall für eingebettete Systeme, bei dem die Geschwindigkeit von LFM2 den Unterschied macht.
Hat Ihnen dieser Guide geholfen?

Haben Sie Feedback, einen Fehler entdeckt oder möchten Sie etwas präzisieren? Geben Sie uns Bescheid – so wird der Guide für alle besser.