News

Neueste Entwicklungen in der KI: Liquid AIs LFM2.5 Q4_0 Checkpoints mit verbesserter Genauigkeit durch Quantization-Aware Distillation

Neueste Entwicklungen in der KI: Liquid AIs LFM2.5 Q4_0 Checkpoints mit verbesserter Genauigkeit durch Quantization-Aware Distillation

Das Wichtigste in Kürze

  • Liquid AI hat aktualisierte 4-Bit-Checkpoints (LFM2.5 Q4_0 GGUFs) für seine LFM2.5-Modellreihe veröffentlicht.
  • Diese Checkpoints wurden mittels Quantization-Aware Distillation (QAD) trainiert, einer Methode, die die Genauigkeit von quantisierten Modellen verbessert.
  • Die QAD-Checkpoints erreichen etwa 97 % der BF16-Baseline-Genauigkeit, während sie die niedrigen Speicher- und hohen Durchsatzvorteile der Q4_0-Quantisierung beibehalten.
  • Die Modelle sind in verschiedenen Größen (230M, 350M, 1.2B-Instruct und 2.6B) verfügbar und auf Plattformen wie Hugging Face zugänglich.
  • Benchmarking-Ergebnisse zeigen eine signifikante Verbesserung der Qualität im Vergleich zur reinen Post-Training Quantization (PTQ).
  • Die verbesserte Effizienz und Genauigkeit ermöglicht den Einsatz auf Edge-Geräten wie Smartphones, Laptops und eingebetteten Systemen.

Revolution in der Modelloptimierung: Liquid AIs LFM2.5 Q4_0 Checkpoints mit Quantization-Aware Distillation

Im Bereich der Künstlichen Intelligenz (KI) stellt die Effizienz von Modellen auf Edge-Geräten eine fortwährende Herausforderung dar. Die Notwendigkeit, leistungsstarke Modelle auf Hardware mit begrenzten Ressourcen zu betreiben, führt oft zu Kompromissen bei der Genauigkeit. Eine aktuelle Entwicklung von Liquid AI, die Veröffentlichung der LFM2.5 Q4_0 Checkpoints, adressiert diese Herausforderung durch den Einsatz der Quantization-Aware Distillation (QAD)-Methode. Dieser Artikel beleuchtet die technischen Details, die Vorteile und die Implikationen dieser Neuerung für die B2B-Zielgruppe.

Quantization-Aware Distillation (QAD): Eine technische Einordnung

Die Quantisierung ist ein Prozess, bei dem die numerische Präzision von Modellgewichten und -aktivierungen reduziert wird, um den Speicherbedarf und die Rechenlast zu verringern. Dies ist besonders relevant für den Einsatz von KI-Modellen auf Edge-Geräten, wo Energieeffizienz und geringe Latenz entscheidend sind. Traditionelle Methoden wie die Post-Training Quantization (PTQ) quantisieren ein bereits trainiertes Modell. Dies kann jedoch zu einem spürbaren Verlust an Genauigkeit führen, da das Modell nicht darauf ausgelegt ist, mit den durch die Quantisierung eingeführten Fehlern umzugehen.

Hier setzt die Quantization-Aware Distillation (QAD) an. QAD ist eine Technik, bei der ein hochpräzises „Lehrer“-Modell in ein quantisiertes „Schüler“-Modell destilliert wird. Im Gegensatz zur PTQ wird bei QAD die Quantisierung bereits während des Trainings simuliert. Dies ermöglicht es dem Schüler-Modell, sich an die durch die Quantisierung entstehenden Rauschmuster anzupassen und somit einen Großteil der Genauigkeit zu bewahren, die bei der reinen PTQ verloren gehen würde. Das Ergebnis sind Modelle, die die geringen Speicheranforderungen und den hohen Durchsatz von quantisierten Modellen aufweisen, aber gleichzeitig eine deutlich höhere Genauigkeit bieten.

Die LFM2.5 Q4_0 Checkpoints im Detail

Liquid AI hat aktualisierte 4-Bit-Checkpoints für seine LFM2.5-Modellfamilie veröffentlicht, darunter LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct und LFM2.5-2.6B. Diese Checkpoints sind im GGUF Q4_0-Format verfügbar und wurden mit der QAD-Methode trainiert. Der Fokus liegt darauf, die Modelle mit der Speichereffizienz und Geschwindigkeit von Q4_0 zu betreiben, ohne die üblichen Qualitätseinbußen hinnehmen zu müssen.

Die Entwickler von Liquid AI berichten, dass die QAD-trainierten Checkpoints etwa 97 % der durchschnittlichen BF16-Genauigkeit wiederherstellen, die durch die Quantisierung verloren gegangen wäre. BF16 (BFloat16) ist ein Gleitkommaformat, das oft als Referenz für die volle Präzision dient.

Benchmarking und Leistungsanalyse

Um die Leistungsfähigkeit der QAD-Checkpoints zu demonstrieren, wurden umfassende Benchmarks durchgeführt. Die Modelle wurden auf einer Reihe von Aufgaben evaluiert, die Schlussfolgerung, Befolgung von Anweisungen, Werkzeugnutzung und agentische Fähigkeiten umfassen. Zu den verwendeten Benchmarks gehören GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF und BFCLv4. Zusätzlich wurden modellspezifische mathematische Evaluierungen wie GSM8K für kleinere Modelle (LFM2.5-230M und LFM2.5-350M) und AIME25 für größere Modelle (LFM2.5-1.2B-Instruct und LFM2.5-2.6B) durchgeführt.

Die Ergebnisse zeigen, dass QAD die Q4_0-Checkpoints in allen vier Modellgrößen erheblich verbessert. Die Wiederherstellung der Genauigkeit war besonders ausgeprägt bei kleineren Modellen, bei denen die PTQ Q4_0 einen größeren relativen Qualitätsverlust verursachte. Die resultierenden QAD-Checkpoints behielten 97,1 %, 96,5 %, 97,4 % und 96,6 % ihrer jeweiligen BF16-Baseline-Leistung bei.

Darüber hinaus wurden die Modelle auf verschiedenen Edge-Hardware-Plattformen hinsichtlich ihres Durchsatzes getestet: MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra und Raspberry Pi 5. Diese Tests umfassten sowohl GPU- als auch Arm-CPU-Inferenz. Die Analyse der Leistungsdaten ergab, dass die QAD Q4_0-Checkpoints die Qualität von Q5_K_M bei kleineren Modellen (230M und 350M) innerhalb der Evaluierungsvarianz erreichen, und dies bei einem um 4-33 % höheren Dekodierungsdurchsatz. Bei größeren Modellen (1.2B und 2.6B) erreichen sie die Qualität von Q4_K_M mit einem 3-14 % höheren Durchsatz. Dies deutet auf eine verbesserte Effizienz im Vergleich zu anderen Quantisierungsformaten hin.

Implikationen für die B2B-Anwendung

Die Einführung der LFM2.5 Q4_0 Checkpoints mit QAD hat weitreichende Implikationen für Unternehmen, die KI-Modelle auf Edge-Geräten einsetzen möchten. Die Möglichkeit, Modelle mit nahezu voller Genauigkeit bei gleichzeitig deutlich reduziertem Ressourcenverbrauch zu betreiben, eröffnet neue Anwendungsfelder und verbessert bestehende Lösungen.

Kosteneffizienz: Durch den geringeren Speicherbedarf und die höhere Energieeffizienz können Unternehmen Hardwarekosten senken und den Betrieb von KI-Anwendungen auf kostengünstigeren Geräten ermöglichen.

Leistungssteigerung: Der höhere Durchsatz und die verbesserte Latenz sind entscheidend für Echtzeitanwendungen, beispielsweise in der industriellen Automatisierung, bei autonomen Systemen oder in der medizinischen Diagnostik.

Datenschutz und Sicherheit: Modelle, die direkt auf dem Gerät laufen, verringern die Notwendigkeit, sensible Daten zur Verarbeitung in die Cloud zu senden. Dies kann die Einhaltung von Datenschutzbestimmungen erleichtern und die Datensicherheit erhöhen.

Erweiterte Einsatzmöglichkeiten: Die verbesserte Leistung auf Edge-Geräten ermöglicht den Einsatz von komplexeren KI-Modellen in Umgebungen, in denen dies zuvor nicht praktikabel war, etwa in abgelegenen Gebieten oder bei eingeschränkter Konnektivität.

Fazit

Die von Liquid AI vorgestellten LFM2.5 Q4_0 Checkpoints, die durch Quantization-Aware Distillation optimiert wurden, stellen einen Fortschritt in der Entwicklung effizienter und leistungsfähiger KI-Modelle für Edge-Anwendungen dar. Die Kombination aus hoher Genauigkeit und den Vorteilen der 4-Bit-Quantisierung bietet Unternehmen neue Möglichkeiten zur Implementierung und Skalierung von KI-Lösungen. Die Verfügbarkeit dieser Checkpoints auf Plattformen wie Hugging Face erleichtert Entwicklern den Zugang und die Integration in ihre Projekte.

Diese Entwicklung unterstreicht die Bedeutung kontinuierlicher Forschung und Innovation im Bereich der KI, um die technologischen Grenzen zu erweitern und den praktischen Nutzen von Künstlicher Intelligenz in vielfältigen Geschäftsbereichen zu maximieren.

Bibliography: - Liquid AI. (2026, August). LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment. Liquid AI Blog. - Liquid AI. (o.D.). Device-native foundation models. Abgerufen von https://www.liquid.ai/ - Cocoloop. (2026, August 19). Liquid AI revives Q4_0 quantization with 97% accuracy via distillation. News - Cocoloop. - aimodelkit.com. (2026, August 19). Optimizing LFM2.5 Q4_0 Checkpoints Through Quantization-Aware Distillation Techniques. - LinkedIn. (2026, August 19). Liquid AI's Post. - Agent5. (2026, August 19). LFM2.5 Q4_0 Checkpoints from Quantization-Aware Distillation. - Ray, S. (2026, August 19). LFM2.5 Q4_0 Checkpoints Just Dropped on Hugging Face. YouTube. - AI News Brief. (2026, August 19). LFM2.5 Q4_0 Checkpoints from Quantization-Aware Distillation. - arXiv. (2026, März 1). Quantization-Aware Distillation for NVFP4 Inference Accuracy Recovery. - Lee, S. (2026, August 17). Developing Nemotron 3.5 Lightning NVFP4 with QAD Using NVIDIA Model Optimizer. NVIDIA Technical Blog.

KI, die in Deutschland zu Hause ist.

Testen Sie Mindverse Studio oder sprechen Sie mit unserem Team über Ihren Anwendungsfall.