News
Kimi K3 und die Optimierung für NVIDIA Hopper-GPUs durch FP8-Quantisierung
Das Wichtigste in Kürze
- Kimi K3 ist ein multimodales Sprachmodell mit 2,8 Billionen Parametern, entwickelt von Moonshot AI.
- Es nutzt eine neue Architektur mit Kimi Delta Attention (KDA) und Attention Residuals (AttnRes) sowie ein Stable LatentMoE-Framework.
- Ein kürzlich veröffentlichter FP8-Block-quantisierter Checkpoint ermöglicht die effiziente Ausführung von Kimi K3 auf NVIDIA Hopper-Architekturen.
- FP8-Quantisierung nutzt die nativen Tensor Cores der Hopper-GPUs und kann die Inferenzgeschwindigkeit erheblich steigern.
- Die Integration mit vLLM ermöglicht eine sofortige Nutzung dieser optimierten Modelle.
- Diese Entwicklung ist besonders relevant für Unternehmen, die Hochleistungs-KI-Anwendungen auf NVIDIA Hopper-Hardware betreiben.
Die Landschaft der künstlichen Intelligenz entwickelt sich rasant weiter, und mit ihr die Anforderungen an die Hardware-Architekturen, die diese komplexen Modelle unterstützen. Eine aktuelle Entwicklung, die für Unternehmen im B2B-Sektor von großem Interesse sein dürfte, betrifft die Optimierung des Sprachmodells Kimi K3 für NVIDIA Hopper-GPUs mittels FP8-Quantisierung. Diese technische Neuerung verspricht eine signifikante Steigerung der Effizienz und Leistung bei der Inferenz großer Sprachmodelle.
Kimi K3: Ein Überblick über das Modell
Kimi K3, entwickelt von Moonshot AI, ist ein Open-Weight, multimodales agentisches Modell, das als eines der leistungsfähigsten Modelle seiner Art gilt. Mit 2,8 Billionen Parametern basiert Kimi K3 auf der Kimi Delta Attention (KDA) und Attention Residuals (AttnRes) Architektur. Es verfügt über native Bildverarbeitungsfähigkeiten und ein Kontextfenster von einer Million Tokens. Das Modell ist darauf ausgelegt, komplexe Aufgaben in den Bereichen Langzeit-Codierung, Wissensarbeit und logisches Denken zu bewältigen.
Ein wesentliches Merkmal der Architektur ist das Stable LatentMoE-Framework, das die MoE-Sparsity skaliert und 16 von 896 Experten aktiviert. Dies führt zu einer Effizienzsteigerung von etwa dem 2,5-fachen im Vergleich zu Kimi K2. Obwohl Kimi K3 in seiner Gesamtleistung hinter den leistungsstärksten proprietären Modellen wie Claude Fable 5 und GPT 5.6 Sol rangiert, zeigt es dennoch eine robuste Leistung auf Frontier-Niveau.
Die Rolle der NVIDIA Hopper-Architektur
Die NVIDIA Hopper-Architektur, repräsentiert durch GPUs wie die H100 und H200, wurde speziell für die Anforderungen moderner KI-Workloads konzipiert. Ein zentrales Element dieser Architektur sind die Tensor Cores, die für die Beschleunigung von Matrixoperationen optimiert sind, welche die Grundlage neuronaler Netze bilden. Insbesondere unterstützen Hopper-GPUs native FP8-Berechnungen.
FP8, eine Gleitkommadarstellung mit 8 Bit, bietet gegenüber höheren Präzisionen wie FP16 oder BF16 den Vorteil einer deutlich reduzierten Speicher- und Bandbreitennutzung sowie einer potenziell höheren Rechenleistung. Die native Unterstützung von FP8 durch die Tensor Cores der Hopper-Architektur ermöglicht es, die für diese GPUs entwickelte Leistung voll auszuschöpfen.
FP8-Quantisierung für Kimi K3 auf Hopper
Die jüngste Veröffentlichung eines FP8-Block-quantisierten Checkpoints für Kimi K3 ist ein entscheidender Schritt zur Optimierung seiner Ausführung auf Hopper-Systemen. Quantisierung ist eine Technik, die es Modellen ermöglicht, mit geringerer Präzision (z.B. FP8 statt FP16) zu rechnen, während die Ausgabequalität akzeptabel bleibt. Dies führt zu einer erheblichen Steigerung des Durchsatzes und einer Verringerung der Latenz.
Normalerweise würden Modelle, die mit NVFP4-Gewichten arbeiten, auf Hopper-GPUs auf den Marlin-Kernel zurückgreifen. Dieser dequantisiert FP4 zu FP16 und nutzt dann FP16-Tensor Cores. Eine solche Vorgehensweise bietet zwar eine Leistung von etwa 989 TFLOPS, ist aber nicht optimal. Die Umwandlung von NVFP4-Gewichten in das FP8-Block-quantisierte Format beim Laden des Modells und die Weiterleitung der Berechnungen über bestehende CUTLASS FP8-Kernel ermöglicht es, die volle Leistung der Hopper-Architektur zu nutzen, die bis zu 3.958 TFLOPS erreichen kann.
Diese Umstellung wird auf Hopper-Systemen automatisch erkannt, wenn native FP4 nicht verfügbar ist, und kann über die Umgebungsvariable VLLM_NVFP4_GEMM_BACKEND=fp8-compute gesteuert werden. Dichte lineare Schichten nutzen padded_cutlass (CUTLASS block-scaled FP8 GEMM), während MoE-Expertenschichten TritonOrDeepGemmExperts (DeepGEMM FP8 MoE) verwenden. Es werden dabei keine neuen CUDA-Kernel benötigt, sondern bestehende FP8-Infrastrukturen wiederverwendet.
Integration mit vLLM
Die nahtlose Integration dieser FP8-optimierten Kimi K3-Modelle mit vLLM ist ein weiterer wichtiger Aspekt dieser Entwicklung. vLLM ist eine Open-Source-Bibliothek für die effiziente Bereitstellung großer Sprachmodelle, die für ihre hohe Durchsatzleistung und geringe Latenz bekannt ist. Die Tatsache, dass vLLM bereits "Day Zero Support" für diese quantisierten Modelle bietet, bedeutet, dass Unternehmen sofort von den Leistungsverbesserungen profitieren können, ohne auf zukünftige Updates warten zu müssen.
Diese Kombination aus einem leistungsstarken Modell, optimierter Quantisierung und einer effizienten Inferenz-Engine schafft eine robuste Lösung für anspruchsvolle KI-Anwendungen im B2B-Bereich.
Implikationen für die B2B-Welt
Für Unternehmen, die KI-Anwendungen entwickeln und betreiben, bieten diese Entwicklungen mehrere Vorteile:
- Kosteneffizienz: Durch die effizientere Nutzung der Hardware können Unternehmen mehr Inferenz-Operationen pro Zeiteinheit durchführen, was die Betriebskosten senken kann.
- Leistungssteigerung: Die signifikante Erhöhung des Durchsatzes und die Reduzierung der Latenz sind entscheidend für Echtzeitanwendungen und Szenarien mit hohem Anfragevolumen.
- Skalierbarkeit: Die optimierte Ausführung auf Hopper-GPUs erleichtert die Skalierung von KI-Workloads, um wachsenden Anforderungen gerecht zu werden.
- Zugänglichkeit: Die Verfügbarkeit von Open-Weight-Modellen wie Kimi K3 in Kombination mit effizienten Quantisierungstechniken demokratisiert den Zugang zu fortschrittlicher KI-Technologie.
Die Fähigkeit, komplexe Modelle wie Kimi K3 auf NVIDIA Hopper-Hardware mit FP8-Quantisierung effizient auszuführen, markiert einen Fortschritt in der Bereitstellung von KI-Lösungen. Unternehmen, die auf Hochleistungs-KI angewiesen sind, sollten diese Entwicklungen genau beobachten und evaluieren, wie sie in ihre bestehenden Infrastrukturen integriert werden können.
Bibliography
- MoonshotAI/Kimi-K3. GitHub. https://github.com/moonshotai/kimi-k3 - README.md · moonshotai/Kimi-K3 at main. Hugging Face. https://huggingface.co/moonshotai/Kimi-K3/blob/main/README.md - Kimi K3 Tech Blog: Open Frontier Intelligence. Kimi.com. https://www.kimi.com/blog/kimi-k3 - [Quantization] Convert NVFP4 weights to FP8 on Hopper for faster inference. GitHub. https://github.com/vllm-project/vllm/pull/38728 - GrEarl/Kimi-K3-NVFP4A16-Transcoded. Hugging Face. https://huggingface.co/GrEarl/Kimi-K3-NVFP4A16-Transcoded - Kimi K3 - How to Run Locally. Unsloth AI. https://unsloth.ai/docs/models/kimi-k3 - FP8 Quantization — TensorRT-LLM. NVIDIA. https://nvidia.github.io/TensorRT-LLM/performance/performance-tuning-guide/fp8-quantization.html - AxionML/Kimi-K2.5-MXFP8. Hugging Face. https://huggingface.co/AxionML/Kimi-K2.5-MXFP8 - GrEarl/Kimi-K3-GGUF. Hugging Face. https://huggingface.co/GrEarl/Kimi-K3-GGUF - festr2/kimi-k2.6-eagle3-mla-fp8. Hugging Face. https://huggingface.co/festr2/kimi-k2.6-eagle3-mla-fp8Passend dazu in Mindverse Studio
- KI-Chat mit allen führenden ModellenGPT, Claude und Gemini in einer Oberfläche — mit Websuche und Quellenangaben.
- Die KI-Plattform für UnternehmenRollen, Freigaben und Abrechnung für den KI-Einsatz im ganzen Unternehmen.
- Studio mit Ihren Tools verbindenIntegrationen für Microsoft 365, Google Workspace, Slack, Notion und mehr.
Weitere News-Artikel
Alle ansehen- Kimi K3 Vorstellung: Fortschritte in der KI mit 2,8 Billionen Parametern und NVFP4-Technologie
- Kimi Linear: Innovationen in der hybriden Aufmerksamkeitsarchitektur
- KI-Modelle lösen Erdős-Problem: Ein Meilenstein in der mathematischen Forschung
- KI-Modelle und ethisches Verhalten unter Stress im Fokus einer neuen Studie
- KI-Modelle und ihre Rolle bei der Identifikation von rechtlichen Schlupflöchern
- KI-Modelle als kritische Denker: Strategien für effektives Prompting
KI, die in Deutschland zu Hause ist.
Testen Sie Mindverse Studio oder sprechen Sie mit unserem Team über Ihren Anwendungsfall.