News

Optimierung der lokalen KI-Ausführung im Browser: Einführung von Hugging Face WebGPU-Kernels

Optimierung der lokalen KI-Ausführung im Browser: Einführung von Hugging Face WebGPU-Kernels

Das Wichtigste in Kürze

  • Hugging Face hat @huggingface/kernels eingeführt, eine JavaScript-Bibliothek zur Optimierung der Ausführung von WebGPU-Operationen für lokale KI im Browser.
  • Die Bibliothek startet mit einer Sammlung von 207 WebGPU-Kernels, die auf dem Hugging Face Hub verfügbar sind.
  • Jeder Kernel ist als versioniertes Paket aufbereitet, das Schnittstelle, Shader-Vorlagen, Korrektheits- und Benchmark-Fälle sowie Nutzungsanweisungen umfasst.
  • Zusätzlich wurde "Fleet" vorgestellt, ein Browser-basiertes Tool für GPU-Benchmarking und Tests, das Leistungs- und Korrektheitsdaten von realen Geräten sammelt.
  • Die Benchmarking-Ergebnisse zeigen signifikante Leistungsverbesserungen der Hugging Face Kernels im Vergleich zu ORT WebGPU auf einer Apple M4 GPU.
  • Ziel ist es, eine transparente und standardisierte Grundlage für WebAI zu schaffen, die eine schnelle und zuverlässige lokale Inferenz ermöglicht.

Revolutionierung der lokalen KI im Browser: Hugging Face stellt 200+ WebGPU Kernels vor

Im Bereich der Künstlichen Intelligenz (KI) und des maschinellen Lernens (ML) ist die Effizienz der Ausführung von Modellen, insbesondere im Browser, ein zentraler Aspekt. Hugging Face, bekannt für seine Beiträge zur Open-Source-KI-Gemeinschaft, hat nun mit der Einführung von @huggingface/kernels einen wichtigen Schritt unternommen, um die lokale KI-Inferenz im Web zu beschleunigen und zu vereinfachen. Diese Initiative umfasst eine Bibliothek zur Ausführung optimierter WebGPU-Kernels und eine anfängliche Sammlung von über 200 dieser Kernels, die auf dem Hugging Face Hub bereitgestellt werden.

Die Bedeutung von WebGPU für Browser-KI

Moderne KI-Modelle, die im Browser ausgeführt werden, basieren letztlich auf einer Sequenz von GPU-Operationen. Hierzu zählen unter anderem Matrixmultiplikationen, Normalisierungen, Faltungsprozesse und Quantisierungsoperationen. WebGPU stellt eine portable API bereit, die diese Operationen in aktuellen Browsern zugänglich macht, während WGSL (WebGPU Shading Language) eine gemeinsame Sprache für die ausführenden Shader bietet.

Die Portabilität von WebGPU bedeutet jedoch nicht automatisch eine optimale Leistung. Die Effizienz von Shadern kann je nach Workgroup-Größen, Speicherzugriffsmustern, Vektorisierung, Datentypen und Fusionsstrategien erheblich variieren. Die optimale Wahl dieser Parameter kann sich zudem mit der Eingabeform, dem verwendeten Gerät, dem Browser und den verfügbaren WebGPU-Funktionen ändern. Aus diesem Grund bilden optimierte Kernels eine grundlegende Schicht für eine schnelle Browser-Inferenz. Höherstufige Laufzeiten können nur so effizient sein wie die Operationen, die sie anstoßen.

Ein umfassendes Kernel-Ökosystem

Die von Hugging Face veröffentlichte Sammlung umfasst 207 WebGPU-Kernels, die als individuelle Repositories unter der Organisation webgpu-kernels auf dem Hugging Face Hub verfügbar sind. Jeder dieser Kernels ist unter der Apache-2.0-Lizenz lizenziert und als vollständiges, versioniertes Paket konzipiert. Dies beinhaltet:

  • Eine definierte Schnittstelle
  • Shader-Vorlagen
  • Fälle zur Überprüfung der Korrektheit
  • Benchmark-Fälle
  • Detaillierte Nutzungsanweisungen

Diese Struktur verwandelt einen Shader in ein wiederverwendbares Softwareartefakt. Die Schnittstelle ist ohne direkten WGSL-Code lesbar, und die Korrektheits- sowie Performance-Fälle sind direkt mit der Implementierung verknüpft. Veröffentlichte Versionen können explizit geladen werden, was die Abhängigkeit von unversionierten Datei-URLs eliminiert und eine stabile Grundlage für Entwickler schafft.

Der JavaScript-Loader @huggingface/kernels

Um die Nutzung dieser Kernels zu erleichtern, hat Hugging Face den JavaScript-Loader @huggingface/kernels entwickelt. Dieser Loader ermöglicht es, Kernels direkt vom Hub herunterzuladen, vorzubereiten und auszuführen. Die Installation erfolgt über npm, und die Ausführung erfordert einen Browser mit WebGPU-Unterstützung. Die Verfügbarkeit von WebGPU kann in JavaScript mittels "gpu" in navigator überprüft werden.

Ein Beispiel für die Nutzung des Loaders ist die elementweise Addition mit multidirektionalem Broadcasting (ai.onnx.Add). Dieser Kernel, einer der einfachsten in neuronalen Netzen, demonstriert, wie der Loader die Ausgabeform und den logischen Datentyp aus dem Manifest-Vertrag und den Eingaben ableitet, um die Ausgabe automatisch zuzuweisen. Die Architektur ermöglicht es, dass die Aufrufmuster für komplexe Operationen wie die Matrixmultiplikation (ai.onnx.MatMul) identisch bleiben, während die Kernels im Hintergrund auf verschiedene Varianten zurückgreifen können, um die beste Leistung für die jeweilige Anwendung und Hardware zu gewährleisten.

Leistungsbewertung der Kernels

Hugging Face hat die Leistung seiner WebGPU-Kernels umfassend evaluiert, indem sie diese mit ORT WebGPU auf einer Apple M4 GPU verglichen haben. Die Tests umfassten 1.756 Testfälle über alle 207 Operationen, wobei 809 Fälle für den Vergleich herangezogen wurden, die übereinstimmende Ausgaben und zuverlässige Zeitmessungen lieferten. Die Ergebnisse zeigten, dass die Hugging Face Kernels im geometrischen Mittel 2,57-mal schneller und im Median 1,90-mal schneller waren. Von den verglichenen Fällen gewannen die Hugging Face Kernels in 629 Fällen, verloren in 176 und endeten in 4 Unentschieden.

Besondere Leistungssteigerungen wurden bei spezifischen, rechenintensiven Fällen festgestellt. So war ein bilinearer Einsum-Fall über 10.000-mal schneller, und ein zeilenweises CumSum war 301-mal schneller. Diese extremen Fälle verdeutlichen das Potenzial spezialisierter Kernels, wenn allgemeine Implementierungen auf Engpässe stoßen. Es ist jedoch zu beachten, dass diese Zahlen die Leistung einzelner Operationen darstellen und nicht die eines vollständigen Modells. Die tatsächliche Leistung kann je nach GPU und Browser variieren.

Fleet: Ein Community-gestütztes Benchmarking-Tool

Um ein umfassenderes Bild der WebGPU-Leistung über verschiedene Geräte und Browser hinweg zu erhalten, wurde "Fleet" eingeführt. Fleet ist ein Browser-basiertes Benchmarking- und Test-Tool, das es Nutzern ermöglicht, Korrektheits- und Leistungstests direkt in ihrem Browser durchzuführen. Mit der Zustimmung der Nutzer trägt jede Ausführung privat zur Datensammlung bei, die dabei hilft, gerätespezifische Fehler zu identifizieren, verschiedene Kernel-Varianten zu vergleichen und Auswahlregeln zu optimieren. Das Ziel von Fleet ist es, durch eine breite, reale Abdeckung die Kernels schneller und zuverlässiger für alle Nutzer zu machen.

Aufbau einer gemeinsamen Grundlage für WebAI

Die Veröffentlichung der 207 WebGPU-Kernels ist als Ausgangspunkt zu verstehen. Durch die unabhängige Veröffentlichung der Kernels auf dem Hub wird ein gemeinsamer Ort für die Überprüfung von Verträgen, den Vergleich von Implementierungen, die Reproduktion von Korrektheitsprüfungen und die Verbesserung der Leistung geschaffen, ohne jeden Shader direkt in jede Laufzeitumgebung einbetten zu müssen. Diese Sammlung ist Teil eines breiteren Kernel-Ökosystems auf dem Hub, das auch Kernels für CUDA, ROCm und Metal umfasst.

Die einzelnen Komponenten dieses Ökosystems verstärken sich gegenseitig:

  • Kernel-Repositories definieren transparente, versionierte Operationsverträge.
  • @huggingface/kernels vereinfacht das Laden und Ausführen dieser Operationen aus JavaScript.
  • Fleet sammelt Echtzeit-Daten von einer Vielzahl von Geräten, die über herkömmliche Benchmark-Labore hinausgehen.
  • Jede beigesteuerte Ausführung kann Fehler aufdecken, die Abstimmung leiten, die Variantenauswahl verbessern und zukünftige Kernel-Versionen validieren.

Diese Initiativen bilden eine grundlegende Basis für die Weiterentwicklung der Browser-Inferenz-Stacks. Sie zielen darauf ab, die Kernels mit höherstufigen Modell-Tools zu verbinden, die Operationsabdeckung zu erweitern und eine schnelle lokale Inferenz im gesamten WebAI-Ökosystem zugänglicher zu machen.

Fazit

Die Einführung von @huggingface/kernels und der zugehörigen WebGPU-Kernel-Sammlung durch Hugging Face stellt einen bedeutenden Fortschritt für die lokale KI im Browser dar. Durch die Bereitstellung optimierter, versionierter und transparent dokumentierter Kernels sowie eines Community-gestützten Benchmarking-Tools wird eine solide Grundlage für die Entwicklung schneller und effizienter WebAI-Anwendungen geschaffen. Diese Entwicklung trägt dazu bei, die Leistungsfähigkeit von KI-Modellen direkt in den Händen der Nutzer zu verbessern und die Zugänglichkeit von KI-Technologien weiter zu demokratisieren.

Bibliography

  • Hugging Face Blog. (2026, September 1). Introducing @huggingface/kernels: 200+ WebGPU Kernels for Local AI. Retrieved from huggingface.co/blog/webgpu-kernels
  • Hugging Face. (n.d.). Kernels · Hugging Face. Retrieved from huggingface.co/docs/kernels/main/en/index
  • Hugging Face. (n.d.). huggingface/kernels. Retrieved from github.com/huggingface/kernels/
  • Hugging Face Blog. (2025, June 12). Learn the Hugging Face Kernel Hub in 5 Minutes. Retrieved from huggingface.co/blog/hello-hf-kernels
  • Hugging Face Changelog. (2026, April 15). Introducing Kernels. Retrieved from huggingface.co/changelog/kernels
  • Hugging Face. (n.d.). Quickstart · Hugging Face. Retrieved from huggingface.co/docs/kernels/main/en/basic-usage
  • Hugging Face Blog. (2026, July 6). Kernels: Major Updates - Hugging Face. Retrieved from huggingface.co/blog/revamped-kernels
  • Hugging Face. (n.d.). Why kernels? · Hugging Face. Retrieved from huggingface.co/docs/kernels/why_kernels
  • HyperAI. (2026, September 1). Hugging Face Releases 207 Optimized WebGPU Kernels for Local AI. Retrieved from hyper.ai/en/stories/0f146bbd840c1766b301fab4b1bea68d
  • Daily.dev. (2026, September 1). Introducing @huggingface/kernels: 200+ WebGPU Kernels for Local AI. Retrieved from daily.dev/posts/introducing-huggingface-kernels-200-webgpu-kernels-for-local-ai-acmz1w1ld

KI, die in Deutschland zu Hause ist.

Testen Sie Mindverse Studio oder sprechen Sie mit unserem Team über Ihren Anwendungsfall.