News

Tencents neues Modell AuK für Spracherzeugung und -bearbeitung

Tencents neues Modell AuK für Spracherzeugung und -bearbeitung

Das Wichtigste in Kürze

  • Tencent hat AuK, ein vereinheitlichtes Modell für Spracherzeugung und -bearbeitung, veröffentlicht.
  • AuK unterstützt Zero-Shot Text-to-Speech (TTS), instruktionsgesteuerte Inhalts-, Akustik- und paralinguistische Bearbeitung.
  • Das Modell ermöglicht Sprachanreicherung und Quellentrennung über eine einzige, natürlichsprachliche Schnittstelle.
  • Eine destillierte Version, AuK-Flash, bietet eine 4,5-fach höhere Verarbeitungsgeschwindigkeit.
  • AuK ist als Open-Source-Modell verfügbar und basiert auf einem 1,5 Milliarden Parameter starken Fundamentmodell.

Tencents AuK: Ein vereinheitlichtes Modell für Spracherzeugung und -bearbeitung

Im Bereich der künstlichen Intelligenz schreitet die Entwicklung von Sprachmodellen kontinuierlich voran. Eine aktuelle Veröffentlichung von Tencent, das Modell AuK, stellt eine Neuerung in der integrierten Spracherzeugung und -bearbeitung dar. Dieses Modell, das über eine natürlichsprachliche Schnittstelle bedient wird, vereint verschiedene Funktionen, die bisher oft separate Lösungen erforderten. Es wurde unter anderem von der Shanghai Jiao Tong Universität mitentwickelt und als Open-Source-Projekt zugänglich gemacht.

Funktionsweise und Fähigkeiten von AuK

AuK ist ein Fundamentmodell mit 1,5 Milliarden Parametern, das darauf ausgelegt ist, ein breites Spektrum an sprachbezogenen Aufgaben zu bewältigen. Es wurde auf Millionen Stunden diverser Audiodaten trainiert und bietet eine Reihe von Kernfunktionen:

  • Zero-Shot Text-to-Speech (TTS): Diese Funktion ermöglicht die Generierung von Sprache aus Text, ohne dass zuvor spezifische Trainingsdaten für eine bestimmte Stimme oder Sprechweise bereitgestellt werden müssen. Das System kann somit unbekannte Stimmen oder Sprachstile nachahmen.
  • Instruktionsgesteuerte Bearbeitung: AuK unterstützt die Bearbeitung von Sprache basierend auf natürlichsprachlichen Anweisungen. Dies umfasst verschiedene Ebenen der Bearbeitung:
    • Inhaltsbearbeitung: Änderungen am gesprochenen Text.
    • Akustische Bearbeitung: Anpassungen der Klangcharakteristik, wie Tonhöhe, Lautstärke oder Sprechgeschwindigkeit.
    • Paralinguistische Bearbeitung: Beeinflussung von nicht-sprachlichen Aspekten der Kommunikation, wie Emotionen, Intonation oder Betonung.
  • Sprachanreicherung: Das Modell kann die Qualität von Sprachaufnahmen verbessern, beispielsweise durch Rauschunterdrückung.
  • Quellentrennung: AuK ist in der Lage, verschiedene Audioquellen in einer Aufnahme zu identifizieren und voneinander zu trennen, was beispielsweise bei der Isolierung von Stimmen in Umgebungsgeräuschen nützlich sein kann.

Die Bedienung dieser komplexen Funktionen erfolgt über eine einzige, vereinheitlichte Schnittstelle, die natürliche Spracheingaben verarbeitet. Dies soll die Zugänglichkeit und Benutzerfreundlichkeit des Modells erhöhen.

AuK-Flash: Eine optimierte Variante

Neben der Basisversion von AuK hat Tencent auch eine destillierte Variante namens AuK-Flash vorgestellt. Diese Version ist speziell auf Effizienz getrimmt und ermöglicht eine deutlich schnellere Inferenz. Laut den Entwicklern ist AuK-Flash 4,5-mal schneller als das Originalmodell und führt die Spracherzeugung in nur vier Schritten durch. Dies könnte für Anwendungen von Bedeutung sein, die eine schnelle Verarbeitung in Echtzeit erfordern, wie beispielsweise in interaktiven Sprachassistenten oder bei der Live-Übersetzung.

Architektur und Trainingsdaten

Die technische Grundlage von AuK basiert auf einer Kombination mehrerer Komponenten. Ein multimodaler Sprachmodell-Ansatz, ein gemeinsamer VAE (Variational Autoencoder) für den akustischen latenten Raum und ein hybrider rectified-flow Transformer bilden das Gerüst. Das Modell wurde auf ungefähr 3,03 Milliarden Instruktions-Audio-Instanzen und 1,95 Millionen Stunden an überwachten Daten trainiert. Diese umfangreiche Datenbasis ermöglicht es AuK, eine hohe Leistungsfähigkeit in den verschiedenen Aufgabenbereichen zu erreichen.

Die Trainingsstrategie umfasste zunächst eine Aufwärmphase für reine Generierungsaufgaben, gefolgt von einem gemeinsamen Vortraining für Generierung und Bearbeitung. Für offene Bearbeitungsaufgaben wurde eine Optimierung mittels menschlichem Feedback implementiert, während Spracherzeugungsaufgaben durch Flow-GRPO (Reinforcement Learning) verbessert wurden. Die Entwicklung von AuK-Flash erfolgte durch eine Entkopplung der DMD-Destillation (Denoising Diffusion Models), die eine schnelle Inferenz ohne klassifikatorfreie Führung ermöglicht.

Anwendungsbereiche und Perspektiven

Die Fähigkeiten von AuK könnten in verschiedenen B2B-Szenarien Anwendung finden. Dazu gehören unter anderem:

  • Medienproduktion: Automatisierte Erstellung und Bearbeitung von Sprachinhalten für Podcasts, Hörbücher oder Synchronisationen.
  • Kundenservice: Entwicklung fortschrittlicher Sprachassistenten, die komplexe Anfragen verstehen und natürlich klingende Antworten generieren können.
  • Barrierefreiheit: Verbesserte Text-to-Speech-Systeme für Menschen mit Seh- oder Leseschwäche.
  • Content-Erstellung: Effiziente Produktion von Audio-Content für Marketing, Bildung oder Unterhaltung.

Die Open-Source-Verfügbarkeit von AuK und AuK-Flash über Plattformen wie Hugging Face ermöglicht es Entwicklern und Unternehmen weltweit, das Modell zu nutzen, anzupassen und weiterzuentwickeln. Dies könnte zu einer Beschleunigung der Innovation im Bereich der Sprach-KI beitragen und neue Anwendungsfelder erschließen.

Die Veröffentlichung von AuK und AuK-Flash durch Tencent stellt einen Schritt in Richtung vereinheitlichter und effizienterer Sprach-KI-Modelle dar. Die Kombination aus vielfältigen Bearbeitungsmöglichkeiten und hoher Geschwindigkeit könnte die Art und Weise, wie mit gesprochener Sprache in digitalen Umgebungen interagiert wird, beeinflussen.

Bibliographie

  • Hugging Face (o.J.). tencent/AuK-Flash. Verfügbar unter: https://huggingface.co/tencent/AuK-Flash [Abgerufen am 10. Mai 2024].
  • Hugging Face (o.J.). tencent/AuK. Verfügbar unter: https://huggingface.co/tencent/AuK [Abgerufen am 10. Mai 2024].
  • Hawthorne, E. (2026). AuK-Flash & AuK: Tencent's Quiet Open-Source Speech Model. Orcarouter.ai. Verfügbar unter: https://www.orcarouter.ai/blog/auk-flash-open-source-release [Abgerufen am 10. Mai 2024].
  • Chen, X. et al. (2026). AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing. alphaXiv. Verfügbar unter: https://www.alphaxiv.org/abs/2609.08936 [Abgerufen am 10. Mai 2024].
  • Dufresne, A. (2026). Shanghai Jiao Tong Open-Sources AuK, a 1.5B Foundation Model Unifying Speech. AI Weekly. Verfügbar unter: https://aiweekly.co/alerts/shanghai-jiao-tong-open-sources-auk-a-15b-foundation-model-unifying-speech [Abgerufen am 10. Mai 2024].
  • Ma, Z. et al. (2026). AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing. Hugging Face Papers. Verfügbar unter: https://huggingface.co/papers/2609.08936 [Abgerufen am 10. Mai 2024].
  • Hugging Face (o.J.). README.md · tencent/AuK-Flash. Verfügbar unter: https://huggingface.co/tencent/AuK-Flash/blob/715df01f7f7d8711a9fecebc8ca10964ea88f012/README.md [Abgerufen am 10. Mai 2024].
  • Paperium.net (2026). AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing: Analysis, Review & Summary. Verfügbar unter: https://paperium.net/article/en/23696/auk-technical-report-an-open-source-foundational-model-for-speech-generationand-editing [Abgerufen am 10. Mai 2024].
  • _akhaliq (o.J.). AK (@_akhaliq) — X Web Viewer. Verfügbar unter: https://twiscan.com/en/x/_akhaliq [Abgerufen am 10. Mai 2024].
  • 通曜智能 (2026). 论文解读《AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing》. Verfügbar unter: https://www.tyaix.com/auk-open-source-speech-generation-editing/ [Abgerufen am 10. Mai 2024].

KI, die in Deutschland zu Hause ist.

Testen Sie Mindverse Studio oder sprechen Sie mit unserem Team über Ihren Anwendungsfall.