
Von der ersten Idee bis zur voll integrierten KI-Lösung – strukturiert, sicher und mit messbarem Erfolg
Wir analysieren Ihre Geschäftsprozesse und identifizieren konkrete Use Cases mit dem höchsten ROI-Potenzial.
✓ Messbare KPIs definiert
Vollständige Datenschutz-Analyse und Implementierung sicherer Datenverarbeitungsprozesse nach EU-Standards.
✓ 100% DSGVO-konform
Maßgeschneiderte Auswahl der optimalen KI-Lösung – von Azure OpenAI bis zu Open-Source-Alternativen.
✓ Beste Lösung für Ihren Fall
Schneller Proof of Concept mit nahtloser Integration in Ihre bestehende IT-Infrastruktur und Workflows.
✓ Ergebnisse in 4-6 Wochen
Unternehmensweiter Rollout mit umfassenden Schulungen für maximale Akzeptanz und Produktivität.
✓ Ihr Team wird KI-fit
Die Fähigkeit, Informationen aus verschiedenen Modalitäten wie Text, Bild und Video zu verarbeiten und in eine einheitliche, numerische Darstellung – ein sogenanntes Embedding – zu überführen, ist ein Eckpfeiler der modernen Künstlichen Intelligenz. Diese multimodalen Embeddings sind entscheidend für die Leistungsfähigkeit von industriellen Such- und Empfehlungssystemen sowie für die Funktionsweise fortschrittlicher KI-Agenten.
Plattformen wie Douyin, Xiaohongshu und YouTube, die mit komplexen Modalitäten und massiven Inhaltsmengen operieren, stehen vor erheblichen Herausforderungen. Sie benötigen Modelle, die sowohl effizient bei der Indexierung von Milliarden von Inhalten sind als auch eine feingranulare Diskriminierung für präzise Übereinstimmungen bieten. Bisherige Modelle, insbesondere multimodale Large Language Model (MLLM) Embedding-Modelle, konnten diese beiden Anforderungen selten gleichzeitig erfüllen.
Kontrastive Modelle sind zwar effizient, basieren jedoch oft auf paarweiser Supervision, die für feingranulare Unterscheidungen zu grob sein kann. Demgegenüber verbessern CoT-basierte (Chain-of-Thought) Modelle die Diskriminierung durch explizite Generierung, was jedoch im Online-Betrieb oft unpraktikabel ist, da es zu hohe Rechenkosten verursacht.
Vor diesem Hintergrund hat Douyin ein neues Modell vorgestellt: das Douyin Multimodal Embedding (DME). Dieses Modell wurde entwickelt, um die Stärken beider Ansätze zu vereinen und sowohl Effizienz als auch feingranulare Diskriminierung zu gewährleisten.
Das DME-Modell ist in einem zweistufigen Prozess trainiert:
Es ist wichtig zu beachten, dass beide Mechanismen der zweiten Stufe ausschließlich während des Trainings aktiv sind. Im Online-Betrieb entstehen dadurch nur marginale zusätzliche Kosten auf der Abfrageseite, wodurch DME so effizient wie ein Standard-Kontrastencoder agiert.
Die Leistungsfähigkeit des DME-Modells wurde umfassend evaluiert. Auf dem MMEB-v2 Benchmark erzielen die 2B- und 9B-Varianten des Modells modernste Ergebnisse von 74,8 bzw. 78,4 Punkten. Besonders hervorzuheben ist die Stärke des Modells bei Video- und visuellen Dokumentenaufgaben.
In der Produktion liefert DME einen relativen Gewinn von 2,92 % auf Douyins internem Offline-Evaluierungsdatensatz. Das Modell wird bereits in verschiedenen Douyin-Szenarien eingesetzt, darunter generative, Bild- und KI-Suche. Im Online-A/B-Testing für die Douyin-Suche wurde zudem ein Lifetime (LT) Gewinn von 0,1 % erzielt.
Das Douyin Multimodal Embedding (DME) Modell stellt einen signifikanten Fortschritt im Bereich des multimodalen Repräsentationslernens dar. Durch die Kombination eines effizienten zweistufigen Trainingsansatzes mit fortschrittlichen Mechanismen zur Verbesserung der semantischen Suffizienz adressiert es die kritischen Anforderungen von Effizienz und feingranularer Diskriminierung in großskaligen realen Anwendungen. Die erzielten Ergebnisse und der erfolgreiche Einsatz in der Produktion unterstreichen das Potenzial dieses Modells, die nächste Generation von KI-gestützten Such- und Empfehlungssystemen maßgeblich zu prägen.
Lernen Sie in nur 30 Minuten kennen, wie Ihr Team mit KI mehr erreichen kann – live und persönlich.
🚀 Demo jetzt buchen