News
Neues Framework Latent Sketchpad erweitert multimodales Denken in KI-Modellen
Das Wichtigste in Kürze
- "Latent Sketchpad" ist ein neues Framework, das Multimodale Große Sprachmodelle (MLLMs) befähigt, visuelle "Gedanken" zu generieren, um komplexere Schlussfolgerungen zu ermöglichen.
- Das Framework integriert eine "Context-Aware Vision Head" zur autoregressiven Erzeugung visueller Latente und einen "Pretrained Sketch Decoder" zur Visualisierung dieser Latente als Skizzen.
- MLLMs können nun textuelles und visuelles Denken in ihrem autoregressiven Schlussfolgerungsprozess miteinander verknüpfen, was die Interpretierbarkeit und Leistungsfähigkeit verbessert.
- Die Methode wurde auf dem neuen MazePlanning-Datensatz evaluiert und zeigt vergleichbare oder bessere Ergebnisse als bestehende MLLMs wie Gemma3 und Qwen2.5-VL.
- "Latent Sketchpad" arbeitet als Plug-and-Play-Modul, das die ursprüngliche Argumentationsfähigkeit der Basismodelle ohne Beeinträchtigung erweitert.
Einführung in "Latent Sketchpad": Eine neue Dimension des multimodalen Denkens
Multimodale Große Sprachmodelle (MLLMs) haben in den letzten Jahren signifikante Fortschritte im Verständnis visueller Informationen gemacht. Ihre Fähigkeit, Bilder zu analysieren und textuelle Beschreibungen zu generieren, ist beeindruckend. Dennoch stoßen diese Modelle an ihre Grenzen, wenn es um komplexe Aufgaben geht, die ein hohes Maß an visueller Planung, Vorstellungskraft und räumlichem Denken erfordern. Menschliche Kognition nutzt in solchen Situationen oft Skizzen und mentale Bilder, um Ideen zu entwickeln, Szenarien zu simulieren und Pläne zu verfeinern. Inspiriert von dieser menschlichen Fähigkeit stellt eine aktuelle Forschungsarbeit das Framework "Latent Sketchpad" vor. Dieses Framework zielt darauf ab, MLLMs mit einer Art internem visuellen Notizblock auszustatten, um generative visuelle Gedanken zu ermöglichen, ohne die textuelle Argumentationsfähigkeit zu beeinträchtigen.
Die traditionellen internen visuellen Repräsentationen von MLLMs waren bisher primär auf das perzeptive Verständnis beschränkt. "Latent Sketchpad" geht einen Schritt weiter, indem es diese Repräsentationen umfunktioniert, um visuelles Denken zu unterstützen. Der Ansatz integriert die visuelle Generierung direkt in den nativen autoregressiven Schlussfolgerungsprozess der Modelle. Dies bedeutet, dass ein MLLM nun textuelle Argumentation mit der Erzeugung visueller Latente verknüpfen kann. Diese Latente dienen als interne Leitfäden für den Denkprozess und können bei Bedarf in interpretierbare Skizzenbilder umgewandelt werden, was neue Möglichkeiten für die Interaktion zwischen Mensch und Computer sowie für breitere Anwendungen eröffnet.
Architektur und Funktionsweise des "Latent Sketchpad"
Das "Latent Sketchpad"-Framework besteht im Wesentlichen aus zwei Hauptkomponenten:
Context-Aware Vision Head
Diese Komponente ist dafür verantwortlich, visuelle Repräsentationen autoregressiv zu erzeugen. Sie ist direkt in das Backbone-Modell des MLLM integriert und erzeugt visuelle Latente aus den internen Hidden States des Modells. Dabei berücksichtigt sie sowohl globale als auch lokale Kontextinformationen. Globale Kontextlatente beziehen sich auf alle vorhergehenden Bilder, während lokale Kontextlatente die bereits innerhalb des aktuellen Bildes erzeugten partiellen Latente erfassen. Dieser aufmerksamkeitsbasierte Mechanismus gewährleistet visuelle Kohärenz und ermöglicht es dem Modell, seine interne visuelle Repräsentation dynamisch anzupassen. Die erzeugten Latente werden dann in den Embedding-Raum des Sprachmodells projiziert, um die autoregressive Generierung fortzusetzen.
Pretrained Sketch Decoder
Der Sketch Decoder ist eine eigenständige Komponente, die darauf trainiert wurde, die vom Vision Head erzeugten visuellen Latente in menschlich interpretierbare Skizzen umzuwandeln. Dieser Decoder arbeitet unabhängig vom MLLM-Backbone und dient als Visualisierungsmodul. Er projiziert die visuellen Latente in den latenten Raum eines vortrainierten VAE (Variational Autoencoder) und nutzt dessen Decoder, um pixelbasierte Skizzenbilder zu erzeugen. Dies ermöglicht eine transparente Inspektion des Denkprozesses des Modells und bietet Einblicke in seine internen visuellen Überlegungen.
Ein wesentlicher Vorteil dieses modularen Aufbaus ist seine Plug-and-Play-Fähigkeit. Der Vision Head kann separat trainiert und an bestehende MLLMs angebracht werden, ohne deren ursprüngliche Parameter zu verändern. Dies bewahrt die bereits vorhandene Argumentationsfähigkeit des Basismodells, während es gleichzeitig um die Fähigkeit zur visuellen Generierung erweitert wird.
Experimentelle Evaluation und Ergebnisse
Die Wirksamkeit des "Latent Sketchpad"-Frameworks wurde anhand eines neu entwickelten Datensatzes namens MazePlanning evaluiert. Dieser Datensatz umfasst 47.800 Labyrinthe unterschiedlicher Größe für das Training und zusätzliche Testsets für In-Distribution- und Out-of-Distribution-Szenarien. Jedes Labyrinth ist mit multimodalen Trajektorien annotiert, die visuelle und textuelle Argumentationsschritte miteinander verknüpfen. Die Modelle wurden auf zwei repräsentativen MLLMs, Gemma3-12B und Qwen2.5-VL-7B, getestet.
Leistungsmetriken
Für die Bewertung wurden zwei Metriken herangezogen:
- Success Rate (SR): Misst den Anteil der Testfälle, in denen das Modell eine vollständige und korrekte Aktionssequenz generiert.
- Progress Rate (PR): Quantifiziert das Verhältnis der aufeinanderfolgend korrekten Aktionen und zeigt an, wie weit das Modell vor dem ersten Fehler kommt.
Ergebnisse und Beobachtungen
Die Experimente zeigten, dass "Latent Sketchpad" eine vergleichbare oder sogar überlegene Argumentationsleistung im Vergleich zu den Basismodellen liefert. Insbesondere bei komplexen und dynamischen multimodalen Argumentationsaufgaben, bei denen proprietäre Modelle Schwierigkeiten hatten, konnte "Latent Sketchpad" signifikante Verbesserungen erzielen. Beispielsweise führte die Integration von "Latent Sketchpad" in GPT-4o zu einer deutlichen Steigerung der Erfolgs- und Fortschrittsraten, indem die generierten visuellen Spuren ergänzende räumliche Hinweise lieferten.
Ein weiterer wichtiger Befund ist die breite Anwendbarkeit des Frameworks. "Latent Sketchpad" konnte erfolgreich auf verschiedene MLLM-Backbones, darunter Gemma3 und Qwen2.5-VL, angewendet werden. Dies deutet darauf hin, dass die Methode nicht an eine spezifische Architektur gebunden ist, sondern als allgemeine Erweiterung für multimodale Modelle dienen kann.
Visualisierungsqualität und Generalisierung
Obwohl die durch den Sketch Decoder gerenderten Visualisierungen in ihrer perzeptiven Qualität nicht immer fotorealistisch sind, zeigten sie eine hohe strukturelle Stabilität und Konsistenz. Dies ist auf den Context-Aware Vision Head zurückzuführen, der semantischen Kontext nutzt, um die visuelle Trajektorie dynamisch zu steuern und strukturelle Konsistenz während des Planungsprozesses zu gewährleisten. Quantitative Analysen zur Layout Consistency Rate (LCR) und Visual Success Rate (VSR) bestätigten, dass "Latent Sketchpad" die räumliche Konfiguration der Labyrinthe über die Argumentationsschritte hinweg beibehält und gültige Pfade zeichnen kann.
Auch die Generalisierungsfähigkeit des Pretrained Sketch Decoders auf ungesehene Daten wurde positiv bewertet. Er erreichte hohe Ähnlichkeitswerte (SSIM) über verschiedene Vision Encoder hinweg, was seine Kompatibilität mit unterschiedlichen vortrainierten Architekturen unterstreicht.
Diskussion und Ausblick
Die Einführung von "Latent Sketchpad" stellt einen bedeutenden Schritt dar, um die Lücke zwischen textueller und visueller Argumentation in MLLMs zu schließen. Die Fähigkeit, interne visuelle Gedanken zu generieren und diese in interpretierbare Skizzen umzuwandeln, eröffnet neue Möglichkeiten für eine reichere Mensch-Computer-Interaktion und breitere Anwendungsfelder. Das Framework ermöglicht es MLLMs, komplexe Aufgaben, die visuelle Planung und Vorstellungskraft erfordern, effektiver zu lösen, indem es den Modellen einen internen "visuellen Notizblock" zur Verfügung stellt.
Zukünftige Forschungsarbeiten könnten sich auf die weitere Verbesserung der visuellen Wiedergabetreue der generierten Skizzen konzentrieren, um Anwendungen zu unterstützen, die eine feinere perzeptive Präzision erfordern. Darüber hinaus könnte die Untersuchung der Integration von "Latent Sketchpad" in andere multimodale Aufgabenbereiche und die Analyse seiner Auswirkungen auf die Robustheit und Erklärbarkeit von KI-Systemen weitere wertvolle Erkenntnisse liefern. Die modulare und Plug-and-Play-Fähigkeit dieses Ansatzes könnte auch die Entwicklung flexiblerer und anpassungsfähigerer KI-Systeme fördern.
Zusammenfassend bietet "Latent Sketchpad" einen vielversprechenden Weg, die Argumentationsfähigkeiten von MLLMs zu erweitern und ihnen eine menschenähnlichere Fähigkeit zur visuellen Vorstellungskraft zu verleihen. Dies könnte die nächste Generation multimodaler KI-Anwendungen maßgeblich prägen.
Bibliographie
- Zhang, H., Wu, W., Li, C., Shang, N., Xia, Y., Huang, Y., Zhang, Y., Dong, L., Zhang, Z., Wang, L., Tan, T., & Wei, F. (2025). Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs. arXiv preprint arXiv:2510.24514. - Latent Sketchpad Project Page: https://latent-sketchpad.github.io/ - Hugging Face: https://huggingface.co/papers/2510.24514 - GitHub: https://github.com/hwanyu112/Latent-Sketchpad ```Weitere News-Artikel
Alle ansehen- Neues Framework MASA optimiert Denkfähigkeiten von KI-Modellen durch Meta-Awareness und Reinforcement Learning
- Neues Framework zur Optimierung von Maskierten Diffusionsmodellen: LFPO im Fokus
- Neues Framework von Microsoft verbessert KI-Agenten durch selbstständiges Lernen
- Neues Framework zur Modellierung symbolischer Weltdynamiken in komplexen stochastischen Umgebungen
- Neues Framework für multimodales Chain-of-Thought Reasoning in der Vision-Language Navigation
- Neues Framework für Online Reinforcement Learning von Flow-basierten VLA-Modellen
KI, die in Deutschland zu Hause ist.
Testen Sie Mindverse Studio oder sprechen Sie mit unserem Team über Ihren Anwendungsfall.