News

Neuer Ansatz zur Generierung von 4D-Videos aus monokularen Quellen mit 4DAnyone

Neuer Ansatz zur Generierung von 4D-Videos aus monokularen Quellen mit 4DAnyone

Das Wichtigste in Kürze

  • Das Forschungsprojekt "4DAnyone" ermöglicht die Generierung konsistenter Multi-View-Videos aus einer einzigen monokularen Videoquelle.
  • Die Technologie zielt darauf ab, 4D-Rekonstruktionen, insbesondere 4D Gaussian Splatting (4DGS), zu vereinfachen und zugänglicher zu machen.
  • Eine Implementierung von 4DAnyone wurde erfolgreich in einen Gradio Space integriert, was die Nutzbarkeit für eine breitere Anwenderschaft erhöht.
  • Optimierungen haben die Rechenanforderungen reduziert, sodass die Anwendung auch auf Grafikkarten mit weniger als 32 GB VRAM läuft.
  • Die Integration mit Rerun.io unterstreicht das Potenzial für interaktive 3D-Visualisierung und -Annotation.

Revolution in der 4D-Videogenerierung: 4DAnyone als Gradio Space verfügbar

Die Forschung im Bereich der generativen KI schreitet kontinuierlich voran und ermöglicht zunehmend komplexere Anwendungen. Ein aktuelles Beispiel hierfür ist das Projekt "4DAnyone", das die Erstellung von 4D-Modellen aus gewöhnlichen monokularen Videos revolutionieren könnte. Jüngste Entwicklungen zeigen, dass diese Technologie nun in einem benutzerfreundlichen Format als Gradio Space bereitgestellt wird, was ihre Zugänglichkeit und praktische Anwendbarkeit erheblich verbessert.

Die Kernfunktionalität von 4DAnyone

Das von Forschenden der Zhejiang University, Robbyant und Ant Group entwickelte 4DAnyone-System, das auch auf Plattformen wie GitHub und Hugging Face gehostet wird, zielt darauf ab, aus einem einzigen, ungezwungenen Video mehrere konsistente Ansichten zu generieren. Dies bildet die Grundlage für eine nachgelagerte 4D Gaussian Splatting (4DGS) Rekonstruktion. Die Herausforderung bei der Erstellung von 4D-Modellen, die sowohl die räumliche Tiefe als auch die zeitliche Entwicklung eines Objekts oder einer Szene erfassen, war bisher oft mit aufwendigen Setups, wie mehreren Kameras oder spezieller Kalibrierung, verbunden. 4DAnyone umgeht diese Einschränkungen, indem es lediglich ein einziges Video als Eingabe benötigt.

Die zugrunde liegende Methodik beinhaltet Techniken wie "Reference Context Packing" (RCP) zur Komprimierung von Referenzansichten und "Target Context Routing" (TCR) zur intelligenten Steuerung des Denoising-Prozesses. Diese Ansätze ermöglichen die Generierung von Multi-View-Videos, die eine hohe Konsistenz über verschiedene Perspektiven hinweg aufweisen und somit eine qualitativ hochwertige 4D-Rekonstruktion unterstützen.

Integration in Gradio und Rerun.io

Ein wesentlicher Schritt zur Demokratisierung dieser Technologie ist die Bereitstellung als interaktiver Gradio Space. Gradio ist eine Open-Source-Bibliothek, die es Entwicklern ermöglicht, maschinelle Lernmodelle schnell und einfach als Web-UIs zu präsentieren. Die Integration von 4DAnyone in einen Gradio Space, wie von einem Experten aus der Community demonstriert, vereinfacht den Zugang für Forschende und Entwickler erheblich. Nutzer können nun ein Video hochladen und erhalten als Ausgabe konsistente Multi-View-Videos, ohne sich um die komplexen Implementierungsdetails kümmern zu müssen.

Darüber hinaus wurde die Gradio-Anwendung mit Rerun.io integriert. Rerun ist ein Tool für die Visualisierung und Debugging von 3D-Daten, das interaktive 3D-Annotationen ermöglicht. Diese Kombination eröffnet neue Möglichkeiten für die Analyse und Weiterverarbeitung der generierten 4D-Daten, beispielsweise für das Tracking von Objekten in monokularen Videos oder die Fusion von Masken aus Multi-View-RGB-D-Daten.

Optimierung und Leistungsfähigkeit

Die ursprünglichen Anforderungen an Rechenleistung für solche generativen Modelle waren oft hoch, was den Einsatz auf spezialisierte Hardware beschränkte. Durch gezielte Optimierungen konnte der Speicherbedarf des DiT-Modells, einer Komponente von 4DAnyone, signifikant reduziert werden. Berichten zufolge konnte der Speicherverbrauch von etwa 50 GB auf unter 32 GB gesenkt werden. Dies ermöglicht den Betrieb der Anwendung auf einer breiteren Palette von Grafikkarten, einschließlich solcher mit weniger VRAM, wie beispielsweise einer NVIDIA RTX 5090. Die Verarbeitungszeit für die Generierung von 16 Ansichten aus einem Video konnte dabei auf etwa 5 Minuten reduziert werden, was eine erhebliche Verbesserung gegenüber früheren Laufzeiten von bis zu 40 Minuten darstellt.

Es wird jedoch darauf hingewiesen, dass die volle Bandbreite der Funktionalität, wie die Generierung von bis zu 48 Videos oder die Durchführung von 4D Gaussian Splatting, lokal immer noch zeitaufwendiger ist und höhere GPU-Ressourcen erfordert. Die öffentliche Gradio-Version ist daher in der Ausgabe auf sechs Videos begrenzt, um eine praktikable Inferenzzeit von etwa 5 bis 8 Minuten zu gewährleisten.

Ausblick und Potenzial

Die Fortschritte bei 4DAnyone und dessen Bereitstellung als zugänglicher Gradio Space unterstreichen das immense Potenzial generativer KI für die Erstellung und Manipulation von 4D-Inhalten. Diese Technologie könnte weitreichende Auswirkungen auf Bereiche wie die Filmproduktion, Virtual Reality (VR), Augmented Reality (AR), die Entwicklung von Videospielen und die Robotik haben, indem sie die Erstellung realistischer und dynamischer 3D-Modelle aus einfachen Videoaufnahmen vereinfacht. Die kontinuierliche Forschung und Entwicklung in diesem Bereich verspricht weitere Innovationen und eine verbesserte Zugänglichkeit für eine breite Anwenderschaft.

Bibliography

- "4DAnyone: Create Anyone in 4D from a Casual Monocular Video." Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen, Zhen Xu, Yujun Shen, Hujun Bao, Xiaowei Zhou, Yinghao Xu. SIGGRAPH Asia 2026. - GitHub Repository: ant-research/4DAnyone. (Accessed: [Aktuelles Datum]) - Hugging Face Space: AntResearch/4DAnyone. (Accessed: [Aktuelles Datum]) - ArXiv Preprint: Jin, Yudong et al. "4DAnyone: Create Anyone in 4D from a Casual Monocular Video." arXiv:2608.20335, 2026. - Rerun.io Documentation: "Interactive 3D annotation app with Rerun and Gradio." (Accessed: [Aktuelles Datum]) - X (formerly Twitter) Post by @_akhaliq. (Accessed: [Aktuelles Datum])

KI, die in Deutschland zu Hause ist.

Testen Sie Mindverse Studio oder sprechen Sie mit unserem Team über Ihren Anwendungsfall.