News

Neues Framework zur Verbesserung des räumlichen Verständnisses in Large Vision-Language Models

Neues Framework zur Verbesserung des räumlichen Verständnisses in Large Vision-Language Models

Das Wichtigste in Kürze

  • Spatial-SSRL ist ein von InternLM entwickeltes Framework zur Verbesserung des räumlichen Verständnisses von Large Vision-Language Models (LVLMs).
  • Es nutzt selbstüberwachtes Reinforcement Learning, um räumliche Signale direkt aus gewöhnlichen RGB/RGB-D-Bildern zu extrahieren, ohne menschliche Annotationen zu benötigen.
  • Das Framework zeichnet sich durch Skalierbarkeit, Kosteneffizienz und Leichtgewichtigkeit aus, da es keine teuren Labels oder externen Tools erfordert.
  • Spatial-SSRL ist mit dem RLVR-Trainingsparadigma kompatibel und kann für verschiedene pretext-Aufgaben erweitert werden.
  • Experimente zeigen, dass Modelle, die mit Spatial-SSRL optimiert wurden, eine stärkere räumliche Intelligenz über sieben Benchmarks hinweg aufweisen.

KI, die in Deutschland zu Hause ist.

Testen Sie Mindverse Studio oder sprechen Sie mit unserem Team über Ihren Anwendungsfall.