News
Neues Framework zur Verbesserung des räumlichen Verständnisses in Large Vision-Language Models
Das Wichtigste in Kürze
- Spatial-SSRL ist ein von InternLM entwickeltes Framework zur Verbesserung des räumlichen Verständnisses von Large Vision-Language Models (LVLMs).
- Es nutzt selbstüberwachtes Reinforcement Learning, um räumliche Signale direkt aus gewöhnlichen RGB/RGB-D-Bildern zu extrahieren, ohne menschliche Annotationen zu benötigen.
- Das Framework zeichnet sich durch Skalierbarkeit, Kosteneffizienz und Leichtgewichtigkeit aus, da es keine teuren Labels oder externen Tools erfordert.
- Spatial-SSRL ist mit dem RLVR-Trainingsparadigma kompatibel und kann für verschiedene pretext-Aufgaben erweitert werden.
- Experimente zeigen, dass Modelle, die mit Spatial-SSRL optimiert wurden, eine stärkere räumliche Intelligenz über sieben Benchmarks hinweg aufweisen.
Weitere News-Artikel
Alle ansehen- Neues Framework Re-Align zur Verbesserung der In-Context Bildgenerierung und -bearbeitung
- Neues Framework für selbstentwickelnde KI-Agenten verbessert Lernfähigkeit aus Erfahrungen
- Neues Framework zur Sicherheitsausrichtung von Sprachmodellen: TriPlay-RL
- Neues Framework zur Bewertung der Speicher-Governance von KI-Agenten in kollaborativen Umgebungen
- Neues Framework SplineGS für die 3D-Rekonstruktion aus monokularen Videos
- Neues Framework STATe-of-Thoughts verbessert Problemlösungsfähigkeiten von Sprachmodellen
KI, die in Deutschland zu Hause ist.
Testen Sie Mindverse Studio oder sprechen Sie mit unserem Team über Ihren Anwendungsfall.