News

DeepSeek präsentiert neues multimodales KI-Modell mit Bildverstehensfähigkeiten

DeepSeek präsentiert neues multimodales KI-Modell mit Bildverstehensfähigkeiten

Das Wichtigste in Kürze

  • DeepSeek hat das experimentelle multimodale Modell DeepSeek-V4-Flash-Vision-Exp veröffentlicht, das Bildverstehensfähigkeiten zu seinen Textfunktionen hinzufügt.
  • Das Modell zeigt in internen Benchmarks eine Leistung, die der von Anthropic's Opus 4.8 in Agentenaufgaben nahekommt.
  • DeepSeek positioniert das Modell für agentenbasierte Anwendungen, die visuelles Verständnis mit Werkzeuggebrauch kombinieren.
  • Trotz der vergleichbaren Leistung ist das Modell zu einem deutlich niedrigeren Preis verfügbar als vergleichbare Modelle.
  • Die Vision-Variante übertrifft das reine Textmodell V4-Flash in den meisten Text-Benchmarks.
  • Das Modell unterstützt die APIs von OpenAI und Anthropic sowie DeepSeeks eigenes Harness-Framework.

Die chinesische KI-Firma DeepSeek hat mit der Veröffentlichung ihres experimentellen multimodalen Modells, DeepSeek-V4-Flash-Vision-Exp, Aufmerksamkeit in der Technologiewelt erregt. Dieses Modell erweitert die bestehenden Textverarbeitungsfähigkeiten des DeepSeek-V4-Flash-Modells um das Verständnis von Bildern und positioniert sich als ernstzunehmender Wettbewerber zu etablierten Modellen wie Anthropic's Opus 4.8.

Ein neuer Akteur im Multimodal-Bereich

DeepSeek-V4-Flash-Vision-Exp stellt eine Weiterentwicklung des bisherigen Textmodells DeepSeek-V4-Flash dar. Die Integration von Bildverarbeitungsfunktionen ermöglicht es dem Modell, nicht nur Text zu verstehen und zu generieren, sondern auch visuelle Informationen zu interpretieren. Laut DeepSeeks eigenen Benchmarks erreicht das Modell in multimodalen Agentenaufgaben eine Leistung, die der von Anthropic's Opus 4.8 nahekommt.

Das Modell ist darauf ausgelegt, in agentenbasierten Anwendungen eingesetzt zu werden. Es kann visuelles Verständnis mit der Nutzung verschiedener Tools kombinieren. Praktische Anwendungsfälle umfassen die Beschreibung von Bildern, das Extrahieren von Text aus Screenshots und die Analyse von Diagrammen. Das Modell ist in der Lage, verschiedene Bildformate wie JPEG, PNG, GIF und WebP zu verarbeiten und erkennt das Format anhand des tatsächlichen Dateiinhaltes.

Leistung und Benchmarks

DeepSeek hat die Leistung des neuen Modells auf verschiedenen Benchmarks bewertet. Dabei wurde eine deutliche Verbesserung der multimodalen Agentenleistung gegenüber dem reinen Textmodell V4-Flash festgestellt. Auf Benchmarks wie "Agents' Last Exam" und "ZeroBench" konnte DeepSeek-V4-Flash-Vision-Exp sogar Anthropic's Opus 4.8 übertreffen. Es ist jedoch zu beachten, dass diese Benchmarks von DeepSeek selbst veröffentlicht wurden und eine direkte Vergleichbarkeit mit anderen Modellen durch unabhängige Tests noch aussteht.

Interessanterweise zeigt das Vision-Modell auch in reinen Text-Benchmarks eine verbesserte Leistung im Vergleich zum ursprünglichen V4-Flash-Modell. Dies deutet darauf hin, dass die Integration visueller Fähigkeiten nicht nur die Multimodalität stärkt, sondern auch die zugrunde liegenden Textverarbeitungsfähigkeiten positiv beeinflussen kann.

Kosten-Effizienz als Wettbewerbsvorteil

Ein wesentlicher Aspekt, der DeepSeek-V4-Flash-Vision-Exp für Unternehmen attraktiv machen könnte, ist die Kostenstruktur. DeepSeek positioniert das Modell als eine kostengünstigere Alternative zu führenden Modellen amerikanischer Wettbewerber. Diese Preisstrategie könnte dazu beitragen, die Akzeptanz des Modells in einem breiteren B2B-Segment zu fördern, insbesondere für Anwendungen, bei denen das Preis-Leistungs-Verhältnis eine entscheidende Rolle spielt.

Die Kosten für die Bildverarbeitung sind so konzipiert, dass sie unabhängig von der ursprünglichen Auflösung maximal 384 Tokens pro Bild betragen. Dies ermöglicht es, auch bei bildintensiven Agenten-Workflows die Kosten niedrig zu halten. Die Preisgestaltung folgt den Tarifen des V4-Flash-Modells.

Technische Implementierung und API-Unterstützung

Für Entwickler bietet DeepSeek-V4-Flash-Vision-Exp umfassende Unterstützung. Das Modell ist über die API-Plattform von DeepSeek zugänglich und unterstützt die Chat Completions und Responses APIs von OpenAI sowie den Messages-Endpunkt von Anthropic. Darüber hinaus hat DeepSeek die Version 0.1.1 seines Harness-Frameworks veröffentlicht, das das neue Modell nativ unterstützt.

Bilder können auf verschiedene Weisen an das Modell übermittelt werden: direkt mit Base64-Kodierung, über öffentlich zugängliche URLs (bis zu 32 MiB) oder über die neue, kostenlose Files API von DeepSeek (bis zu 64 MiB). Diese Flexibilität in der Bildintegration erleichtert die Implementierung in bestehende Systeme und Workflows.

Das Modell ermöglicht es, bis zu 600 Bilder in einer einzigen Anfrage zu verarbeiten. Die maximale Kantenlänge beträgt 8.192 Pixel pro Seite, reduziert sich jedoch auf 4.096 Pixel, wenn eine Anfrage 15 oder mehr Bilder enthält. Eine optionale "Detail"-Einstellung skaliert Bilder auf 512 x 512 Pixel herunter, was Token spart, wenn keine feinen visuellen Details erforderlich sind.

Ausblick und Marktpositionierung

Die Veröffentlichung von DeepSeek-V4-Flash-Vision-Exp unterstreicht den Wettbewerb im Bereich der multimodalen KI-Modelle. Während die eigenen Benchmarks vielversprechend sind, wird die tatsächliche Akzeptanz und Leistung des Modells in realen Anwendungen entscheidend sein. Die Kombination aus fortschrittlichen multimodalen Fähigkeiten und einer wettbewerbsfähigen Preisgestaltung könnte DeepSeek jedoch zu einem wichtigen Akteur im B2B-Markt für KI-Lösungen machen, insbesondere für Unternehmen, die effiziente und kostengünstige Agenten-Workflows mit visuellen Komponenten suchen.

Die stetige Weiterentwicklung und die Einführung von Modellen, die eine breite Palette von Aufgaben abdecken und gleichzeitig eine hohe Effizienz bieten, sind von großer Bedeutung für die zukünftige Gestaltung der KI-Landschaft. DeepSeeks jüngster Schritt signalisiert einen Trend hin zu spezialisierten, aber dennoch leistungsstarken Modellen, die auf spezifische Geschäftsanforderungen zugeschnitten sind.

Bibliography:

- Matthias Bastian, "Deepseek releases experimental Flash vision model that rivals Opus 4.8 on agent benchmarks", The Decoder, 21. August 2026. - Ana Maria Constantin, "DeepSeek launches an experimental multimodal model to rival Anthropic", The Next Web, 21. August 2026. - Siliconangle.com, "DeepSeek debuts multimodal language model competitive with Opus 4.8", 21. August 2026. - Aytun Çelebi, "DeepSeek unveils vision model rivaling Anthropic's Opus 4.8 at lower cost - TechBriefly", TechBriefly, 21. August 2026. - TOI Tech Desk, "DeepSeek unveils vision-enabled AI model claimed to match Anthropic’s top tier", Times of India, 22. August 2026. - OfficeChai Team, "DeepSeek Releases V4-Flash-Vision-Exp, Matches Opus 4.8 On Some Multimodal Benchmarks", OfficeChai, 21. August 2026. - Jon Swartz, "DeepSeek Unveils Vision Model to Challenge Anthropic, Pitching Low Cost Against Top Performance", Techstrong.ai, 21. August 2026. - Dataconomy, "DeepSeek Unveils Vision Model Challenging Anthropic's Opus 4.8 Performance", Dataconomy, 21. August 2026. - Top AI Product, "DeepSeek-V4-Flash-Vision-Exp: multimodal agents near Opus 4.8, at $0.22/M input", Top AI Product, 21. August 2026. - Flowtivity.ai, "DeepSeek V4-Flash-Vision-Exp: Multimodal Agents Near Opus 4.8 at V4 Flash Prices", Flowtivity.ai, 21. August 2026.

KI, die in Deutschland zu Hause ist.

Testen Sie Mindverse Studio oder sprechen Sie mit unserem Team über Ihren Anwendungsfall.