Von der ersten Idee bis zur voll integrierten KI-Lösung – strukturiert, sicher und mit messbarem Erfolg
Wir analysieren Ihre Geschäftsprozesse und identifizieren konkrete Use Cases mit dem höchsten ROI-Potenzial.
✓ Messbare KPIs definiert
Vollständige Datenschutz-Analyse und Implementierung sicherer Datenverarbeitungsprozesse nach EU-Standards.
✓ 100% DSGVO-konform
Maßgeschneiderte Auswahl der optimalen KI-Lösung – von Azure OpenAI bis zu Open-Source-Alternativen.
✓ Beste Lösung für Ihren Fall
Schneller Proof of Concept mit nahtloser Integration in Ihre bestehende IT-Infrastruktur und Workflows.
✓ Ergebnisse in 4-6 Wochen
Unternehmensweiter Rollout mit umfassenden Schulungen für maximale Akzeptanz und Produktivität.
✓ Ihr Team wird KI-fit
Die Integration von Künstlicher Intelligenz (KI) in verschiedene Geschäftsbereiche schreitet kontinuierlich voran. Insbesondere Large Language Models (LLMs) haben in den letzten Jahren beeindruckende Fähigkeiten in der Sprachverarbeitung und -generierung gezeigt. Doch wie steht es um ihre Leistungsfähigkeit in spezialisierten Domänen, die höchste Präzision und komplexes logisches Denken erfordern, wie beispielsweise dem Finanzsektor? Eine aktuelle Studie beleuchtet genau diese Frage und untersucht die Glaubwürdigkeit der Finanzanalyse durch LLMs anhand eines realitätsnahen Tests über langfristige Finanzberichte.
Der Finanzbereich zeichnet sich durch eine Reihe spezifischer Anforderungen aus, die ihn zu einem anspruchsvollen Testfeld für KI-Systeme machen:
Bestehende Benchmarks für LLMs im Finanzbereich wurden in der Vergangenheit kritisiert, da sie oft auf vereinfachte Aufgaben wie Multiple-Choice-Fragen oder Single-Hop-Antworten auf zugeschnittene Tabellen beschränkt waren. Diese Ansätze vernachlässigten die komplexen Dynamiken zwischen verschiedenen Finanzberichten und die zeitliche Entkumulierung von Daten, die in der realen Welt unerlässlich sind.
Um diese Lücke zu schließen, wurde der neue Benchmark "FinIndices" entwickelt. Dieser groß angelegte Benchmark zielt darauf ab, die Datenverarbeitungsgenauigkeit von LLMs anhand ungeschnittener Finanzberichte mit einer Länge von bis zu 32.000 Tokens zu bewerten. Ein zentrales Merkmal von FinIndices ist der Fokus auf authentische chinesische Finanzberichte und die darauf basierenden Rechnungslegungsvorschriften (CAS).
FinIndices verwendet eine automatisierte Synthese-Pipeline mit "adversarial traps", um die Robustheit der Modelle zu testen. Der Benchmark umfasst zwei Hauptaufgabenbereiche:
Die Formeln für die Berechnungen in FinIndices stammen aus maßgeblichen Quellen, einschließlich der chinesischen Rechnungslegungsstandards, Lehrbüchern zur Finanzanalyse und Referenzen aus dem Bereich Corporate Finance. Der Testdatensatz wurde zudem von Domänenexperten manuell auf seine buchhalterische Gültigkeit und numerische Korrektheit überprüft.
Die Evaluation der LLMs mit FinIndices offenbarte zwei signifikante Schwachstellen:
Die Studie zeigte, dass LLMs, obwohl sie Formeln während des Pre-Trainings möglicherweise gelernt haben, eine fragile Mustererkennung aufweisen. Wenn explizite Formelhinweise entfernt wurden, brach die Leistung der Modelle signifikant ein. Beispielsweise sank die Leistung des Gemini-3.1-Pro-Modells bei Tabellenaufgaben von 70,70 % auf 38,22 %. Dies deutet darauf hin, dass die Modelle die buchhalterischen Formeln, die CAS-Taxonomie und die Semantik der Finanzberichte nicht vollständig verinnerlicht haben. Besondere Schwierigkeiten zeigten sich bei der zeitlichen Entkumulierung und der Abstimmung von Bestands- und Stromgrößen.
Beispiele für komplexe Szenarien, die nicht durch einfache Schlüsselwortsuche gelöst werden können, sind:
Die Generierung von Tabellen ist nicht nur eine Formatierungsfrage, sondern stellt eine erhebliche kognitive Belastung für LLMs dar. Wenn Modelle aufgefordert werden, Tabellen mit mehreren Metriken und Zeiträumen zu füllen, verschlechtert sich ihre Argumentationsfähigkeit oft. Beobachtet wurden unter anderem:
Die Studie hebt hervor, dass LLMs, die einzelne Ableitungen fehlerfrei ausführen konnten, unter strukturellem Druck auf oberflächliche Heuristiken zurückfielen. Dies umfasste das Abrufen falscher benachbarter Spalten oder das Ersetzen tiefergehender buchhalterischer Anpassungen durch simple arithmetische Operationen.
Ein weiterer wichtiger Aspekt ist der Umgang mit fehlenden Informationen. In adversen Fällen, in denen notwendige Berichte nicht verfügbar waren, war die korrekte Antwort "unzureichende Informationen" und nicht eine halluzinierte Zahl. Dies ist für die Vertrauenswürdigkeit von KI-Systemen im Finanzbereich von entscheidender Bedeutung.
Trotz der identifizierten Schwachstellen zeigte die Studie auch, dass Supervised Fine-Tuning (SFT) zu erheblichen Verbesserungen führen kann. SFT führte zu substanziellen Gewinnen bei der Leistung ohne explizite Formelhinweise (+8,54 % bei Einzelindizes, +3,82 % bei Tabellenaufgaben). Dies validiert die Annahme, dass strukturierte Logik durch datenzentrierte Ausrichtung teilweise wiederhergestellt werden kann.
Die Ergebnisse dieser Studie sind für Unternehmen im B2B-Bereich, die den Einsatz von LLMs in der Finanzanalyse in Betracht ziehen, von großer Bedeutung:
Die Forschungsergebnisse von FinIndices tragen dazu bei, die Evaluierung von LLMs über einfache Finanz-QA-Aufgaben hinaus zu erweitern und den Weg für zuverlässigere, kontextsensitive und rechnungslegungsbewusste Finanzanalysen durch KI-Systeme zu ebnen. Für Unternehmen bedeutet dies, dass die Entwicklung und Implementierung von KI-Lösungen im Finanzbereich ein tiefes Verständnis sowohl der KI-Technologie als auch der spezifischen Domänenanforderungen erfordert.
Die kontinuierliche Weiterentwicklung von LLMs in Kombination mit spezifischem Fine-Tuning und der Nutzung von Benchmarks wie FinIndices wird voraussichtlich zu robusteren und vertrauenswürdigeren KI-Anwendungen im Finanzsektor führen. Die Herausforderung besteht darin, die Modelle dazu zu befähigen, nicht nur Muster zu erkennen, sondern auch echtes strukturelles und kontextuelles Denken zu demonstrieren, das für die Komplexität realer Finanzaufgaben unerlässlich ist.
Mindverse als Ihr KI-Partner verfolgt diese Entwicklungen aufmerksam und unterstützt Unternehmen dabei, die Potenziale von KI im Finanzbereich verantwortungsvoll und effektiv zu nutzen.
Bibliography
- Tong, X., Zhang, X., Tang, T., Yang, A., Hu, J., Lin, G., ... & Liu, D. (2026). Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements. arXiv preprint arXiv:2607.28661. - Wang, X., & Brorsson, M. (2025). Can Large language model analyze financial statements well?. Proceedings of the Joint Workshop of the 9th FinNLP, the 6th FNP, and the 1st LLMFinLegal, 196-206. - Krumdick, M., Reddy, V., Chaudhary, S., Day, W., Ahmed, M., Haqqi, H., ... & Tanner, C. (2026). FrontierFinance: A Long-Horizon Computer-Use Benchmark of Real-World Financial Tasks. arXiv preprint arXiv:2604.05912. - Cao, Y., Liu, H., Li, Z., Guo, J., & Jiang, Y. (2026). FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks. arXiv preprint arXiv:2604.10015. - Zhao, Y., Long, Y., Jiang, Y., Wang, C., Chen, W., Liu, H., ... & Cohan, A. (2024). FINDVER: Explainable Claim Verification over Long and Hybrid-Content Financial Documents. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 14739-14752. - Mateega, S., Georgescu, C., & Tang, D. (2025). FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models. arXiv preprint arXiv:2501.18062. - Srivastava, P., Malik, M., Gupta, V., Ganu, T., & Roth, D. (2024). Evaluating LLMs’ Mathematical Reasoning in Financial Document Question Answering. arXiv preprint arXiv:2402.11194. - Jiang, Y., Chen, J., Makri, E., Chen, J., Li, P., Maatouk, A., ... & Brenner, E. (2026). Fin-RATE: A Real-world Financial Analytics and Tracking Evaluation Benchmark for LLMs on SEC Filings. arXiv preprint arXiv:2602.07294.
Lernen Sie in nur 30 Minuten kennen, wie Ihr Team mit KI mehr erreichen kann – live und persönlich.
🚀 Demo jetzt buchen