
Kann dein Agent diese Bücher ausgleichen?
Ein Agentenlauf stimmte ein dreizeiliges Ledger auf 2958,50 USD Girokonto und 1958,50 USD Septembergewinn ab und erholte sich von einem selbst diagnostizierten Fehler.
#llm
Forschung zu großen Sprachmodellen mit Anwendungen in Finanzaufgaben

Ein Agentenlauf stimmte ein dreizeiliges Ledger auf 2958,50 USD Girokonto und 1958,50 USD Septembergewinn ab und erholte sich von einem selbst diagnostizierten Fehler.

FinRAGBench-V zeigt: Top-Modelle erreichen nur 20–61 % Block-Level-Zitat-Recall auf Finanzseiten. Multimodales Retrieval schlägt Text-only um fast 50 Punkte.

Nur Qwen3.5-9B übersteht 80% der 132-Monats-CFO-Läufe von EnterpriseArena, während GPT-5.4 und DeepSeek-V3.1 0% erreichen. Übersprungener Ledger-Abgleich verursacht die Fehler.

WildToolBench findet kein LLM über 15 % Sitzungsgenauigkeit bei 1.024 Echtnutzer-Aufgaben, verborgene Intention und Instruktionswechsel sind die schärfsten Fehlermodi.

Verbalisierte GPT-4-Konfidenz erreicht nur ~62,7 % AUROC, kaum über Zufall. Unsicherheitsbewusste Finanzagenten brauchen bessere Kalibrierung.

JSONSchemaBench findet, dass die Abdeckung von 86% bei einfachen Schemas auf 3% bei komplexen fällt, daher kann strukturierte LLM-Ausgabe still nicht-konformes JSON liefern.

FinMCP-Bench bewertet das beste von sechs LLMs mit nur 3,08 % Exact Match bei 613 echten MCP-Finanzaufgaben, ein 20-facher Einbruch von Single-Tool zu Multi-Turn.

FinTrace zeigt: Frontier-LLMs wählen die richtigen Finanztools (F1 ~0,9), erreichen aber nur 3,23/5 bei deren Nutzung – der Schritt, der Write-Back-Agenten scheitern lässt.

FinToolBench findet Intent-Mismatch über 50% bei jedem getesteten LLM, aggressives Tool-Calling bedeutet also nicht bessere Antworten bei Finanzaufgaben.

OmniEval bewertet die besten RAG-Systeme mit 36% numerischer Genauigkeit über 5 Finanzaufgaben, daher brauchen Ledger-Agenten Validierung vor dem Buchen.

Die NAACL-2025-Taxonomie bleibt gültig, doch tabellarische Abdeckung fehlt. Finanz-KI-Teams müssen Vision-Modell-Methoden selbst anpassen.

Das Subtrahieren von Positions-Bias aus LLM-Attention-Gewichten gewinnt bis zu 15 Punkte RAG-Genauigkeit, wenn Belege mitten im Kontext liegen.