
FinRAGBench-V : RAG multimodal avec citations visuelles dans le domaine financier
FinRAGBench-V : les meilleurs modèles n'atteignent que 20–61 % de rappel de citations par blocs sur les pages financières, malgré le multimodal.
#financial-reporting
Génération et audit de rapports financiers avec des modèles de langage

FinRAGBench-V : les meilleurs modèles n'atteignent que 20–61 % de rappel de citations par blocs sur les pages financières, malgré le multimodal.

Fin-RATE montre que la précision des LLM chute à 18,60 % en suivi longitudinal, le pipeline de retrieval, et non le modèle, étant le goulot d'étranglement.

Les 5 703 requêtes réelles de FinDER montrent qu'un bon RAG ne rappelle que 25,95 % des preuves 10-K. Normalisez d'abord les abréviations.

DocFinQA remplace les passages de 700 mots de FinQA par des dépôts SEC complets : un contexte 175× plus long qui divise presque par deux la précision de GPT-4.

FinAuditing montre que les meilleurs LLM n'atteignent que 13,86 % à la vérification mathématique financière de dépôts SEC XBRL réels, limitant l'automatisation sans aide.

TAT-LLM affine LLaMA 2 7B à 64,60 % d'EM sur FinQA, devançant les 63,91 % de GPT-4 : un pipeline extraire-raisonner-exécuter permet l'arithmétique de tableaux.

MultiHiertt montre des modèles à 38 % de F1 contre 87 % pour l'humain sur 10 440 paires de QA financière, avec une chute de 15 points sur les questions inter-tableaux.

Le meilleur modèle de ConvFinQA obtient une précision d'exécution de 68,9 % contre 89,4 % pour les experts humains — un écart de 21 points auquel la conversation comptable multi-tours doit encore faire face.

Les questions hybrides tableau-texte de TAT-QA ont montré que l'ancrage des preuves, non l'arithmétique, est le goulot. Les LLM 7B affinés atteignaient 83 % de F1.

FinQA a montré que les modèles neuronaux obtenaient 61 % en mathématiques sur rapports financiers contre 91 % pour les experts, chutant à 22 % dès trois étapes.

FinanceBench évalue 16 configurations d'IA par rapport à 10 231 questions issues de dépôts réels de la SEC ; le RAG avec base de données vectorielle partagée ne répond correctement que dans 19 % des cas, et même GPT-4-Turbo avec le passage oracle n'atteint que 85 % de précision — montrant que le raisonnement numérique, et non la récupération, est la contrainte limitante pour l'IA financière en entreprise.

PHANTOM (NeurIPS 2025) mesure la détection d'hallucinations LLM sur de vrais dépôts SEC. Qwen3-30B mène à F1=0,882, mais les modèles 7B devinent au hasard.