
FinRAGBench-V : RAG multimodal avec citations visuelles dans le domaine financier
FinRAGBench-V : les meilleurs modèles n'atteignent que 20–61 % de rappel de citations par blocs sur les pages financières, malgré le multimodal.
#data-science
Méthodes de science des données appliquées aux jeux de données financières et aux flux comptables

FinRAGBench-V : les meilleurs modèles n'atteignent que 20–61 % de rappel de citations par blocs sur les pages financières, malgré le multimodal.

WildToolBench : aucun LLM ne dépasse 15 % de précision par session sur 1 024 tâches réelles, l'intention cachée étant le pire échec.

La confiance verbalisée de GPT-4 n'atteint qu'environ 62,7 % d'AUROC, à peine mieux que le hasard. Les agents financiers ont besoin de mieux.

FinToolBench constate une inadéquation d'intention supérieure à 50 % pour chaque LLM testé : appeler beaucoup d'outils ne garantit pas de meilleures réponses financières.

OmniEval note les meilleurs systèmes RAG à 36 % de précision numérique sur 5 types de tâches financières : les agents de registre doivent valider avant d'écrire.

La taxonomie NAACL 2025 tient, mais la couverture tabulaire est absente. Les équipes d'IA financière doivent adapter elles-mêmes les méthodes des modèles de vision.

Retirer le biais positionnel des poids d'attention des LLM rend jusqu'à 15 points de précision RAG quand la preuve est au milieu du contexte.

Fin-RATE montre que la précision des LLM chute à 18,60 % en suivi longitudinal, le pipeline de retrieval, et non le modèle, étant le goulot d'étranglement.

Les 5 703 requêtes réelles de FinDER montrent qu'un bon RAG ne rappelle que 25,95 % des preuves 10-K. Normalisez d'abord les abréviations.

Les LLM perdent jusqu'à 20 points quand la réponse se trouve au milieu du contexte ; les pipelines RAG financiers doivent placer les meilleurs passages au début ou à la fin.

AD-LLM constate que GPT-4o atteint 0,93 à 0,99 d'AUROC en zero-shot pour les anomalies textuelles, mais le choix du modèle LLM reste peu fiable en audit financier.

CausalTAD réordonne les colonnes d'une table selon leur dépendance causale avant la sérialisation LLM, faisant passer l'AUC-ROC moyenne de 0,803 à 0,834 face à AnoLLM.