
FinRAGBench-V : RAG multimodal avec citations visuelles dans le domaine financier
FinRAGBench-V : les meilleurs modèles n'atteignent que 20–61 % de rappel de citations par blocs sur les pages financières, malgré le multimodal.
#ai
Recherche et applications de l'intelligence artificielle en finance et comptabilité

FinRAGBench-V : les meilleurs modèles n'atteignent que 20–61 % de rappel de citations par blocs sur les pages financières, malgré le multimodal.

Seul Qwen3.5-9B survit à 80 % des 132 mois de CFO d'EnterpriseArena, tandis que GPT-5.4 et DeepSeek-V3.1 tombent à 0 %. Le rapprochement de registre omis cause ces échecs.

WildToolBench : aucun LLM ne dépasse 15 % de précision par session sur 1 024 tâches réelles, l'intention cachée étant le pire échec.

La confiance verbalisée de GPT-4 n'atteint qu'environ 62,7 % d'AUROC, à peine mieux que le hasard. Les agents financiers ont besoin de mieux.

JSONSchemaBench : la couverture passe de 86 % sur des schémas simples à 3 % sur des schémas complexes, le JSON structuré des LLM pouvant être non conforme.

FinMCP-Bench note le meilleur de six LLM à seulement 3,08 % de correspondance exacte sur 613 tâches financières MCP réelles, un effondrement de 20× du mono-outil au multi-tour.

FinTrace : les LLM de pointe choisissent les bons outils financiers (F1 ~0,9) mais n'obtiennent que 3,23/5 pour exploiter les résultats.

FinToolBench constate une inadéquation d'intention supérieure à 50 % pour chaque LLM testé : appeler beaucoup d'outils ne garantit pas de meilleures réponses financières.

OmniEval note les meilleurs systèmes RAG à 36 % de précision numérique sur 5 types de tâches financières : les agents de registre doivent valider avant d'écrire.

La taxonomie NAACL 2025 tient, mais la couverture tabulaire est absente. Les équipes d'IA financière doivent adapter elles-mêmes les méthodes des modèles de vision.

Retirer le biais positionnel des poids d'attention des LLM rend jusqu'à 15 points de précision RAG quand la preuve est au milieu du contexte.

ReDAct ne passe d'un petit modèle à un grand que lorsque la perplexité signale une incertitude, réduisant le coût de 64 % à précision égale pour les workflows d'agents.