
FinRAGBench-V : RAG multimodal avec citations visuelles dans le domaine financier
FinRAGBench-V : les meilleurs modèles n'atteignent que 20–61 % de rappel de citations par blocs sur les pages financières, malgré le multimodal.
#machine-learning
Techniques d'apprentissage automatique pour l'analyse et l'automatisation des données financières

FinRAGBench-V : les meilleurs modèles n'atteignent que 20–61 % de rappel de citations par blocs sur les pages financières, malgré le multimodal.

WildToolBench : aucun LLM ne dépasse 15 % de précision par session sur 1 024 tâches réelles, l'intention cachée étant le pire échec.

La confiance verbalisée de GPT-4 n'atteint qu'environ 62,7 % d'AUROC, à peine mieux que le hasard. Les agents financiers ont besoin de mieux.

JSONSchemaBench : la couverture passe de 86 % sur des schémas simples à 3 % sur des schémas complexes, le JSON structuré des LLM pouvant être non conforme.

FinMCP-Bench note le meilleur de six LLM à seulement 3,08 % de correspondance exacte sur 613 tâches financières MCP réelles, un effondrement de 20× du mono-outil au multi-tour.

FinTrace : les LLM de pointe choisissent les bons outils financiers (F1 ~0,9) mais n'obtiennent que 3,23/5 pour exploiter les résultats.

FinToolBench constate une inadéquation d'intention supérieure à 50 % pour chaque LLM testé : appeler beaucoup d'outils ne garantit pas de meilleures réponses financières.

OmniEval note les meilleurs systèmes RAG à 36 % de précision numérique sur 5 types de tâches financières : les agents de registre doivent valider avant d'écrire.

La taxonomie NAACL 2025 tient, mais la couverture tabulaire est absente. Les équipes d'IA financière doivent adapter elles-mêmes les méthodes des modèles de vision.

Retirer le biais positionnel des poids d'attention des LLM rend jusqu'à 15 points de précision RAG quand la preuve est au milieu du contexte.

ReDAct ne passe d'un petit modèle à un grand que lorsque la perplexité signale une incertitude, réduisant le coût de 64 % à précision égale pour les workflows d'agents.

L'agent CodeAct d'OpenHands obtient 26 % sur SWE-Bench Lite, montrant ce que les agents IA font réellement. L'automatisation financière doit démarrer cadrée, pas autonome.