
FinRAGBench-V : RAG multimodal avec citations visuelles dans le domaine financier
FinRAGBench-V : les meilleurs modèles n'atteignent que 20–61 % de rappel de citations par blocs sur les pages financières, malgré le multimodal.
#finance
Recherche financière, analyse et connaissances du domaine pour l'IA comptable

FinRAGBench-V : les meilleurs modèles n'atteignent que 20–61 % de rappel de citations par blocs sur les pages financières, malgré le multimodal.

La confiance verbalisée de GPT-4 n'atteint qu'environ 62,7 % d'AUROC, à peine mieux que le hasard. Les agents financiers ont besoin de mieux.

FinTrace : les LLM de pointe choisissent les bons outils financiers (F1 ~0,9) mais n'obtiennent que 3,23/5 pour exploiter les résultats.

OmniEval note les meilleurs systèmes RAG à 36 % de précision numérique sur 5 types de tâches financières : les agents de registre doivent valider avant d'écrire.

Les 5 703 requêtes réelles de FinDER montrent qu'un bon RAG ne rappelle que 25,95 % des preuves 10-K. Normalisez d'abord les abréviations.

Les LLM perdent jusqu'à 20 points quand la réponse se trouve au milieu du contexte ; les pipelines RAG financiers doivent placer les meilleurs passages au début ou à la fin.

AnoLLM (ICLR 2025) reformule la détection d'anomalies tabulaires comme une estimation de densité par LLM — un fine-tuning sur des lignes normales et un score par vraisemblance logarithmique négative (NLL). Il surpasse les méthodes classiques sur des ensembles de données de fraude à types mixtes, mais n'offre aucun avantage sur les données purement numériques, avec des implications concrètes pour la détection d'anomalies dans les écritures comptables Beancount.

DocFinQA remplace les passages de 700 mots de FinQA par des dépôts SEC complets : un contexte 175× plus long qui divise presque par deux la précision de GPT-4.

TheAgentCompany évalue 175 tâches d'entreprise dans un intranet simulé, et le meilleur modèle, Gemini-2.5-Pro, n'en termine que 30 % à 4 $ chacune.

InvestorBench : Qwen2.5-72B mène le trading d'actions avec un CR de 46,15 % ; Palmyra-Fin, affiné pour la finance, échoue sur les actions — la taille prime sur l'affinage par domaine.

Avec des budgets de jetons de réflexion égaux, les LLM à agent unique égalent ou battent les systèmes multi-agents sur le raisonnement multi-sauts—privilégiez des conceptions d'agent financier plus simples.

M3MAD-Bench révèle que l'illusion collective cause 65 % des échecs de débat multi-agents, et le débat adversarial réduit la précision jusqu'à 12,8 %.