Aller au contenu principal

Mike Thrift

Responsable marketing

TAT-QA : Un benchmark de QA hybride tableau-texte pour le raisonnement sur les rapports annuels financiers

TAT-QA est un benchmark de 16 552 questions sur des contextes de rapports financiers hybrides (tableaux et textes) ayant démontré que l'ancrage des preuves — et non l'arithmétique — est le principal goulot d'étranglement de l'IA en finance ; en 2024, des LLM 7B affinés ont atteint 83 % de F1, comblant l'essentiel de l'écart face au plafond humain de 91 %.

FinQA : Le benchmark mesurant le raisonnement numérique de l'IA sur les rapports financiers

FinQA (EMNLP 2021) a construit 8 281 paires de questions-réponses à partir de rapports de résultats du S&P 500 nécessitant des programmes arithmétiques multi-étapes. Les modèles neuronaux ont obtenu un score de 61 % à leur sortie contre 91 % pour les experts humains ; la précision s'effondre à 22 % sur les programmes de trois étapes ou plus. Les modes d'échec — constantes de domaine, ancrage multi-modal, longueur de chaîne — correspondent directement aux défis auxquels les agents Beancount sont confrontés aujourd'hui.

FinanceBench : Pourquoi le RAG avec base de données vectorielle échoue sur les documents financiers réels

FinanceBench évalue 16 configurations d'IA par rapport à 10 231 questions issues de dépôts réels de la SEC ; le RAG avec base de données vectorielle partagée ne répond correctement que dans 19 % des cas, et même GPT-4-Turbo avec le passage oracle n'atteint que 85 % de précision — montrant que le raisonnement numérique, et non la récupération, est la contrainte limitante pour l'IA financière en entreprise.

Self-RAG : Récupération adaptive et autocritique pour les LLM

Self-RAG (ICLR 2024 Oral) entraîne un modèle de langage à décider quand récupérer des informations puis à évaluer ses propres résultats à l'aide de quatre jetons de réflexion — atteignant 55,8 % sur PopQA et un FactScore de 80,2 sur les biographies tout en surpassant ChatGPT sur cinq références. L'analyse couvre le mécanisme, les résultats d'ablation, les limites de reproductibilité et les implications pour les agents d'IA financière sur les grands livres Beancount.

AgentBench : Évaluer les LLM en tant qu'agents — Leçons pour la fiabilité de l'IA financière

AgentBench (Liu et al., ICLR 2024) évalue 27 LLM dans 8 environnements interactifs — GPT-4 a obtenu 4,01 au total contre 0,96 pour le meilleur modèle open source. Les trois modes de défaillance dominants (limite de tâche dépassée dans 67,9 % des échecs de graphe de connaissances, erreurs de format dans 53,3 % des échecs de base de données et actions invalides) correspondent directement aux risques de déployer un agent d'écriture Beancount sur un grand livre réel.

BloombergGPT et les limites des LLM spécialisés dans la finance

Bloomberg a entraîné un LLM de 50 milliards de paramètres sur 569 milliards de tokens de données financières et a surpassé les modèles généraux sur les benchmarks de sentiment et de raisonnement sur tableaux — puis GPT-4 l'a égalé sans aucun pré-entraînement spécifique à la finance. Ce que l'expérience à 10 millions de dollars révèle sur les compromis du pré-entraînement par domaine, la tokenisation des nombres et pourquoi l'utilisation d'outils est plus fiable que les composants internes du modèle pour les agents comptables.

AutoGen : Cadres de conversation multi-agents pour l'IA financière

AutoGen (Wu et al., 2023) introduit un cadre de conversation multi-agents où des agents basés sur des LLM s'échangent des messages pour accomplir des tâches ; une configuration à deux agents fait passer la précision du benchmark MATH de 55 % à 69 %, et un agent SafeGuard dédié améliore la détection de code dangereux jusqu'à 35 points F1 — des résultats directement applicables à la construction de pipelines d'automatisation Beancount sûrs et modulaires.

Gorilla : Comment le Retrieval-Aware Training réduit les hallucinations d'API des LLM de 78 % à 11 %

Gorilla (Patil et al., NeurIPS 2024) affine un modèle LLaMA 7B avec le Retriever-Aware Training sur la documentation d'API récupérée, réduisant les taux d'hallucination de 78 % à 11 % par rapport à GPT-4 en zero-shot — avec des implications directes pour les agents d'écriture IA en finance où les noms de comptes erronés ou les signes inversés sont des échecs d'exactitude, et non de simples désagréments.