Aller au contenu principal

#technology

Technology

Technology research and software engineering topics relevant to financial AI systems

Perdu au milieu : le biais de position dans les LLM et son impact sur l'IA financière

L'article TACL 2024 de Liu et al. montre que les LLM sont jusqu'à 20 points moins performants sur les informations enfouies au milieu de contextes longs — une dégradation en forme de U affectant tous les modèles testés, y compris Claude-1.3-100K — avec des implications concrètes sur la manière dont les pipelines RAG devraient ordonner les passages récupérés dans les applications de finance et de comptabilité.

StructRAG (ICLR 2025) : Choisir la bonne structure de document surpasse GraphRAG de 28 points

StructRAG (ICLR 2025) oriente chaque requête vers un type de structure adapté à la tâche — tableau, graphe, catalogue, algorithme ou fragment — avant le raisonnement, obtenant un score supérieur de 28 points à GraphRAG sur le benchmark Loong tout en étant 22 fois plus rapide, le routeur entraîné par DPO représentant à lui seul un gain de précision de 15 points.

Self-RAG : Récupération adaptive et autocritique pour les LLM

Self-RAG (ICLR 2024 Oral) entraîne un modèle de langage à décider quand récupérer des informations puis à évaluer ses propres résultats à l'aide de quatre jetons de réflexion — atteignant 55,8 % sur PopQA et un FactScore de 80,2 sur les biographies tout en surpassant ChatGPT sur cinq références. L'analyse couvre le mécanisme, les résultats d'ablation, les limites de reproductibilité et les implications pour les agents d'IA financière sur les grands livres Beancount.

AgentBench : Évaluer les LLM en tant qu'agents — Leçons pour la fiabilité de l'IA financière

AgentBench (Liu et al., ICLR 2024) évalue 27 LLM dans 8 environnements interactifs — GPT-4 a obtenu 4,01 au total contre 0,96 pour le meilleur modèle open source. Les trois modes de défaillance dominants (limite de tâche dépassée dans 67,9 % des échecs de graphe de connaissances, erreurs de format dans 53,3 % des échecs de base de données et actions invalides) correspondent directement aux risques de déployer un agent d'écriture Beancount sur un grand livre réel.