
DIN-SQL : GPT-4 passe de 67,4 % à 85,3 % d'EX sur Spider
DIN-SQL fait passer GPT-4 de 67,4 % à 85,3 % de précision d'exécution sur Spider grâce aux étapes de liaison de schéma et d'auto-correction — la même décomposition convient à BQL de Beancount.

DIN-SQL fait passer GPT-4 de 67,4 % à 85,3 % de précision d'exécution sur Spider grâce aux étapes de liaison de schéma et d'auto-correction — la même décomposition convient à BQL de Beancount.

Sur BIRD, GPT-4 atteint 54,89 % de précision d'exécution avec indices de domaine et 34,88 % sans — un écart de 20 points que toute interface Beancount NL→BQL doit combler.

Des chercheurs de CMU et NC State proposent d'utiliser l'Analyse de Processus Systémique (STPA) et un protocole Model Context Protocol enrichi de capacités pour dériver des spécifications de sécurité formelles pour l'utilisation d'outils par les agents LLM, avec une vérification basée sur Alloy démontrant l'absence de flux dangereux dans une étude de cas de planification d'agenda.

Le GraphRAG de Microsoft affiche des gains de compréhension de 72–83 % par rapport au RAG vectoriel ; un audit de 2025 les fait disparaître après correction du biais du juge — prudence pour le QA multi-documents.

FinAuditing teste 13 LLM en zero-shot sur 1 102 instances réelles de dépôts XBRL de la SEC ; les meilleurs scores sont de 13,86 % sur la vérification mathématique financière et de 12,42 % sur l'extraction de concepts — des résultats qui limitent directement ce que les outils de comptabilité par IA peuvent automatiser en toute confiance sans outils externes.

InvestorBench : Qwen2.5-72B mène le trading d'actions avec un CR de 46,15 % ; Palmyra-Fin, affiné pour la finance, échoue sur les actions — la taille prime sur l'affinage par domaine.

StructRAG (ICLR 2025) oriente chaque requête vers un type de structure adapté à la tâche — tableau, graphe, catalogue, algorithme ou fragment — avant le raisonnement, obtenant un score supérieur de 28 points à GraphRAG sur le benchmark Loong tout en étant 22 fois plus rapide, le routeur entraîné par DPO représentant à lui seul un gain de précision de 15 points.

Avec des budgets de jetons de réflexion égaux, les LLM à agent unique égalent ou battent les systèmes multi-agents sur le raisonnement multi-sauts—privilégiez des conceptions d'agent financier plus simples.

M3MAD-Bench met à l'épreuve le débat multi-agent sur 9 modèles, 5 domaines et des configurations vision-langage, révélant que le délire collectif cause 65 % des échecs, que le débat contradictoire réduit la précision jusqu'à 12,8 % et que l'auto-cohérence égale généralement la précision du débat à un coût en jetons inférieur.

AGrail (ACL 2025) introduit un garde-fou coopératif à deux LLM qui adapte les contrôles de sécurité au moment de l'inférence via l'adaptation au temps de test, atteignant un taux de succès d'attaque par injection de prompt de 0 % et une préservation des actions bénignes de 95,6 % sur Safe-OS — comparativement à GuardAgent et LLaMA-Guard qui bloquent jusqu'à 49,2 % des actions légitimes.

ShieldAgent (ICML 2025) remplace les garde-fous basés sur les LLM par des circuits de règles probabilistes s'appuyant sur des réseaux logiques de Markov, atteignant une précision de 90,4 % sur les attaques d'agents avec 64,7 % d'appels API en moins — et ce que cela signifie pour la sécurité vérifiable dans les systèmes d'IA financière.

Atlas (JMLR 2023) atteint une précision de 42,4 % sur Natural Questions avec seulement 64 exemples d'entraînement — battant PaLM 540B de 3 points en utilisant 11B paramètres — grâce au pré-entraînement conjoint d'un extracteur dense basé sur Contriever avec un lecteur T5 Fusion-in-Decoder. L'analyse couvre les limites de précision de récupération, les coûts d'infrastructure d'un index de 587 Go et les implications pour les systèmes de QA sur les grands livres Beancount.