
Votre agent peut-il équilibrer ces livres ?
Une exécution d'agent a rapproché un grand livre de trois lignes : 2958,50 USD en courant et 1958,50 USD de profit, après un échec auto-diagnostiqué.
#reconciliation
Rapprochement automatisé des grands livres à l'aide d'agents de modèles de langage

Une exécution d'agent a rapproché un grand livre de trois lignes : 2958,50 USD en courant et 1958,50 USD de profit, après un échec auto-diagnostiqué.

FinRAGBench-V : les meilleurs modèles n'atteignent que 20–61 % de rappel de citations par blocs sur les pages financières, malgré le multimodal.

Seul Qwen3.5-9B survit à 80 % des 132 mois de CFO d'EnterpriseArena, tandis que GPT-5.4 et DeepSeek-V3.1 tombent à 0 %. Le rapprochement de registre omis cause ces échecs.

FinMCP-Bench note le meilleur de six LLM à seulement 3,08 % de correspondance exacte sur 613 tâches financières MCP réelles, un effondrement de 20× du mono-outil au multi-tour.

Retirer le biais positionnel des poids d'attention des LLM rend jusqu'à 15 points de précision RAG quand la preuve est au milieu du contexte.

Fin-RATE montre que la précision des LLM chute à 18,60 % en suivi longitudinal, le pipeline de retrieval, et non le modèle, étant le goulot d'étranglement.

La bibliothèque de compétences persistante de Voyager découvre 3,3× plus d'objets Minecraft que l'état de l'art précédent sans fine-tuning—le registre de réutilisation dont les agents de grand livre ont besoin.

La conversation à deux agents d'AutoGen fait passer la précision sur MATH de 55 % à 69 %, et son agent SafeGuard ajoute jusqu'à 35 points F1 en détection de code dangereux.

CodeAct remplace les appels d'outils JSON par du Python exécutable, augmentant d'environ 20 points le taux de succès des agents GPT-4 et réduisant les tours de 30 %.

CRITIC gagne 7,7 F1 en QA ouverte et réduit la toxicité de 79,2 % en vérifiant les révisions du LLM contre des outils externes, pas contre lui-même.

ReAct alterne raisonnement et actions d'outils, battant le CoT pur de 34 points en vérification des faits. Ses échecs façonnent les agents écrivant dans Beancount.