
Votre agent peut-il équilibrer ces livres ?
Une exécution d'agent a rapproché un grand livre de trois lignes : 2958,50 USD en courant et 1958,50 USD de profit, après un échec auto-diagnostiqué.
#plain-text-accounting
Recherche fondée sur les formats et flux de travail de la comptabilité en texte brut

Une exécution d'agent a rapproché un grand livre de trois lignes : 2958,50 USD en courant et 1958,50 USD de profit, après un échec auto-diagnostiqué.

ReDAct ne passe d'un petit modèle à un grand que lorsque la perplexité signale une incertitude, réduisant le coût de 64 % à précision égale pour les workflows d'agents.

L'agent CodeAct d'OpenHands obtient 26 % sur SWE-Bench Lite, montrant ce que les agents IA font réellement. L'automatisation financière doit démarrer cadrée, pas autonome.

LLMFinLiteracy constate que cinq modèles ~7B n'écrivent des transactions Beancount correctes que 2,3 % du temps, échouant sur le raisonnement comptable, pas la syntaxe.

TableMaster atteint 78,13 % sur WikiTQ avec GPT-4o-mini, 13 points de plus que Chain-of-Table, via table-of-focus et raisonnement adaptatif pour les agents Beancount.

τ²-bench étend l'évaluation des agents aux environnements à double contrôle où l'IA et l'utilisateur invoquent tous deux des outils sur un état partagé — révélant que les utilisateurs actifs réduisent les taux de réussite de 18 à 25 points de pourcentage, avec des implications directes pour les agents Beancount partageant l'accès en écriture avec des utilisateurs humains.

Les 466 tâches de GAIA montrent les agents IA de pointe à 74,55 % contre 92 % pour les humains, la coordination de niveau 3 restant l'écart le plus dur à combler.

Les 33 tâches ServiceNow de WorkArena montrent GPT-4o à 42,7 % au global mais 0 % sur les filtres de liste, un mur que l'interaction structurée doit franchir.

τ-bench constate que les meilleurs LLM passent de pass@1 0,692 à pass@4 0,462 sur des tâches d'outils de vente. Les agents écrivant sur un grand livre subissent la même chute.

Chain-of-Table atteint 67,31 % sur WikiTQ contre 61,48 % pour la chaîne de pensée textuelle, et devance de 10,25 points sur les tables de plus de 4 000 tokens.

TableLlama surpasse GPT-4 en annotation de type de colonne (F1 94 vs 32) mais accuse 33 points de retard en raisonnement compositionnel sur WikiTQ.

TAPAS répond aux questions sur tables en sélectionnant des cellules, sans jamais générer de SQL. Il convient aux petites requêtes Beancount mais cale à grande échelle.