Aller au contenu principal

Journal de recherche Bean Labs

AgentBench : Évaluer les LLM en tant qu'agents — Leçons pour la fiabilité de l'IA financière

Publié Dernière mise à jour 7 minutes de lectureMike ThriftMike Thrift
AgentBench : Évaluer les LLM en tant qu'agents — Leçons pour la fiabilité de l'IA financière

Article: https://arxiv.org/abs/2308.03688

Sur cette page

Lorsque je demande ce qu'un agent d'écriture Beancount doit réellement faire de manière fiable, la réponse n'est pas « générer du texte » — c'est « exécuter une séquence d'actions dans un environnement structuré sans dérailler ». AgentBench (Liu et al., Tsinghua, ICLR 2024) est l'une des premières tentatives sérieuses pour mesurer cette capacité à grande échelle, et l'instantané de 2023 contient encore des leçons qui valent la peine d'être extraites.

L'article

AgentBench, par Xiao Liu et 21 co-auteurs de l'Université Tsinghua, définit huit environnements conçus pour tester les LLM en tant qu'agents interactifs plutôt que comme générateurs de texte passifs. Cinq environnements sont originaux : OS (interaction bash), Base de données (génération SQL et récupération d'erreurs), Graphe de connaissances (requêtes structurées basées sur des outils), Jeu de cartes numérique (compétition stratégique multi-tours) et Énigmes de pensée latérale (dialogue déductif). Trois sont adaptés de jeux de données antérieurs : House-Holding de ALFWorld, Web Shopping de WebShop et Web Browsing de Mind2Web. L'article évalue 27 modèles — modèles API commerciaux et modèles open source jusqu'à 70B — à travers environ 4 000 générations sur l'ensemble de développement et 13 000 générations sur l'ensemble de test, et rapporte à la fois les taux de réussite par environnement et un score global composite.

Idées clés

  • GPT-4 mène avec un score global de 4,01. Claude-2 obtient 2,49, GPT-3.5-turbo 2,32. CodeLlama-34B, le modèle open source le plus performant au moment de la soumission, n'obtient que 0,96. Les modèles API atteignent en moyenne 2,24 contre 0,42 pour les modèles open source.
  • GPT-4 obtient 42,4 % sur OS, 32,0 % sur Base de données et 78,0 % sur House-Holding — l'écart montre quels environnements récompensent le suivi d'instructions par rapport au raisonnement structuré.
  • « Limite de tâche dépassée » est le mode de défaillance dominant : 67,9 % des échecs de graphe de connaissances atteignent le budget d'étapes avant de résoudre la tâche. C'est un échec de raisonnement à long horizon, pas un déficit de connaissances.
  • Les erreurs de conformité de format représentent 53,3 % des échecs de base de données — l'agent produit du SQL syntaxiquement invalide, ou enveloppe les requêtes dans de la prose que l'évaluateur ne peut pas analyser.
  • La sélection d'actions invalides motive 64,1 % des échecs de House-Holding — l'agent nomme une action indisponible dans l'état actuel.
  • L'entraînement sur du code a des « effets contradictoires selon les tâches » : il aide les environnements de suivi de procédures mais peut nuire au raisonnement général dans ceux qui sont riches en dialogue.

Ce qui tient — et ce qui ne tient pas

Le choix de conception central — évaluation interactive multi-environnement et multi-tours — est juste et reste sous-utilisé. La plupart des références LLM mesurent encore la qualité de génération en un seul tour ; AgentBench insiste correctement sur le fait que les agents doivent continuer à prendre des décisions jusqu'à ce qu'une tâche soit terminée ou que le budget soit épuisé.

Cela dit, l'instantané est daté d'une manière qui compte. L'écart entre GPT-4 (4,01) et le meilleur modèle open source (0,96) semblait alarmant à la mi-2023, mais d'ici 2025, il s'est en grande partie comblé. Des modèles comme Llama 3.1 70B ou Qwen 2.5 72B franchissent désormais les obstacles de suivi d'instructions et de conformité de format qui étaient des défis nouveaux il y a deux ans. Lire l'article comme « l'open source ne peut pas faire de tâches agentiques » serait une erreur ; le lire comme « la conformité de format et la cohérence à long horizon sont les problèmes difficiles » reste correct.

Il y a aussi un compromis entre largeur et profondeur. Huit environnements semblent complets, mais chacun est relativement superficiel. WebArena (Zhou et al., 2024) couvre 812 tâches modélisées à long horizon pour la seule navigation web ; OSWorld (Xie et al., 2024) évalue 369 tâches de bureau réelles sur Ubuntu et Windows. AgentBench peut donner un signal transversal, mais il ne remplace pas un référencement spécifique au domaine une fois que vous savez quel environnement vous intéresse.

La taxonomie des modes de défaillance dans le Tableau 4 est probablement la contribution la plus durable. Les auteurs classent les défaillances en limite de tâche dépassée, erreur de format, action invalide et quelques autres. Ce ne sont pas des bugs d'implémentation — ce sont des faiblesses structurelles dans la manière dont les LLM maintiennent l'état, suivent les actions disponibles et produisent une sortie analysable sous pression multi-tours. Tout système agentique sérieux doit les traiter.

Pourquoi cela compte pour l'IA financière

Les trois modes de défaillance dominants correspondent presque directement à ce que je m'attends à voir casser un agent d'écriture Beancount.

Limite de tâche dépassée est le mode de défaillance de la réconciliation du grand livre. Clôturer une période sur plusieurs comptes signifie vérifier les soldes d'ouverture, faire correspondre les débits et les crédits, identifier les écarts et proposer des corrections — une chaîne qui dépasse facilement 10 à 20 étapes. Un agent qui atteint un budget de contexte ou d'étapes en plein milieu et abandonne ne fait pas qu'échouer avec grâce ; il peut laisser le grand livre dans un état partiellement modifié.

Erreur de format est le mode de défaillance de la saisie de transactions. Beancount a une syntaxe stricte : une écriture malformée (devise manquante, mauvaise indentation, indicateur invalide) est une erreur d'analyse qui corrompt le fichier. Un agent qui génère de la prose autour de sa sortie Beancount, ou produit une syntaxe d'apparence correcte dans le mauvais format, est inutile. C'est le problème central de l'article CRITIC appliqué à un domaine plus strict.

Action invalide est le problème de sécurité de l'écriture. Un agent Beancount opérant sur un grand livre réel a un ensemble limité d'opérations sûres : ajouter une transaction, corriger un indicateur, déplacer une écriture. Halluciner une action en dehors de cet ensemble — par exemple supprimer un compte qui a encore des positions ouvertes — est un échec de correction qui pourrait ne pas apparaître avant un audit.

La constatation que « l'entraînement sur du code a des effets contradictoires » est également pertinente. L'écriture Beancount est plus proche de la génération de code que de la récupération de connaissances, donc un modèle pré-entraîné sur du code devrait être un choix naturel. Mais si l'entraînement sur du code nuit au suivi de dialogue dans des contextes multi-tours, une évaluation hybride comme celle d'AgentBench est nécessaire pour mettre en évidence ces compromis avant le déploiement.

Quoi lire ensuite

  • WebArena (Zhou et al., 2024 ; arXiv:2307.13854) — 812 tâches de navigation web dans un environnement navigateur en direct ; le suivi plus approfondi du niveau web d'AgentBench.
  • OSWorld (Xie et al., 2024 ; NeurIPS 2024) — référence complet de l'environnement de bureau incluant le système de fichiers et les tâches GUI ; l'environnement OS d'OSWorld est un successeur direct et plus approfondi du niveau OS d'AgentBench.
  • TAU-bench (Yao et al., 2024) — évalue les agents dans des environnements API de vente au détail et de compagnie aérienne avec une utilisation réelle d'outils et une simulation d'utilisateurs ; le référencement publié le plus proche de traiter un grand livre Beancount comme un environnement.

Partager cet article

Source : https://beancount.io/fr/bean-labs/research-logs/2026/05/06/agentbench-evaluating-llms-as-agents

Publié: 6 mai 2026

Dernière mise à jour: 14 septembre 2026