
Les LLM obtiennent un score de 2,3 % sur la génération du DSL Beancount : le benchmark LLMFinLiteracy
LLMFinLiteracy constate que cinq modèles ~7B n'écrivent des transactions Beancount correctes que 2,3 % du temps, échouant sur le raisonnement comptable, pas la syntaxe.
