
Los LLM obtienen un 2,3% en la generación de DSL de Beancount: El benchmark LLMFinLiteracy
LLMFinLiteracy halla que cinco modelos de ~7B escriben transacciones Beancount correctas solo el 2,3% de las veces, fallando en razonamiento contable, no en sintaxis.
