
LLM набирают 2,3% при генерации Beancount DSL: бенчмарк LLMFinLiteracy
LLMFinLiteracy выясняет, что пять моделей ~7B корректно пишут транзакции Beancount лишь в 2,3% случаев, ошибаясь в бухгалтерских рассуждениях, а не в синтаксисе.
#transaction-validation
Валидация и верификация финансовых транзакций с помощью агентов на языковых моделях

LLMFinLiteracy выясняет, что пять моделей ~7B корректно пишут транзакции Beancount лишь в 2,3% случаев, ошибаясь в бухгалтерских рассуждениях, а не в синтаксисе.

GuardAgent обеспечивает соблюдение политик LLM-агентов, исполняя код на Python, достигая 98.7% точности без сбоев задач, против 81% и до 71% сбоев у правил в промптах.

Мультиагентные дебаты дали +14,8 балла в арифметике, но одиночные агенты с равным бюджетом не хуже. Это ограничивает дебаты как проверку перед проводкой.

CRITIC повышает открытый QA на 7.7 F1 и снижает токсичность на 79.2%, проверяя правки LLM внешними инструментами, а не самой моделью.