
LLM dosahujú 2,3 % v generovaní Beancount DSL: Benchmark LLMFinLiteracy
LLMFinLiteracy zisťuje, že päť modelov s ~7B parametrami napíše správne Beancount transakcie len v 2,3 % prípadov, pričom zlyhávajú na účtovnom uvažovaní, nie na syntaxi.
#transaction-validation
Validácia a overovanie finančných transakcií pomocou agentov jazykových modelov

LLMFinLiteracy zisťuje, že päť modelov s ~7B parametrami napíše správne Beancount transakcie len v 2,3 % prípadov, pričom zlyhávajú na účtovnom uvažovaní, nie na syntaxi.

GuardAgent presadzuje pravidlá LLM agentov spúšťaním kódu v Pythone, dosahuje 98,7 % presnosť bez zlyhaní úloh, oproti 81 % a až 71 % zlyhaní pri pravidlách v prompte.

Debata multiagentných LLM získala 14,8 bodu v aritmetike, ale samostatní agenti s rovnakým rozpočtom ju dorovnajú. To obmedzuje debatu ako kontrolu pred zápisom do knihy.

CRITIC zvyšuje open-domain QA o 7,7 F1 a znižuje toxicitu o 79,2 % overovaním revízií LLM voči externým nástrojom, nie voči sebe samému.