
LLM отримують 2,3% за генерацію Beancount DSL: бенчмарк LLMFinLiteracy
LLMFinLiteracy: п'ять моделей ~7B пишуть правильні проводки Beancount лише у 2,3% випадків, помиляючись у бухгалтерських міркуваннях, а не в синтаксисі.
#transaction-validation
Перевірка та верифікація фінансових транзакцій агентами мовних моделей

LLMFinLiteracy: п'ять моделей ~7B пишуть правильні проводки Beancount лише у 2,3% випадків, помиляючись у бухгалтерських міркуваннях, а не в синтаксисі.

GuardAgent enforces LLM agent policies by running Python code, hitting 98.7% accuracy with no task failures, versus 81% and up to 71% failure for prompt rules.

Дебати мультиагентів дали 14,8 пункту в арифметиці, але одиночні агенти з рівним бюджетом не гірші. Це обмежує дебати як перевірку перед проводкою.

CRITIC підвищує QA відкритого домену на 7,7 F1 і знижує токсичність на 79,2%, перевіряючи правки LLM зовнішніми інструментами, а не нею самою.