
Dokáže váš agent vyrovnať tieto knihy?
Jeden beh agenta zosúladil trojriadkovú knihu na 2958,50 USD bežný účet a 1958,50 USD septembrový zisk, pričom sa zotavil z jedného zlyhania, ktoré sám diagnostikoval.
#reconciliation
Automatizované zosúlaďovanie účtovnej knihy pomocou agentov jazykových modelov

Jeden beh agenta zosúladil trojriadkovú knihu na 2958,50 USD bežný účet a 1958,50 USD septembrový zisk, pričom sa zotavil z jedného zlyhania, ktoré sám diagnostikoval.

FinRAGBench-V zisťuje, že špičkové modely dosahujú len 20 – 61 % citovania blokov na finančných stránkach. Multimodálne vyhľadávanie prekonáva textové o takmer 50 bodov.

Len Qwen3.5-9B prežije 80 % zo 132-mesačných CFO behov EnterpriseArena, kým GPT-5.4 a DeepSeek-V3.1 dosahujú 0 %. Príčinou zlyhaní je vynechané odsúhlasenie hlavnej knihy.

FinMCP-Bench dáva najlepšiemu zo šiestich LLM len 3,08 % presnej zhody na 613 reálnych finančných úlohách MCP, teda 20-násobný prepad pri viackolovom použití.

Odčítanie pozičnej odchýlky z váh pozornosti LLM obnoví až 15 bodov presnosti RAG, keď dôkaz leží uprostred kontextu, čo pomáha pipeline finančných agentov.

Fin-RATE ukazuje pokles presnosti LLM o 18,60 % pri longitudinálnom sledovaní, pričom úzkym miestom je retrieval pipeline, nie model.

Pretrvávajúca knižnica zručností Voyageru objavuje 3,3× viac predmetov z Minecraftu ako predchádzajúci SOTA bez doladenia — vzor, ktorý účtovní agenti potrebujú.

Dvojagentová konverzácia AutoGen zvyšuje presnosť MATH z 55 % na 69 % a jeho SafeGuard agent pridáva až 35 F1 bodov pri detekcii nebezpečného kódu.

CodeAct nahrádza JSON volania nástrojov spustiteľným Pythonom, čím zvyšuje úspešnosť GPT-4 agenta o ~20 bodov a znižuje počet krokov o 30 %.

CRITIC zvyšuje open-domain QA o 7,7 F1 a znižuje toxicitu o 79,2 % overovaním revízií LLM voči externým nástrojom, nie voči sebe samému.

ReAct prelína uvažovanie s akciami nástrojov a prekonáva čistý CoT o 34 bodov pri overovaní faktov. Jeho režimy zlyhania formujú agentov zapisujúcich do Beancount ledgerov.