
Dokáže váš agent vyrovnať tieto knihy?
Jeden beh agenta zosúladil trojriadkovú knihu na 2958,50 USD bežný účet a 1958,50 USD septembrový zisk, pričom sa zotavil z jedného zlyhania, ktoré sám diagnostikoval.
#plain-text-accounting
Výskum založený na plain-text účtovných formátoch a pracovných postupoch

Jeden beh agenta zosúladil trojriadkovú knihu na 2958,50 USD bežný účet a 1958,50 USD septembrový zisk, pričom sa zotavil z jedného zlyhania, ktoré sám diagnostikoval.

ReDAct presúva úlohu z malého modelu na veľký len vtedy, keď perplexita signalizuje neistotu, čím znižuje náklady o 64 % pri rovnakej presnosti pre agentové workflowy.

CodeAct agent OpenHands získava 26 % na SWE-Bench Lite, čo ukazuje, čo AI agenti dnes spoľahlivo zvládajú. Automatizácia financií by mala začínať úzko vymedzená, nie autonómna.

LLMFinLiteracy zisťuje, že päť modelov s ~7B parametrami napíše správne Beancount transakcie len v 2,3 % prípadov, pričom zlyhávajú na účtovnom uvažovaní, nie na syntaxi.

TableMaster dosahuje 78,13 % na WikiTQ s GPT-4o-mini, o 13 bodov viac než Chain-of-Table, vďaka table-of-focus a adaptívnemu uvažovaniu pre agentov nad Beancount ledgermi.

τ²-bench zisťuje, že aktívni používatelia s vlastnými nástrojmi znižujú úspešnosť konverzačných agentov o 18–25 bodov. Beancount agenti zdieľajúci zápis strácajú rovnako.

466 úloh GAIA ukazuje špičkových AI agentov na 74,55 % oproti 92 % u ľudí, pričom koordinácia na úrovni 3 zostáva najťažšou medzerou.

33 úloh ServiceNow v WorkArena ukazuje GPT-4o na 42,7 % celkovo, ale 0 % pri filtroch zoznamov — múr, ktorý musí interakcia so štruktúrovaným UI prekonať.

τ-bench zisťuje, že špičkové LLM klesajú z pass@1 0,692 na pass@4 0,462 pri retail úlohách s nástrojmi. Agenti zapisujúci do ledgera čelia rovnakému útesu konzistencie.

Chain-of-Table hits 67.31% on WikiTQ versus 61.48% for text-only chain-of-thought, and leads by 10.25 points on tables over 4,000 tokens.

TableLlama prekonáva GPT-4 v anotácii typu stĺpca (F1 94 vs 32), no zaostáva o 33 bodov v kompozičnom uvažovaní na WikiTQ.

TAPAS odpovedá na otázky o tabuľkách výberom buniek, nikdy negeneruje SQL. Hodí sa na malé dotazy nad Beancount ledgerom, ale pri väčšom rozsahu zlyháva.