
Pot el vostre agent equilibrar aquests llibres?
Una execució d'agent va conciliar un llibre de tres files amb 2958,50 USD de corrent i 1958,50 USD de benefici del setembre, recuperant-se d'una fallada que va diagnosticar.
#plain-text-accounting
Recerca basada en formats i fluxos de treball de comptabilitat de text pla

Una execució d'agent va conciliar un llibre de tres files amb 2958,50 USD de corrent i 1958,50 USD de benefici del setembre, recuperant-se d'una fallada que va diagnosticar.

ReDAct delega d'un model petit a un de gran només quan la perplexitat indica incertesa, retallant el cost un 64% amb precisió equivalent per a fluxos d'agents.

L'agent CodeAct d'OpenHands puntua un 26% a SWE-Bench Lite, mostrant què fan de fiable els agents d'IA avui. L'automatització financera hauria de començar acotada, no autònoma.

LLMFinLiteracy troba que cinc models d'uns 7B escriuen transaccions Beancount correctes només un 2,3% de les vegades, fallant en raonament comptable més que en sintaxi.

TableMaster assoleix un 78,13% a WikiTQ amb GPT-4o-mini, 13 punts més que Chain-of-Table, via table-of-focus i raonament adaptatiu per a agents sobre llibres Beancount.

τ²-bench troba que usuaris actius amb eines pròpies redueixen l'èxit dels agents conversacionals en 18–25 punts. Els agents Beancount amb accés d'escriptura perden igual.

Les 466 tasques de GAIA mostren els agents d'IA frontera al 74,55% davant el 92% dels humans, amb la coordinació de nivell 3 encara com la bretxa més difícil de tancar.

Les 33 tasques ServiceNow de WorkArena mostren GPT-4o al 42,7% global però 0% en filtres de llista, un mur que la interacció estructurada amb la interfície ha de superar.

τ-bench troba que els millors LLM baixen de pass@1 0,692 a pass@4 0,462 en tasques d'eines de venda al detall. Els agents d'escriptura afronten el mateix precipici.

Chain-of-Table hits 67.31% on WikiTQ versus 61.48% for text-only chain-of-thought, and leads by 10.25 points on tables over 4,000 tokens.

TableLlama supera GPT-4 en anotació de tipus de columna (F1 94 vs 32), però queda 33 punts enrere en raonament composicional a WikiTQ.

TAPAS answers table questions by selecting cells, never generating SQL. It fits small Beancount ledger queries but breaks down at scale.