
Kann dein Agent diese Bücher ausgleichen?
Ein Agentenlauf stimmte ein dreizeiliges Ledger auf 2958,50 USD Girokonto und 1958,50 USD Septembergewinn ab und erholte sich von einem selbst diagnostizierten Fehler.
#plain-text-accounting
Forschung auf Basis von Klartext-Buchhaltungsformaten und Workflows

Ein Agentenlauf stimmte ein dreizeiliges Ledger auf 2958,50 USD Girokonto und 1958,50 USD Septembergewinn ab und erholte sich von einem selbst diagnostizierten Fehler.

ReDAct wechselt vom kleinen zum großen Modell nur, wenn Perplexität Unsicherheit signalisiert – 64% Kostenersparnis bei gleicher Genauigkeit für Agenten-Workflows.

OpenHands' CodeAct-Agent erreicht 26% im SWE-Bench Lite und zeigt, was KI-Agenten heute zuverlässig leisten. Finanzautomatisierung sollte eng begrenzt starten, nicht autonom.

LLMFinLiteracy zeigt: Fünf ~7B-Modelle schreiben nur in 2,3 % der Fälle korrekte Beancount-Transaktionen, sie scheitern am Buchhaltungs-Reasoning, nicht an der Syntax.

TableMaster erreicht 78,13 % bei WikiTQ mit GPT-4o-mini, 13 Punkte über Chain-of-Table, mittels Table-of-Focus plus adaptivem Reasoning für Agenten über Beancount-Hauptbüchern.

τ²-bench findet: Aktive Nutzer mit eigenen Tools senken den Erfolg von Konversationsagenten um 18–25 Punkte. Beancount-Agenten mit gemeinsamem Schreibzugriff verlieren ebenso.

GAIAs 466 Aufgaben zeigen führende KI-Agenten bei 74,55 % gegenüber 92 % bei Menschen, wobei Koordination auf Level 3 die härteste Lücke bleibt.

WorkArenas 33 ServiceNow-Aufgaben zeigen GPT-4o bei 42,7 % insgesamt, aber 0 % bei Listenfiltern – eine Hürde, die strukturierte UI-Interaktion überwinden muss.

τ-bench findet: Top-LLMs fallen von pass@1 0,692 auf pass@4 0,462 bei Retail-Tool-Aufgaben. Zurückschreibende Ledger-Agenten stehen vor derselben Konsistenzklippe.

Chain-of-Table erreicht 67,31 % in WikiTQ gegenüber 61,48 % für rein textbasiertes Chain-of-Thought und führt bei Tabellen über 4.000 Token um 10,25 Punkte.

TableLlama schlägt GPT-4 bei der Spaltentypannotation (F1 94 vs. 32), liegt aber beim kompositionellen Denken in WikiTQ um 33 Punkte zurück.

TAPAS beantwortet Tabellenfragen durch Auswahl von Zellen, ohne SQL zu generieren. Es eignet sich für kleine Beancount-Ledger-Abfragen, versagt aber bei Skalierung.