
Kann dein Agent diese Bücher ausgleichen?
Ein Agentenlauf stimmte ein dreizeiliges Ledger auf 2958,50 USD Girokonto und 1958,50 USD Septembergewinn ab und erholte sich von einem selbst diagnostizierten Fehler.
#reconciliation
Automatisierte Hauptbuchabstimmung mit Sprachmodell-Agenten

Ein Agentenlauf stimmte ein dreizeiliges Ledger auf 2958,50 USD Girokonto und 1958,50 USD Septembergewinn ab und erholte sich von einem selbst diagnostizierten Fehler.

FinRAGBench-V zeigt: Top-Modelle erreichen nur 20–61 % Block-Level-Zitat-Recall auf Finanzseiten. Multimodales Retrieval schlägt Text-only um fast 50 Punkte.

Nur Qwen3.5-9B übersteht 80% der 132-Monats-CFO-Läufe von EnterpriseArena, während GPT-5.4 und DeepSeek-V3.1 0% erreichen. Übersprungener Ledger-Abgleich verursacht die Fehler.

FinMCP-Bench bewertet das beste von sechs LLMs mit nur 3,08 % Exact Match bei 613 echten MCP-Finanzaufgaben, ein 20-facher Einbruch von Single-Tool zu Multi-Turn.

Das Subtrahieren von Positions-Bias aus LLM-Attention-Gewichten gewinnt bis zu 15 Punkte RAG-Genauigkeit, wenn Belege mitten im Kontext liegen.

Fin-RATE zeigt: LLM-Genauigkeit bricht auf 18,60 % bei longitudinaler Verfolgung ein, wobei die Retrieval-Pipeline, nicht das Modell, der Engpass ist.

Die persistente Code-Skill-Bibliothek von Voyager entdeckt 3,3× mehr Minecraft-Gegenstände als bisherige SOTA ohne Feintuning — das Wiederverwendungsmuster-Hauptbuch, das Agenten benötigen.

Die Zwei-Agenten-Konversation von AutoGen hebt die MATH-Genauigkeit von 55% auf 69%, und sein SafeGuard-Agent liefert bis zu 35 F1-Punkte bei der Erkennung unsicheren Codes.

CodeAct ersetzt JSON-Tool-Aufrufe durch ausführbares Python, steigert den GPT-4-Agenten-Erfolg um ~20 Punkte und senkt die Turns um 30%.

CRITIC steigert Open-Domain-QA um 7,7 F1 und senkt Toxizität um 79,2%, indem es LLM-Revisionen gegen externe Tools statt gegen sich selbst verifiziert.

ReAct verschränkt Schlussfolgern mit Tool-Aktionen und schlägt reine CoT um 34 Punkte bei Faktenprüfung. Seine Fehlermodi prägen Agenten, die in Beancount-Ledger schreiben.