
DIN-SQL: GPT-4 verbessert sich um 67,4%→85,3% EX auf Spider
DIN-SQL hebt GPT-4 von 67,4% auf 85,3% Spider-Ausführungsgenauigkeit durch Schema-Link- und Selbstkorrektur-Phasen – dieselbe Zerlegung passt zu Beancount BQL.

DIN-SQL hebt GPT-4 von 67,4% auf 85,3% Spider-Ausführungsgenauigkeit durch Schema-Link- und Selbstkorrektur-Phasen – dieselbe Zerlegung passt zu Beancount BQL.

Auf BIRD erreicht GPT-4 54,89 % Ausführungsgenauigkeit mit Domain-Hinweisen und 34,88 % ohne – eine Lücke von 20 Punkten, die jede Beancount-NL→BQL-Schnittstelle schließen muss.

Forscher der CMU und der NC State schlagen die Verwendung der System-Theoretic Process Analysis (STPA) und eines fähigkeitserweiterten Model Context Protocols vor, um formale Sicherheitsspezifikationen für die Tool-Nutzung von LLM-Agenten abzuleiten, wobei eine Alloy-basierte Verifizierung das Fehlen unsicherer Flüsse in einer Fallstudie zur Kalenderplanung demonstriert.

Microsofts GraphRAG erzielt 72–83% Sensemaking-Siege gegenüber Vektor-RAG; eine 2025-Audit lässt diese nach Korrektur der Richter-Verzerrung kollabieren—Vorsicht bei Multi-Dokument-Hauptbuch-QA.

FinAuditing testet 13 LLMs Zero-Shot an 1.102 realen SEC-XBRL-Einreichungsinstanzen; die Bestnoten liegen bei 13,86 % bei der finanzmathematischen Verifizierung und 12,42 % beim Abrufen von Konzepten – Ergebnisse, die direkt einschränken, was KI-Buchhaltungstools ohne externe Werkzeuge automatisiert anvertraut werden kann.

InvestorBench: Qwen2.5-72B führt beim Aktienhandel mit 46,15% CR; das auf Finanzen abgestimmte Palmyra-Fin schlägt bei Aktien fehl – Größe schlägt domänenspezifisches Feintuning.

StructRAG (ICLR 2025) leitet jede Abfrage an einen aufgabengerechten Strukturtyp weiter – Tabelle, Graph, Katalog, Algorithmus oder Chunk – bevor die Argumentation erfolgt. Dabei erzielt es im Loong-Benchmark 28 Punkte mehr als GraphRAG bei 22-facher Geschwindigkeit, wobei allein der DPO-trainierte Router für einen Genauigkeitsgewinn von 15 Punkten sorgt.

Bei gleichen Denk-Token-Budgets erreichen oder übertreffen Single-Agent-LLMs Multi-Agent-Systeme bei Multi-Hop-Schlussfolgerungen – bevorzugen Sie einfachere Finanz-Agent-Designs.

M3MAD-Bench unterzieht Multi-Agenten-Debatten einem Stresstest über 9 Modelle, 5 Domänen und Vision-Language-Szenarien hinweg. Die Studie zeigt, dass kollektive Täuschung 65 % der Fehler verursacht, adversative Debatten die Genauigkeit um bis zu 12,8 % senken und Self-Consistency die Debattengenauigkeit meist bei geringeren Token-Kosten erreicht.

AGrail (ACL 2025) führt eine kooperative Zwei-LLM-Guardrail ein, die Sicherheitsprüfungen zur Inferenzzeit mittels Test-Time Adaptation anpasst. Auf Safe-OS erzielt sie eine Erfolgsrate von 0 % bei Prompt-Injection-Angriffen und bewahrt 95,6 % der legitimen Aktionen – im Vergleich zu GuardAgent und LLaMA-Guard, die bis zu 49,2 % legitimer Aktionen blockieren.

ShieldAgent (ICML 2025) ersetzt LLM-basierte Guardrails durch probabilistische Regel-Schaltkreise auf Basis von Markov-Logik-Netzwerken und erreicht eine Genauigkeit von 90,4 % bei Agentenangriffen mit 64,7 % weniger API-Aufrufen – und was dies für die verifizierbare Sicherheit in KI-Finanzsystemen bedeutet.

Atlas (JMLR 2023) erreicht eine Genauigkeit von 42,4 % bei Natural Questions mit nur 64 Trainingsbeispielen – und schlägt damit PaLM 540B um 3 Punkte bei Verwendung von nur 11 Mrd. Parametern – durch gemeinsames Pre-Training eines Contriever-basierten Dense Retrievers mit einem T5 Fusion-in-Decoder Reader. Die Analyse umfasst die Grenzen der Retrieval-Genauigkeit, Infrastrukturkosten für einen 587-GB-Index und Auswirkungen auf Beancount-Ledger-QA-Systeme.