Zum Hauptinhalt springen

Forschungstagebuch

Offene Experimente und Erkenntnisse von Bean Labs — die Finance-AI-Agent-Forschungsinitiative von Beancount.io.

GraphRAG: Von lokaler zu globaler abfrageorientierter Zusammenfassung

Microsofts GraphRAG erstellt einen Leiden-partitionierten Entitätsgraphen über ein Textkorpus und berechnet Community-Zusammenfassungen im Voraus, um globale Fragen zum Gesamtverständnis zu beantworten, die Standard-Vektor-RAG nicht bewältigen kann – ein Bias-Audit von 2025 zeigt jedoch, dass die Gewinnraten von 72–83 % einbrechen, sobald Positions- und Längenartefakte in der LLM-as-Judge-Evaluierung korrigiert werden.

InvestorBench: Benchmarking von LLM-Agenten bei finanziellen Handelsentscheidungen

InvestorBench (ACL 2025) testet 13 LLM-Backbones im Backtesting von Aktien-, Krypto- und ETF-Handel anhand von kumulierter Rendite und Sharpe-Ratio – nicht anhand von QA-Genauigkeit. Qwen2.5-72B führt die Aktien-Rangliste mit 46,15 % CR an; auf Finanzen spezialisierte Modelle erweisen sich bei Aktien als kontraproduktiv. Die Modellgröße sagt die Performance zuverlässiger voraus als domänenspezifisches Fine-Tuning.

Single-Agent-LLMs übertreffen Multi-Agenten-Systeme beim Multi-Hop-Reasoning unter gleichem Thinking-Token-Budget

Ein Stanford-Preprint aus dem Jahr 2026 gleicht die Thinking-Token-Budgets über fünf Multi-Agenten-Architekturen hinweg an und stellt fest, dass Single-Agent-LLMs bei Multi-Hop-Reasoning-Aufgaben mit Multi-Agenten-Systemen gleichziehen oder diese übertreffen – mit theoretischer Fundierung in der Datenverarbeitungsungleichung und Auswirkungen auf das Design von KI-Finanzagenten.

Atlas: Gemeinsames Retriever-Reader-Pre-Training schlägt LLMs mit 540 Mrd. Parametern mit nur 11 Mrd. Parametern

Atlas (JMLR 2023) erreicht eine Genauigkeit von 42,4 % bei Natural Questions mit nur 64 Trainingsbeispielen – und schlägt damit PaLM 540B um 3 Punkte bei Verwendung von nur 11 Mrd. Parametern – durch gemeinsames Pre-Training eines Contriever-basierten Dense Retrievers mit einem T5 Fusion-in-Decoder Reader. Die Analyse umfasst die Grenzen der Retrieval-Genauigkeit, Infrastrukturkosten für einen 587-GB-Index und Auswirkungen auf Beancount-Ledger-QA-Systeme.

Fusion-in-Decoder: Wie Multi-Passage-Retrieval das generative QA verbessert

Izacards und Graves FiD-Architektur kodiert abgerufene Passagen unabhängig voneinander und führt sie dann im Decoder zusammen. Sie übertrifft RAG-Sequence bei NQ und TriviaQA um 4–11 Punkte. Dieser Beitrag untersucht das Design und seine Auswirkungen auf die Beancount-Ledger-Fragenbeantwortung, bei der die Synthese mehrerer Einträge über verschiedene Transaktionen hinweg die Norm ist.