Zum Hauptinhalt springen

#technology

Technology

Technology research and software engineering topics relevant to financial AI systems

Lost in the Middle: Position Bias in LLMs und seine Auswirkungen auf Finance AI

Das TACL-2024-Paper von Liu et al. zeigt, dass LLMs bei Informationen, die in der Mitte langer Kontexte verborgen sind, bis zu 20 Punkte schlechter abschneiden – eine U-förmige Verschlechterung, die jedes getestete Modell einschließlich Claude-1.3-100K betrifft – mit konkreten Auswirkungen darauf, wie RAG-Pipelines abgerufene Passagen in Finanz- und Buchhaltungsanwendungen anordnen sollten.

Self-RAG: Adaptive Retrieval und Selbstkritik für LLMs

Self-RAG (ICLR 2024 Oral) trainiert ein Sprachmodell darauf, zu entscheiden, wann Informationen abgerufen werden sollen, und die Ergebnisse anschließend anhand von vier Reflection-Tokens zu bewerten — dabei erreicht es 55,8 % bei PopQA und einen FactScore von 80,2 bei Biografien und übertrifft ChatGPT in fünf Benchmarks. Die Analyse umfasst den Mechanismus, Ablationsergebnisse, Grenzen der Reproduzierbarkeit und Auswirkungen auf Finanz-KI-Agenten für Beancount-Ledger.

AgentBench: Evaluating LLMs as Agents — Lehren für die Zuverlässigkeit von KI im Finanzwesen

AgentBench (Liu et al., ICLR 2024) benchmarkt 27 LLMs in 8 interaktiven Umgebungen — GPT-4 erreichte 4,01 insgesamt gegenüber 0,96 für das beste Open-Source-Modell. Die drei dominanten Fehlermodi (Aufgabenlimit überschritten in 67,9 % der Wissensgraph-Fehler, Formatfehler in 53,3 % der Datenbankfehler und ungültige Aktionen) übertragen sich direkt auf die Risiken bei der Bereitstellung eines Beancount-Write-Back-Agenten auf einem echten Ledger.