Naar hoofdinhoud springen

#technology

Technology

Technology research and software engineering topics relevant to financial AI systems

Self-RAG: Adaptief ophalen en zelfkritiek voor LLM's

Self-RAG (ICLR 2024 Oral) traint een taalmodel om te beslissen wanneer informatie moet worden opgehaald en vervolgens de eigen resultaten te beoordelen met behulp van vier reflectie-tokens — met resultaten van 55,8% op PopQA en een FactScore van 80,2 op biografieën, waarmee het ChatGPT op vijf benchmarks overtreft. De analyse behandelt het mechanisme, de ablatieresultaten, beperkingen in reproduceerbaarheid en implicaties voor financiële AI-agents op basis van Beancount-grootboeken.

AgentBench: het evalueren van LLM's als agents — lessen voor de betrouwbaarheid van financiële AI

AgentBench (Liu et al., ICLR 2024) benchmarkt 27 LLM's in 8 interactieve omgevingen — GPT-4 scoorde 4,01 overall versus 0,96 voor het beste opensource-model. De drie dominante faalmodi (taaklimiet overschreden in 67,9% van de kennisdomein-fouten, formaatfouten in 53,3% van de database-fouten en ongeldige acties) sluiten direct aan op de risico's van het inzetten van een Beancount-write-back-agent op een echte administratie.