Salta al contenuto principale

#fintech

Fintech

Financial technology research, platforms, and infrastructure for modern accounting systems

FinToolBench: Valutazione degli agenti LLM sull'uso di strumenti finanziari in scenari reali

FinToolBench combina 760 strumenti finanziari API attivi con 295 query eseguibili per testare gli agenti LLM su compiti finanziari reali — rivelando che la frequenza di chiamata conservativa di GPT-4o del 22,7% garantisce una qualità delle risposte superiore (CSS 0,670) rispetto al TIR aggressivo di Qwen3-8B all'87,1%, mentre il disallineamento delle intenzioni supera il 50% in tutti i modelli testati.

BloombergGPT e i Limiti dei LLM Specifici di Dominio nella Finanza

Bloomberg ha addestrato un LLM da 50 miliardi di parametri su 569 miliardi di token di dati finanziari, superando i modelli generici nei benchmark di sentiment analysis e ragionamento su tabelle, finché GPT-4 non lo ha eguagliato senza alcun pre-addestramento specifico per la finanza. Cosa rivela l'esperimento da 10 milioni di dollari sui compromessi del pre-addestramento di dominio, la tokenizzazione dei numeri e perché l'uso di strumenti è più affidabile degli interni del modello per gli agenti contabili.