Salta al contenuto principale

#fintech

Fintech

Financial technology research, platforms, and infrastructure for modern accounting systems

FinToolBench: Valutare gli Agenti LLM sull'Uso Reale di Strumenti Finanziari

FinToolBench abbina 760 API finanziarie in tempo reale a 295 query eseguibili per valutare gli agenti LLM su compiti finanziari reali — rivelando che il tasso di invocazione conservativo del 22,7% di GPT-4o produce una qualità delle risposte superiore (CSS 0,670) rispetto al TIR aggressivo dell'87,1% di Qwen3-8B, mentre la mancata corrispondenza dell'intento supera il 50% in ogni modello testato.

BloombergGPT e i Limiti dei LLM Specifici di Dominio nella Finanza

Bloomberg ha addestrato un LLM da 50 miliardi di parametri su 569 miliardi di token di dati finanziari, superando i modelli generici nei benchmark di sentiment analysis e ragionamento su tabelle, finché GPT-4 non lo ha eguagliato senza alcun pre-addestramento specifico per la finanza. Cosa rivela l'esperimento da 10 milioni di dollari sui compromessi del pre-addestramento di dominio, la tokenizzazione dei numeri e perché l'uso di strumenti è più affidabile degli interni del modello per gli agenti contabili.