#fintech
Fintech
Financial technology research, platforms, and infrastructure for modern accounting systems
FinMCP-Bench: Valutazione di Agenti LLM per l'Uso di Strumenti Finanziari Reali tramite MCP
FinMCP-Bench valuta sei modelli LLM su 613 compiti reali di utilizzo di strumenti finanziari, supportati da 65 server MCP. Il modello migliore ottiene un 3,08% di corrispondenza esatta nei compiti multi-turn, rivelando un crollo prestazionale di 20 volte passando da compiti a singolo strumento a scenari multi-turn.
FinTrace: Valutazione a Livello di Traiettoria della Chiamata a Strumenti LLM per Compiti Finanziari
FinTrace valuta 13 LLM su 800 traiettorie di compiti finanziari annotate da esperti, attraverso 9 metriche, scoprendo che i modelli all'avanguardia ottengono una forte selezione degli strumenti (F1 ~0.9) ma solo 3,23/5 nell'utilizzo delle informazioni — il passaggio in cui gli agenti ragionano su ciò che gli strumenti restituiscono.
FinToolBench: Valutazione degli agenti LLM sull'uso di strumenti finanziari in scenari reali
FinToolBench combina 760 strumenti finanziari API attivi con 295 query eseguibili per testare gli agenti LLM su compiti finanziari reali — rivelando che la frequenza di chiamata conservativa di GPT-4o del 22,7% garantisce una qualità delle risposte superiore (CSS 0,670) rispetto al TIR aggressivo di Qwen3-8B all'87,1%, mentre il disallineamento delle intenzioni supera il 50% in tutti i modelli testati.
BloombergGPT e i Limiti dei LLM Specifici di Dominio nella Finanza
Bloomberg ha addestrato un LLM da 50 miliardi di parametri su 569 miliardi di token di dati finanziari, superando i modelli generici nei benchmark di sentiment analysis e ragionamento su tabelle, finché GPT-4 non lo ha eguagliato senza alcun pre-addestramento specifico per la finanza. Cosa rivela l'esperimento da 10 milioni di dollari sui compromessi del pre-addestramento di dominio, la tokenizzazione dei numeri e perché l'uso di strumenti è più affidabile degli interni del modello per gli agenti contabili.