Salta al contenuto principale

#fintech

Fintech

Financial technology research, platforms, and infrastructure for modern accounting systems

FinMCP-Bench: Valutazione di Agenti LLM per l'Uso di Strumenti Finanziari Reali tramite MCP
·mike

FinMCP-Bench: Valutazione di Agenti LLM per l'Uso di Strumenti Finanziari Reali tramite MCP

FinMCP-Bench valuta sei modelli LLM su 613 compiti reali di utilizzo di strumenti finanziari, supportati da 65 server MCP. Il modello migliore ottiene un 3,08% di corrispondenza esatta nei compiti multi-turn, rivelando un crollo prestazionale di 20 volte passando da compiti a singolo strumento a scenari multi-turn.

ai
llm
automation
FinTrace: Valutazione a Livello di Traiettoria della Chiamata a Strumenti LLM per Compiti Finanziari
·mike

FinTrace: Valutazione a Livello di Traiettoria della Chiamata a Strumenti LLM per Compiti Finanziari

FinTrace valuta 13 LLM su 800 traiettorie di compiti finanziari annotate da esperti, attraverso 9 metriche, scoprendo che i modelli all'avanguardia ottengono una forte selezione degli strumenti (F1 ~0.9) ma solo 3,23/5 nell'utilizzo delle informazioni — il passaggio in cui gli agenti ragionano su ciò che gli strumenti restituiscono.

llm
ai
finance
FinToolBench: Valutazione degli agenti LLM sull'uso di strumenti finanziari in scenari reali
·mike

FinToolBench: Valutazione degli agenti LLM sull'uso di strumenti finanziari in scenari reali

FinToolBench combina 760 strumenti finanziari API attivi con 295 query eseguibili per testare gli agenti LLM su compiti finanziari reali — rivelando che la frequenza di chiamata conservativa di GPT-4o del 22,7% garantisce una qualità delle risposte superiore (CSS 0,670) rispetto al TIR aggressivo di Qwen3-8B all'87,1%, mentre il disallineamento delle intenzioni supera il 50% in tutti i modelli testati.

ai
llm
automation
BloombergGPT e i Limiti dei LLM Specifici di Dominio nella Finanza
·mike

BloombergGPT e i Limiti dei LLM Specifici di Dominio nella Finanza

Bloomberg ha addestrato un LLM da 50 miliardi di parametri su 569 miliardi di token di dati finanziari, superando i modelli generici nei benchmark di sentiment analysis e ragionamento su tabelle, finché GPT-4 non lo ha eguagliato senza alcun pre-addestramento specifico per la finanza. Cosa rivela l'esperimento da 10 milioni di dollari sui compromessi del pre-addestramento di dominio, la tokenizzazione dei numeri e perché l'uso di strumenti è più affidabile degli interni del modello per gli agenti contabili.

llm
ai
machine-learning