Salta al contingut principal

#fintech

Fintech

Financial technology research, platforms, and infrastructure for modern accounting systems

FinToolBench: Avaluació d'agents LLM en l'ús d'eines financeres del món real

FinToolBench combina 760 eines financeres API en directe amb 295 consultes executables per avaluar agents LLM en tasques financeres reals — revelant que la taxa d'invocació conservadora del 22,7% de GPT-4o produeix una qualitat de resposta més alta (CSS 0,670) que la TIR agressiva del 87,1% de Qwen3-8B, mentre que el desajust d'intenció supera el 50% en tots els models provats.

BloombergGPT i els límits dels LLM de domini específic en finances

Bloomberg va entrenar un LLM de 50.000 milions de paràmetres amb 569.000 milions de tokens de dades financeres i va superar els models generals en proves de referència de sentiment i raonament de taules; després, GPT-4 el va igualar sense cap preentrenament específic en finances. El que revela l'experiment de 10 milions de dòlars sobre els compromisos del preentrenament de domini, la tokenització de números i per què l'ús d'eines és més fiable que les funcions internes del model per als agents comptables.