
FinRAGBench-V: RAG multimodal con citas visuales en el dominio financiero
FinRAGBench-V halla que los mejores modelos solo logran un recall de citas a nivel de bloque del 20–61% en páginas financieras. La recuperación multimodal supera al texto.
#machine-learning
Técnicas de aprendizaje automático para análisis y automatización de datos financieros

FinRAGBench-V halla que los mejores modelos solo logran un recall de citas a nivel de bloque del 20–61% en páginas financieras. La recuperación multimodal supera al texto.

WildToolBench halla que ningún LLM supera el 15% de precisión por sesión en 1.024 tareas reales, con intención oculta y cambios de instrucción como peores fallos.

La confianza verbalizada de GPT-4 solo alcanza ~62,7% de AUROC, apenas por encima del azar. Los agentes financieros necesitan mejor calibración.

JSONSchemaBench halla que la cobertura cae del 86% en esquemas simples al 3% en complejos, así que la salida estructurada LLM puede emitir JSON no conforme.

FinMCP-Bench puntúa al mejor de seis LLM en solo 3,08% de coincidencia exacta en 613 tareas financieras MCP reales, un colapso de 20× de una sola herramienta a uso multiturno.

FinTrace muestra que los LLM frontera eligen las herramientas financieras correctas (F1 ~0,9) pero solo logran 3,23/5 al usar los resultados, el paso que rompe a los agentes.

FinToolBench halla un desajuste de intención superior al 50% en todos los LLM probados, así que llamar más herramientas no mejora las respuestas financieras.

OmniEval puntúa los mejores sistemas RAG con 36% de precisión numérica en 5 tipos de tareas financieras, así que los agentes de libro mayor necesitan validación.

La taxonomía de NAACL 2025 se mantiene, pero falta cobertura tabular. Los equipos de IA financiera deben adaptar por su cuenta los métodos de modelos de visión.

Restar el sesgo posicional de los pesos de atención del LLM recupera hasta 15 puntos de precisión RAG cuando la evidencia está a mitad de contexto.

ReDAct difiere de un modelo pequeño a uno grande solo cuando la perplejidad indica incertidumbre, recortando el costo 64% con igual precisión en flujos de trabajo de agentes.

El agente CodeAct de OpenHands logra 26% en SWE-Bench Lite, mostrando lo que los agentes de IA hacen hoy. La automatización financiera debe empezar acotada.