
FinRAGBench-V: RAG multimodal con citas visuales en el dominio financiero
FinRAGBench-V halla que los mejores modelos solo logran un recall de citas a nivel de bloque del 20–61% en páginas financieras. La recuperación multimodal supera al texto.
#data-science
Métodos de ciencia de datos aplicados a conjuntos de datos financieros y flujos contables

FinRAGBench-V halla que los mejores modelos solo logran un recall de citas a nivel de bloque del 20–61% en páginas financieras. La recuperación multimodal supera al texto.

WildToolBench halla que ningún LLM supera el 15% de precisión por sesión en 1.024 tareas reales, con intención oculta y cambios de instrucción como peores fallos.

La confianza verbalizada de GPT-4 solo alcanza ~62,7% de AUROC, apenas por encima del azar. Los agentes financieros necesitan mejor calibración.

FinToolBench halla un desajuste de intención superior al 50% en todos los LLM probados, así que llamar más herramientas no mejora las respuestas financieras.

OmniEval puntúa los mejores sistemas RAG con 36% de precisión numérica en 5 tipos de tareas financieras, así que los agentes de libro mayor necesitan validación.

La taxonomía de NAACL 2025 se mantiene, pero falta cobertura tabular. Los equipos de IA financiera deben adaptar por su cuenta los métodos de modelos de visión.

Restar el sesgo posicional de los pesos de atención del LLM recupera hasta 15 puntos de precisión RAG cuando la evidencia está a mitad de contexto.

Fin-RATE muestra que la precisión de los LLM cae al 18,60% en seguimiento longitudinal, con el pipeline de recuperación, no el modelo, como cuello de botella limitante.

Las 5.703 consultas reales de analistas de FinDER muestran que el mejor RAG solo recupera el 25,95% de la evidencia 10-K. Normalice las abreviaturas primero.

Los LLM puntúan hasta 20 puntos peor cuando la respuesta está en medio del contexto, así que RAG financiero debe poner los mejores pasajes primero o al final.

AD-LLM halla que GPT-4o alcanza 0.93–0.99 AUROC zero-shot en detección de anomalías de texto, pero la selección de modelo LLM sigue siendo poco fiable.

CausalTAD reordena las columnas de la tabla por dependencia causal antes de la serialización al LLM, elevando el AUC-ROC promedio de 0.803 a 0.834 sobre AnoLLM.