
FinRAGBench-V: RAG multimodal con citas visuales en el dominio financiero
FinRAGBench-V halla que los mejores modelos solo logran un recall de citas a nivel de bloque del 20–61% en páginas financieras. La recuperación multimodal supera al texto.
#financial-reporting
Generación y auditoría de informes financieros con modelos de lenguaje

FinRAGBench-V halla que los mejores modelos solo logran un recall de citas a nivel de bloque del 20–61% en páginas financieras. La recuperación multimodal supera al texto.

Fin-RATE muestra que la precisión de los LLM cae al 18,60% en seguimiento longitudinal, con el pipeline de recuperación, no el modelo, como cuello de botella limitante.

Las 5.703 consultas reales de analistas de FinDER muestran que el mejor RAG solo recupera el 25,95% de la evidencia 10-K. Normalice las abreviaturas primero.

DocFinQA cambia los pasajes de 700 palabras de FinQA por presentaciones completas de la SEC, contexto 175× mayor que casi reduce a la mitad la precisión de GPT-4.

FinAuditing muestra que los mejores LLM logran solo 13.86% en verificación matemática financiera de presentaciones XBRL reales de la SEC.

TAT-LLM ajusta LLaMA 2 7B al 64,60% EM en FinQA, superando el 63,91% de GPT-4: un pipeline extraer-razonar-ejecutar permite aritmética de tablas a un modelo pequeño.

MultiHiertt muestra que los modelos logran 38% F1 frente al 87% de los humanos en 10.440 pares de QA financiero, con una caída de 15 puntos en preguntas entre tablas.

El mejor modelo de ConvFinQA obtiene una precisión de ejecución del 68,9% frente al 89,4% de los expertos humanos: una brecha de 21 puntos que el chat de contabilidad multi-turno aún debe superar.

TAT-QA es un benchmark de 16.552 preguntas sobre contextos de informes financieros híbridos de tabla más texto que demostró que la fundamentación en la evidencia —no la aritmética— es el cuello de botella central en la IA financiera; para 2024, los LLM de 7B ajustados alcanzaron un 83% de F1, cerrando la mayor parte de la brecha frente al techo humano del 91%.

FinQA halló que los modelos neuronales lograron 61% en matemáticas de informes financieros frente a 91% de expertos humanos, cayendo a 22% en programas de tres o más pasos.

FinanceBench evalúa 16 configuraciones de IA frente a 10,231 preguntas de presentaciones reales ante la SEC; el RAG de almacenamiento de vectores compartido responde correctamente solo el 19% de las veces, e incluso GPT-4-Turbo con el pasaje del oráculo alcanza solo el 85% de precisión, lo que demuestra que el razonamiento numérico, no la recuperación, es la limitación crítica para la IA financiera empresarial.

PHANTOM (NeurIPS 2025) mide la detección de alucinaciones LLM en informes SEC reales. Qwen3-30B lidera con F1=0.882, pero los modelos de 7B aciertan casi al azar.