
FinRAGBench-V: RAG multimodal con citas visuales en el dominio financiero
FinRAGBench-V halla que los mejores modelos solo logran un recall de citas a nivel de bloque del 20–61% en páginas financieras. La recuperación multimodal supera al texto.
#finance
Investigación financiera, análisis y conocimiento del dominio para IA contable

FinRAGBench-V halla que los mejores modelos solo logran un recall de citas a nivel de bloque del 20–61% en páginas financieras. La recuperación multimodal supera al texto.

La confianza verbalizada de GPT-4 solo alcanza ~62,7% de AUROC, apenas por encima del azar. Los agentes financieros necesitan mejor calibración.

FinTrace muestra que los LLM frontera eligen las herramientas financieras correctas (F1 ~0,9) pero solo logran 3,23/5 al usar los resultados, el paso que rompe a los agentes.

OmniEval puntúa los mejores sistemas RAG con 36% de precisión numérica en 5 tipos de tareas financieras, así que los agentes de libro mayor necesitan validación.

Las 5.703 consultas reales de analistas de FinDER muestran que el mejor RAG solo recupera el 25,95% de la evidencia 10-K. Normalice las abreviaturas primero.

Los LLM puntúan hasta 20 puntos peor cuando la respuesta está en medio del contexto, así que RAG financiero debe poner los mejores pasajes primero o al final.

AnoLLM supera a las líneas base clásicas en datos de fraude de tipos mixtos al puntuar filas con log-verosimilitud negativa del LLM.

DocFinQA cambia los pasajes de 700 palabras de FinQA por presentaciones completas de la SEC, contexto 175× mayor que casi reduce a la mitad la precisión de GPT-4.

TheAgentCompany evalúa 175 tareas empresariales en una intranet simulada, y el mejor modelo, Gemini-2.5-Pro, completa solo 30% a $4 cada una.

InvestorBench: Qwen2.5-72B lidera el trading de acciones con un 46,15% de CR; Palmyra-Fin ajustada a finanzas falla en renta variable: el tamaño supera al ajuste de dominio.

Con presupuestos de tokens de pensamiento iguales, los LLM de agente único igualan o superan a los sistemas multiagente en razonamiento de múltiples saltos—favoreciendo diseños de agentes financieros más simples.

M3MAD-Bench encuentra que la Ilusión Colectiva impulsa el 65% de los fallos del debate multiagente, y el debate adversarial reduce la precisión hasta un 12,8%.