Saltar al contenido principal

#technology

Technology

Technology research and software engineering topics relevant to financial AI systems

Perdidos en el medio: El sesgo de posición en los LLM y su impacto en la IA financiera

El artículo de TACL 2024 de Liu et al. muestra que los LLM rinden hasta 20 puntos peor con información enterrada en el medio de contextos largos —una degradación en forma de U que afecta a todos los modelos probados, incluido Claude-1.3-100K— con implicaciones concretas sobre cómo los pipelines de RAG deben ordenar los pasajes recuperados en aplicaciones de finanzas y contabilidad.

StructRAG (ICLR 2025): Elegir la estructura de documento correcta supera a GraphRAG por 28 puntos

StructRAG (ICLR 2025) enruta cada consulta a un tipo de estructura adecuada para la tarea (tabla, grafo, catálogo, algoritmo o fragmento) antes del razonamiento, logrando 28 puntos más que GraphRAG en el benchmark Loong y funcionando 22 veces más rápido, siendo el enrutador entrenado con DPO responsable por sí solo de una ganancia de 15 puntos en precisión.

Self-RAG: Recuperación Adaptativa y Autocrítica para LLMs

Self-RAG (ICLR 2024 Oral) entrena un modelo de lenguaje para decidir cuándo recuperar información y luego calificar sus propios resultados utilizando cuatro tokens de reflexión, alcanzando un 55.8% en PopQA y un 80.2 de FactScore en biografías, superando a ChatGPT en cinco pruebas de rendimiento. El análisis cubre el mecanismo, los resultados de ablación, los límites de reproducibilidad y las implicaciones para los agentes de IA financiera sobre libros mayores de Beancount.

AgentBench: Evaluación de LLMs como Agentes — Lecciones para la Fiabilidad de la IA Financiera

AgentBench (Liu et al., ICLR 2024) evalúa 27 LLMs en 8 entornos interactivos — GPT-4 obtuvo 4.01 en general frente a 0.96 del mejor modelo de código abierto. Los tres modos de fallo dominantes (límite de tarea excedido en el 67.9% de los fallos del grafo de conocimiento, errores de formato en el 53.3% de los fallos de base de datos y acciones inválidas) se mapean directamente a los riesgos de implementar un agente de escritura en Beancount en un libro real.