
DIN-SQL: GPT-4 salta del 67,4%→85,3% EX en Spider
DIN-SQL eleva la precisión de ejecución de GPT-4 del 67,4% al 85,3% en Spider mediante etapas de enlace de esquema y autocorrección—la misma descomposición se ajusta a BQL de Beancount.

DIN-SQL eleva la precisión de ejecución de GPT-4 del 67,4% al 85,3% en Spider mediante etapas de enlace de esquema y autocorrección—la misma descomposición se ajusta a BQL de Beancount.

En BIRD, GPT-4 alcanza un 54.89% de exactitud de ejecución con pistas de dominio y un 34.88% sin ellas—una brecha de 20 puntos que cualquier interfaz NL→BQL de Beancount debe cerrar.

Investigadores de CMU y NC State proponen el uso del Análisis de Procesos Sistémico-Teóricos (STPA) y un Protocolo de Contexto de Modelo mejorado con capacidades para derivar especificaciones de seguridad formales para el uso de herramientas por parte de agentes de LLM, con una verificación basada en Alloy que demuestra la ausencia de flujos inseguros en un caso de estudio de programación de calendarios.

GraphRAG de Microsoft publica ventajas de comprensión del 72 al 83% frente a RAG vectorial; una auditoría de 2025 las colapsa tras corregir el sesgo del juez—precaución para QA de libros mayores multidocumento.

FinAuditing evalúa 13 LLM en modo zero-shot sobre 1,102 instancias reales de presentaciones SEC XBRL; las puntuaciones máximas son del 13.86% en verificación matemática financiera y del 12.42% en recuperación de conceptos, resultados que limitan directamente qué herramientas de contabilidad con IA pueden automatizarse de forma fiable sin herramientas externas.

InvestorBench: Qwen2.5-72B lidera el trading de acciones con un 46,15% de CR; Palmyra-Fin ajustada a finanzas falla en renta variable: el tamaño supera al ajuste de dominio.

StructRAG (ICLR 2025) enruta cada consulta a un tipo de estructura adecuada para la tarea (tabla, grafo, catálogo, algoritmo o fragmento) antes del razonamiento, logrando 28 puntos más que GraphRAG en el benchmark Loong y funcionando 22 veces más rápido, siendo el enrutador entrenado con DPO responsable por sí solo de una ganancia de 15 puntos en precisión.

Con presupuestos de tokens de pensamiento iguales, los LLM de agente único igualan o superan a los sistemas multiagente en razonamiento de múltiples saltos—favoreciendo diseños de agentes financieros más simples.

M3MAD-Bench pone a prueba el debate multi-agente en 9 modelos, 5 dominios y entornos de visión-lenguaje, encontrando que el delirio colectivo causa el 65% de los fallos, el debate adversarial reduce la precisión hasta en un 12,8% y la autoconsistencia suele igualar la precisión del debate con un menor coste de tokens.

AGrail (ACL 2025) presenta una pasarela cooperativa de dos LLM que adapta las comprobaciones de seguridad en el momento de la inferencia mediante la adaptación en tiempo de prueba, logrando un 0% de éxito en ataques de inyección de prompts y un 95,6% de preservación de acciones benignas en Safe-OS — en comparación con GuardAgent y LLaMA-Guard que bloquean hasta el 49,2% de las acciones legítimas.

ShieldAgent (ICML 2025) reemplaza las protecciones basadas en LLM con circuitos de reglas probabilísticas construidos sobre Redes Lógicas de Markov, logrando una precisión del 90.4% en ataques a agentes con un 64.7% menos de llamadas a la API — y lo que esto significa para la seguridad verificable en sistemas de IA financiera.

Atlas (JMLR 2023) logra una precisión del 42,4% en Natural Questions con solo 64 ejemplos de entrenamiento —superando a PaLM 540B por 3 puntos usando 11B de parámetros— mediante el preentrenamiento conjunto de un recuperador denso basado en Contriever con un lector T5 Fusion-in-Decoder. El análisis cubre los límites de precisión de recuperación, los costos de infraestructura de un índice de 587GB y las implicaciones para los sistemas de QA de libros contables de Beancount.