Saltar al contenido principal

Mike Thrift

Gerente de marketing

Fusion-in-Decoder: Cómo la recuperación de múltiples pasajes mejora el QA generativo

La arquitectura FiD de Izacard y Grave codifica de forma independiente los pasajes recuperados y luego los fusiona en el decodificador, superando a RAG-Sequence por 4–11 puntos en NQ y TriviaQA. Este post examina el diseño y sus implicaciones para el QA de libros mayores de Beancount, donde la síntesis de múltiples entradas a través de transacciones es la norma.

GuardAgent: Cumplimiento de seguridad determinista para agentes de LLM mediante ejecución de código

GuardAgent (ICML 2025) sitúa un agente de LLM independiente entre un agente objetivo y su entorno, verificando cada acción propuesta mediante la generación y ejecución de código Python; logra una precisión del 98.7% en la aplicación de políticas y mantiene el 100% de la finalización de tareas, en comparación con el 81% de precisión y el 29-71% de fallos en tareas de las reglas de seguridad integradas en el prompt.

Debate de LLM multiagente: Ganancias reales de precisión, cómputo no controlado y delusión colectiva

Una lectura detallada del artículo sobre debate multiagente de Du et al. en ICML 2024 —que informa ganancias de precisión de 14.8 puntos en aritmética— junto con refutaciones de 2025 que muestran que los agentes individuales con el mismo presupuesto igualan el rendimiento del debate, y un análisis de por qué la delusión colectiva (65% de los fallos del debate) plantea riesgos específicos para los registros asistidos por IA.

Los LLM no son útiles para el pronóstico de series temporales: lo que NeurIPS 2024 significa para la IA financiera

Un artículo Spotlight de NeurIPS 2024 analiza tres métodos de pronóstico de series temporales basados en LLM (OneFitsAll, Time-LLM y CALF) y descubre que eliminar el modelo de lenguaje mejora la precisión en la mayoría de los casos, con una aceleración del entrenamiento de hasta 1,383 veces. Para aplicaciones de IA financiera como la predicción de saldos en Beancount, los modelos ligeros diseñados específicamente superan consistentemente a los LLM reutilizados.

AuditCopilot: LLMs para la detección de fraude en contabilidad de partida doble

AuditCopilot aplica LLMs de código abierto (Mistral-8B, Gemma, Llama-3.1) a la detección de fraude en asientos de diario corporativos, reduciendo los falsos positivos de 942 a 12; sin embargo, la ablación revela que el LLM funciona principalmente como una capa de síntesis sobre las puntuaciones de Isolation Forest, no como un detector de anomalías independiente.

Ajuste fino (Fine-Tuning) vs. RAG: Por qué la recuperación gana al inyectar nuevo conocimiento en LLMs

La comparación empírica de RAG frente al ajuste fino no supervisado en LLMs de 7 mil millones de parámetros muestra que RAG alcanza una precisión de más de 0,875 en hechos posteriores al corte de conocimiento, mientras que el ajuste fino se estanca en 0,504, con implicaciones directas para el diseño de agentes de Beancount y cualquier sistema que requiera actualizaciones frecuentes de conocimiento.

FLARE: Generación Aumentada por Recuperación Activa

FLARE (EMNLP 2023) mejora el RAG estándar al activar la recuperación a mitad de la generación mediante umbrales de confianza de probabilidad de tokens, alcanzando un 51.0 EM en 2WikiMultihopQA frente al 39.4 de la recuperación única; sin embargo, los fallos de calibración en los modelos de chat ajustados por instrucciones limitan su fiabilidad para agentes financieros de producción.

MultiHiertt: Evaluación del razonamiento numérico en tablas financieras multi-jerárquicas

MultiHiertt (ACL 2022) presenta 10,440 pares de preguntas y respuestas de informes financieros reales con un promedio de 3.89 tablas jerárquicas cada uno; los modelos de vanguardia obtienen un F1 del 38% frente al 87% de los humanos, con una penalización de 15 puntos para las preguntas entre tablas, cuantificando la brecha de recuperación que la IA financiera debe cerrar.