Saltar al contenido principal

Mike Thrift

Gerente de marketing

TAT-QA: Benchmark de QA Híbrido de Tabla y Texto para el Razonamiento de Informes Financieros Anuales

TAT-QA es un benchmark de 16.552 preguntas sobre contextos de informes financieros híbridos de tabla más texto que demostró que la fundamentación en la evidencia —no la aritmética— es el cuello de botella central en la IA financiera; para 2024, los LLM de 7B ajustados alcanzaron un 83% de F1, cerrando la mayor parte de la brecha frente al techo humano del 91%.

FinQA: El benchmark que mide el razonamiento numérico de la IA en informes financieros

FinQA (EMNLP 2021) construyó 8,281 pares de preguntas y respuestas a partir de informes de ganancias del S&P 500 que requieren programas aritméticos de múltiples pasos. Los modelos neuronales obtuvieron una puntuación del 61% en el momento de su lanzamiento frente al 91% de los expertos humanos; la precisión se desploma al 22% en programas de tres o más pasos. Los modos de falla (constantes de dominio, fundamentación intermodal, longitud de la cadena) se corresponden directamente con los desafíos que enfrentan los agentes de Beancount hoy en día.

FinanceBench: Por qué el RAG de almacenamiento de vectores falla con documentos financieros reales

FinanceBench evalúa 16 configuraciones de IA frente a 10,231 preguntas de presentaciones reales ante la SEC; el RAG de almacenamiento de vectores compartido responde correctamente solo el 19% de las veces, e incluso GPT-4-Turbo con el pasaje del oráculo alcanza solo el 85% de precisión, lo que demuestra que el razonamiento numérico, no la recuperación, es la limitación crítica para la IA financiera empresarial.

LATS: Búsqueda de Árbol de Agentes de Lenguaje: Razonamiento, Actuación y Planificación en un Solo Marco de Trabajo

LATS (Búsqueda de Árbol de Agentes de Lenguaje, ICML 2024) unifica ReAct, Árbol de Pensamientos y Reflexion en un solo marco de MCTS, alcanzando 92.7% de pass@1 en HumanEval con GPT-4. Para libros de contabilidad de Beancount con respaldo git, el requisito de reversión de estado que restringe a LATS en producción se cumple trivialmente.

Self-RAG: Recuperación Adaptativa y Autocrítica para LLMs

Self-RAG (ICLR 2024 Oral) entrena un modelo de lenguaje para decidir cuándo recuperar información y luego calificar sus propios resultados utilizando cuatro tokens de reflexión, alcanzando un 55.8% en PopQA y un 80.2 de FactScore en biografías, superando a ChatGPT en cinco pruebas de rendimiento. El análisis cubre el mecanismo, los resultados de ablación, los límites de reproducibilidad y las implicaciones para los agentes de IA financiera sobre libros mayores de Beancount.

AgentBench: Evaluación de LLMs como Agentes — Lecciones para la Fiabilidad de la IA Financiera

AgentBench (Liu et al., ICLR 2024) evalúa 27 LLMs en 8 entornos interactivos — GPT-4 obtuvo 4.01 en general frente a 0.96 del mejor modelo de código abierto. Los tres modos de fallo dominantes (límite de tarea excedido en el 67.9% de los fallos del grafo de conocimiento, errores de formato en el 53.3% de los fallos de base de datos y acciones inválidas) se mapean directamente a los riesgos de implementar un agente de escritura en Beancount en un libro real.

BloombergGPT y los límites de los LLM especializados en finanzas

Bloomberg entrenó un LLM de 50 mil millones de parámetros con 569 mil millones de tokens de datos financieros y superó a los modelos generales en evaluaciones de sentimiento y razonamiento sobre tablas; luego, GPT-4 lo igualó sin ningún preentrenamiento específico en finanzas. Lo que el experimento de 10 millones de dólares revela sobre los compromisos del preentrenamiento de dominio, la tokenización de números y por qué el uso de herramientas es más confiable que los componentes internos del modelo para los agentes contables.

AutoGen: Marcos de Conversación Multi-Agente para IA en Finanzas

AutoGen (Wu et al., 2023) introduce un marco de conversación multi-agente donde los agentes respaldados por LLM intercambian mensajes para completar tareas; una configuración de dos agentes eleva la precisión de la referencia MATH del 55% al 69%, y un agente SafeGuard dedicado mejora la detección de código no seguro hasta en 35 puntos F1 — hallazgos directamente aplicables a la creación de flujos de automatización de Beancount seguros y modulares.

Gorilla: Cómo el entrenamiento consciente de la recuperación reduce las alucinaciones de las API en los LLM del 78% al 11%

Gorilla (Patil et al., NeurIPS 2024) realiza un ajuste fino de un modelo LLaMA de 7B con Entrenamiento Consciente del Recuperador (RAT) sobre documentación de API recuperada, reduciendo las tasas de alucinación del 78% al 11% frente a GPT-4 zero-shot — con implicaciones directas para agentes de escritura de IA financiera donde los nombres de cuenta incorrectos o los signos invertidos son fallos de integridad, no simples molestias.