Salta al contingut principal

Mike Thrift

Responsable de màrqueting

TAT-QA: un benchmark de QA híbrid de taula i text per al raonament d'informes anuals financers

TAT-QA és un benchmark de 16.552 preguntes sobre contextos híbrids de taula i text d'informes financers que ha demostrat que la fonamentació de l'evidència —i no l'aritmètica— és el coll d'ampolla principal en l'IA financera; el 2024, els LLM de 7B ajustats van assolir un F1 del 83%, tancant la major part de la bretxa respecte al sostre humà del 91%.

FinQA: El referent per mesurar el raonament numèric de la IA en informes financers

FinQA (EMNLP 2021) va crear 8.281 parells de preguntes i respostes d'informes de resultats de l'S&P 500 que requerien programes aritmètics de diversos passos. Els models neuronals van obtenir un 61% de puntuació en el llançament enfront del 91% dels experts humans; la precisió cau al 22% en programes de tres o més passos. Els modes de fallada —constants de domini, vinculació entre modalitats, longitud de la cadena— es relacionen directament amb els reptes que afronten avui els agents de Beancount.

FinanceBench: Per què el RAG de magatzem de vectors falla en documents financers reals

FinanceBench avalua 16 configuracions d'IA amb 10.231 preguntes de documents reals de la SEC; el RAG de magatzem de vectors compartit respon correctament només el 19% de les vegades, i fins i tot GPT-4-Turbo amb el fragment d'oracle arriba només al 85% de precisió, cosa que demostra que el raonament numèric, i no la recuperació, és el factor limitant per a la IA en les finances empresarials.

Self-RAG: Recuperació Adaptativa i Autocrítica per a LLMs

Self-RAG (ICLR 2024 Oral) entrena un model de llenguatge per decidir quan recuperar informació i després avaluar els seus propis resultats mitjançant quatre tokens de reflexió, assolint un 55,8% a PopQA i un 80,2 de FactScore en biografies, superant ChatGPT en cinc bancs de proves. L'anàlisi cobreix el mecanisme, els resultats d'ablació, els límits de reproductibilitat i les implicacions per als agents d'IA financera sobre llibres majors de Beancount.

AgentBench: Avaluació de LLMs com a Agents — Lliçons per a la Fiabilitat de la IA Financera

AgentBench (Liu et al., ICLR 2024) avalua 27 LLMs en 8 entorns interactius — GPT-4 va obtenir 4,01 globalment enfront de 0,96 del millor model de codi obert. Els tres modes de fallada dominants (límit de tasca superat en el 67,9% de les fallades de grafs de coneixement, errors de format en el 53,3% de les fallades de bases de dades, i accions invàlides) es corresponen directament amb els riscos de desplegar un agent d'escriptura Beancount en un llibre major real.

BloombergGPT i els límits dels LLM de domini específic en finances

Bloomberg va entrenar un LLM de 50.000 milions de paràmetres amb 569.000 milions de tokens de dades financeres i va superar els models generals en proves de referència de sentiment i raonament de taules; després, GPT-4 el va igualar sense cap preentrenament específic en finances. El que revela l'experiment de 10 milions de dòlars sobre els compromisos del preentrenament de domini, la tokenització de números i per què l'ús d'eines és més fiable que les funcions internes del model per als agents comptables.

AutoGen: Marcs de conversació multiagent per a la IA financera

AutoGen (Wu et al., 2023) presenta un marc de conversació multiagent on els agents basats en LLM s'intercanvien missatges per completar tasques; una configuració de dos agents augmenta la precisió de la referència MATH del 55% al 69%, i un agent SafeGuard dedicat millora la detecció de codi insegur fins a 35 punts F1 — troballes directament aplicables a la construcció de fluxos d'automatització de Beancount segurs i modulars.

Gorilla: Com l'entrenament conscient de la recuperació (RAT) redueix les al·lucinacions de l'API dels LLM del 78% a l'11%

Gorilla (Patil et al., NeurIPS 2024) ajusta un model LLaMA de 7B amb entrenament conscient del recuperador (RAT) sobre documentació d'API recuperada, reduint les taxes d'al·lucinació del 78% a l'11% en comparació amb GPT-4 zero-shot, amb implicacions directes per als agents d'escriptura d'IA financera on els noms de compte incorrectes o els signes invertits són fallades de correcció, no simples molèsties.