Salta al contingut principal

#technology

Technology

Technology research and software engineering topics relevant to financial AI systems

Perduts pel mig: el biaix de posició en els LLM i el seu impacte en la IA financera

L'article de TACL 2024 de Liu et al. mostra que els LLM funcionen fins a 20 punts pitjor amb la informació enterrada al mig de contextos llargs —una degradació en forma de U que afecta tots els models provats, inclòs Claude-1.3-100K— amb implicacions concretes sobre com les canalitzacions RAG haurien d'ordenar els fragments recuperats en aplicacions de finances i comptabilitat.

Self-RAG: Recuperació Adaptativa i Autocrítica per a LLMs

Self-RAG (ICLR 2024 Oral) entrena un model de llenguatge per decidir quan recuperar informació i després avaluar els seus propis resultats mitjançant quatre tokens de reflexió, assolint un 55,8% a PopQA i un 80,2 de FactScore en biografies, superant ChatGPT en cinc bancs de proves. L'anàlisi cobreix el mecanisme, els resultats d'ablació, els límits de reproductibilitat i les implicacions per als agents d'IA financera sobre llibres majors de Beancount.

AgentBench: Avaluació de LLMs com a Agents — Lliçons per a la Fiabilitat de la IA Financera

AgentBench (Liu et al., ICLR 2024) avalua 27 LLMs en 8 entorns interactius — GPT-4 va obtenir 4,01 globalment enfront de 0,96 del millor model de codi obert. Els tres modes de fallada dominants (límit de tasca superat en el 67,9% de les fallades de grafs de coneixement, errors de format en el 53,3% de les fallades de bases de dades, i accions invàlides) es corresponen directament amb els riscos de desplegar un agent d'escriptura Beancount en un llibre major real.