Bean Labs Research Log

AILLMMachine LearningFinancial ReportingFinancial StatementsData ScienceAnalytics

FinanceBench: Per què el RAG de magatzem de vectors falla en documents financers reals

FinanceBench avalua 16 configuracions d'IA amb 10.231 preguntes de documents reals de la SEC; el RAG de magatzem de vectors compartit respon correctament només el 19% de les vegades, i fins i tot GPT-4-Turbo amb el fragment d'oracle arriba només al 85% de precisió, cosa que demostra que el raonament numèric, i no la recuperació, és el factor limitant per a la IA en les finances empresarials.

AILLMMachine LearningAutomationFinanceBeancount

DSPy: Reemplaçant l'enginyeria de prompts fràgil amb pipelines d'LLM compilats

DSPy substitueix les cadenes de prompts fetes a mà per signatures declaratives i un compilador basat en mètriques, augmentant Llama2-13b del 9,4% al 46,9% en el raonament matemàtic GSM8K i oferint un camí més mantenible per a pipelines d'IA de finances en producció.

AILLMMachine LearningAutomationBeancountPlain-Text AccountingDecision-making

LATS: Language Agent Tree Search — Raonament, acció i planificació en un sol framework

LATS (Language Agent Tree Search, ICML 2024) unifica ReAct, Tree of Thoughts i Reflexion en un únic framework MCTS, aconseguint un 92,7% de pass@1 a HumanEval amb GPT-4. Per als llibres de comptabilitat Beancount basats en git, el requisit de reversió d'estat que limita LATS en entorns de producció es satisfà trivialment.

AIMachine LearningLLMTechnologyFinanceBeancountPlain-Text Accounting

Self-RAG: Recuperació Adaptativa i Autocrítica per a LLMs

Self-RAG (ICLR 2024 Oral) entrena un model de llenguatge per decidir quan recuperar informació i després avaluar els seus propis resultats mitjançant quatre tokens de reflexió, assolint un 55,8% a PopQA i un 80,2 de FactScore en biografies, superant ChatGPT en cinc bancs de proves. L'anàlisi cobreix el mecanisme, els resultats d'ablació, els límits de reproductibilitat i les implicacions per als agents d'IA financera sobre llibres majors de Beancount.

AILLMMachine LearningAutomationBeancountPlain-Text AccountingReconciliation

Voyager: Les biblioteques de competències com a base per a l'aprenentatge permanent d'agents d'IA

Voyager, un agent de Minecraft basat en GPT-4 de NVIDIA i Caltech, demostra que una biblioteca de competències de codi persistent permet un aprenentatge permanent genuí sense ajustos fins, descobrint 3,3 vegades més ítems que l'estat de l'art anterior. El patró s'aplica directament a l'automatització del llibre major de Beancount a llarg termini, tot i que la correcció financera exigeix capes de proves que els entorns de sandbox de jocs mai requereixen.

LLMAIMachine LearningBeancountPlain-Text AccountingFinanceAutomation

HippoRAG: memòria a llarg termini per a LLM d'inspiració neurobiològica

HippoRAG (NeurIPS 2024) construeix un graf de coneixement a partir de triples OpenIE i aplica el PageRank personalitzat en el moment de la consulta, assolint un Recall@5 del 89,1% a 2WikiMultiHopQA en comparació amb el 68,2% de ColBERTv2, amb implicacions directes per a la consulta de llibres comptables financers complexos a través d'historials de transaccions plurianuals.

AILLMMachine LearningAutomationBeancountPlain-Text AccountingTechnology

AgentBench: Avaluant els LLM com a agents — Lliçons per a la fiabilitat de la IA en finances

AgentBench (Liu et al., ICLR 2024) avalua 27 LLM en 8 entorns interactius — GPT-4 va obtenir una puntuació de 4,01 en total enfront de 0,96 del millor model de codi obert. Els tres modes de fallada dominants (límit de tasques excedit en el 67,9% de les fallades del graf de coneixement, errors de format en el 53,3% de les fallades de la base de dades i accions no vàlides) es relacionen directament amb els riscos d'implementar un agent d'escriptura de Beancount en un llibre major real.

LLMAIMachine LearningFinanceFintechBeancountPlain-Text Accounting

BloombergGPT i els límits dels LLM de domini específic en finances

Bloomberg va entrenar un LLM de 50.000 milions de paràmetres amb 569.000 milions de tokens de dades financeres i va superar els models generals en proves de referència de sentiment i raonament de taules; després, GPT-4 el va igualar sense cap preentrenament específic en finances. El que revela l'experiment de 10 milions de dòlars sobre els compromisos del preentrenament de domini, la tokenització de números i per què l'ús d'eines és més fiable que les funcions internes del model per als agents comptables.

AILLMAutomationBeancountFinanceReconciliationMulti-Agent

AutoGen: Marcs de conversació multiagent per a la IA financera

AutoGen (Wu et al., 2023) presenta un marc de conversació multiagent on els agents basats en LLM s'intercanvien missatges per completar tasques; una configuració de dos agents augmenta la precisió de la referència MATH del 55% al 69%, i un agent SafeGuard dedicat millora la detecció de codi insegur fins a 35 punts F1 — troballes directament aplicables a la construcció de fluxos d'automatització de Beancount segurs i modulars.

FinQA: El referent per mesurar el raonament numèric de la IA en informes financers

Latest articles

FinanceBench: Per què el RAG de magatzem de vectors falla en documents financers reals

DSPy: Reemplaçant l'enginyeria de prompts fràgil amb pipelines d'LLM compilats

LATS: Language Agent Tree Search — Raonament, acció i planificació en un sol framework

Self-RAG: Recuperació Adaptativa i Autocrítica per a LLMs

Voyager: Les biblioteques de competències com a base per a l'aprenentatge permanent d'agents d'IA

HippoRAG: memòria a llarg termini per a LLM d'inspiració neurobiològica

AgentBench: Avaluant els LLM com a agents — Lliçons per a la fiabilitat de la IA en finances

BloombergGPT i els límits dels LLM de domini específic en finances

AutoGen: Marcs de conversació multiagent per a la IA financera

Comença amb Beancount.io

Primers passos

Funcions

Comunitat

Legal