
DIN-SQL: GPT-4 salta de 67,4% a 85,3% EX en Spider
DIN-SQL eleva GPT-4 de 67,4% a 85,3% d'exactitud d'execució Spider mitjançant etapes d'enllaç d'esquema i auto-correcció—la mateixa descomposició s'aplica a Beancount BQL.

DIN-SQL eleva GPT-4 de 67,4% a 85,3% d'exactitud d'execució Spider mitjançant etapes d'enllaç d'esquema i auto-correcció—la mateixa descomposició s'aplica a Beancount BQL.

A BIRD, GPT-4 arriba al 54,89% de precisió d'execució amb pistes de domini i al 34,88% sense—una diferència de 20 punts que qualsevol interfície NL→BQL de Beancount ha de tancar.

Investigadors de la CMU i de la NC State proposen l'ús de l'Anàlisi de Processos Teòric del Sistema (STPA) i un Model Context Protocol millorat amb capacitats per derivar especificacions de seguretat formals per a l'ús d'eines d'agents de LLM, amb una verificació basada en Alloy que demostra l'absència de fluxos insegurs en un estudi de cas de programació de calendaris.

El GraphRAG de Microsoft publica guanys de comprensió del 72–83% sobre el RAG vectorial; una auditoria del 2025 els esfondra després de corregir el biaix del jutge—advertència per a la QA de llibres multi-doc.

FinAuditing posa a prova 13 LLM en format zero-shot sobre 1.102 instàncies reals de presentacions SEC XBRL; les puntuacions més altes són del 13,86% en verificació matemàtica financera i del 12,42% en recuperació de conceptes — resultats que limiten directament el que es pot confiar a les eines de comptabilitat d'IA sense eines externes.

InvestorBench: Qwen2.5-72B lidera la negociació d'accions amb un 46,15% de CR; la Palmyra-Fin ajustada a finances falla en rendes variables—la mida supera l'ajust finetuning al domini.

StructRAG (ICLR 2025) encamina cada consulta a un tipus d'estructura adequat per a la tasca —taula, graf, catàleg, algoritme o fragment— abans del raonament, obtenint 28 punts més que GraphRAG al benchmark Loong mentre s'executa 22 vegades més ràpid, amb l'encaminador entrenat amb DPO representant per si sol un guany de 15 punts en precisió.

Amb pressupostos iguals de tokens de reflexió, els LLM d'agent únic igualen o superen els sistemes multi-agent en raonament multi-salt—afavoriu dissenys d'agents financers més simples.

M3MAD-Bench posa a prova el debat multiagent en 9 models, 5 dominis i entorns de llenguatge visual, i descobreix que el deliri col·lectiu causa el 65% dels errors, el debat adversari redueix la precisió fins a un 12,8% i l'autoconsistència sol igualar la precisió del debat amb un cost de tòquens inferior.

AGrail (ACL 2025) introdueix un guardrail cooperatiu de dos LLM que adapta les comprovacions de seguretat en temps d'inferència mitjançant l'adaptació en temps de prova, aconseguint un 0% d'èxit en atacs d'injecció de prompts i un 95,6% de preservació d'accions benignes a Safe-OS — en comparació amb GuardAgent i LLaMA-Guard que bloquegen fins al 49,2% de les accions legítimes.

ShieldAgent (ICML 2025) substitueix les barreres de seguretat basades en LLM per circuits de regles probabilístics construïts sobre xarxes lògiques de Markov, aconseguint una precisió del 90,4% en atacs contra agents amb un 64,7% menys de crides a l'API — i què significa això per a la seguretat verificable en sistemes d'IA financera.

Atlas (JMLR 2023) aconsegueix una precisió del 42,4% en Natural Questions amb només 64 exemples d'entrenament, superant PaLM 540B per 3 punts utilitzant 11 mil milions de paràmetres, mitjançant el pre-entrenament conjunt d'un recuperador dens basat en Contriever amb un lector T5 Fusion-in-Decoder. L'anàlisi cobreix els límits de la precisió de recuperació, els costos d'infraestructura d'índex de 587 GB i les implicacions per als sistemes de preguntes i respostes de llibres majors de Beancount.