Salta al contenuto principale

#technology

Technology

Technology research and software engineering topics relevant to financial AI systems

Persi nel Mezzo: Bias Posizionale negli LLM e il Suo Impatto sull'AI Finanziaria

L'articolo di Liu et al. (TACL 2024) mostra che gli LLM ottengono fino a 20 punti in meno sulle informazioni sepolte nel mezzo di contesti lunghi — un degrado a forma di U che colpisce ogni modello testato, incluso Claude-1.3-100K — con implicazioni concrete su come i pipeline RAG dovrebbero ordinare i passaggi recuperati nelle applicazioni finanziarie e contabili.

OSWorld: Agenti AI Desktop riescono nel 12% dei compiti dove gli umani riescono nel 72%

OSWorld (NeurIPS 2024) valuta gli agenti AI multimodali su 369 compiti desktop reali in Ubuntu, Windows e macOS — rilevando un divario di 60 punti percentuali tra il miglior modello (12,24%) e la performance umana (72,36%), con il 75% degli insuccessi attribuiti a errori di ancoraggio visuomotorio piuttosto che a fallimenti di ragionamento.

StructRAG (ICLR 2025): Scegliere la Struttura Documentale Giusta Supera GraphRAG di 28 Punti

StructRAG (ICLR 2025) instrada ogni query al tipo di struttura più adatto al compito — tabella, grafo, catalogo, algoritmo o blocco di testo — prima di ragionare, ottenendo un punteggio di 28 punti superiore a GraphRAG sul benchmark Loong, eseguendo 22× più velocemente, con il solo router addestrato con DPO che contribuisce a un guadagno di accuratezza di 15 punti.

Self-RAG: Recupero Adattivo e Autocritica per LLM

Self-RAG (ICLR 2024 Oral) addestra un modello linguistico a decidere quando recuperare informazioni e poi a valutare i propri risultati utilizzando quattro token di riflessione — raggiungendo il 55,8% su PopQA e 80,2 FactScore sulle biografie, superando ChatGPT su cinque benchmark. L'analisi copre il meccanismo, i risultati delle ablazioni, i limiti di riproducibilità e le implicazioni per agenti di intelligenza artificiale finanziaria su registri Beancount.

AgentBench: valutare gli LLM come agenti — lezioni per l'affidabilità dell'AI finanziaria

AgentBench (Liu et al., ICLR 2024) confronta 27 LLM in 8 ambienti interattivi — GPT-4 ha ottenuto 4,01 complessivo contro 0,96 per il miglior modello open-source. Le tre modalità di errore dominanti (limite di attività superato nel 67,9% degli errori del grafo di conoscenza, errori di formato nel 53,3% degli errori del database e azioni non valide) si traducono direttamente nei rischi di implementare un agente di scrittura-beancount su un registro reale.