#technology
Technology
Technology research and software engineering topics relevant to financial AI systems
WildToolBench: Perché nessun LLM supera il 15% di accuratezza di sessione nell'uso di strumenti reali
WildToolBench (ICLR 2026) valuta 57 LLM su 1.024 attività derivate dal comportamento reale degli utenti — nessun modello supera il 15% di accuratezza di sessione, con orchestrazione compositiva, intento nascosto e transizioni di istruzione come le tre modalità di fallimento più marcate.
Persi nel Mezzo: Bias Posizionale negli LLM e il Suo Impatto sull'AI Finanziaria
L'articolo di Liu et al. (TACL 2024) mostra che gli LLM ottengono fino a 20 punti in meno sulle informazioni sepolte nel mezzo di contesti lunghi — un degrado a forma di U che colpisce ogni modello testato, incluso Claude-1.3-100K — con implicazioni concrete su come i pipeline RAG dovrebbero ordinare i passaggi recuperati nelle applicazioni finanziarie e contabili.
OSWorld: Agenti AI Desktop riescono nel 12% dei compiti dove gli umani riescono nel 72%
OSWorld (NeurIPS 2024) valuta gli agenti AI multimodali su 369 compiti desktop reali in Ubuntu, Windows e macOS — rilevando un divario di 60 punti percentuali tra il miglior modello (12,24%) e la performance umana (72,36%), con il 75% degli insuccessi attribuiti a errori di ancoraggio visuomotorio piuttosto che a fallimenti di ragionamento.
StructRAG (ICLR 2025): Scegliere la Struttura Documentale Giusta Supera GraphRAG di 28 Punti
StructRAG (ICLR 2025) instrada ogni query al tipo di struttura più adatto al compito — tabella, grafo, catalogo, algoritmo o blocco di testo — prima di ragionare, ottenendo un punteggio di 28 punti superiore a GraphRAG sul benchmark Loong, eseguendo 22× più velocemente, con il solo router addestrato con DPO che contribuisce a un guadagno di accuratezza di 15 punti.
LLM ad Agente Singolo Superano i Sistemi Multi-Agente nel Ragionamento Multi-Salto a Parità di Budget di Token di Pensiero
Una preprint di Stanford del 2026 equalizza i budget di token di pensiero in cinque architetture multi-agente e scopre che i LLM ad agente singolo eguagliano o superano i sistemi multi-agente nel ragionamento multi-salto — con fondamento teorico nella Disuguaglianza di Elaborazione dei Dati e implicazioni per la progettazione di agenti AI finanziari.
Self-RAG: Recupero Adattivo e Autocritica per LLM
Self-RAG (ICLR 2024 Oral) addestra un modello linguistico a decidere quando recuperare informazioni e poi a valutare i propri risultati utilizzando quattro token di riflessione — raggiungendo il 55,8% su PopQA e 80,2 FactScore sulle biografie, superando ChatGPT su cinque benchmark. L'analisi copre il meccanismo, i risultati delle ablazioni, i limiti di riproducibilità e le implicazioni per agenti di intelligenza artificiale finanziaria su registri Beancount.
AgentBench:评估作为代理的 LLM —— 对金融 AI 可靠性的启示
AgentBench(Liu 等人,ICLR 2024)在 8 个交互式环境中对 27 个大语言模型进行了基准测试 —— GPT-4 的综合得分为 4.01,而表现最好的开源模型仅为 0.96。三种主要的失败模式(知识图谱失败中 67.9% 为超出任务限制、数据库失败中 53.3% 为格式错误以及无效操作)直接对应了在真实账本上部署 Beancount 回写代理的风险。
MemGPT: Gestione del Contestuale Virtuale per Agenti LLM
MemGPT applica il paging della memoria virtuale in stile OS agli LLM, utilizzando un archivio a tre livelli — memoria di lavoro, richiamo e archivio — per fornire agli agenti un ricordo persistente tra le sessioni; sui benchmark di chat multi-sessione, MemGPT con GPT-4 raggiunge il 92,5% di accuratezza rispetto al 32,1% della baseline a contesto fisso.