#developers
Developers
Developer resources, APIs, and integration documentation for finance tools
OpenHands: Piattaforma Aperta per Agenti Software AI e le sue Implicazioni per l'Automazione Finanziaria
OpenHands è una piattaforma per agenti con licenza MIT, in ambiente sandbox Docker, dove CodeAct raggiunge il 26% su SWE-Bench Lite — un benchmark che fissa con sobrietà ciò che gli agenti AI possono fare realmente oggi, e spiega perché le prime implementazioni produttive in finanza dovrebbero essere strettamente circoscritte piuttosto che autonome.
ShieldAgent: Ragionamento Verificabile sulla Sicurezza delle Policy per Agenti LLM
ShieldAgent (ICML 2025) sostituisce i guardrail basati su LLM con circuiti di regole probabilistiche costruiti su Reti Logiche Markov, raggiungendo il 90.4% di accuratezza sugli attacchi agli agenti con il 64.7% in meno di chiamate API — e cosa significa per la sicurezza verificabile nei sistemi AI finanziari.
Fine-Tuning vs. RAG: Perché il Recupero Vince per Iniettare Nuova Conoscenza negli LLM
Un confronto empirico tra RAG e fine-tuning non supervisionato su LLM con 7 miliardi di parametri mostra che RAG raggiunge una precisione superiore a 0,875 su fatti successivi al cutoff, mentre il fine-tuning si attesta a 0,504 — con implicazioni dirette per la progettazione di agenti Beancount e qualsiasi sistema che richieda aggiornamenti frequenti della conoscenza.
Gorilla: Come l'Addestramento Retrieval-Aware Riduce le Allucinazioni delle API LLM dal 78% all'11%
Gorilla (Patil et al., NeurIPS 2024) mette a punto un modello LLaMA da 7B con Addestramento Retriever-Aware sulla documentazione API recuperata, riducendo i tassi di allucinazione dal 78% all'11% rispetto a GPT-4 zero-shot — con implicazioni dirette per gli agenti di scrittura AI in finanza, dove nomi di conto errati o segni invertiti sono fallimenti di correttezza, non fastidi.
SWE-agent: Come il Design dell'Interfaccia Sblocca l'Ingegneria del Software Automatizzata
SWE-agent (NeurIPS 2024) introduce le Interfacce Agente-Computer (ACI) — strati progettati appositamente tra LLM e ambienti software — mostrando un miglioramento di 10,7 punti percentuali rispetto all'accesso shell grezzo e una risoluzione del 12,47% su SWE-bench con GPT-4 Turbo. Il design dell'interfaccia, non la capacità del modello, è il collo di bottiglia principale per gli agenti di codifica autonomi.
SWE-bench: I modelli linguistici possono risolvere problemi reali di GitHub?
SWE-bench valuta i modelli linguistici su 2.294 problemi reali di GitHub in 12 repository Python utilizzando test basati sull'esecuzione; al momento della pubblicazione, Claude 2 risolveva solo l'1,96% dei problemi con recupero realistico, stabilendo il benchmark de facto per gli agenti di codifica e rivelando modalità di fallimento nel recupero e nella lunghezza delle patch direttamente rilevanti per gli agenti di scrittura su Beancount.
Toolformer: Utilizzo di strumenti in auto-supervisione e i suoi limiti per l'AI finanziaria
Un'analisi approfondita di Toolformer (Meta AI, NeurIPS 2023): come l'addestramento auto-supervisionato filtrato per perplessità insegna a un modello da 6,7 miliardi di parametri a chiamare API esterne, dove supera GPT-3 175B nei benchmark aritmetici, e perché la sua architettura a passo singolo non può supportare le chiamate a strumenti concatenate richieste per operazioni contabili strutturate.