Salta al contenuto principale

#open-source

Open Source

Open-source tools, frameworks, and research artifacts for financial AI

OpenHands: Piattaforma Aperta per Agenti Software AI e le sue Implicazioni per l'Automazione Finanziaria
·mike

OpenHands: Piattaforma Aperta per Agenti Software AI e le sue Implicazioni per l'Automazione Finanziaria

OpenHands è una piattaforma per agenti con licenza MIT, in ambiente sandbox Docker, dove CodeAct raggiunge il 26% su SWE-Bench Lite — un benchmark che fissa con sobrietà ciò che gli agenti AI possono fare realmente oggi, e spiega perché le prime implementazioni produttive in finanza dovrebbero essere strettamente circoscritte piuttosto che autonome.

ai
open-source
automation
WebArena: Il benchmark di 812 compiti che misura cosa gli agenti web possono e non possono effettivamente fare
·mike

WebArena: Il benchmark di 812 compiti che misura cosa gli agenti web possono e non possono effettivamente fare

GPT-4 completa solo il 14,41% degli 812 compiti web realistici di WebArena mentre gli umani raggiungono il 78,24%; la modalità di fallimento dominante è la falsa impossibilità — un rifiuto conservativo di agire — con implicazioni dirette per qualsiasi agente che operi su Fava o interfacce web finanziarie.

ai
llm
automation
TableLlama: un Modello Open da 7B può Eguagliare GPT-4 nella Comprensione delle Tabelle?
·mike

TableLlama: un Modello Open da 7B può Eguagliare GPT-4 nella Comprensione delle Tabelle?

TableLlama ottimizza Llama 2 (7B) su 2,6 milioni di esempi di attività relative a tabelle e supera GPT-4 in compiti strutturali come l'annotazione del tipo di colonna (F1 94 vs 32), ma è inferiore di 33 punti nel ragionamento compositivo di WikiTQ — un benchmark calibrato per ciò che i modelli open da 7B possono e non possono fare nell'AI finanziaria odierna.

llm
ai
machine-learning
SWE-agent: Come il Design dell'Interfaccia Sblocca l'Ingegneria del Software Automatizzata
·mike

SWE-agent: Come il Design dell'Interfaccia Sblocca l'Ingegneria del Software Automatizzata

SWE-agent (NeurIPS 2024) introduce le Interfacce Agente-Computer (ACI) — strati progettati appositamente tra LLM e ambienti software — mostrando un miglioramento di 10,7 punti percentuali rispetto all'accesso shell grezzo e una risoluzione del 12,47% su SWE-bench con GPT-4 Turbo. Il design dell'interfaccia, non la capacità del modello, è il collo di bottiglia principale per gli agenti di codifica autonomi.

ai
llm
automation