Salta al contenuto principale

#queries

Queries

Query generation, table reasoning, and structured data retrieval for financial AI

TableMaster: Ragionamento Adattivo per la Comprensione di Tabelle con LLM
·mike

TableMaster: Ragionamento Adattivo per la Comprensione di Tabelle con LLM

TableMaster è una pipeline basata esclusivamente su prompting che raggiunge il 78,13% su WikiTQ con GPT-4o-mini—13 punti sopra Chain-of-Table—combinando estrazione del focus tabellare, verbalizzazione semantica e commutazione adattiva tra ragionamento testuale e simbolico. Ecco cosa significa l'architettura per gli agenti AI che lavorano su registri finanziari come Beancount.

ai
llm
machine-learning
Chain-of-Table: Evoluzione delle Tabelle nella Catena di Ragionamento dei LLM
·mike

Chain-of-Table: Evoluzione delle Tabelle nella Catena di Ragionamento dei LLM

Chain-of-Table (ICLR 2024) migliora il ragionamento tabellare dei LLM evolvendo la tabella stessa come stato intermedio — raggiungendo il 67,31% su WikiTQ rispetto al 61,48% dei baselines precedenti, con un vantaggio di +10,25 punti su tabelle oltre i 4.000 token e applicabilità diretta agli agenti di interrogazione del ledger Beancount.

ai
llm
machine-learning
TableLlama: un Modello Open da 7B può Eguagliare GPT-4 nella Comprensione delle Tabelle?
·mike

TableLlama: un Modello Open da 7B può Eguagliare GPT-4 nella Comprensione delle Tabelle?

TableLlama ottimizza Llama 2 (7B) su 2,6 milioni di esempi di attività relative a tabelle e supera GPT-4 in compiti strutturali come l'annotazione del tipo di colonna (F1 94 vs 32), ma è inferiore di 33 punti nel ragionamento compositivo di WikiTQ — un benchmark calibrato per ciò che i modelli open da 7B possono e non possono fare nell'AI finanziaria odierna.

llm
ai
machine-learning
TAPAS: Risposta a Domande su Tabelle con Supervisione Debole Senza SQL, e Cosa Significa per Beancount
·mike

TAPAS: Risposta a Domande su Tabelle con Supervisione Debole Senza SQL, e Cosa Significa per Beancount

TAPAS (Google Research, ACL 2020) risponde a domande su tabelle selezionando celle e applicando aggregazioni scalari — senza generare SQL. Questo post analizza l'architettura, il suo guadagno di accuratezza di 12 punti su SQA, e perché il paradigma di selezione delle celle si adatta a piccole interrogazioni di ledger Beancount ma fallisce su larga scala.

ai
machine-learning
llm
MAC-SQL: Text-to-SQL collaborativo multi-agente
·mike

MAC-SQL: Text-to-SQL collaborativo multi-agente

MAC-SQL (COLING 2025) utilizza tre agenti specializzati — Selettore per la riduzione dello schema, Decompositore per la scomposizione delle domande e Raffinatore per la correzione SQL guidata dall'esecuzione — raggiungendo un'accuratezza di esecuzione del 59,59% sul benchmark BIRD; l'ablation mostra che il Raffinatore contribuisce maggiormente (+4,63 punti), con implicazioni dirette per la generazione di query nel registro di Beancount.

ai
machine-learning
database
DIN-SQL: Apprendimento Contestuale Decomposto per Text-to-SQL
·mike

DIN-SQL: Apprendimento Contestuale Decomposto per Text-to-SQL

DIN-SQL (NeurIPS 2023) decompone text-to-SQL in fasi di collegamento dello schema, classificazione della complessità e generazione SQL, portando GPT-4 dal 67,4% all'85,3% di accuratezza di esecuzione su Spider senza ottimizzazione — e la stessa strategia di decomposizione si applica direttamente alle interfacce in linguaggio naturale per il linguaggio di query BQL di Beancount.

ai
llm
database
BIRD Benchmark: Il Divario tra Database Reali e LLM per Text-to-SQL
·mike

BIRD Benchmark: Il Divario tra Database Reali e LLM per Text-to-SQL

Il benchmark BIRD (NeurIPS 2023) testa gli LLM su 95 database reali — GPT-4 raggiunge solo il 54,89% di accuratezza di esecuzione con suggerimenti di dominio e il 34,88% senza, un divario di 20 punti che modella direttamente ciò che un'interfaccia BQL in linguaggio naturale per Beancount dovrebbe risolvere.

beancount
ai
llm
GraphRAG: Dalla Sintesi Locale a quella Globale Focalizzata sulle Query
·mike

GraphRAG: Dalla Sintesi Locale a quella Globale Focalizzata sulle Query

Il GraphRAG di Microsoft costruisce un grafo di entità partizionato con Leiden su un corpus di testi e precalcola riassunti delle community per rispondere a domande di comprensione globale che il RAG vettoriale standard non può gestire — ma un audit sui bias del 2025 mostra che i suoi tassi di vittoria del 72–83% crollano dopo aver corretto gli artefatti di posizione e lunghezza nella valutazione LLM-as-judge.

ai
llm
machine-learning