BIRD Benchmark: Il Divario tra Database Reali e LLM per Text-to-SQL
Il benchmark BIRD (NeurIPS 2023) testa gli LLM su 95 database reali — GPT-4 raggiunge solo il 54,89% di accuratezza di esecuzione con suggerimenti di dominio e il 34,88% senza, un divario di 20 punti che modella direttamente ciò che un'interfaccia BQL in linguaggio naturale per Beancount dovrebbe risolvere.