Benchmark BIRD: A Lacuna de Bancos de Dados Reais em LLM Text-to-SQL
O benchmark BIRD (NeurIPS 2023) testa LLMs em 95 bancos de dados reais — o GPT-4 atinge apenas 54,89% de acurácia de execução com dicas de domínio e 34,88% sem elas, uma lacuna de 20 pontos que molda diretamente o que uma interface BQL de linguagem natural para o Beancount precisaria resolver.