BIRD Benchmark: Priepasť medzi reálnymi databázami a LLM pri prevode textu na SQL
Benchmark BIRD (NeurIPS 2023) testuje LLM na 95 reálnych databázach – GPT-4 dosahuje len 54,89 % presnosť vykonávania s doménovými nápovedami a 34,88 % bez nich. Tento 20-bodový rozdiel priamo definuje výzvy, ktoré by muselo riešiť rozhranie BQL v prirodzenom jazyku pre Beancount.