بنچمارک BIRD: شکاف پایگاهداده واقعی در مدلهای زبانی بزرگ Text-to-SQL
بنچمارک BIRD (NeurIPS 2023) مدلهای زبانی بزرگ را روی ۹۵ پایگاهداده واقعی آزمایش میکند — GPT-4 با راهنماهای دامنه تنها به ۵۴.۸۹٪ و بدون آنها به ۳۴.۸۸٪ دقت اجرا میرسد؛ شکافی ۲۰ واحدی که مستقیماً چالشهای ایجاد یک رابط زبان طبیعی BQL برای Beancount را تعریف میکند.