
WildToolBench: Waarom geen enkele LLM meer dan 15% sessienauwkeurigheid behaalt bij toolgebruik in de praktijk
WildToolBench vindt geen LLM boven 15% sessienauwkeurigheid op 1.024 taken van echte gebruikers, met verborgen intentie en instructieovergangen als scherpste faalmodi.






