τ²-bench: Misurare il Controllo Duale negli Agenti Conversazionali di IA
τ²-bench estende il benchmarking degli agenti a contesti di controllo duale in cui sia l'IA che l'utente invocano strumenti su uno stato condiviso — scoprendo che gli utenti attivi riducono i tassi di successo di 18–25 punti percentuali, con implicazioni dirette per gli agenti Beancount che condividono l'accesso in scrittura con utenti umani.