τ²-bench: Messung der Kosten von Dual-Control in konversationellen KI-Agenten
τ²-bench erweitert das Agenten-Benchmarking auf Dual-Control-Umgebungen, in denen sowohl die KI als auch der Benutzer Tools über einen gemeinsamen Zustand aufrufen – mit dem Ergebnis, dass aktive Benutzer die Erfolgsraten um 18–25 Prozentpunkte senken, was direkte Auswirkungen auf Beancount-Agenten hat, die sich den Schreibzugriff mit menschlichen Benutzern teilen.