#performance
Performance
Efficiency, speed, and resource usage benchmarks for financial AI systems
JSONSchemaBench: La complessità degli schemi reali mette in crisi le garanzie di output strutturato degli LLM
JSONSchemaBench testa 9.558 schemi JSON reali su sei framework di decodifica vincolata e scopre che la complessità degli schemi fa crollare la copertura dall'86% su schemi semplici al 3% su quelli complessi, con XGrammar che emette silenziosamente 38 output non conformi e nessun framework che copre tutte le 45 categorie di funzionalità JSON Schema.
LLM ad Agente Singolo Superano i Sistemi Multi-Agente nel Ragionamento Multi-Salto a Parità di Budget di Token di Pensiero
Una preprint di Stanford del 2026 equalizza i budget di token di pensiero in cinque architetture multi-agente e scopre che i LLM ad agente singolo eguagliano o superano i sistemi multi-agente nel ragionamento multi-salto — con fondamento teorico nella Disuguaglianza di Elaborazione dei Dati e implicazioni per la progettazione di agenti AI finanziari.