Salta al contenuto principale

Dibattito Multiagente con LLM: Veri Guadagni di Accuratezza, Calcolo Incontrollato e Delirio Collettivo

6 minuti di letturaMike ThriftMike Thrift
Dibattito Multiagente con LLM: Veri Guadagni di Accuratezza, Calcolo Incontrollato e Delirio Collettivo

Sto riflettendo sulla verifica multi-agente per la sicurezza di scrittura su Beancount — nello specifico, se un agente verificatore possa dibattere efficacemente con un agente scrittore prima che una registrazione contabile venga effettivamente inserita. Questa riflessione mi ha riportato al paper fondativo sul dibattito multiagente, presentato a ICML 2024, che ha successivamente generato un utile corpus di lavori critici.

Il paper

"Improving Factuality and Reasoning in Language Models through Multiagent Debate" di Yilun Du, Shuang Li, Antonio Torralba, Joshua B. Tenenbaum e Igor Mordatch propone un approccio che definiscono "società di menti": più istanze di LLM generano ciascuna una risposta iniziale, poi leggono l'insieme completo delle risposte dei pari e aggiornano la propria risposta in più turni. La scelta progettuale chiave è che l'approccio richiede solo accesso black-box agli output del modello — niente gradienti, niente fine-tuning, niente modifiche all'architettura. Lo testano su sei benchmark: aritmetica, GSM8K, ottimalità di mosse negli scacchi, factualità biografica, MMLU e validità di mosse negli scacchi.

La configurazione su cui riportano la maggior parte dei risultati è di 3 agenti che dibattono per 2 turni. L'ipotesi concettuale è che il disaccordo costringa gli agenti ad articolare il proprio ragionamento, mentre la convergenza segnala una fiducia genuina piuttosto che una coincidenza fortunata.

Idee chiave

  • In aritmetica, il dibattito ha raggiunto l'81,8% di accuratezza rispetto al 67,0% di un singolo agente e al 72,1% della riflessione di un singolo agente — un guadagno di 14,8 punti rispetto alla baseline.
  • Su GSM8K (matematica scolastica), 85,0% contro 77,0% del singolo agente e 75,0% con riflessione.
  • Su MMLU (100 domande in diverse aree tematiche), 71,1% contro 63,9% del singolo agente e 57,7% con riflessione.
  • Sulla factualità biografica, 73,8% contro 66,0% del singolo agente.
  • Il dibattito tra modelli diversi (ChatGPT + Bard su 20 problemi GSM8K) ha risolto 17/20 contro 11-14 per ciascun modello individualmente — il risultato più sorprendente del paper perché mostra come agenti eterogenei riescano a cogliere gli errori reciproci.
  • Le performance sono migliorate con l'aumento sia del numero di agenti che dei turni fino a 4, con rendimenti decrescenti oltre. I prompt "lunghi" che incoraggiavano esplicitamente gli agenti a rallentare prima del consenso hanno costantemente superato i prompt brevi.

Cosa regge e cosa no

I guadagni sono reali e la copertura dei benchmark è più ampia rispetto alla maggior parte dei paper sul prompting. Credo nella direzione del risultato: far sì che più agenti si critichino a vicenda coglie più errori rispetto a un singolo agente che riflette sul proprio output.

Il problema è ciò che non è controllato. Tre agenti che dibattono per due turni significano circa 6 volte il calcolo inferenziale di una singola chiamata, prima ancora di considerare il contesto più lungo. Il paper non presenta mai una baseline a parità di budget. L'autoconsistenza — voto di maggioranza su molti campioni indipendenti di un singolo agente — è un confronto naturale che il paper affronta solo brevemente. Un paper del 2025 (arXiv:2604.02460) esegue esattamente questo controllo su benchmark di ragionamento multi-hop con Qwen3, DeepSeek-R1 e Gemini 2.5, usando budget di token di ragionamento corrispondenti, e scopre che "i sistemi a singolo agente possono eguagliare o superare i sistemi multi-agente" una volta equalizzato il calcolo. Questa è una sfida diretta all'affermazione principale.

L'altra modalità di fallimento che il paper riconosce ma sottovaluta è ciò che M3MAD-Bench (arXiv:2601.02854) chiama "Delirio Collettivo": in un'analisi manuale di 100 fallimenti del dibattito, il 65% coinvolgeva agenti che si rafforzavano reciprocamente in risposte errate anziché correggersi. Il testo del paper stesso nota che gli agenti a volte "affermano con sicurezza che la loro risposta è corretta" anche quando convergono su una risposta sbagliata. Quando tutti gli agenti condividono la stessa distribuzione di addestramento — il caso omogeneo — è probabile che condividano anche gli stessi punti ciechi. Il dibattito amplifica allora l'errore anziché coglierlo.

Un risultato correlato dello stesso paper: il "Conformismo Errato" spiega una parte non trascurabile dei fallimenti — un agente corretto abbandona un ragionamento valido dopo aver letto risposte errate dei pari. Questo è l'opposto di ciò che il framework del dibattito dovrebbe fare. È un promemoria che le dinamiche di persuasione in questi cicli multi-agente possono andare in entrambe le direzioni.

Perché questo è rilevante per la finanza con IA

L'architettura è genuinamente attraente per la sicurezza di scrittura su Beancount: lo scrittore propone una registrazione contabile, il verificatore dibatte, il consenso innesca la scrittura effettiva. L'analisi del rischio cambia a seconda di ciò che si sta scrivendo. Per una spesa alimentare di routine, il costo di un turno di dibattito non ne vale la pena. Per una registrazione di fine anno fiscale o un trasferimento infragruppo, avere un secondo agente che esamina i codici contabili e gli importi prima della scrittura è difendibile.

Ma il Delirio Collettivo è particolarmente pericoloso per la contabilità. Se sia lo scrittore che il verificatore condividono la stessa convinzione errata su come una specifica detrazione viene classificata secondo le regole di una data giurisdizione, il dibattito conferma l'errore anziché segnalarlo. Il risultato del paper sull'uso di modelli diversi suggerisce la soluzione: agenti eterogenei — modelli diversi, prompt di sistema diversi, o un agente basato su documentazione esterna — hanno più probabilità di far emergere un disaccordo genuino. M3MAD-Bench conferma che il "dibattito eterogeneo collaborativo" supera sostanzialmente le configurazioni omogenee.

Anche la moltiplicazione del calcolo è importante a scala di produzione. Dieci modifiche contabili per sessione × 3 agenti × 2 turni = 60 chiamate LLM. Questo è sostenibile per scritture ad alta rilevanza, ma non per l'importazione di routine di transazioni. La progettazione giusta è probabilmente un approccio a livelli: un percorso veloce con un singolo agente per le registrazioni ben strutturate, e il dibattito attivato solo quando lo scrittore esprime incertezza o quando la registrazione coinvolge un conto ad alta sensibilità (passività fiscali, utili non distribuiti, infragruppo).

Cosa leggere dopo

  • arXiv:2604.02460 — "Single-Agent LLMs Outperform Multi-Agent Systems on Multi-Hop Reasoning Under Equal Thinking Token Budgets": la confutazione più chiara pubblicata dei presunti vantaggi computazionali del dibattito.
  • arXiv:2601.02854 — M3MAD-Bench: valutazione su larga scala del dibattito su 9 modelli e 13 dataset, con la tassonomia del Delirio Collettivo.
  • arXiv:2406.09187 — GuardAgent: un agente di guardia che traduce policy di sicurezza in codice eseguibile; un approccio più diretto alla sicurezza di scrittura rispetto al consenso basato sul dibattito.

Condividi questo articolo