#multi-agent
Multi-Agent
Multi-agent LLM frameworks and architectures for collaborative financial automation
M3MAD-Bench: I dibattiti multi-agente sono davvero efficaci tra domini e modalità?
M3MAD-Bench mette sotto stress il Dibattito Multi-Agente su 9 modelli, 5 domini e impostazioni visione-linguaggio, scoprendo che il Delirio Collettivo causa il 65% dei fallimenti, il dibattito avversario riduce l'accuratezza fino al 12,8% e l'Auto-Consistenza generalmente eguaglia l'accuratezza del dibattito a un costo di token inferiore.
AutoGen: Framework di Conversazione Multi-Agente per l'AI Finanziaria
AutoGen (Wu et al., 2023) introduce un framework di conversazione multi-agente in cui agenti basati su LLM si scambiano messaggi per completare attività; una configurazione a due agenti porta l'accuratezza sul benchmark MATH dal 55% al 69%, e un agente SafeGuard dedicato migliora il rilevamento di codice non sicuro fino a 35 punti F1 — risultati direttamente applicabili alla creazione di pipeline di automazione Beancount sicure e modulari.