
M3MAD-Bench: Sú debaty viacerých agentov skutočne efektívne naprieč doménami a modalitami?
M3MAD-Bench zisťuje, že Collective Delusion spôsobuje 65 % zlyhaní debát viacerých agentov a adversariálna debata znižuje presnosť až o 12,8 %.
#multi-agent
Multi-agentné LLM frameworky a architektúry pre kolaboratívnu finančnú automatizáciu

M3MAD-Bench zisťuje, že Collective Delusion spôsobuje 65 % zlyhaní debát viacerých agentov a adversariálna debata znižuje presnosť až o 12,8 %.

Dvojagentová konverzácia AutoGen zvyšuje presnosť MATH z 55 % na 69 % a jeho SafeGuard agent pridáva až 35 F1 bodov pri detekcii nebezpečného kódu.