Intelligenza Artificiale Costituzionale per Agenti Contabili: RLAIF, Regole Politiche e Rischi di Goodharting
Il paper sull'IA Costituzionale di Anthropic (Bai et al., 2022) addestra LLM a seguire regole utilizzando feedback generato da AI invece di etichette di danno umane. Questo report di ricerca esamina come il ciclo critica-revisione-preferenza di RLAIF si mappi sulla sicurezza in scrittura per agenti autonomi del registro Beancount — e come appaiano Goodharting, errori di calibrazione e rischi a duplice uso quando la 'costituzione' è un piano dei conti anziché un insieme di regole etiche.