Конституционен ИИ за счетоводни агенти: RLAIF, правила за политиките и рискове от Гудхартинг
Документът на Anthropic за конституционен ИИ (Bai et al., 2022) обучава LLM да следват правила, използвайки генерирана от ИИ обратна връзка, вместо човешки етикети за вреда. Този изследователски запис разглежда как RLAIF тръбопроводът критика-преразглеждане-предпочитание се пренася върху безопасността при запис за автономни Beancount ledger агенти — и как изглеждат Гудхартингът, калибрационните грешки и рисковете от двойна употреба, когато „конституцията“ е сметкоплан вместо етичен набор от правила.
mike
aimachine-learningllm