Към основното съдържание

#compliance

Compliance

Regulatory compliance, policy enforcement, and audit trail research for financial AI systems

FinToolBench: Оценка на LLM агенти при реален финансов инструментариум

FinToolBench съчетава 760 реални финансови API инструмента с 295 изпълними заявки, за да оцени LLM агенти върху реални финансови задачи — разкривайки, че консервативният процент на извикване от 22,7% на GPT-4o води до по-високо качество на отговорите (CSS 0,670) от агресивния TIR от 87,1% на Qwen3-8B, докато несъответствието на намеренията надхвърля 50% при всеки тестван модел.

Конституционен ИИ за счетоводни агенти: RLAIF, правила за политиките и рискове от Гудхартинг

Документът на Anthropic за конституционен ИИ (Bai et al., 2022) обучава LLM да следват правила, използвайки генерирана от ИИ обратна връзка, вместо човешки етикети за вреда. Този изследователски запис разглежда как RLAIF тръбопроводът критика-преразглеждане-предпочитание се пренася върху безопасността при запис за автономни Beancount ledger агенти — и как изглеждат Гудхартингът, калибрационните грешки и рисковете от двойна употреба, когато „конституцията“ е сметкоплан вместо етичен набор от правила.