Перейти до основного вмісту
Beancount.io Logo

#compliance

Compliance

Regulatory compliance, policy enforcement, and audit trail research for financial AI systems

FinToolBench: Оцінювання LLM-агентів на основі реального використання фінансових інструментів
·mike

FinToolBench: Оцінювання LLM-агентів на основі реального використання фінансових інструментів

FinToolBench поєднує 760 реальних фінансових API-інструментів із 295 виконуваними завданнями для тестування LLM-агентів на реальних фінансових задачах — виявивши, що консервативна частота викликів GPT-4o у 22,7% забезпечує вищу якість відповідей (CSS 0,670), ніж агресивна TIR Qwen3-8B у 87,1%, тоді як рівень невідповідності намірів перевищує 50% у всіх протестованих моделях.

ai
llm
automation
Перевірено безпечне використання інструментів для агентів LLM: STPA зустрічає MCP
·mike

Перевірено безпечне використання інструментів для агентів LLM: STPA зустрічає MCP

Дослідники з CMU та Університету штату Північна Кароліна пропонують використовувати системно-теоретичний аналіз процесів (STPA) та розширений протокол контексту моделі (MCP) для отримання формальних специфікацій безпеки для використання інструментів агентами LLM, а верифікація на основі Alloy демонструє відсутність небезпечних потоків у тематичному дослідженні планування календаря.

ai
llm
security
FinAuditing: LLMs Score Under 14% on Real SEC XBRL Auditing Tasks
·mike

FinAuditing: LLMs Score Under 14% on Real SEC XBRL Auditing Tasks

FinAuditing tests 13 LLMs zero-shot on 1,102 real SEC XBRL filing instances; top scores are 13.86% on financial math verification and 12.42% on concept retrieval—results that directly bound what AI accounting tools can be trusted to automate without external tooling.

llm
ai
financial-reporting
AGrail: Адаптивні захисні бар'єри для LLM-агентів, що навчаються в ході виконання завдань
·mike

AGrail: Адаптивні захисні бар'єри для LLM-агентів, що навчаються в ході виконання завдань

AGrail (ACL 2025) представляє кооперативний захисний бар'єр на основі двох LLM, який адаптує перевірки безпеки під час виведення за допомогою адаптації під час тестування (TTA), досягаючи 0% успішних атак через ін'єкції промптів та 95,6% збереження добронамірених дій у Safe-OS — порівняно з GuardAgent та LLaMA-Guard, які блокують до 49,2% легітимних дій.

ai
llm
security
ShieldAgent: Верифіковане міркування щодо політики безпеки для агентів LLM
·mike

ShieldAgent: Верифіковане міркування щодо політики безпеки для агентів LLM

ShieldAgent (ICML 2025) замінює запобіжники на основі LLM імовірнісними схемами правил, побудованими на мережах марковської логіки, досягаючи точності 90,4% при атаках на агентів з на 64,7% меншою кількістю викликів API — і що це означає для верифікованої безпеки у фінансових системах ШІ.

ai
llm
machine-learning
AuditCopilot: LLM для виявлення шахрайства в подвійній бухгалтерії
·mike

AuditCopilot: LLM для виявлення шахрайства в подвійній бухгалтерії

AuditCopilot застосовує LLM з відкритим вихідним кодом (Mistral-8B, Gemma, Llama-3.1) для виявлення шахрайства в корпоративних журнальних проведеннях, скорочуючи кількість хибнопозитивних результатів з 942 до 12 — але абляційне дослідження показує, що LLM функціонує переважно як шар синтезу поверх оцінок Isolation Forest, а не як незалежний детектор аномалій.

fraud-detection
llm
double-entry
Конституційний ШІ для бухгалтерських агентів: RLAIF, правила політики та ризики Ґудгарта
·mike

Конституційний ШІ для бухгалтерських агентів: RLAIF, правила політики та ризики Ґудгарта

Стаття Anthropic про Конституційний ШІ (Bai et al., 2022) навчає великі мовні моделі (LLM) дотримуватися правил за допомогою зворотного зв'язку, створеного ШІ, а не міток людської шкоди. Цей дослідницький журнал розглядає, як конвеєр RLAIF «критика-перегляд-перевага» відображається на безпеці зворотного запису для автономних агентів реєстру Beancount — і як виглядають закон Ґудгарта, помилки калібрування та ризики подвійного призначення, коли «конституцією» є план рахунків, а не набір етичних правил.

ai
machine-learning
llm