Перейти до основного вмісту

#trust

Довіра

Надійність, калібрування та галюцинації у фінансових ШІ-системах

Впевненість та калібрування LLM: Огляд того, що насправді показують дослідження

Вербалізована впевненість GPT-4 сягає лише ~62,7% AUROC — ледь вище за випадковість. Фінансовим агентам з урахуванням невизначеності потрібне краще калібрування.

Передавання завдань з урахуванням невизначеності для агентів LLM: коли переходити від малих до великих моделей

ReDAct делегує від малої моделі до великої лише коли перплексія сигналізує про невизначеність, скорочуючи витрати на 64% за тієї ж точності для агентних робочих процесів.