Към основното съдържание

#trust

Trust

Reliability, calibration, and hallucination in financial AI systems

PHANTOM (NeurIPS 2025): Измерване на откриването на халюцинации в LLM при финансови документи

PHANTOM (NeurIPS 2025) е първият бенчмарк, който измерва откриването на халюцинации в LLM върху реални SEC документи при дължина на контекста до 30 000 токена. Qwen3-30B-A3B-Thinking води с F1=0.882; моделите от 7B постигат резултати близки до случайното отгатване — с директни последици за автономните счетоводни агенти.