Към основното съдържание

Дневник на изследванията на Bean Labs

PHANTOM (NeurIPS 2025): Измерване на откриването на халюцинации в LLM при финансови документи

Публикувано Последно обновено 6 минути четенеMike ThriftMike Thrift
PHANTOM (NeurIPS 2025): Измерване на откриването на халюцинации в LLM при финансови документи

Документ: https://openreview.net/forum?id=5YQAo0S3Hm

На тази страница

PHANTOM (NeurIPS 2025) задава въпроса, на който най-много исках да получа отговор, преди да се доверя на LLM да докосне Beancount ledger: може ли моделът наистина да разпознае кога си измисля неща относно финансов документ? Резултатите не са успокояващи, а методологичните избори си заслужава да бъдат разгледани внимателно.

Статията

Lanlan Ji, Dominic Seyler, Gunkirat Kaur, Manjunath Hegde, Koustuv Dasgupta и Bing Xiang — повечето свързани с IBM Research — конструираха PHANTOM специално, за да запълнят празнината, която общите бенчмаркове за халюцинации оставят отворена. Стандартните бенчмаркове за халюцинации тестват кратки, чисти контексти с добре формулирани заявки. Финансовите документи са точно обратното: един единствен 10-K доклад рутинно надхвърля 100 000 токена, числата са точни до стотинката, а езикът е наситен с термини със специфично значение, които имат неочевидни значения (EBITDA, отложени приходи, обезценка на репутацията). Основният принос е набор от данни с тройки заявка-отговор-документ, изградени от реални SEC документи — годишни доклади 10-K, документи на взаимни фондове 497K и прокси изявления DEF 14A — където всеки отговор е или правилен, или умишлено халюциниран, валидиран от човешки анотатори. Бенчмаркът след това разширява този начален набор, за да тества дължини на контекста от ~500 токена чак до 30 000 токена, и систематично варира къде се появява съответната информация: в началото, средата или края на контекста.

Ключови идеи

  • Задачата е откриване на халюцинации, а не генериране на халюцинации: при даден фрагмент от документ и отговор, класифицирайте дали отговорът е основан на факти или е измислен. Това е по-проста задача от генерирането на отговор, основан на факти — въпреки това моделите все още се справят зле.
  • Дължината на контекста има голямо значение. Началният набор използва фрагменти от ~500 токена. С нарастването на контекста до 10K, 20K и 30K токена, производителността спада значително при всички модели — в съответствие с откритието „Изгубени в средата“ (arXiv:2307.03172), че LLM се влошават, когато съответната информация е заровена в средата на дълъг контекст.
  • Llama-3.3-70B-Instruct постига най-висок F1 резултат от 0.916 върху началния набор от данни — но авторите отбелязват, че този модел е бил използван и за генерирането на началния набор от данни, което е проблем на кръгова зависимост, който завишава числото.
  • Qwen3-30B-A3B-Thinking постига F1 = 0.882, превъзхождайки всички тествани модели със затворен код. Неговият „non-thinking“ вариант Instruct постига 0.848, което предполага, че изчисленията по време на тестване (разсъждения чрез верига от мисли) добавят реална стойност тук.
  • Малките модели (Qwen-2.5-7B) постигат резултати само малко над случайното отгатване върху бенчмарка. Откриването на халюцинации върху дълги финансови документи изглежда изисква значителен капацитет на модела.
  • Финото настройване на модели с отворен код върху PHANTOM данни значително подобрява техните нива на откриване — статията идентифицира това като най-обещаващата посока за практиците.

Какво издържа — и какво не

Методологията на конструиране е внимателна. Човешката анотация върху началния набор, последвана от систематично разширяване през дължините на контекста и позициите на поставяне, дава на PHANTOM структура, която липсва на повечето финансови NLP набори от данни. По-специално варирането на позицията е полезно: то ви позволява да измерите дали провалът на модела се дължи на общата дължина на контекста или на специфичния U-образен модел на внимание (силно в началото и края, слабо в средата), който е документиран в множество LLM архитектури.

Кръговата зависимост при Llama-3.3-70B е реален проблем и авторите заслужават признание за това, че го отбелязват — но това също означава, че най-добрият резултат на бенчмарка е неинтерпретируем. За практиците по-полезните числа вероятно са резултатите на Qwen3 и Phi-4, където такова замърсяване не съществува.

Какво бих искал да предостави статията: реалната крива на влошаване с нарастването на контекста от 500 до 30 000 токена. Статията установява, че влошаването се случва и че позицията има значение, но не можах да извлека конкретните процентни пункта на спад от наличните материали. Тази гранулираност е от значение за решението къде да се зададе размерът на фрагмента за извличане в производствена система. Също така си струва да се отбележи, че бенчмаркът тества само дали моделът открива халюцинация в представен отговор — той не тества дали моделът ще халюцинира, когато бъде помолен да създаде отговор от нулата. Това са свързани, но различни видове грешки, и система, която се представя добре при откриването, може все пак да се провали сериозно при генерирането.

Накрая, наборът от данни обхваща три типа SEC документи. Това е значителен сегмент от финансовото документно пространство, но оставя извън обхвата стенограми от разговори за печалбите, одиторски доклади, клаузи за конвенанти в договори за заеми и вида ad-hoc описания на счетоводни статии, които изпълват един Beancount ledger. Обобщаването към тези формати е отворен въпрос.

Защо това е от значение за финансовия AI

Халюцинацията е проблемът на доверието за всеки автономен счетоводен агент, който мога да си представя, че е изграден върху Beancount. Сценарият за обратно записване е най-лошият случай: агент, който чете банково извлечение, класифицира транзакция и публикува счетоводна статия. Ако халюцинира получателя, сумата или кода на сметката, ledger-ът е тихо грешен. PHANTOM е първият бенчмарк, който съм виждал, който се опитва да измери дали моделите могат да уловят този клас грешки в реалистични условия на документи.

Откритието, че малките модели (7B) се представят почти случайно при откриването на халюцинации, е пряко свързано с Bean Labs: ако изпълняваме агент на устройство или с ниска латентност, не можем да разчитаме на 7B модел да самопроверява собствения си изход. Нуждаем се или от по-голям модел-верификатор, или от външна проверка за извличане, или от ограничен формат на изхода, който прави халюцинациите структурно невъзможни (например, принуждаване на модела да цитира номер на ред от изходния документ, преди да публикува статия). Резултатът от финото настройване е окуражаващ: специфичната за домейна адаптация върху данни от тип PHANTOM изглежда възстановява голяма част от способността за откриване дори при по-малките модели, което предполага, че фино настроен верификатор може да бъде практичен компонент в тръбопровод за обратно записване.

Какво да прочетете след това

  • SelfCheckGPT (Manakul и др., arXiv:2303.08896) — откриване на халюцинации, базирано на проби, без референтен документ; допълва подхода на PHANTOM, основан на референции, и може да се обобщава по-добре към свободни анотации в ledger-а
  • „Изгубени в средата“ (Liu и др., arXiv:2307.03172) — основната статия за позиционното влошаване на вниманието в дълги контексти; резултатите за позицията в PHANTOM са по същество приложено възпроизвеждане на това във финансовата област
  • FinanceBench (Islam и др., 2023) — QA бенчмаркът върху SEC документи, който показа, че GPT-4 Turbo с извличане се проваля в 81% от извадка от 150 случая; работи добре в двойка с PHANTOM като допълнение от страна на генерирането към перспективата на PHANTOM от страна на откриването

Споделете тази статия

Източник: https://beancount.io/bg/bean-labs/research-logs/2026/04/19/phantom-hallucination-detection-financial-long-context

Публикувано: 19 април 2026 г.

Последно обновено: 15 юли 2026 г.