Salta al contenuto principale

I LLM non sono utili per il forecasting di serie temporali: cosa significa NeurIPS 2024 per la finanza AI

5 minuti di letturaMike ThriftMike Thrift
I LLM non sono utili per il forecasting di serie temporali: cosa significa NeurIPS 2024 per la finanza AI

Questo articolo è finito nella mia lista di lettura perché sfida direttamente l'ondata di lavori sul forecasting di serie temporali basati su LLM del 2023-2024. Mentre Bean Labs riflette su come prevedere saldi contabili e flussi di cassa dai registri Beancount, la questione se utilizzare LLM generici o modelli numerici costruiti appositamente non è accademica. Il risultato Spotlight di NeurIPS 2024 di Tan et al. è una doccia fredda.

L'articolo

"I modelli linguistici sono realmente utili per il forecasting di serie temporali?" di Mingtian Tan, Mike Merrill, Vinayak Gupta, Tim Althoff e Thomas Hartvigsen (arXiv:2406.16964, NeurIPS 2024 Spotlight) abla tre popolari metodi di previsione basati su LLM: OneFitsAll (GPT-2 con attenzione congelata e patching), Time-LLM (LLaMA con riprogrammazione a patch) e CALF (GPT-2 con adattatori LoRA e allineamento cross-modale). La domanda è se la rimozione o sostituzione del componente LLM degradi le prestazioni. Su 13 benchmark, la risposta è quasi sempre no — e spesso le ablazioni sono migliori.

Idee chiave

  • Le ablazioni superano Time-LLM in 26/26 casi metrici su 13 dataset, CALF in 22/26 e OneFitsAll in 19/26 — l'LLM è più spesso un freno che un aiuto.
  • Time-LLM ha 6.642M parametri e richiede 3.003 minuti di addestramento sul dataset Weather; un'ablation solo attenzione con 0.245M parametri si addestra in 2,17 minuti — circa un'accelerazione di 1.383× con accuratezza uguale o migliore.
  • LLM inizializzati casualmente superano quelli pre-addestrati in 8 confronti su 11 dataset, il che significa che i pesi pre-addestrati sul testo contribuiscono negativamente in media.
  • In scenari con pochi dati (10% di dati di addestramento), Time-LLM e l'ablation senza LLM vincono ciascuno in 8 casi su 16 — statisticamente indistinguibili, smentendo l'argomento dei pochi dati comunemente usato per giustificare l'inclusione dell'LLM.
  • Mescolare intere sequenze di serie temporali degrada sia i modelli basati su LLM che quelli solo attenzione in modo comparabile, suggerendo che nessuna delle due architetture cattura in modo affidabile la struttura temporale sequenziale.
  • Una baseline PAttn semplice (patching più un singolo strato di attenzione) eguaglia i metodi LLM completi su tutti i dataset pur essendo di ordini di grandezza più economica in fase di inferenza.

Cosa regge — e cosa no

Il design dell'ablation è metodologicamente solido: gli autori sostituiscono solo il componente LLM mantenendo tutto il resto (patching, normalizzazione, teste) fisso, quindi il confronto è pulito. Il codice è pubblico. Solo il dato sul calcolo — 1.383× di accelerazione, nessuna perdita di accuratezza — è difficile da contestare per qualsiasi caso d'uso produttivo.

Ciò che l'articolo lascia aperto è il perché gli LLM non aiutano. L'esperimento di mescolamento mostra che i modelli non riescono a distinguere serie temporali ordinate da quelle mescolate — ma questa patologia vale anche per le ablazioni, non solo per gli LLM. Il fallimento potrebbe essere una proprietà più profonda di come i transformer basati su patch elaborano le serie temporali, piuttosto che un difetto specifico del modello linguistico. Gli autori lo accennano ma non lo approfondiscono.

Anche l'ambito è limitato. Tutti e tre i metodi utilizzano LLM congelati o leggermente adattati del 2022-2023 (GPT-2, LLaMA-7B). I modelli costruiti appositamente per le serie temporali — Chronos, TimesFM — tokenizzano i dati numerici in modo diverso e non sono coperti. Uno scettico può ragionevolmente sostenere che la critica colpisca uno schema progettuale specifico (riadattare architetture NLP senza modifiche) piuttosto che gli LLM per dati numerici in generale.

Perché questo è importante per la finanza AI

Per i compiti di previsione di Beancount — prevedere il saldo del mese prossimo, stimare la responsabilità fiscale annuale, segnalare gap di flusso di cassa — questo articolo spinge decisamente verso modelli numerici leggeri e costruiti appositamente. Il divario computazionale non è teorico: un agente che esegue previsioni mobili su un registro personale non può permettersi il sovraccarico di inferenza di Time-LLM.

C'è anche un'implicazione più netta. Il risultato sulla struttura sequenziale suggerisce che qualsiasi agente che tratti le voci di registro come token e si aspetti che il modello ragioni sull'ordinamento temporale dal solo contesto è su un terreno instabile. Se il modello non riesce a distinguere serie mescolate da quelle ordinate, la corrispondenza di pattern temporali deve essere progettata esplicitamente — attraverso codifica posizionale, scomposizione trend-stagionale o un'architettura costruita appositamente — non data per scontata come emergente dal pre-addestramento.

Il rischio è generalizzare eccessivamente. La critica di Tan et al. è strettamente sull'estrapolazione numerica. Gli LLM portano ancora valore genuino quando il compito coinvolge il linguaggio naturale — spiegare anomalie, rispondere a "perché la mia spesa al supermercato è aumentata a marzo?", revisionare note narrative in un registro. L'errore è confondere "gli LLM non possono estrapolare serie temporali" con "gli LLM non possono ragionare sulla finanza". Sono affermazioni diverse, e Bean Labs ha bisogno di entrambe le capacità.

Cosa leggere dopo

  • TimesFM: "A decoder-only foundation model for time-series forecasting" (Das et al., ICML 2024, arXiv:2310.10688) — Il modello di Google da 200M parametri pre-addestrato su 100 miliardi di punti temporali reali; costruito appositamente per il forecasting piuttosto che riadattato da NLP, e un test diretto per vedere se il problema sono gli LLM o lo schema di riadattamento.
  • Chronos: "Learning the Language of Time Series" (Ansari et al., TMLR 2024, arXiv:2403.07815) — L'approccio di Amazon di tokenizzare valori numerici in un vocabolario discreto e addestrare modelli basati su T5 da zero su serie temporali; più vicino nello spirito a PatchTST che ai previsori basati su GPT e ottiene forti risultati zero-shot su 42 benchmark.
  • PatchTST: "A Time Series is Worth 64 Words" (Nie et al., ICLR 2023, arXiv:2211.14730) — Il design di patching più indipendenza dei canali che sta alla base della maggior parte degli wrapper LLM ablati in questo articolo; comprenderlo chiarisce esattamente quale componente sta facendo il lavoro reale in OneFitsAll e Time-LLM.

Condividi questo articolo