Salta al contenuto principale

Atlas: Il Pre-Addestramento Congiunto Retriever-Reader Supera LLM da 540B Parametri con 11B Parametri

6 minuti di letturaMike ThriftMike Thrift
Atlas: Il Pre-Addestramento Congiunto Retriever-Reader Supera LLM da 540B Parametri con 11B Parametri

Atlas è il seguito di Izacard e Grave del loro stesso articolo su Fusion-in-Decoder, estendendo FiD in un sistema completamente addestrato congiuntamente dove il retriever e il lettore sono co-addestrati da zero. Lo sto leggendo ora perché chiude la discendenza architetturale dall'articolo originale RAG attraverso FiD fino al recupero addestrato congiuntamente—esattamente lo spazio decisionale che qualsiasi sistema di Q&A per libri contabili deve navigare.

L'articolo

"Atlas: Few-shot Learning with Retrieval Augmented Language Models" (Izacard et al., JMLR 2023) si chiede se i modelli potenziati dal recupero possano eguagliare LLM con parametri massicci su compiti knowledge-intensive few-shot. Il contributo principale è un sistema di recupero potenziato attentamente pre-addestrato che addestra congiuntamente un retriever denso basato su Contriever insieme a un lettore T5 Fusion-in-Decoder. L'intuizione chiave è che il pre-addestramento congiunto—non l'architettura—è ciò che guida le prestazioni conoscitive few-shot. Il sistema recupera i primi 20 documenti, codifica ciascuno indipendentemente nell'encoder, quindi li fonde nell'attenzione incrociata del decoder, lo stesso design FiD dell'articolo degli autori del 2021.

Idee chiave

  • Atlas-11B raggiunge il 42,4% di accuratezza su Natural Questions con solo 64 esempi di addestramento, superando PaLM (540B parametri) di circa 3 punti utilizzando 50 volte meno parametri.
  • Su TriviaQA (64-shot), Atlas-11B raggiunge il 74,5% sul set filtrato e l'84,7% sul test nascosto non filtrato, mostrando che la componente di recupero compensa fortemente la supervisione limitata del compito.
  • Vengono valutati quattro obiettivi di addestramento del retriever: Distillazione dell'Attenzione (ADist), EMDR2 (trattando i documenti recuperati come variabili latenti), Distillazione della Perplessità (PDist) e LOOP (leave-one-out). Le differenze di prestazione tra di loro sono piccole; PDist è adottato per efficienza computazionale.
  • Il pre-addestramento congiunto su testo non etichettato è il singolo fattore più importante: tutte le configurazioni di pre-addestramento potenziato dal recupero superano nettamente la linea di base del solo fine-tuning potenziato dal recupero.
  • L'indice dei documenti può essere aggiornato dopo l'addestramento senza riaddestrare il modello, il che è architetturalmente importante per basi di conoscenza dinamiche. Gli indici temporalmente disallineati degradano notevolmente le prestazioni.
  • Su MMLU (5-shot), Atlas-11B raggiunge il 47,9%, superando il 43,9% riportato da GPT-3, nonostante circa 16 volte meno parametri.

Cosa regge—e cosa no

L'affermazione principale—che il recupero consente prestazioni conoscitive few-shot a una frazione del conteggio dei parametri—regge in modo convincente. Il numero del 42,4% su NQ con 64 esempi è un risultato sorprendente, e il confronto con PaLM è equo perché PaLM era il benchmark di scala all'avanguardia al momento.

Ma ho tre riserve. In primo luogo, l'accuratezza del recupero non è eccezionale nemmeno dopo l'addestramento congiunto: analisi indipendenti mostrano che Contriever perde almeno un'affermazione gold in circa l'85% dei casi e raggiunge circa il 47% di accuratezza nel recupero per Q&A. L'addestramento congiunto migliora il recupero rispetto alle linee di base non addestrate congiuntamente, ma il lettore sta svolgendo un lavoro enorme per compensare il recupero imperfetto—i numeri headline few-shot riflettono il tetto del sistema, non la qualità della componente di recupero. In secondo luogo, il costo infrastrutturale è reale: l'aggiornamento degli indici dei documenti durante il pre-addestramento aggiunge circa il 30% di overhead computazionale, e l'indice completo di Wikipedia+CommonCrawl richiede 587GB in fp16. Questo è gestibile per un ambiente di ricerca ma è un vero vincolo operativo per la distribuzione in produzione. In terzo luogo, la fuga di dati è riconosciuta ma non risolta: il 2,8% delle domande MMLU appaiono testualmente nel corpus CCNet utilizzato per il pre-addestramento, gonfiando i risultati MMLU di un margine sconosciuto.

C'è anche una limitazione architetturale più sottile con cui l'articolo non si confronta pienamente: FiD codifica ogni passaggio recuperato indipendentemente prima della fusione, il che aiuta il parallelismo ma significa che l'encoder non ha attenzione tra passaggi. Le lunghe catene di ragionamento multi-hop che devono collegare informazioni tra passaggi devono svolgere tutto questo lavoro nel decoder—e con 20 passaggi recuperati, l'attenzione incrociata del decoder sta portando un carico pesante.

Perché questo è importante per l'AI finanziaria

Per il Q&A sui libri contabili Beancount, il contributo più rilevante di Atlas è la dimostrazione empirica che l'addestramento congiunto retriever-lettore ripaga in contesti few-shot—e la sua onesta contabilità di quando non lo fa. Un agente Beancount che interroga una cronologia di transazioni pluriennale si trova ad affrontare esattamente il problema dell'indice dinamico: nuove voci arrivano quotidianamente, e un indice vecchio di un mese produce risposte errate. Atlas mostra che l'indice può essere scambiato a caldo senza riaddestrare il modello, il che è architetturalmente incoraggiante.

I numeri sull'accuratezza del recupero sono comunque scoraggianti. Se Contriever perde la voce di libro contabile rilevante nel 53% dei tentativi di recupero anche dopo l'addestramento congiunto su testo generico, un agente nel dominio finanziario che opera su libri contabili Beancount—con i loro nomi di merci specifici del dominio, gerarchie di conti e direttive bean—avrà bisogno di un addestramento del retriever adattivo al dominio o di un recupero potenziato da metodi di interrogazione strutturati (corrispondenza esatta dell'account, filtraggio per data). Il solo recupero in stile RAG, anche se addestrato congiuntamente, non sarà sufficiente per operazioni contabili ad alta precisione.

Il confronto con PaLM chiarisce anche il compromesso architetturale: il recupero permette di comprimere la conoscenza in meno parametri, riducendo il costo di inferenza. Per un prodotto come Beancount.io dove il costo di inferenza è importante su larga scala, la filosofia di design di Atlas è interessante. Ma il costo dell'indice da 587GB sposta l'onere sull'infrastruttura di archiviazione e recupero—un diverso tipo di vincolo operativo che non compare nei numeri di benchmark.

Cosa leggere dopo

  • REALM: Retrieval-Augmented Language Model Pre-Training (Guu et al., arXiv:2002.08909, ICML 2020) — il precedente framework di pre-addestramento congiunto retriever-lettore che Atlas estende; essenziale per capire cosa Atlas effettivamente migliora e cosa lascia invariato.
  • RA-DIT: Retrieval-Augmented Dual Instruction Tuning (Lin et al., arXiv:2310.01352, ICLR 2024) — raggiunge prestazioni competitive con Atlas utilizzando l'istruzione tuning piuttosto che il pre-addestramento congiunto da zero; suggerisce che il divario tra addestramento congiunto e indipendente potrebbe essere colmabile senza il costo infrastrutturale.
  • RETRO: Improving Language Models by Retrieving from Trillions of Tokens (Borgeaud et al., arXiv:2112.04426, ICML 2022) — l'approccio di DeepMind al recupero durante il pre-addestramento a una scala diversa; completa il quadro degli approcci di pre-addestramento potenziati dal recupero prima di fare scelte architetturali per il Q&A sui libri contabili.

Condividi questo articolo