Salta al contenuto principale

Fine-Tuning vs. RAG: Perché il Recupero Vince per Iniettare Nuova Conoscenza negli LLM

6 minuti di letturaMike ThriftMike Thrift
Fine-Tuning vs. RAG: Perché il Recupero Vince per Iniettare Nuova Conoscenza negli LLM

La domanda a cui torno sempre quando progetto agenti Beancount è questa: quando i dati del tuo libro mastro cambiano, dovresti fare fine-tuning del modello sui nuovi fatti o costruire un sistema di recupero? Lo studio di Ovadia et al., "Fine-Tuning or Retrieval? Comparing Knowledge Injection in LLMs" (EMNLP 2024, arXiv:2312.05934), fornisce la risposta empirica più chiara che abbia trovato, e taglia nettamente contro l'hype del fine-tuning.

L'articolo

Oded Ovadia, Menachem Brief, Moshik Mishaeli e Oren Elisha confrontano due approcci per aggiornare ciò che un LLM conosce: il pre-training continuo non supervisionato (il modello legge nuovo testo e continua la previsione del token successivo) e il RAG (il modello riceve passaggi recuperati al momento della query). Testano tre modelli da 7 miliardi di parametri — Llama2-7B, Mistral-7B e Orca2-7B — in due domini di conoscenza: un sottoinsieme di MMLU che copre anatomia, astronomia, biologia universitaria e chimica (conoscenza che i modelli probabilmente hanno visto durante il pre-training), e un dataset personalizzato di attualità composto da 910 domande a scelta multipla su eventi statunitensi da agosto a novembre 2023, esplicitamente oltre i cutoff di addestramento dei modelli. La pipeline RAG utilizza gli embedding BGE-large-en su un indice FAISS. Il fine-tuning esegue un addestramento LM causale non supervisionato su blocchi di Wikipedia da 256 token su 4 GPU A100.

Idee chiave

  • Il RAG domina sulla conoscenza genuinamente nuova: Nel compito di attualità, il solo RAG ottiene un punteggio di 0,875 (Mistral) e 0,876 (Orca) rispetto ai baseline dei modelli base di 0,353–0,481. Il fine-tuning non supervisionato con parafrasi raggiunge solo 0,504–0,511 — il RAG ha più che raddoppiato il guadagno di precisione che il fine-tuning aveva ottenuto su fatti oltre il cutoff di addestramento.
  • Il tetto del fine-tuning è la conoscenza esistente, non quella nuova: Anche sugli argomenti MMLU che i modelli avevano già incontrato durante il pre-training, il fine-tuning produce solo guadagni modesti; il RAG supera comunque le prestazioni in tutte e cinque le materie.
  • Le parafrasi aiutano, ma lentamente: Le parafrasi generate da GPT-4 per ogni blocco di addestramento migliorano i risultati del fine-tuning in modo monotono — 10 versioni superano costantemente 1 — e gli autori suggeriscono che questo potrebbe affrontare parzialmente la Maledizione dell'Inversione (Berglund et al., arXiv:2309.12288), in cui i modelli addestrati su "A è B" non riescono a generalizzare a "B è A". Sono cauti nel notare che la connessione merita ulteriori ricerche.
  • La dimenticanza catastrofica è un costo reale: Llama2 senza aumento dei dati ha mostrato una significativa degradazione della precisione su compiti appresi in precedenza dopo il fine-tuning sugli eventi correnti. Il RAG evita completamente questo problema.
  • Combinarli entrambi non aiuta in modo affidabile: Il fine-tuning + RAG ha raggiunto 0,520–0,830 nella condizione di attualità, a volte inferiore al solo RAG. Il fine-tuning sembra interferire con la capacità del modello di utilizzare il contesto recuperato.

Cosa regge — e cosa no

Il risultato centrale è credibile. Un dataset di 910 domande con un chiaro cutoff temporale è sufficiente per fidarsi della direzione del risultato: il fine-tuning non supervisionato è un veicolo scarso per iniettare fatti genuinamente nuovi. Il disegno della valutazione è pulito e le dimensioni dell'effetto sono grandi.

I punti ciechi sono anche reali. Tutti e tre i modelli testati hanno 7 miliardi di parametri — non sappiamo se il divario del fine-tuning si riduca o cresca con modelli di frontiera. Ancora più importante, il metodo di fine-tuning è strettamente la previsione non supervisionata del token successivo. Niente LoRA, niente instruction tuning, niente coppie QA supervisionate. RAFT (Zhang et al., arXiv:2403.10131) e approcci simili di adattamento di dominio supervisionato sono baseline più competitive che questo articolo non affronta. La conclusione "il fine-tuning perde" è in realtà "il fine-tuning non supervisionato perde", che è un'affermazione più ristretta.

Anche l'implementazione del RAG è modesta: recupero denso di base con FAISS e BGE-large-en, senza ri-ranking o espansione delle query. Una nota in appendice riconosce che la K ottimale varia sostanzialmente tra modelli e compiti — scegliere il numero sbagliato di passaggi recuperati danneggia significativamente le prestazioni. In produzione, la regolazione di K per dominio è un costo operativo non trascurabile.

Un'affermazione con cui non sono d'accordo: gli autori inquadrano il risultato che le parafrasi aiutano il fine-tuning come potenzialmente in grado di attenuare la Maledizione dell'Inversione, ma la loro evidenza è indiretta. Il miglioramento monotono con il numero di parafrasi potrebbe semplicemente riflettere i benefici standard dell'aumento dei dati, piuttosto che qualsiasi soluzione strutturale alla generalizzazione bidirezionale. La connessione è interessante ma non stabilita.

Perché questo è importante per l'AI finanziaria

Questo è uno degli articoli più direttamente utilizzabili per l'agenda di Bean Labs. Un agente Beancount non può essere riaddestrato ogni volta che viene aggiunta una transazione, una regola cambia o inizia un nuovo anno fiscale. L'articolo supporta fortemente il trattamento del libro mastro come un corpus di recupero piuttosto che come materiale per fine-tuning: i guadagni fattuali dal fine-tuning sono modesti, il rischio di dimenticanza catastrofica è reale e il costo operativo del riaddestramento supera di gran lunga il costo della reindicizzazione.

Il risultato sulle parafrasi indica qualcosa di utile anche se mettiamo da parte il fine-tuning. Se una regola contabile specifica del dominio deve essere incorporata profondamente nel comportamento di un modello — non solo recuperata ma seguita in modo affidabile — esprimerla in più forme (vincolo, controllo di validazione, esempio di violazione) è probabilmente più robusto di una singola affermazione canonica. È così che funziona l'educazione contabile, ed è coerente con il modo in cui gli studi sul rispetto delle regole dell'AI Costituzionale inquadrano la copertura delle regole.

Il risultato sulla dimenticanza catastrofica è l'avvertimento pratico più chiaro: l'adattamento di dominio non supervisionato sui dati del libro mastro può degradare le capacità di ragionamento generale necessarie per il rilevamento di anomalie e la risposta a domande. Il recupero evita questo problema al costo di un indice e di un recuperatore — un compromesso che vale la pena fare.

Cosa leggere dopo

  • La Maledizione dell'Inversione (Berglund et al., arXiv:2309.12288, ICLR 2024) — l'articolo a cui fanno riferimento Ovadia et al.; spiega perché gli LLM falliscono nell'implicazione bidirezionale dai dati di addestramento e delinea i limiti fondamentali del fine-tuning per l'iniezione fattuale.
  • RAFT: Adattare il Modello Linguistico al RAG Specifico del Dominio (Zhang et al., arXiv:2403.10131) — una ricetta di fine-tuning supervisionato progettata per funzionare con il RAG piuttosto che sostituirlo; un baseline di fine-tuning più competitivo dell'approccio non supervisionato testato qui.
  • Fine Tuning vs. Retrieval Augmented Generation per Conoscenze Meno Popolari (arXiv:2403.01432) — estende il confronto alla conoscenza di entità di coda lunga, dove il RAG domina ancora, e propone Stimulus RAG come alternativa leggera.

Condividi questo articolo