Salta al contenuto principale

Mike Thrift

Marketing Manager

FinQA: Il Benchmark che Misura il Ragionamento Numerico dell'IA sui Report Finanziari
·mike

FinQA: Il Benchmark che Misura il Ragionamento Numerico dell'IA sui Report Finanziari

FinQA (EMNLP 2021) ha costruito 8.281 coppie QA dai report sugli utili delle aziende S&P 500, richiedendo programmi aritmetici multi-step. I modelli neurali hanno ottenuto un punteggio del 61% al rilascio, contro il 91% degli esperti umani; l'accuratezza crolla al 22% su programmi con tre o più passaggi. Le modalità di fallimento — costanti di dominio, grounding cross-modale, lunghezza della catena — corrispondono direttamente alle sfide che gli agenti Beancount affrontano oggi.

ai
machine-learning
llm
FinanceBench: Perché il RAG basato su Vector-Store Fallisce sui Documenti Finanziari Reali
·mike

FinanceBench: Perché il RAG basato su Vector-Store Fallisce sui Documenti Finanziari Reali

FinanceBench valuta 16 configurazioni AI su 10.231 domande tratte da documenti SEC reali; il RAG basato su un archivio vettoriale condiviso risponde correttamente solo nel 19% dei casi, e persino GPT-4-Turbo con il passaggio oracle raggiunge solo l'85% di precisione, dimostrando che il ragionamento numerico, e non il recupero, è il vincolo principale per l'AI finanziaria aziendale.

ai
llm
machine-learning
DSPy: Sostituire l'Ingegneria Fragile dei Prompt con Pipeline LLM Compilate
·mike

DSPy: Sostituire l'Ingegneria Fragile dei Prompt con Pipeline LLM Compilate

DSPy sostituisce le stringhe di prompt artigianali con firme dichiarative e un compilatore guidato da metriche, portando Llama2-13b dal 9,4% al 46,9% nel ragionamento matematico GSM8K e offrendo un percorso più manutenibile per pipeline AI finanziarie in produzione.

ai
llm
machine-learning
LATS: Language Agent Tree Search — Integrazione di Ragionamento, Azione e Pianificazione in un unico Framework
·mike

LATS: Language Agent Tree Search — Integrazione di Ragionamento, Azione e Pianificazione in un unico Framework

LATS (Language Agent Tree Search, ICML 2024) integra ReAct, Tree of Thoughts e Reflexion in un unico framework MCTS, raggiungendo il 92,7% di pass@1 su HumanEval con GPT-4. Per le contabilità Beancount basate su Git, il requisito di ripristino dello stato che limita LATS in produzione è soddisfatto con estrema facilità.

ai
llm
machine-learning
Self-RAG: Recupero Adattivo e Autocritica per LLM
·mike

Self-RAG: Recupero Adattivo e Autocritica per LLM

Self-RAG (ICLR 2024 Oral) addestra un modello linguistico a decidere quando recuperare informazioni e poi a valutare i propri risultati utilizzando quattro token di riflessione — raggiungendo il 55,8% su PopQA e 80,2 FactScore sulle biografie, superando ChatGPT su cinque benchmark. L'analisi copre il meccanismo, i risultati delle ablazioni, i limiti di riproducibilità e le implicazioni per agenti di intelligenza artificiale finanziaria su registri Beancount.

ai
machine-learning
llm
Voyager: Le Librerie di Competenze come Fondamento per l'Apprendimento Continuo degli Agenti IA
·mike

Voyager: Le Librerie di Competenze come Fondamento per l'Apprendimento Continuo degli Agenti IA

Voyager, un agente Minecraft basato su GPT-4 di NVIDIA e Caltech, dimostra che una libreria persistente di competenze in codice consente un vero apprendimento continuo senza fine-tuning — scoprendo 3,3× più oggetti rispetto allo stato dell'arte precedente. Il pattern si applica direttamente all'automazione di ledger Beancount a lungo orizzonte, sebbene la correttezza finanziaria richieda livelli di staging che i sandbox di gioco non richiedono mai.

ai
llm
machine-learning
HippoRAG: Memoria a Lungo Termine Neurobiologicamente Ispirata per LLM
·mike

HippoRAG: Memoria a Lungo Termine Neurobiologicamente Ispirata per LLM

HippoRAG (NeurIPS 2024) costruisce un grafo della conoscenza da triple OpenIE e applica Personalized PageRank al momento della query, raggiungendo 89.1% Recall@5 su 2WikiMultiHopQA rispetto al 68.2% di ColBERTv2—con implicazioni dirette per interrogare registri finanziari complessi su storie transazionali pluriennali.

llm
ai
machine-learning
AgentBench:评估作为代理的 LLM —— 对金融 AI 可靠性的启示
·mike

AgentBench:评估作为代理的 LLM —— 对金融 AI 可靠性的启示

AgentBench(Liu 等人,ICLR 2024)在 8 个交互式环境中对 27 个大语言模型进行了基准测试 —— GPT-4 的综合得分为 4.01,而表现最好的开源模型仅为 0.96。三种主要的失败模式(知识图谱失败中 67.9% 为超出任务限制、数据库失败中 53.3% 为格式错误以及无效操作)直接对应了在真实账本上部署 Beancount 回写代理的风险。

ai
llm
machine-learning
BloombergGPT e i Limiti dei LLM Specifici di Dominio nella Finanza
·mike

BloombergGPT e i Limiti dei LLM Specifici di Dominio nella Finanza

Bloomberg ha addestrato un LLM da 50 miliardi di parametri su 569 miliardi di token di dati finanziari, superando i modelli generici nei benchmark di sentiment analysis e ragionamento su tabelle, finché GPT-4 non lo ha eguagliato senza alcun pre-addestramento specifico per la finanza. Cosa rivela l'esperimento da 10 milioni di dollari sui compromessi del pre-addestramento di dominio, la tokenizzazione dei numeri e perché l'uso di strumenti è più affidabile degli interni del modello per gli agenti contabili.

llm
ai
machine-learning
AutoGen: Framework di Conversazione Multi-Agente per l'AI Finanziaria
·mike

AutoGen: Framework di Conversazione Multi-Agente per l'AI Finanziaria

AutoGen (Wu et al., 2023) introduce un framework di conversazione multi-agente in cui agenti basati su LLM si scambiano messaggi per completare attività; una configurazione a due agenti porta l'accuratezza sul benchmark MATH dal 55% al 69%, e un agente SafeGuard dedicato migliora il rilevamento di codice non sicuro fino a 35 punti F1 — risultati direttamente applicabili alla creazione di pipeline di automazione Beancount sicure e modulari.

ai
llm
automation
Gorilla: Come l'Addestramento Retrieval-Aware Riduce le Allucinazioni delle API LLM dal 78% all'11%
·mike

Gorilla: Come l'Addestramento Retrieval-Aware Riduce le Allucinazioni delle API LLM dal 78% all'11%

Gorilla (Patil et al., NeurIPS 2024) mette a punto un modello LLaMA da 7B con Addestramento Retriever-Aware sulla documentazione API recuperata, riducendo i tassi di allucinazione dal 78% all'11% rispetto a GPT-4 zero-shot — con implicazioni dirette per gli agenti di scrittura AI in finanza, dove nomi di conto errati o segni invertiti sono fallimenti di correttezza, non fastidi.

ai
llm
machine-learning
MemGPT: Gestione del Contestuale Virtuale per Agenti LLM
·mike

MemGPT: Gestione del Contestuale Virtuale per Agenti LLM

MemGPT applica il paging della memoria virtuale in stile OS agli LLM, utilizzando un archivio a tre livelli — memoria di lavoro, richiamo e archivio — per fornire agli agenti un ricordo persistente tra le sessioni; sui benchmark di chat multi-sessione, MemGPT con GPT-4 raggiunge il 92,5% di accuratezza rispetto al 32,1% della baseline a contesto fisso.

ai
llm
machine-learning
Mostrando 61–72 di 87 articoli