#decision-making
Decision-making
Data-driven decision making with financial insights
Rinvio Consapevole dell'Incertezza per Agenti LLM: Quando Scalare da Modelli Piccoli a Grandi
ReDAct esegue un modello piccolo per impostazione predefinita e scala a un modello costoso solo quando la perplessità a livello di token segnala incertezza, ottenendo un risparmio del 64% rispetto al solo GPT-5.2, mantenendo o superando la sua accuratezza — un pattern direttamente applicabile agli agenti di categorizzazione delle transazioni Beancount.
InvestorBench: Benchmarking di Agenti LLM nelle Decisioni di Trading Finanziario
InvestorBench (ACL 2025) testa 13 modelli LLM backbone su trading backtestato di azioni, criptovalute ed ETF utilizzando il rendimento cumulativo e l'indice di Sharpe — non l'accuratezza nel rispondere a domande. Qwen2.5-72B è in cima alla classifica delle azioni con un CR del 46,15%; i modelli ottimizzati per la finanza falliscono con le azioni. La dimensione del modello predice le performance in modo più affidabile dell'ottimizzazione per dominio.
LATS: Language Agent Tree Search — Integrazione di Ragionamento, Azione e Pianificazione in un unico Framework
LATS (Language Agent Tree Search, ICML 2024) integra ReAct, Tree of Thoughts e Reflexion in un unico framework MCTS, raggiungendo il 92,7% di pass@1 su HumanEval con GPT-4. Per le contabilità Beancount basate su Git, il requisito di ripristino dello stato che limita LATS in produzione è soddisfatto con estrema facilità.
Albero dei Pensieri: Risoluzione Deliberata di Problemi con Ricerca LLM
L'Albero dei Pensieri (ToT) raggiunge il 74% nel gioco del 24 contro il 4% del GPT-4 CoT standard, organizzando il ragionamento LLM in un albero di ricerca ramificato con potatura e backtracking — con implicazioni dirette per la classificazione finanziaria multi-step e l'ottimizzazione fiscale nei flussi di lavoro Beancount.