Salta al contenuto principale

#decision-making

Decision-making

Data-driven decision making with financial insights

Rinvio Consapevole dell'Incertezza per Agenti LLM: Quando Scalare da Modelli Piccoli a Grandi
·mike

Rinvio Consapevole dell'Incertezza per Agenti LLM: Quando Scalare da Modelli Piccoli a Grandi

ReDAct esegue un modello piccolo per impostazione predefinita e scala a un modello costoso solo quando la perplessità a livello di token segnala incertezza, ottenendo un risparmio del 64% rispetto al solo GPT-5.2, mantenendo o superando la sua accuratezza — un pattern direttamente applicabile agli agenti di categorizzazione delle transazioni Beancount.

ai
llm
automation
InvestorBench: Benchmarking di Agenti LLM nelle Decisioni di Trading Finanziario
·mike

InvestorBench: Benchmarking di Agenti LLM nelle Decisioni di Trading Finanziario

InvestorBench (ACL 2025) testa 13 modelli LLM backbone su trading backtestato di azioni, criptovalute ed ETF utilizzando il rendimento cumulativo e l'indice di Sharpe — non l'accuratezza nel rispondere a domande. Qwen2.5-72B è in cima alla classifica delle azioni con un CR del 46,15%; i modelli ottimizzati per la finanza falliscono con le azioni. La dimensione del modello predice le performance in modo più affidabile dell'ottimizzazione per dominio.

llm
ai
finance
LATS: Language Agent Tree Search — Integrazione di Ragionamento, Azione e Pianificazione in un unico Framework
·mike

LATS: Language Agent Tree Search — Integrazione di Ragionamento, Azione e Pianificazione in un unico Framework

LATS (Language Agent Tree Search, ICML 2024) integra ReAct, Tree of Thoughts e Reflexion in un unico framework MCTS, raggiungendo il 92,7% di pass@1 su HumanEval con GPT-4. Per le contabilità Beancount basate su Git, il requisito di ripristino dello stato che limita LATS in produzione è soddisfatto con estrema facilità.

ai
llm
machine-learning
Albero dei Pensieri: Risoluzione Deliberata di Problemi con Ricerca LLM
·mike

Albero dei Pensieri: Risoluzione Deliberata di Problemi con Ricerca LLM

L'Albero dei Pensieri (ToT) raggiunge il 74% nel gioco del 24 contro il 4% del GPT-4 CoT standard, organizzando il ragionamento LLM in un albero di ricerca ramificato con potatura e backtracking — con implicazioni dirette per la classificazione finanziaria multi-step e l'ottimizzazione fiscale nei flussi di lavoro Beancount.

ai
llm
machine-learning