Preskočiť na hlavný obsah

Výskumný denník

Otvorené experimenty a zistenia z Bean Labs — výskumnej iniciatívy Finance AI Agent od Beancount.io.

Overiteľne bezpečné používanie nástrojov pre LLM agentov: STPA sa stretáva s MCP

Výskumníci z CMU a NC State navrhujú využitie systémovo-teoretickej analýzy procesov (STPA) a rozšíreného protokolu Model Context Protocol na odvodenie formálnych bezpečnostných špecifikácií pre používanie nástrojov LLM agentmi, pričom verifikácia založená na nástroji Alloy demonštruje absenciu nebezpečných tokov v prípadovej štúdii plánovania kalendára.

GraphRAG: Od lokálnej po globálnu sumarizáciu zameranú na dopyty

GraphRAG od Microsoftu buduje graf entít rozdelený podľa Leidenského algoritmu nad textovým korpusom a vopred vypočítava súhrny komunít pre zodpovedanie globálnych otázok o zmysle údajov, ktoré štandardný vektorový RAG nezvláda – audit skreslenia z roku 2025 však ukazuje, že jeho 72 – 83 % miera víťazstiev kolabuje po oprave artefaktov pozície a dĺžky pri vyhodnocovaní pomocou LLM ako sudcu.

InvestorBench: Benchmarking LLM agentov pri rozhodovaní o finančnom obchodovaní

InvestorBench (ACL 2025) testuje 13 základných LLM modelov na spätne testovanom obchodovaní s akciami, kryptomenami a ETF pomocou kumulatívneho výnosu a Sharpeho pomeru – nie presnosti otázok a odpovedí. Qwen2.5-72B vedie v rebríčku akcií s 46,15 % CR; modely vyladené pre financie pri akciách zlyhávajú. Veľkosť modelu predpovedá výkon spoľahlivejšie než doménové jemné doladenie.

StructRAG (ICLR 2025): Výber správnej štruktúry dokumentu poráža GraphRAG o 28 bodov

StructRAG (ICLR 2025) smeruje každý dopyt na typ štruktúry vhodný pre danú úlohu — tabuľku, graf, katalóg, algoritmus alebo fragment — pred samotným uvažovaním, pričom v benchmarku Loong dosahuje o 28 bodov vyššie skóre ako GraphRAG a beží 22-krát rýchlejšie, pričom samotný router vytrénovaný pomocou DPO predstavuje nárast presnosti o 15 bodov.

Atlas: Spoločný tréning retrievera a readera prekonáva 540B-parametrové LLM modely s 11B parametrami

Atlas (JMLR 2023) dosahuje presnosť 42,4 % v rámci Natural Questions len so 64 tréningovými príkladmi – čím prekonáva PaLM 540B o 3 body pri použití 11 miliárd parametrov – a to vďaka spoločnému predtrénovaniu hustého retrievera na báze modelu Contriever s readerom T5 Fusion-in-Decoder. Analýza pokrýva limity presnosti vyhľadávania, náklady na infraštruktúru indexu s veľkosťou 587 GB a dôsledky pre systémy odpovedania na otázky nad hlavnou knihou Beancount.