
DIN-SQL: GPT-4 skočí z 67,4% na 85,3% EX na Spideri
DIN-SQL posúva GPT-4 z 67,4% na 85,3% presnosti vykonávania na Spideri cez fázy schema-link a self-correct — rovnaký rozklad sa hodí aj na Beancount BQL.

DIN-SQL posúva GPT-4 z 67,4% na 85,3% presnosti vykonávania na Spideri cez fázy schema-link a self-correct — rovnaký rozklad sa hodí aj na Beancount BQL.

Na BIRD dosahuje GPT-4 presnosť vykonávania 54,89 % s doménovými nápoveďami a 34,88 % bez nich – rozdiel 20 bodov, ktorý musí každé rozhranie NL→BQL v Beancount preklenúť.

Výskumníci z CMU a NC State navrhujú využitie systémovo-teoretickej analýzy procesov (STPA) a rozšíreného protokolu Model Context Protocol na odvodenie formálnych bezpečnostných špecifikácií pre používanie nástrojov LLM agentmi, pričom verifikácia založená na nástroji Alloy demonštruje absenciu nebezpečných tokov v prípadovej štúdii plánovania kalendára.

GraphRAG od Microsoftu hlási 72–83% výhier v porozumení nad vektorovým RAG; audit z roku 2025 ich po oprave zaujatosti sudcu znižuje – varovanie pre QA vo viacdokumentových účtovných knihách.

FinAuditing testuje 13 LLM modelov metódou zero-shot na 1 102 reálnych prípadoch podaní SEC XBRL; najlepšie výsledky sú 13,86 % pri overovaní finančnej matematiky a 12,42 % pri vyhľadávaní konceptov – výsledky, ktoré priamo vymedzujú, do akej miery možno dôverovať automatizácii nástrojov AI účtovníctva bez externých nástrojov.

InvestorBench: Qwen2.5-72B vedie obchodovanie s akciami s 46,15% CR; finančne vyladený Palmyra-Fin zlyháva na akciách – veľkosť prekonáva doménové doladenie.

StructRAG (ICLR 2025) smeruje každý dopyt na typ štruktúry vhodný pre danú úlohu — tabuľku, graf, katalóg, algoritmus alebo fragment — pred samotným uvažovaním, pričom v benchmarku Loong dosahuje o 28 bodov vyššie skóre ako GraphRAG a beží 22-krát rýchlejšie, pričom samotný router vytrénovaný pomocou DPO predstavuje nárast presnosti o 15 bodov.

Pri rovnakých rozpočtoch myšlienkových tokenov dosahujú single-agent LLM rovnaké alebo lepšie výsledky ako multi-agent systémy pri viacstupňovom uvažovaní — uprednostnite jednoduchšie návrhy finančných agentov.

M3MAD-Bench záťažovo testuje debatu viacerých agentov na 9 modeloch, 5 doménach a v prostrediach obraz-jazyk. Zisťuje, že kolektívna ilúzia spôsobuje 65 % zlyhaní, adverziálna debata znižuje presnosť až o 12,8 % a Self-Consistency zvyčajne dosahuje rovnakú presnosť ako debata pri nižších nákladoch na tokeny.

AGrail (ACL 2025) predstavuje kooperatívny mantinel s dvoma LLM, ktorý adaptuje bezpečnostné kontroly v čase inferencie pomocou adaptácie v čase testovania (TTA). Dosahuje 0 % úspešnosť útokov typu prompt injection a 95,6 % zachovanie legitímnych akcií na Safe-OS — v porovnaní s GuardAgent a LLaMA-Guard, ktoré blokujú až 49,2 % legitímnych akcií.

ShieldAgent (ICML 2025) nahrádza mantinely založené na LLM pravdepodobnostnými obvodmi pravidiel postavenými na Markovových logických sieťach, čím dosahuje presnosť 90,4 % pri útokoch na agentov so 64,7 % menej volaniami API — a čo to znamená pre overiteľnú bezpečnosť vo finančných AI systémoch.

Atlas (JMLR 2023) dosahuje presnosť 42,4 % v rámci Natural Questions len so 64 tréningovými príkladmi – čím prekonáva PaLM 540B o 3 body pri použití 11 miliárd parametrov – a to vďaka spoločnému predtrénovaniu hustého retrievera na báze modelu Contriever s readerom T5 Fusion-in-Decoder. Analýza pokrýva limity presnosti vyhľadávania, náklady na infraštruktúru indexu s veľkosťou 587 GB a dôsledky pre systémy odpovedania na otázky nad hlavnou knihou Beancount.