
MemGPT: 92,5% viacsedeníová vybaviteľnosť oproti 32,1% základnej úrovni
MemGPT pamäťové vrstvy v štýle OS zvyšujú presnosť viacsedeníového chatu GPT-4 na 92,5% oproti 32,1% pri pevnom kontexte – potrebné pre viacročných ledger agentov.

MemGPT pamäťové vrstvy v štýle OS zvyšujú presnosť viacsedeníového chatu GPT-4 na 92,5% oproti 32,1% pri pevnom kontexte – potrebné pre viacročných ledger agentov.

SWE-agent (NeurIPS 2024) predstavuje rozhrania agent-počítač (ACI) — účelovo vytvorené vrstvy medzi LLM a softvérovými prostrediami — čím vykazuje 10,7-percentuálne zlepšenie oproti priamemu prístupu k shellu a 12,47 % úspešnosť riešenia v SWE-bench s GPT-4 Turbo. Dizajn rozhrania, nie schopnosti modelu, je primárnym úzkym hrdlom pre autonómne programovacie agenty.

SWE-bench vyhodnocuje jazykové modely na 2 294 skutočných problémoch GitHub-u v 12 repozitároch Pythonu pomocou testov založených na spustení; v čase publikácie Claude 2 vyriešil iba 1,96 % problémov s realistickým vyhľadávaním, čím vytvoril de facto benchmark pre kódovacích agentov a odhalil zlyhania pri vyhľadávaní a dĺžke opráv priamo relevantné pre write-back agentov Beancount.

CodeAct (ICML 2024) nahrádza volanie nástrojov cez JSON spustiteľným Python kódom, čím zvyšuje mieru úspešnosti agentov GPT-4 o približne 20 percentuálnych bodov pri úlohách s viacerými nástrojmi a znižuje počet interakčných kôl o 30 % — s priamymi dôsledkami pre budovanie spoľahlivých agentov na párovanie v Beancount.

Huang et al. (ICLR 2024): intrinsická samokorekcia znižuje GPT-4 z 95,5 % na 91,5 % v GSM8K — účtovné agenty potrebujú externé validátory, nie vlastnú revíziu.

Strom myšlienok (ToT) dosahuje 74 % v Hre 24 oproti 4 % pri štandardnom GPT-4 CoT organizovaním uvažovania LLM do rozvetveného vyhľadávacieho stromu s orezávaním a spätným vyhľadávaním — s priamymi dôsledkami pre viacstupňovú finančnú klasifikáciu a daňovú optimalizáciu v pracovných postupoch Beancount.

CRITIC (ICLR 2024) dosahuje zlepšenie F1 o 7,7 v QA s otvorenou doménou a 79,2 % zníženie toxicity tým, že revíziu LLM zakladá na signáloch z externých nástrojov – slučka verifikácie a následnej opravy, ktorá sa priamo vzťahuje na bezpečnosť zápisu pre finančných agentov v Beancount.

Reflexion (NeurIPS 2023) umožňuje LLM agentom zlepšovať sa ukladaním verbálnych analýz po zlyhaní do epizodickej vyrovnávacej pamäte – bez potreby aktualizácie váh. S GPT-4 dosahuje 91 % v HumanEval, ale zlyháva vo WebShop-e, čo odhaľuje štrukturálne obmedzenie: verbálne posilňovanie funguje len vtedy, keď evaluátor poskytuje jasný, akcieschopný signál. Tu je vysvetlenie, čo to znamená pre budovanie samoopravného agenta pre účtovnú knihu Beancount.

Sekvenčná konzistentnosť nahrádza greedy dekódovanie reťazca myšlienok väčšinovým hlasovaním cez N vzorkovaných ciest uvažovania — čím zvyšuje presnosť GPT-3 na GSM8K o 17,9 percentuálneho bodu bez dodatočného trénovania — a priamo sa aplikuje na viackrokové finančné výpočty, kde je jediné dekódovanie modelu nespoľahlivé.

PAL získava +38,1 pp oproti reťazcu myšlienok na GSM-hard spustením Pythonu pre aritmetiku – správne rozdelenie pre spoľahlivé výpočty v účtovníctve Beancount.

Štyri benchmarky z rokov 2024 – 2025 ukazujú, že GPT-4 dosahuje v reálnom odpovedaní na otázky k tabuľkám 42 % v porovnaní s 86 % u ľudí, pričom komplexné agregácie klesajú na 19,6 % – a natívna syntax Beancount sa nachádza na najhoršom konci hierarchie serializácie pre LLM vstupy.

Práca spoločnosti Anthropic o konštitučnej AI (Bai a kol., 2022) trénuje LLM modely na dodržiavanie pravidiel pomocou spätnej väzby generovanej AI namiesto ľudských označení škodlivosti. Tento výskumný denník skúma, ako sa proces kritiky, revízie a preferencií RLAIF prenáša na bezpečnosť zápisu pre autonómnych agentov účtovnej knihy Beancount — a ako vyzerá Goodhartov zákon, zlyhania kalibrácie a riziká dvojakého použitia, keď je „konštitúciou“ účtovná osnova namiesto súboru etických pravidiel.