Към основното съдържание

Mike Thrift

Маркетинг мениджър

SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

SWE-bench evaluates language models on 2,294 real GitHub issues across 12 Python repositories using execution-based tests; at publication, Claude 2 resolved only 1.96% of issues with realistic retrieval, establishing the de facto benchmark for coding agents and revealing retrieval and patch-length failure modes directly relevant to Beancount write-back agents.

Рефлексия: Езикови агенти, които се учат от грешки без преобучване

Рефлексия (NeurIPS 2023) позволява на LLM агентите да се усъвършенстват, като съхраняват вербални постмортем анализи в епизодичен буфер — без актуализации на теглата. Достига 91% на HumanEval с GPT-4, но се проваля на WebShop, разкривайки структурно ограничение: вербалното подкрепление работи само когато оценителят произвежда ясен и действен сигнал. Ето какво означава това за изграждането на самокоригиращ се Beancount агент за водене на сметки.

Самосъгласуваност: Извадково гласуване с мнозинство подобрява точността на веригата на мисълта

Самосъгласуваността заменя алчното декодиране по верига на мисълта с гласуване с мнозинство по N извадкови пътища на разсъждение — повишавайки точността на GPT-3 по GSM8K с 17,9 процентни пункта без допълнително обучение — и се прилага директно към многостъпкови финансови изчисления, където единично моделно декодиране е ненадеждно.

PAL: +38pp при тежка математика чрез прехвърляне на аритметиката към Python

PAL постига +38.1pp над веригата на разсъждение при GSM-hard, като изпълнява аритметиката чрез Python — правилното разделение за надеждни изчисления в Beancount счетоводната книга.

Могат ли LLM да разсъждават върху таблични данни? Какво ни казват четири бенчмарка за финансовия ИИ

Четири бенчмарка от 2024–2025 г. показват, че GPT-4 постига 42% при отговаряне на въпроси от реални таблици срещу 86% за хората, като сложните агрегации се сриват до 19,6% — а родният синтаксис на Beancount се намира в най-неефективния край на йерархията за сериализация при LLM вход.

Конституционен ИИ за счетоводни агенти: RLAIF, правила за политиките и рискове от Гудхартинг

Документът на Anthropic за конституционен ИИ (Bai et al., 2022) обучава LLM да следват правила, използвайки генерирана от ИИ обратна връзка, вместо човешки етикети за вреда. Този изследователски запис разглежда как RLAIF тръбопроводът критика-преразглеждане-предпочитание се пренася върху безопасността при запис за автономни Beancount ledger агенти — и как изглеждат Гудхартингът, калибрационните грешки и рисковете от двойна употреба, когато „конституцията“ е сметкоплан вместо етичен набор от правила.