Перейти до основного вмісту
Beancount.io Logo

#fintech

Fintech

Financial technology research, platforms, and infrastructure for modern accounting systems

FinMCP-Bench: Бенчмаркінг агентів LLM для реального використання фінансових інструментів під управлінням MCP
·mike

FinMCP-Bench: Бенчмаркінг агентів LLM для реального використання фінансових інструментів під управлінням MCP

FinMCP-Bench оцінює шість моделей LLM на 613 реальних завданнях з використання фінансових інструментів на базі 65 серверів MCP — найкраща модель отримує 3,08% точних збігів у багатоходових завданнях, демонструючи 20-кратне падіння продуктивності при переході від одноінструментальних до багатоходових сценаріїв.

ai
llm
automation
FinTrace: оцінка виклику інструментів LLM для фінансових завдань на рівні траєкторії
·mike

FinTrace: оцінка виклику інструментів LLM для фінансових завдань на рівні траєкторії

FinTrace тестує 13 LLM на 800 анотованих експертами траєкторіях фінансових завдань за 9 метриками, виявивши, що передові моделі демонструють якісний вибір інструментів (F1 ~0,9), але отримують лише 3,23/5 за використання інформації — етап, на якому агенти аналізують результати роботи інструментів.

llm
ai
finance
FinToolBench: Оцінювання LLM-агентів на основі реального використання фінансових інструментів
·mike

FinToolBench: Оцінювання LLM-агентів на основі реального використання фінансових інструментів

FinToolBench поєднує 760 реальних фінансових API-інструментів із 295 виконуваними завданнями для тестування LLM-агентів на реальних фінансових задачах — виявивши, що консервативна частота викликів GPT-4o у 22,7% забезпечує вищу якість відповідей (CSS 0,670), ніж агресивна TIR Qwen3-8B у 87,1%, тоді як рівень невідповідності намірів перевищує 50% у всіх протестованих моделях.

ai
llm
automation
BloombergGPT та межі вузькоспеціалізованих LLM у фінансах
·mike

BloombergGPT та межі вузькоспеціалізованих LLM у фінансах

Bloomberg навчила LLM з 50 млрд параметрів на 569 млрд токенів фінансових даних і перевершила загальні моделі в бенчмарках аналізу настроїв та міркувань на основі таблиць — проте GPT-4 наздогнала її без жодного спеціалізованого фінансового донавчання. Що цей експеримент вартістю 10 млн доларів відкриває про компроміси претренінгу в конкретних доменах, токенізацію чисел та чому використання інструментів надійніше за внутрішню логіку моделі для бухгалтерських агентів.

llm
ai
machine-learning