Перейти до основного вмісту

#reconciliation

Звірка

Автоматизована звірка журналу за допомогою агентів мовних моделей

FinMCP-Bench: Бенчмаркінг агентів LLM для реального використання фінансових інструментів під управлінням MCP

FinMCP-Bench оцінює найкращу з шести LLM лише в 3,08% точного збігу на 613 реальних фінансових задачах MCP — 20-кратний обвал від одного інструмента до багатокроковості.

Знайдено посередині: Калібрування позиційного зміщення уваги покращує RAG з довгим контекстом

Віднімання позиційного зсуву з ваг уваги LLM повертає до 15 пунктів точності RAG, коли доказ лежить у середині контексту, допомагаючи конвеєрам фінансових агентів.

Voyager: бібліотеки навичок відкривають у 3,3 раза більше предметів

Постійна бібліотека коду навичок Voyager виявляє у 3,3 раза більше предметів Minecraft, ніж попередні SOTA без тонкого налаштування—це реєстр патернів повторного використання, необхідний агентам обліку.