Salta al contingut principal

Mike Thrift

Marketing Manager

GraphRAG: De la resumització local a la global centrada en consultes

El GraphRAG de Microsoft construeix un graf d'entitats particionat per Leiden sobre un corpus de text i precalcula resums de comunitats per respondre preguntes de comprensió global que el RAG vectorial estàndard no pot gestionar — però una auditoria de biaix del 2025 mostra que les seves taxes de victòria del 72–83% col·lapsen després de corregir els artefactes de posició i longitud en l'avaluació de LLM com a jutge.

InvestorBench: Avaluació comparativa d'agents LLM en decisions de compravenda financera

InvestorBench (ACL 2025) avalua 13 backbones de LLM en la compravenda retroactiva d'accions, criptomonedes i ETF utilitzant el rendiment acumulat i la ràtio de Sharpe — no la precisió de les respostes. Qwen2.5-72B lidera la classificació d'accions amb un 46,15% de CR; els models ajustats per a finances fracassen en les accions. La mida del model prediu el rendiment amb més fiabilitat que l'ajust d'especialització de domini.

Els LLM d'agent únic superen els sistemes multi-agent en el raonament de múltiples salts sota pressupostos iguals de tòquens de pensament

Un preprint de Stanford de 2026 iguala els pressupostos de tòquens de pensament en cinc arquitectures multi-agent i descobreix que els LLM d'agent únic igualen o superen els sistemes multi-agent en el raonament de múltiples salts, amb base teòrica en la Desigualtat de Processament de Dades i implicacions per al disseny d'agents d'IA financera.

AGrail: Guardrails de seguretat adaptatius per a agents LLM que aprenen a través de tasques

AGrail (ACL 2025) introdueix un guardrail cooperatiu de dos LLM que adapta les comprovacions de seguretat en temps d'inferència mitjançant l'adaptació en temps de prova, aconseguint un 0% d'èxit en atacs d'injecció de prompts i un 95,6% de preservació d'accions benignes a Safe-OS — en comparació amb GuardAgent i LLaMA-Guard que bloquegen fins al 49,2% de les accions legítimes.

Atlas: El pre-entrenament conjunt de recuperador i lector supera els LLM de 540 mil milions de paràmetres amb 11 mil milions de paràmetres

Atlas (JMLR 2023) aconsegueix una precisió del 42,4% en Natural Questions amb només 64 exemples d'entrenament, superant PaLM 540B per 3 punts utilitzant 11 mil milions de paràmetres, mitjançant el pre-entrenament conjunt d'un recuperador dens basat en Contriever amb un lector T5 Fusion-in-Decoder. L'anàlisi cobreix els límits de la precisió de recuperació, els costos d'infraestructura d'índex de 587 GB i les implicacions per als sistemes de preguntes i respostes de llibres majors de Beancount.

Fusion-in-Decoder: Com la recuperació de múltiples fragments millora les preguntes i respostes generatives

L'arquitectura FiD d'Izacard i Grave codifica independentment els fragments recuperats i després els fusiona en el descodificador, superant RAG-Sequence entre 4 i 11 punts en NQ i TriviaQA. Aquest article examina el disseny i les seves implicacions per a les consultes sobre llibres majors de Beancount, on la síntesi de múltiples entrades entre transaccions és la norma.