Aller au contenu principal

Mike Thrift

Responsable marketing

GuardAgent : Application déterministe de la sécurité pour les agents LLM via l'exécution de code

GuardAgent (ICML 2025) place un agent LLM distinct entre un agent cible et son environnement, vérifiant chaque action proposée en générant et en exécutant du code Python — atteignant une précision d'application des politiques de 98,7 % tout en préservant 100 % de l'achèvement des tâches, contre 81 % de précision et 29 à 71 % d'échec des tâches pour les règles de sécurité intégrées au prompt.

Débat LLM multi-agents : Gains de précision réels, calcul incontrôlé et délire collectif

Une analyse approfondie de l'article de Du et al. (ICML 2024) sur le débat multi-agents — qui fait état de gains de précision de 14,8 points en arithmétique — accompagnée de réfutations de 2025 montrant que des agents uniques à budget équivalent égalent les performances de débat, et une analyse de la raison pour laquelle le Délire Collectif (65 % des échecs de débat) présente des risques spécifiques pour les validations de grands livres assistées par IA.

Les LLM ne sont pas utiles pour la prévision de séries temporelles : ce que NeurIPS 2024 signifie pour l'IA financière

Un article Spotlight de NeurIPS 2024 analyse par ablation trois méthodes de prévision de séries temporelles basées sur les LLM — OneFitsAll, Time-LLM et CALF — et constate que la suppression du modèle de langage améliore la précision dans la plupart des cas, avec une accélération de l'entraînement allant jusqu'à 1 383×. Pour les applications d'IA financière comme la prédiction de solde Beancount, les modèles légers dédiés surpassent systématiquement les LLM détournés de leur usage initial.

AuditCopilot : les LLM pour la détection de fraude en comptabilité en partie double

AuditCopilot applique des LLM open-source (Mistral-8B, Gemma, Llama-3.1) à la détection de fraude dans les écritures comptables d'entreprises, réduisant les faux positifs de 942 à 12 — mais l'ablation révèle que le LLM fonctionne principalement comme une couche de synthèse au-dessus des scores Isolation Forest, et non comme un détecteur d'anomalies indépendant.

Fine-Tuning vs RAG : Pourquoi la récupération l'emporte pour l'injection de nouvelles connaissances dans les LLM

Une comparaison empirique entre le RAG et l'ajustement fin non supervisé sur des LLM de 7 milliards de paramètres montre que le RAG atteint une précision de plus de 0,875 sur les faits postérieurs à la date de coupure, alors que l'ajustement fin plafonne à 0,504 — avec des implications directes pour la conception d'agents Beancount et tout système nécessitant des mises à jour fréquentes des connaissances.

IRCoT : Entrelacer la recherche d'information avec la chaîne de pensée pour les questions-réponses multi-étapes

IRCoT entrelace la recherche BM25 avec chaque étape d'une boucle de raisonnement par chaîne de pensée, obtenant un rappel de recherche de +11,3 et un score F1 de +7,1 sur HotpotQA par rapport au RAG en une étape — et démontre qu'un modèle de 3B peut surpasser GPT-3 175B lorsque la stratégie de recherche est adéquate.

FLARE : Génération augmentée par récupération active

FLARE (EMNLP 2023) améliore le RAG standard en déclenchant la récupération en cours de génération à l'aide de seuils de confiance de probabilité de jetons, atteignant 51,0 EM sur 2WikiMultihopQA contre 39,4 pour la récupération unique — mais les échecs de calibration dans les modèles de chat optimisés pour les instructions limitent sa fiabilité pour les agents financiers en production.

MultiHiertt : Évaluation du raisonnement numérique sur des tableaux financiers multi-hiérarchiques

MultiHiertt (ACL 2022) présente 10 440 paires de questions-réponses issues de rapports financiers réels comprenant en moyenne 3,89 tableaux hiérarchiques chacun ; les modèles de pointe obtiennent un score F1 de 38 % contre 87 % pour les humains, avec une pénalité de 15 points pour les questions multi-tableaux — quantifiant l'écart de récupération que l'IA financière doit combler.