Aller au contenu principal

Mike Thrift

Responsable marketing

SWE-agent : comment la conception d'interface libère l'ingénierie logicielle automatisée

SWE-agent (NeurIPS 2024) introduit les interfaces agent-ordinateur (ACI) — des couches logicielles conçues sur mesure entre les LLMs et les environnements de développement — montrant une amélioration de 10,7 points de pourcentage par rapport à l'accès shell brut et une résolution de 12,47 % sur SWE-bench avec GPT-4 Turbo. La conception de l'interface, et non la capacité du modèle, est le principal goulot d'étranglement pour les agents de codage autonomes.

SWE-bench : Les modèles de langage peuvent-ils résoudre des problèmes GitHub réels ?

SWE-bench évalue les modèles de langage sur 2 294 problèmes GitHub réels répartis dans 12 dépôts Python à l'aide de tests basés sur l'exécution ; lors de la publication, Claude 2 n'a résolu que 1,96 % des problèmes avec une recherche réaliste, établissant la référence de facto pour les agents de codage et révélant des modes d'échec de recherche et de longueur de correctif directement pertinents pour les agents d'écriture Beancount.

Arbre de pensées : Résolution délibérée de problèmes avec la recherche LLM

Tree of Thoughts (ToT) atteint un taux de réussite de 74 % sur le Jeu de 24, contre 4 % pour le CoT standard de GPT-4, en organisant le raisonnement du LLM en un arbre de recherche ramifié avec élagage et retour en arrière — avec des implications directes pour la classification financière multi-étapes et l'optimisation fiscale dans les flux de travail Beancount.

Reflexion : Des agents de langage qui apprennent de leurs erreurs sans réentraînement

Reflexion (NeurIPS 2023) permet aux agents LLM de s'améliorer en stockant des analyses post-mortem verbales dans un tampon épisodique — sans mise à jour des poids. Il atteint 91 % sur HumanEval avec GPT-4 mais échoue sur WebShop, révélant une contrainte structurelle : le renforcement verbal ne fonctionne que lorsque l'évaluateur produit un signal clair et exploitable. Voici ce que cela signifie pour la création d'un agent de grand livre Beancount autocorrecteur.

Auto-cohérence : l'échantillonnage par vote majoritaire améliore la précision du raisonnement en chaîne de pensée

L'auto-cohérence remplace le décodage glouton en chaîne de pensée par un vote majoritaire sur N chemins de raisonnement échantillonnés — améliorant la précision de GPT-3 sur GSM8K de 17,9 points de pourcentage sans entraînement supplémentaire — et s'applique directement aux calculs financiers multi-étapes où un décodage unique du modèle n'est pas fiable.

IA constitutionnelle pour les agents comptables : RLAIF, règles de politique et risques de Goodharting

L'article d'Anthropic sur l'IA constitutionnelle (Bai et al., 2022) forme les LLM à suivre des règles en utilisant des retours générés par l'IA plutôt que des étiquettes de préjudice humain. Ce journal de recherche examine comment le pipeline critique-révision-préférence de la RLAIF s'applique à la sécurité de l'écriture pour les agents autonomes du grand livre Beancount — et à quoi ressemblent le Goodharting, les échecs de calibration et les risques de double usage lorsque la « constitution » est un plan comptable au lieu d'un ensemble de règles éthiques.