Salta al contingut principal

Mike Thrift

Responsable de màrqueting

SWE-agent: Com el disseny d'interfícies desbloqueja l'enginyeria de programari automatitzada

SWE-agent (NeurIPS 2024) introdueix les interfícies agent-ordinador (ACI) —capes creades específicament entre els LLM i els entorns de programari—, mostrant una millora de 10,7 punts percentuals respecte a l'accés directe a la shell i una resolució del 12,47% a SWE-bench amb GPT-4 Turbo. El disseny de la interfície, i no la capacitat del model, és el principal coll d'ampolla per als agents de programació autònoms.

SWE-bench: Poden els models de llenguatge resoldre problemes reals de GitHub?

SWE-bench avalua els models de llenguatge en 2.294 problemes reals de GitHub en 12 repositoris de Python mitjançant proves basades en l'execució; en el moment de la publicació, Claude 2 va resoldre només l'1,96% dels problemes amb una recuperació realista, establint el referent de facto per als agents de codificació i revelant modes d'error de recuperació i longitud de pegats directament rellevants per als agents d'escriptura de Beancount.

Reflexion: Agents de llenguatge que aprenen dels errors sense reentrenament

Reflexion (NeurIPS 2023) permet que els agents LLM millorin emmagatzemant autòpsies verbals en un buffer episòdic — sense necessitat d'actualitzar els pesos. Arriba al 91% a HumanEval amb GPT-4 però falla a WebShop, revelant una restricció estructural: el reforç verbal només funciona quan l'avaluador produeix un senyal clar i executable. Aquí expliquem què significa això per construir un agent de llibre major de Beancount que s'autocorregeixi.

Auto-consistència: el mostreig per vot majoritari millora la precisió de la cadena de pensament

L'auto-consistència substitueix la decodificació greedy de cadena de pensament per un vot majoritari sobre N camins de raonament mostrejats — augmentant la precisió de GPT-3 a GSM8K en 17,9 punts percentuals sense entrenament addicional — i s'aplica directament a càlculs financers de diversos passos on una única decodificació del model no és fiable.

Poden els LLM raonar sobre dades tabulars? El que quatre bancs de proves ens diuen sobre la IA financera

Quatre bancs de proves de 2024–2025 mostren que el GPT-4 obté una puntuació del 42% en preguntes i respostes sobre taules reals en comparació amb el 86% dels humans, amb agregacions complexes que cauen fins al 19,6%, i la sintaxi nativa de Beancount se situa en l'extrem amb pitjor rendiment de la jerarquia de serialització per a l'entrada de LLM.

IA constitucional per a agents comptables: RLAIF, regles de política i riscos de Goodharting

L'article sobre IA constitucional d'Anthropic (Bai et al., 2022) entrena LLMs per seguir regles mitjançant retroalimentació generada per IA en lloc d'etiquetes de dany humanes. Aquest registre d'investigació examina com el pipeline de crítica-revisió-preferència de RLAIF s'aplica a la seguretat de reescriptura per a agents autònoms de llibres majors de Beancount, i com es veuen el Goodharting, els errors de calibratge i els riscos de doble ús quan la «constitució» és un pla de comptes en lloc d'un conjunt de regles ètiques.