Saltar al contenido principal

#open-source

Open Source

Open-source tools, frameworks, and research artifacts for financial AI

4 publicacionesVer todas las etiquetas
OpenHands: Plataforma abierta para agentes de software de IA y lo que significa para la automatización financiera
·mike

OpenHands: Plataforma abierta para agentes de software de IA y lo que significa para la automatización financiera

OpenHands es una plataforma de agentes con licencia MIT y entorno de pruebas Docker donde CodeAct logra un 26% en SWE-Bench Lite — un benchmark revelador que establece lo que los agentes de IA pueden hacer de manera confiable hoy en día, y por qué los primeros despliegues financieros productivos deben tener un alcance limitado en lugar de ser autónomos.

ai
open-source
automation
WebArena: El benchmark de 812 tareas que mide lo que los agentes web realmente pueden y no pueden hacer
·mike

WebArena: El benchmark de 812 tareas que mide lo que los agentes web realmente pueden y no pueden hacer

GPT-4 completa solo el 14,41% de las 812 tareas web realistas de WebArena, mientras que los humanos alcanzan el 78,24%; el modo de fallo dominante es la falsa inviabilidad (un rechazo conservador a actuar), con implicaciones directas para cualquier agente que opere Fava o interfaces web financieras.

ai
llm
automation
TableLlama: ¿Puede un modelo abierto de 7B igualar a GPT-4 en la comprensión de tablas?
·mike

TableLlama: ¿Puede un modelo abierto de 7B igualar a GPT-4 en la comprensión de tablas?

TableLlama ajusta Llama 2 (7B) con 2,6 millones de ejemplos de tareas de tablas y supera a GPT-4 en tareas estructurales como la anotación de tipos de columnas (F1 94 vs 32), pero queda 33 puntos por debajo en el razonamiento compositivo de WikiTQ; un referente calibrado de lo que los modelos abiertos de 7B pueden y no pueden hacer hoy en la IA financiera.

llm
ai
machine-learning
SWE-agent: Cómo el diseño de interfaces desbloquea la ingeniería de software automatizada
·mike

SWE-agent: Cómo el diseño de interfaces desbloquea la ingeniería de software automatizada

SWE-agent (NeurIPS 2024) introduce las Interfaces Agente-Computadora (ACI) —capas diseñadas específicamente entre los LLM y los entornos de software— mostrando una mejora de 10.7 puntos porcentuales sobre el acceso directo a la shell y una resolución del 12.47% en SWE-bench con GPT-4 Turbo. El diseño de la interfaz, no la capacidad del modelo, es el principal cuello de botella para los agentes de codificación autónomos.

ai
llm
automation