
DIN-SQL: GPT-4 salta de 67,4%→85,3% EX no Spider
O DIN-SQL eleva o GPT-4 de 67,4% para 85,3% de precisão de execução no Spider por meio de etapas de schema-link e autocorreção — a mesma decomposição se aplica ao BQL do Beancount.

O DIN-SQL eleva o GPT-4 de 67,4% para 85,3% de precisão de execução no Spider por meio de etapas de schema-link e autocorreção — a mesma decomposição se aplica ao BQL do Beancount.

No BIRD, o GPT-4 atinge 54.89% de precisão de execução com dicas de domínio e 34.88% sem—uma diferença de 20 pontos que qualquer interface Beancount NL→BQL precisa superar.

Pesquisadores da CMU e NC State propõem o uso da Análise de Processos Teórico-Sistêmica (STPA) e um Protocolo de Contexto de Modelo aprimorado por recursos para derivar especificações formais de segurança para o uso de ferramentas por agentes de LLM, com verificação baseada em Alloy demonstrando a ausência de fluxos inseguros em um estudo de caso de agendamento de calendário.

O GraphRAG da Microsoft registra vitórias de 72–83% em sensemaking sobre RAG vetorial; uma auditoria de 2025 as derruba após corrigir o viés do juiz—cautela para QA em livros-razão multi-documento.

O FinAuditing testa 13 LLMs zero-shot em 1.102 instâncias reais de arquivamentos SEC XBRL; as pontuações máximas são de 13,86% na verificação matemática financeira e 12,42% na recuperação de conceitos — resultados que limitam diretamente o que as ferramentas de contabilidade de IA podem ser confiáveis para automatizar sem ferramentas externas.

InvestorBench: Qwen2.5-72B lidera negociação de ações com CR de 46,15%; Palmyra-Fin ajustada para finanças falha em ações—tamanho supera ajuste fino de domínio.

O StructRAG (ICLR 2025) roteia cada consulta para um tipo de estrutura apropriado para a tarefa — tabela, grafo, catálogo, algoritmo ou bloco — antes do raciocínio, pontuando 28 pontos a mais que o GraphRAG no benchmark Loong, enquanto roda 22 vezes mais rápido, com o roteador treinado via DPO sozinho sendo responsável por um ganho de 15 pontos na precisão.

Com orçamentos iguais de tokens de raciocínio, LLMs de agente único igualam ou superam sistemas multiagentes em raciocínio multi-hop—favorecendo designs de agentes financeiros mais simples.

O M3MAD-Bench testa o estresse do Debate Multi-Agente em 9 modelos, 5 domínios e configurações de visão-linguagem, revelando que o Delírio Coletivo causa 65% das falhas, o debate adversarial reduz a precisão em até 12,8% e a Self-Consistency geralmente iguala a precisão do debate com um custo de tokens menor.

O AGrail (ACL 2025) apresenta um trilho de segurança cooperativo de dois LLMs que adapta verificações de segurança no momento da inferência via adaptação em tempo de teste, alcançando 0% de taxa de sucesso em ataques de injeção de prompt e 95,6% de preservação de ações benignas no Safe-OS — em comparação com o GuardAgent e o LLaMA-Guard, que bloqueiam até 49,2% das ações legítimas.

O ShieldAgent (ICML 2025) substitui os guardrails baseados em LLM por circuitos de regras probabilísticas construídos em Redes Lógicas de Markov, alcançando 90,4% de precisão em ataques de agentes com 64,7% menos chamadas de API — e o que isso significa para a segurança verificável em sistemas de IA financeira.

O Atlas (JMLR 2023) atinge 42,4% de precisão no Natural Questions com apenas 64 exemplos de treinamento — superando o PaLM 540B por 3 pontos usando 11B de parâmetros — através do pré-treinamento conjunto de um recuperador denso baseado em Contriever com um leitor Fusion-in-Decoder baseado em T5. A análise cobre os limites de precisão da recuperação, custos de infraestrutura de um índice de 587 GB e implicações para sistemas de QA para livros razão Beancount.