Projetos atuais
SynSimba: base sintética brasileira compatível com o Simba
O Sistema de Investigação de Movimentações Bancárias (Simba) é uma infraestrutura estratégica para o recebimento, o processamento e a análise de dados bancários em procedimentos oficiais de afastamento de sigilo, sendo utilizado por órgãos como a Polícia Federal e o Ministério Público no combate à lavagem de dinheiro.
Entretanto, a sensibilidade e as restrições legais associadas às bases reais limitam seu uso em pesquisas acadêmicas, na reprodução de experimentos e na comparação de métodos computacionais. Além disso, as bases sintéticas públicas atualmente disponíveis refletem, em grande parte, contextos financeiros e regulatórios estrangeiros, reduzindo sua aderência à realidade brasileira.
Nesse contexto, o SynSimba propõe uma base sintética brasileira compatível com o leiaute Simba, combinando atividade transacional regular, fontes públicas nacionais e padrões suspeitos derivados de normativos de Prevenção à Lavagem de Dinheiro. A base permitirá ampliar a pesquisa em lavagem de dinheiro no Brasil, especialmente ao viabilizar o desenvolvimento, o treinamento e a avaliação de técnicas de inteligência artificial de estado da arte em um ambiente controlado, reproduzível e juridicamente seguro.
A arquitetura do projeto é organizada nas seguintes etapas:
- Geração sintética. Um motor de geração produz entidades, contas, instituições, transações e padrões controlados. O Tide é adotado como motor inicial, mantendo-se a possibilidade de integração futura de outros geradores. (van den Beukel et al., 2026).
- Adaptação ao contexto brasileiro. Normativos do Banco Central orientam o leiaute e os padrões suspeitos, enquanto fontes públicas nacionais parametrizam a atividade transacional regular. O leiaute adotado como referência é o definido pela Carta-Circular nº 3.454/2010 do Banco Central do Brasil (Banco Central do Brasil, 2010).
- Materialização no padrão Simba. Os dados sintéticos são convertidos para os arquivos TXT utilizados no ecossistema Simba, preservando o formato original de disponibilização e análise.
- Benchmark de modelos. A base sintética materializada é utilizada no treinamento, no teste e na comparação de modelos de detecção de atividades suspeitas. Em etapa complementar, os modelos serão avaliados em casos reais da Polícia Federal.
NL2Rules: de requisitos de validação em linguagem natural a regras executáveis
Muitas aplicações reais envolvem validação: documentos, registros ou outros artefatos precisam ser verificados contra regras descritas em requisitos, políticas, normas ou manuais. Automatizar essas verificações exige transformar regras escritas para interpretação humana em uma forma executável e consistente (Gupta & Sreenivasamurthy, 2026). Embora modelos de linguagem possam apoiar essa transformação, gerar diretamente a regra executável pode fazer com que uma interpretação incorreta do requisito seja incorporada ao resultado final (Tian et al., 2025).
O NL2Rules separa interpretação e execução. Primeiro, um modelo de linguagem transforma o requisito em uma representação estruturada, registrando condições, restrições e exceções. Depois, um componente determinístico converte essa representação em regras executáveis. Essa estratégia se baseia em trabalhos que empregam representações intermediárias antes da geração do artefato final (Mordechai et al., 2024;).
Na validação, o item analisado é representado de forma estruturada e verificado contra as regras produzidas. O resultado registra quais regras foram aplicadas e quais informações sustentaram a conclusão, favorecendo confiabilidade e rastreabilidade.
A abordagem do projeto é organizada nas seguintes etapas:
- Interpretação dos requisitos. O modelo identifica condições, restrições e exceções presentes no texto.
- Representação estruturada. As informações extraídas são organizadas em um formato intermediário padronizado.
- Geração determinística das regras. Um componente determinístico converte essa representação em regras executáveis.
- Validação e rastreabilidade. As regras são aplicadas aos dados do item avaliado, registrando resultado e evidências.
- Avaliação experimental. O método é comparado com a geração direta de regras por modelos de linguagem.