Projetos atuais

SynSimba: base sintética brasileira compatível com o Simba

O Sistema de Investigação de Movimentações Bancárias (Simba) é uma infraestrutura estratégica para o recebimento, o processamento e a análise de dados bancários em procedimentos oficiais de afastamento de sigilo, sendo utilizado por órgãos como a Polícia Federal e o Ministério Público no combate à lavagem de dinheiro.

Entretanto, a sensibilidade e as restrições legais associadas às bases reais limitam seu uso em pesquisas acadêmicas, na reprodução de experimentos e na comparação de métodos computacionais. Além disso, as bases sintéticas públicas atualmente disponíveis refletem, em grande parte, contextos financeiros e regulatórios estrangeiros, reduzindo sua aderência à realidade brasileira.

Nesse contexto, o SynSimba propõe uma base sintética brasileira compatível com o leiaute Simba, combinando atividade transacional regular, fontes públicas nacionais e padrões suspeitos derivados de normativos de Prevenção à Lavagem de Dinheiro. A base permitirá ampliar a pesquisa em lavagem de dinheiro no Brasil, especialmente ao viabilizar o desenvolvimento, o treinamento e a avaliação de técnicas de inteligência artificial de estado da arte em um ambiente controlado, reproduzível e juridicamente seguro.

A arquitetura do projeto é organizada nas seguintes etapas:

  1. Geração sintética. Um motor de geração produz entidades, contas, instituições, transações e padrões controlados. O Tide é adotado como motor inicial, mantendo-se a possibilidade de integração futura de outros geradores. (van den Beukel et al., 2026).
  2. Adaptação ao contexto brasileiro. Normativos do Banco Central orientam o leiaute e os padrões suspeitos, enquanto fontes públicas nacionais parametrizam a atividade transacional regular. O leiaute adotado como referência é o definido pela Carta-Circular nº 3.454/2010 do Banco Central do Brasil (Banco Central do Brasil, 2010).
  3. Materialização no padrão Simba. Os dados sintéticos são convertidos para os arquivos TXT utilizados no ecossistema Simba, preservando o formato original de disponibilização e análise.
  4. Benchmark de modelos. A base sintética materializada é utilizada no treinamento, no teste e na comparação de modelos de detecção de atividades suspeitas. Em etapa complementar, os modelos serão avaliados em casos reais da Polícia Federal.
Pesquisadores: Dr. Lindeberg Leite · Prof. Felipe Campelo (University of Bristol) · Dr. Teofilo Emidio de Campos (Microsoft Applied Sciences Group) · Dr. Roberto Almino (Aston University) · Prof. Luis Rocha (Ghent University)

NL2Rules: de requisitos de validação em linguagem natural a regras executáveis

Muitas aplicações reais envolvem validação: documentos, registros ou outros artefatos precisam ser verificados contra regras descritas em requisitos, políticas, normas ou manuais. Automatizar essas verificações exige transformar regras escritas para interpretação humana em uma forma executável e consistente (Gupta & Sreenivasamurthy, 2026). Embora modelos de linguagem possam apoiar essa transformação, gerar diretamente a regra executável pode fazer com que uma interpretação incorreta do requisito seja incorporada ao resultado final (Tian et al., 2025).

O NL2Rules separa interpretação e execução. Primeiro, um modelo de linguagem transforma o requisito em uma representação estruturada, registrando condições, restrições e exceções. Depois, um componente determinístico converte essa representação em regras executáveis. Essa estratégia se baseia em trabalhos que empregam representações intermediárias antes da geração do artefato final (Mordechai et al., 2024;).

Na validação, o item analisado é representado de forma estruturada e verificado contra as regras produzidas. O resultado registra quais regras foram aplicadas e quais informações sustentaram a conclusão, favorecendo confiabilidade e rastreabilidade.

A abordagem do projeto é organizada nas seguintes etapas:

  1. Interpretação dos requisitos. O modelo identifica condições, restrições e exceções presentes no texto.
  2. Representação estruturada. As informações extraídas são organizadas em um formato intermediário padronizado.
  3. Geração determinística das regras. Um componente determinístico converte essa representação em regras executáveis.
  4. Validação e rastreabilidade. As regras são aplicadas aos dados do item avaliado, registrando resultado e evidências.
  5. Avaliação experimental. O método é comparado com a geração direta de regras por modelos de linguagem.
Pesquisador: Dr. Lindeberg Leite