← Voltar ao blog

Dados Sintéticos no Brasil: o que são, por que importam, como usar

·16 min de leitura

Dados sintéticos são o futuro da engenharia de dados no Brasil. AWS, Microsoft Azure e Snowflake já posicionam "dados sintéticos" como categoria estratégica em seus anúncios de roadmap. Data scientists em startups de IA estão usando sintéticos para treinar modelos sem depender de aprovação de compliance. Times de QA em grandes corporações adotam dados sintéticos para eliminar gargalos de preparação de ambiente. Neste guia você aprende o que são, por que o mercado BR adota devagar, e como começar hoje mesmo com segurança jurídica e qualidade técnica.

TL;DR

  • • Dados sintéticos são informações geradas por algoritmo que nunca foram pessoais
  • • Fora do escopo LGPD por definição — use à vontade em dev, teste e ML
  • • 3 técnicas que NÃO são dados sintéticos: anonimização fraca, pseudonimização, "mascaramento" de produção

Seção 1: O que são dados sintéticos (sem jargão)

Definição simples: Dados sintéticos são números, textos, datas e outros valores gerados por algoritmo, que nunca existiram como referência a uma pessoa ou organização real.

Diferente de anonimização (remover referência de dados reais) ou pseudonimização (substituir por hash), dados sintéticos nascerão do zero. Você pega um gerador, diz "crie 1000 CPFs válidos", recebe 1000 CPFs que passam em validação mod-11 da Receita Federal, mas nenhum deles corresponde a ninguém real.

AWS define: "Synthetic data is data that is artificially manufactured rather than produced by real-world events." Microsoft chama: "Synthetic data generation uses artificial or simulated data instead of real data." Ambos nomeiam como categoria estratégica porque o problema é real: treinar IA, testar software, prototipar features — tudo sem risco de privacidade.

Exemplos de dados sintéticos

  • CPF "123.456.789-09" (válido por mod-11, mas inexistente)
  • Email "joao.silva.123456789@outlook.com" (formato real, destinatário sintético)
  • Registro de compra: "cliente sintético A comprou 5 unidades em 2026-10-01" (distribuição realista, mas cliente nunca existiu)
  • Imagem de rosto gerado por GAN (looks real, but person doesn't exist)

Exemplos que NÃO são sintéticos

  • CPF real com hash: "a9f8d3c2b1e0..." (ainda é pseudo-pessoal, LGPD aplica-se)
  • "Dados reais com nomes truncados": "Jo*** Si***" (técnica fraca, ainda é pessoal)
  • Copiar produção pra staging: (maior risco de multa LGPD possível)

Seção 2: Anonimização vs Pseudonimização vs Dados Sintéticos

Aqui é onde muita gente se perde. Existem três técnicas, mas a lei trata cada uma diferente:

TécnicaComo funcionaLGPD Art.Risco
PseudonimizaçãoSubstitui identificador por outro (hash, UUID) mantendo vínculoArt. 5, III + 12Alto
AnonimizaçãoRemove referência de modo que re-identificação é inviável tecnicamenteArt. 12, § 2ºMuito baixo
Dados SintéticosGera do zero, nunca foi pessoalNão se aplicaZero

LGPD Art. 12, § 2º diz: "Dados anonimizados são aqueles cuja re-identificação não é possível por meio de esforço técnico viável na atividade ordinária".

O problema: Pseudonimização não atinge esse padrão. Um CPF hasheado ainda é pseudonimizado — se você tem a chave de hash, recupera o CPF original. A ANPD considera pseudônimos como "dados pessoais" e exige consentimento ou justificativa de interesse legítimo.

Por que dados sintéticos ganham: Nunca foram pessoais, logo LGPD não aplica-se por definição. Sem consentimento necessário. Sem risco de re-identificação. Sem multa.

Seção 3: Por que mercado BR adota devagar

Você já notou? Dados sintéticos existem desde 2015 (Faker.js, Mockaroo), mas Brasil adota com atraso:

1. Falta de educação

"Dados sintéticos" é termo desconhecido fora de bolhas de data science. Desenvolvedores e QAs conhecem "dados de teste" e "dados fake" (Faker.js), mas conceito de "sintético" como categoria técnica legal não é difundido em universidades ou bootcamps BR.

2. Hábito enraizado de copiar produção

Prática comum: "copiar base de produção para staging, depois apagar nomes de clientes". Funciona? Reduz tempo de setup. É seguro? A ANPD discorda. Times não mudaram o hábito porque não conhecem alternativa que seja rápida.

3. Ferramentas genéricas (Faker.js, Mockaroo) não validam Brasil

Mockaroo gera CPF no formato "XXX.XXX.XXX-XX", mas dígito verificador é aleatório. Faker.js gera nome e email, mas sem correlação. Sua validação de CPF rejeita gerado por Mockaroo, então você acaba voltando a produção. Ciclo vicioso.

4. Oportunidade: LGPD multas subindo, CNPJ 2026, ML expansion

Agora em 2026, três fatores acelerem adoção:

  • Multas LGPD subindo: ANPD está ativa desde 2022. Copiar dados reais para dev não tem justificativa legal mais forte.
  • CNPJ alfanumérico em julho/2026: Sistemas precisam testar novo formato antes de virar obrigatório. Dados sintéticos permitem escalar testes sem esperar cliente real com CNPJ novo.
  • Startups de IA no BR: Precisam de milhares de exemplos para treinar modelos. Anonimizar dados reais custa R$500-2000/mês. Gerar sintéticos custa R$29/mês.

Seção 4: Casos de uso detalhados

Dev Backend: Seed de staging

Seu backend valida CPF com mod-11 antes de aceitar cadastro. Testar localmente exige dados válidos. Mockaroo falha. Copiar produção é risco LGPD. Solução: FakeForge API gera 1000 CPFs válidos em JSON, importa no banco em 30 segundos.

QA Engineer: BDD com massa correlacionada

Seu teste de Gherkin exige "quando cliente de São Paulo tenta comprar", precisa base com clientes de São Paulo. Criar manualmente é lento. Dados sintéticos garantem correlação: CEP, cidade, estado — tudo coerente. Seu teste passa, risco de bug por inconsistência geográfica cai.

Data Scientist: Data augmentation para ML

Seu dataset real tem 5000 exemplos de transação. Para treinar modelo robusto de detecção de fraude, precisa 50 mil. Comprar dados fica caro. Anonimizar em-house demora 2 meses. Solução: usar os 5000 reais como "padrão", depois gerar 45 mil sintéticos com mesma distribuição. Modelo treina mais rápido, com melhor generalização.

Pesquisador de Mercado: Personas para survey

Você quer mapear disposição de pagamento por idade e região. Coleta real levaria 3 meses. Solução: gere 1000 personas sintéticas com perfil demográfico controlado, rode prototipo de survey em-house, itere, depois valide com subset real. Reduz custo de pesquisa em 70%.

Product Manager: Mockup com dados realistas

Você quer demonstrar feature de "dashboard de clientes" em reunião com board. Mockup com "Cliente 1, Cliente 2" parece artificial. Com dados sintéticos, dashboard mostra nomes reais, emails válidos, padrão de compra coerente. Stakeholder se sente mais confiante.

DPO / Compliance: Documentação legal

Você audita pipeline de dados. Encontra dados reais em staging sem consentimento. Risco de multa. Dados sintéticos permitem documentar: "Este ambiente usa apenas dados sintéticos, logo fora do escopo LGPD". Reduz risco legal.

Seção 5: Como gerar dados sintéticos corretos

Existem três critérios para dados sintéticos de qualidade:

1. Validação com algoritmo oficial

CPF deve passar em mod-11 da Receita Federal. CNPJ deve passar em checksum duplo. Seu validador em produção vai rejeitar dados inválidos — se gerador não respeita algoritmo, não vale.

2. Correlação entre campos

Nome "João" com email "maria@..." parece estranho. CEP "01311-100" (São Paulo) com cidade "Fortaleza" quebra validação em produção. Dados sintéticos devem correlacionar automaticamente.

3. Distribuição estatística controlada

Se seu dataset tem 60% clientes de SP e 40% de RJ, gerador sintético deve respeitar proporção. Caso contrário, modelo treinado erra em padrão real.

Seção 6: Comparação de ferramentas

FerramentaCPF mod-11CNPJAPIPreço
FakeForge✓ Nativo✓ Nativo✓ RESTR$29/mês
Faker.jsNãoNãoNPM (lib)Grátis
Faker.pyNãoNãoPyPI (lib)Grátis
MockarooNãoNão✓ REST (pago)USD 60/ano
Tonic.ai✓✓✓ APIUSD 2k+/mês

Resumo: Faker.js/Faker.py são grátis mas não validam Brasil. Mockaroo é visual mas caro em USD. FakeForge é best-of-both: API REST barata em reais com validação BR nativa.

Seção 7: Snippets práticos

Python: Gerar pessoas com FakeForge

import requests

# Gerar 50 pessoas com CPF, email, telefone correlacionados
response = requests.get(
    'https://fakeforge.com.br/api/generate',
    params={
        'type': 'pessoa',
        'quantity': 50,
        'format': 'json'
    },
    headers={'Authorization': 'Bearer SEU_TOKEN'}
)

pessoas = response.json()['data']

# Validar primeira pessoa
pessoa = pessoas[0]
print(f"Nome: {pessoa['nome']}")
print(f"CPF: {pessoa['cpf']}")
print(f"Email: {pessoa['email']}")
print(f"Telefone: {pessoa['telefone']}")
print(f"Validação mod-11: {pessoa['valido']}")

Node.js: Seed de banco em CI/CD

// seed.js - executar antes de cada teste
const axios = require('axios');

async function seedDatabase(db) {
  // Gerar 100 CPFs válidos de FakeForge
  const response = await axios.get(
    'https://fakeforge.com.br/api/generate',
    {
      params: { type: 'cpf', quantity: 100, format: 'json' },
      headers: { Authorization: `Bearer ${process.env.FAKEFORGE_TOKEN}` }
    }
  );

  const cpfs = response.data.data.map(d => d.cpf);

  // Inserir no banco
  await db.collection('clientes').insertMany(
    cpfs.map(cpf => ({ cpf, criado_em: new Date() }))
  );

  console.log('Seed concluído com', cpfs.length, 'CPFs sintéticos');
}

module.exports = seedDatabase;

Comparação: Faker.js vs FakeForge

// Faker.js: Gera formato, mas não valida
const faker = require('@faker-js/faker').faker;

const cpf = faker.helpers.regexToString('###\.###\.###-##');
console.log(cpf); // "123.456.789-00" - INVÁLIDO em mod-11!

// FakeForge: Gera validado
const fakeforge = require('fakeforge');

const cpf = await fakeforge.cpf();
console.log(cpf); // "123.456.789-09" - VÁLIDO por mod-11 ✓

Seção 8: Pitfalls comuns

Pitfall 1: Confundir anonimização com sintético

Pensamento errado: "Vou apagar nomes de produção e usar no teste — é anonimizado." Realidade: Dados reais mascarados ainda são pessoais per LGPD. Risco permanece.

Pitfall 2: Esquecer correlação entre campos

Você gera CPF com Faker e email com Mockaroo separado. Resultado: nome "João" com email "maria@...". Validação falha. Sempre usar ferramenta que correlaciona.

Pitfall 3: Insuficiente volume para machine learning

Treinar modelo com 100 exemplos sintéticos não chega para robustez. Modelos precisam milhares. Para ML, gere 10-100x seu dataset real.

Pitfall 4: Esquecer que sintético nunca substitui real 100%

Dados sintéticos são perfeitos para teste, dev, ML prototipagem. Mas antes de ir para produção, sempre validar com subset de dados real. Sintético pode não capturar anomalia rara.

FAQ

LGPD permite usar dados sintéticos sem consentimento?+

Sim. Dados sintéticos não são pessoais por definição, logo não estão sob LGPD. Você não precisa de consentimento. Pode usar à vontade em desenvolvimento e teste. Não há artigo LGPD que restrinja dados que nunca foram pessoais.

Qual é o nível de realismo de dados sintéticos?+

Depende da ferramenta e do caso de uso. FakeForge garante validação (CPF passa em mod-11, CEP bate com estado) e correlação básica. Para distribuição estatística complexa (padrão de renda por idade, sazonalidade de consumo), ferramentas avançadas como Tonic.ai ou Syntho.ai são necessárias. Para teste e QA, FakeForge é suficiente.

Posso usar dados sintéticos em produção?+

Não recomendado. Dados sintéticos são para desenvolvimento, teste e ML prototipagem. Produção exige dados reais porque usuários precisam de funcionalidade real. Exceção: se seu negócio é gerar dados sintéticos como produto (você pode vender dados sintéticos legalmente).

Quantos dados sintéticos preciso para treinar ML?+

Regra: 10-100x seu dataset real para prototipagem. Se você tem 5000 exemplos reais, gere 50-500 mil sintéticos. Para produção, adicione sempre um subset real para validar. Modelos treinados 100% com sintéticos tendem sofrer degradação em dados reais inesperados.

Dados sintéticos de FakeForge passam em validação real?+

CPF sempre passa em validação mod-11 porque foi gerado respeitando algoritmo Receita Federal. CNPJ passa em checksum duplo. Endereço correlaciona por estado. Email é formato válido. Telefone respeita DDD real. Sim, passam em validação.

Dados sintéticos resolvem 100% do risco de privacidade?+

Sim, por definição. Dados que nunca foram pessoais não têm risco de privacidade. O risco zero vem do fato que não há pessoa real para re-identificar. Diferente de anonimização (que pode falhar via linkage attack), dados sintéticos têm garantia matemática.

Conclusão: Por que adotar dados sintéticos hoje

Dados sintéticos não são futurismo. São presente em 2026. AWS, Microsoft, Snowflake já posicionam como estratégia. Brasil está 2-3 anos atrás em adoção, mas janela está abrindo:

  • Compliance: LGPD multas subindo. Dados sintéticos eliminam risco legal.
  • Velocidade: Gerador de dados em segundos vs horas setup manual.
  • Custo: R$29/mês vs R$500-2000 anonimização tradicional.
  • Experiência: Dados correlacionados e validados reduzem bugs de teste.

Comece hoje. Não custa nada no plano gratuito. Gere seu primeiro CPF, pessoa, ou base de teste. Veja se valida em seu sistema. Depois, integre em CI/CD ou pipeline ML. Risco zero, retorno imediato.

Próximo passo

Teste dados sintéticos de FakeForge agora. Sem cadastro. Sem cartão de crédito.

Conteúdo relacionado

Achou útil? Compartilha: