O que você vai aprender aqui
- Qualidade de dados decide se o piloto de IA vira operação: o Gartner previu que 60% dos projetos sem dado pronto para IA serão abandonados até o fim de 2026
- As seis dimensões da qualidade de dados viram seis perguntas, mais uma sétima que proponho para IA
- A IA preditiva grava o dado ruim no treino e a IA generativa o lê a cada consulta, e a correção é diferente em cada uma
- O dado de má qualidade cobra o preço em cada área da empresa, e uma conta simples mede o seu
- O dono do dado é alguém do negócio, e a LGPD já pede qualidade como princípio
- Um teste de uma semana mede a base de uma decisão, sem projeto nem contratação nova
- Um agente de IA com contexto ruim repete o erro sem avisar
- O dado proprietário passou a ter preço em 2026, e o contrato decide quem pode treinar com ele
O e-book gratuito Engenharia de Prompts na Prática reúne técnicas de prompt e exemplos prontos por área profissional, para quem já tem o dado em ordem e quer melhorar o pedido que faz à IA.
Imagine uma distribuidora de materiais de construção que contrata uma ferramenta de IA para prever a demanda por região. O teste inicial, o chamado piloto, roda por seis semanas, a diretoria assiste à demonstração e aprova o contrato anual. No terceiro mês, o gerente de compras percebe que a previsão para Campinas só acerta quando alguém corrige o cadastro à mão.
O modelo aprendeu o padrão sobre um histórico errado: o mesmo parafuso aparece com quatro códigos, então a demanda dele se espalha em quatro, e três filiais lançam a venda com um dia de atraso, então a demanda de cada dia se desloca.
O dado está entre as causas de pilotos que não passam para a operação, e a empresa descobre isso depois de pagar a ferramenta. Trocar de modelo não resolve sozinho, porque o próximo modelo parte do mesmo cadastro.
Quem usa IA no RH ou no marketing conhece a versão pequena disso: a ferramenta devolve uma resposta genérica, errada ou que ninguém reconhece, e o time conclui que a IA não serve. A causa pode estar no pedido que se faz à ferramenta (o prompt), no modelo ou no dado. Para separar as três, refaça o mesmo pedido com o dado corrigido à mão em dez linhas: se a resposta melhora, a causa estava no dado.
A IA preditiva, também chamada de aprendizado de máquina clássico, aprende, numa fase chamada de treino, os padrões do histórico da empresa para prever algo, como a demanda por região ou o cancelamento de um cliente: o dado ruim entra no treino e fica gravado no modelo.
A IA generativa, como os assistentes, que respondem, e os agentes, que também executam tarefas em várias etapas, é construída sobre modelos de linguagem. Ela produz texto e age com base no que lê na hora da consulta, em geral nas bases da empresa: o dado ruim entra na consulta e vira resposta.
Qualidade de dados é o grau em que o dado serve ao uso que a empresa quer fazer dele. O Gartner define o conceito pela usabilidade e pela aplicabilidade do dado nos casos de uso prioritários da organização, inclusive os de IA. A definição é relativa ao uso: o mesmo cadastro pode ser bom para emitir nota fiscal e ruim para prever cancelamento.
Por que o piloto de IA quebra no dado antes de quebrar no modelo
O Gartner previu, em 2025, que as organizações abandonarão 60% dos projetos de IA que não tiverem dado pronto para IA (em inglês, “AI-ready”) até o fim de 2026. Dado pronto para IA é o que passa nas perguntas da próxima seção, inclusive a sétima, para o uso pretendido. A previsão se apoia em pesquisa com líderes de gestão de dados, em que 63% afirmaram não ter, ou não saber se têm, as práticas de gestão de dados adequadas para IA. O 60% é uma previsão, e o 63% é o que os líderes disseram sobre as próprias práticas.
O dado é a única parte do projeto que a empresa já tem antes de assinar o contrato, e a primeira que dá para inspecionar.
O piloto às vezes roda sobre uma amostra que alguém arrumou à mão, e o resultado impressiona. A produção roda sobre o que o sistema grava no dia a dia, com códigos duplicados e filiais atrasadas, e é nessa base que a demonstração vira operação.
Exija que o piloto rode sobre o dado real da operação, do jeito que o sistema grava, sem arrumação prévia, e combine com o jurídico como o dado pessoal será compartilhado com o fornecedor.
As seis dimensões da qualidade de dados, mais a sétima que proponho para IA
A literatura de gestão de dados organiza a qualidade em dimensões. A lista de seis vem de um documento de 2013 do DAMA UK, braço britânico de uma associação de profissionais de gestão de dados, e cada dimensão vira uma pergunta que qualquer pessoa pode fazer sobre uma base.
Completude. Todos os campos que a decisão usa, as colunas da planilha ou os itens do formulário de cadastro, estão preenchidos? Um cadastro de cliente sem setor, sem porte e sem data da última interação não permite prever cancelamento. A pergunta mede o que falta, e o que falta quase nunca aparece no painel, porque o painel mostra o que existe. No RH, uma base de desligamentos sem o motivo da saída não permite prever rotatividade.
Precisão. O sistema diz que há 40 unidades no estoque e a prateleira tem 12. O valor guardado bate com a realidade? É a dimensão mais difícil de medir, porque exige um ponto de comparação fora do sistema: contagem física, extrato, documento original.
Consistência. O mesmo fato aparece igual em todos os sistemas? “Cliente ativo” é quem comprou nos últimos 90 dias para o comercial e quem tem contrato vigente para o financeiro. As duas definições estão certas dentro de cada área.
Atualidade. A tabela de preços foi atualizada na sexta, e a IA de atendimento responde na segunda com o preço antigo. O dado chega a tempo de a decisão usá-lo? O atraso aceitável muda com o uso: dado de vendas de ontem serve ao planejamento mensal e chega tarde para o preço dinâmico.
Unicidade. Cada pessoa, produto ou empresa aparece uma vez? O cliente cadastrado duas vezes, com grafias diferentes, conta como dois na campanha e como dois no cálculo de recompra, e o mesmo contato em duas listas recebe duas vezes a mesma mensagem de marketing. A duplicidade distorce toda média que depende de contar entidades.
Validade. O valor segue o formato e a regra da empresa? Data 31/04, CEP com sete dígitos, “N/A” digitado num campo numérico. O próprio sistema pode recusar o valor na entrada, se alguém configurar a regra.

Para IA, proponho uma sétima pergunta, a de representatividade: o dado cobre os casos em que a IA vai operar? Um histórico que só registra os clientes que compraram ensina o modelo a ignorar quem desistiu antes de comprar, e a IA de recomendação passa a repetir o perfil de quem já era cliente. A pergunta vale para o histórico de treino da IA preditiva e para a base que o assistente generativo consulta.
As seis primeiras medem principalmente a qualidade de cada linha do cadastro. A sétima mede se o conjunto cobre o uso pretendido, e é a que mais escapa da área de TI, porque depende de saber o que o negócio quer prever.
Como o dado ruim derruba um caso de IA
Um exemplo prático por dimensão, com o tipo de IA afetado e o que ela entregou:
| Dimensão | O que o dado fazia | Tipo de IA | O que a IA entregou |
|---|---|---|---|
| Completude | Cadastro sem data da última interação em 4 de cada 10 clientes | Preditiva | Previsão de cancelamento que só enxerga quem já tinha histórico |
| Precisão | Estoque do sistema acima do físico | Generativa | Agente de compras, que age em etapas, recomenda não repor o que acabou |
| Consistência | Duas definições de “cliente ativo” | Generativa | Assistente que devolve o número de uma área, e a outra não o reconhece |
| Atualidade | Tabela de preços atualizada com atraso | Generativa | Assistente de atendimento que cita o preço antigo |
| Unicidade | Mesmo cliente cadastrado duas vezes | Preditiva | Modelo de recompra que conta dois clientes e distorce a previsão |
| Validade | Datas fora do formato esperado em uma filial | Preditiva | Previsão de vendas que herda meses trocados |
Dois desses casos, em mais detalhe, um de IA preditiva e outro de IA generativa:
Completude, IA preditiva: a previsão que só enxerga quem já era cliente. Uma operadora de assinaturas treina um modelo para prever cancelamento. Em quatro de cada dez cadastros falta a data da última interação, e o modelo aprende só com os seis que a têm, quase todos de clientes antigos. Os clientes recentes, que mais cancelam nesta operação, ficam fora do aprendizado, e o modelo erra justamente neles.
O painel que mede o acerto do modelo mostra um número alto, porque mede o conjunto que o modelo conhece.
Consistência, IA generativa: duas respostas certas para o mesmo pedido. A diretoria instrui um assistente de IA a informar o número de clientes ativos, e ele consulta duas bases. O comercial conta quem comprou nos últimos 90 dias e o financeiro conta quem tem contrato vigente. O número que o assistente devolve depende da base que ele lê primeiro, e não há definição de qual vale.
Na IA preditiva, o erro se grava no modelo durante o treino e só sai com um novo treino, depois de corrigido o dado. Na generativa, ele entra a cada consulta e se corrige na base que o assistente lê, sem retreinar o modelo, e o índice de busca dessa base, quando existe, também precisa ser atualizado.
Pegue a última resposta de IA que alguém da equipe corrigiu à mão e pergunte em qual das seis dimensões o dado de origem falhou. A lista de correções manuais da semana vira a lista de prioridades de qualidade.
Quanto o dado ruim custa, área por área
O número mais citado é do Gartner: dado de baixa qualidade custa às organizações, em média, pelo menos US$ 12,9 milhões por ano. A cifra vem de pesquisa de 2020, anterior à IA generativa, é média global e pertence a empresas grandes, então indica a ordem de grandeza.
O custo da sua empresa se mede com uma conta simples: horas por semana gastas corrigindo dado à mão, multiplicadas pelo custo da hora de quem corrige e por 52 semanas, mais o valor das decisões revistas depois de tomadas no mesmo período.
| Área | Onde o dado ruim aparece | Como medir o custo |
|---|---|---|
| Comercial | Contato comercial (lead) duplicado, previsão de vendas errada | Horas de limpeza do CRM, o sistema de cadastro de clientes, por semana; meta errada vezes margem |
| Marketing | Contato duplicado, segmentação com cadastro incompleto | Disparos repetidos para a mesma pessoa; verba gasta em público errado |
| Financeiro | Fechamento que não bate entre sistemas | Dias de fechamento a mais; ajustes manuais por mês |
| Operações | Estoque e prazo divergentes do real | Compra de emergência, frete extra, falta de produto |
| Atendimento | Histórico do cliente incompleto | Contatos repetidos por problema; tempo de atendimento |
| RH | Cadastro de cargo e salário inconsistente | Retrabalho na folha; correção de relatório de diversidade |
| Jurídico e conformidade | Cadastro de fornecedor desatualizado | Contrato com parte irregular; multa evitável |
O ponto de partida mais barato é a área onde o retrabalho já é visível, porque a planilha de correção manual existe e alguém só precisa somar as horas.
Nenhuma linha acima registra o custo da confiança: depois que a primeira resposta errada chega a um diretor, conferir tudo à mão vira o jeito mais seguro de trabalhar, e o ganho de produtividade prometido no contrato some sem que a causa apareça em algum relatório.
Quem é o dono do dado, e o que a LGPD já exige
Quando o comercial e o financeiro chegam a números diferentes para o mesmo indicador, a reunião vira disputa política se ninguém tem a palavra final. A TI guarda, move e protege o dado, e o negócio sabe o que ele significa. Um nome do lado do negócio precisa responder pela definição e pela regra, e quem arbitra “cliente ativo” é quem responde pela decisão que esse número alimenta.
Quem coletou, quem interpretou e quem decide são as três perguntas que toda decisão com dado precisa responder, como descrevi no artigo sobre cultura data driven.
“Dono do dado” é um papel de governança dentro da empresa. Na LGPD, os termos são outros: o titular é a pessoa a quem o dado pessoal se refere, e o controlador é a empresa que decide sobre o tratamento.
Dar dono ao dado começa por poucas definições:
- Escolha as cinco que mais geram discussão, como cliente ativo, receita reconhecida e venda concluída.
- Nomeie para cada uma uma pessoa do negócio que responde por ela.
- Registre a definição em um lugar que a IA e as pessoas consultem: um catálogo de dados, que é a lista do que existe com o significado de cada campo e o responsável, ou, no começo, uma página compartilhada.
Para dado pessoal, a lei brasileira já exige qualidade como princípio. A Lei Geral de Proteção de Dados (LGPD) lista dez princípios que o tratamento, ou seja, qualquer uso do dado pessoal, deve observar, e um deles é a qualidade dos dados, no artigo 6º, item V: a garantia, aos titulares, de exatidão, clareza, relevância e atualização dos dados, de acordo com a necessidade e para o cumprimento da finalidade do tratamento. É a mesma lógica de qualidade relativa ao uso.
Dado pessoal desatualizado que alimenta uma IA pode ser problema de cumprimento da lei, além de problema de resultado. O titular pode pedir a correção de dado incompleto, inexato ou desatualizado e a revisão de decisão tomada só por sistema automático.
Se um dado desatualizado usado numa decisão automatizada infringe esse princípio é uma questão sem decisão conhecida da ANPD nem de tribunal, e a resposta fica com o jurídico.
Leve ao jurídico da empresa:
- Quais dados pessoais alimentam as nossas IAs?
- Qual a base legal de cada uso, ou seja, a justificativa que a LGPD exige, como o consentimento, a execução de contrato e o legítimo interesse?
- Quem corrige o dado quando ele está errado?
O teste de uma semana para medir o seu dado
Este método é proposta minha: mede uma decisão em cinco dias e indica onde investigar, sem certificar a base. Corrigir é a etapa seguinte.
Quem conhece o dado conduz o teste: um analista de negócio ou, na falta dele, você mesmo, com uma extração pedida à TI. Quem responde pela definição do dado acompanha.
- Segunda: escolha a decisão. Uma decisão recorrente que já usa dado, como previsão de vendas, política de desconto, priorização de lead, segmentação de campanha ou triagem de currículos. Escreva em uma frase qual dado a sustenta e quem decide com ele. Se a empresa já tem um piloto de IA, escolha a decisão que ele automatiza.
- Terça: tire a amostra. Peça 200 registros sorteados da base que alimenta a decisão, por alguém que não participa dela. Registro é uma linha da base, como um cliente ou um pedido. Na planilha, acrescente uma coluna com a fórmula =ALEATÓRIO(), ordene por ela e fique com os 200 primeiros. Uma amostra escolhida pelo time esconde o problema. Se um segmento pesa na decisão, como os clientes novos ou uma filial, tire uma amostra à parte dele.
- Quarta: aplique as seis perguntas, mais a sétima. Um registro falha numa dimensão quando qualquer campo que a decisão usa falha nela. Registre o percentual de falha por dimensão:
- Completude e validade: fórmulas de planilha sobre o próprio registro, como contar células vazias (CONT.VAZIO) e conferir o formato.
- Unicidade: rode a busca de duplicados na base inteira, pelos campos que identificam a pessoa ou o produto (na planilha, a ferramenta Remover Duplicatas), porque duas cópias do mesmo cliente raramente caem juntas em 200 linhas sorteadas.
- Atualidade: compare a data da última atualização com o prazo que a decisão exige.
- Precisão e consistência: confira com uma fonte externa à base, como contagem física, documento original ou outro sistema (no RH, o documento do colaborador; no marketing, o retorno do próprio cliente), numa amostra menor, de 30 a 50 registros. Com esse tamanho e uma falha em torno de 10%, a margem de erro passa de 8 pontos percentuais, e o resultado mostra o tipo de erro, sem medir o percentual.
- Sétima pergunta: uma amostra da base não mostra quem nunca entrou nela. Pergunte a quem conhece a operação quais casos a IA vai atender, como clientes novos, regiões pequenas ou quem desistiu, e confira se eles existem na base e em que volume.
- Quinta: rastreie dez números. Escolha os dez números de maior peso na decisão. Um número está rastreado quando alguém mostra, sem consultar outra pessoa, de qual tabela e de qual regra ele sai. Anote em quantos isso acontece e em quantos alguém precisa “lembrar de onde vem”.
- Sexta: reunião de 30 minutos com quem decide com esse dado e quem responde por ele. Leve o percentual de falha por dimensão e os dez rastreios. Saia com uma decisão: corrigir na origem, ou seja, onde o dado nasce, definir a regra ou aceitar o risco com nome e prazo.
Onde a IA generativa acelera o teste
Um assistente de IA encurta quatro etapas do teste, desde que receba só o que precisa. A conferência de precisão e consistência continua com a fonte externa, porque a IA não sabe o que está na prateleira nem no documento original. Dado pessoal só entra numa ferramenta corporativa contratada pela empresa, nunca numa conta pessoal. Na dúvida, troque nomes e documentos por códigos antes de colar.
Fórmulas de completude e validade (quarta). Confira o resultado à mão em dez linhas antes de confiar na contagem.
Tenho uma planilha com 200 linhas e estas colunas: [liste cada coluna e o que ela guarda]. Escreva, para o Excel em português, uma fórmula por coluna que marque a linha com FALHA quando o campo estiver vazio ou fora do formato esperado, como data inválida, CEP sem 8 dígitos ou e-mail sem @. Depois, escreva uma fórmula que calcule o percentual de linhas com falha em cada coluna. Explique em uma linha o que cada fórmula faz.
Duplicados com grafias diferentes (quarta). O Remover Duplicatas só acha cópias idênticas, e “Maria Aparecida Silva” e “M. Aparecida da Silva” passam por ele.
A lista abaixo tem nome e cidade de clientes. Aponte os pares que parecem ser a mesma pessoa ou empresa com grafia diferente, por abreviação, acento, ordem das palavras ou erro de digitação. Entregue uma tabela com as duas grafias e o motivo da suspeita. Não junte nem apague nada; só liste os candidatos.
Casos ausentes, a sétima pergunta (quarta). Este prompt não usa dado de cliente, só a descrição da decisão.
Vou usar IA para [descreva a decisão, por exemplo: priorizar contatos comerciais]. A base que alimenta essa decisão registra [descreva o que ela guarda e desde quando]. Liste os tipos de caso que a IA vai encontrar na operação e que podem estar ausentes ou raros nessa base, como clientes novos, regiões pequenas ou quem desistiu antes de comprar. Para cada um, diga como eu confiro se ele existe na base e em que volume.
Página da reunião (sexta). O resumo sai em minutos e mantém a reunião em 30 minutos.
Abaixo estão os resultados de um teste de qualidade de dados: o percentual de falha por dimensão (completude, precisão, consistência, atualidade, unicidade e validade), o resultado da pergunta sobre casos ausentes e quantos dos dez números de maior peso foram rastreados até a origem. Monte uma página para uma reunião de 30 minutos com: um resumo em três linhas; as dimensões acima de 10% de falha, em ordem de custo do erro; e, para cada uma, as três saídas possíveis: corrigir na origem, definir a regra ou aceitar o risco com nome e prazo. Use só os números fornecidos.
Com 200 registros e uma falha medida em 10%, a falha real da dimensão está entre 6% e 14%, com 95% de confiança.
Se a falha aparecer em mais de uma dimensão, corrija uma de cada vez, na ordem do custo do erro. Validade se resolve com uma regra no sistema que recusa o valor errado na hora do cadastro. Unicidade e consistência pedem uma decisão de negócio sobre qual registro vale. Precisão pede mudar o processo que gera o dado.
Use 10% de falha como alerta para investigar a causa. Acima disso em uma dimensão, o dado merece correção ou revisão humana antes de alimentar uma IA. Se a causa se corrige na origem, adie a expansão até corrigir; se não se corrige, mantenha a revisão humana. O 10% é ponto de partida meu, e cada empresa o ajusta ao custo do erro: uma decisão de baixo custo tolera mais, e uma que mexe com dinheiro ou com pessoas tolera menos.
Quem ainda não contratou roda o teste antes de assinar. Se a falha passa do alerta, o primeiro investimento vai para a origem do dado, antes da ferramenta.
Um agente com contexto ruim repete o erro sem avisar
Um agente de IA, construído sobre um modelo de linguagem, executa tarefas em várias etapas, e cada etapa pode consumir o dado da anterior. O modelo não aprende com a sua base a cada consulta: ele lê o que o agente entrega, o chamado contexto.
Um preço três vezes acima do normal, que uma pessoa corrigiria por estranhamento, segue adiante com a mesma fluência de um dado correto, a menos que alguém tenha instruído o agente a checar.
A BCG Platinion publicou em julho de 2026 o artigo Lost in Translation, segundo o qual, sem uma camada semântica, as empresas não escalam agentes de IA além de pilotos.
A BCG descreve a camada semântica como um dicionário compartilhado dos conceitos do negócio, com um mapa de como eles se conectam. O catálogo de dados é o passo anterior, mais simples: lista o que existe e o significado de cada campo. Dívida semântica, no uso da BCG Platinion, são as definições inconsistentes e as regras de negócio que ficam em sistemas antigos ou na cabeça de especialistas.
Quem coloca um agente em produção se protege do erro silencioso com três cuidados:
- Antes de conectar o agente a uma base, rode o teste de uma semana nessa base.
- Escreva as definições que o agente precisa, como cliente ativo e venda concluída, em um texto que ele leia a cada execução.
- Meça o agente com casos de teste que incluam dado ruim de propósito, para ver se ele erra em silêncio ou avisa.
O blog tem artigos sobre:
- como curar o que o agente enxerga
- como testar um agente antes do primeiro erro com um cliente
- até onde delegar a um agente
Dado proprietário como ativo: o que passou a ter preço
Dado proprietário é o que a empresa registra sobre o seu negócio e que não está disponível publicamente: o histórico de pedidos, o motivo de cada cancelamento, o laudo, o chamado de suporte, a conversa de venda. Em 2026, duas perguntas entraram na conta: quanto ele vale para quem treina modelos e quem pode treinar com ele.
“Ativo”, aqui, é palavra de gestão: o que gera valor ou vantagem para a empresa. O dado limpo e com direito resolvido dá menos trabalho e menos risco a quem o usa.
O dado que só a empresa tem é a vantagem que o concorrente não copia.
O que mudou em 2026
Reddit, Google e Stack Overflow têm em comum conteúdo que era público e passou a ser licenciado, ou seja, cedido sob contrato para uso por terceiros. Mostram que existe mercado para dado com preço, e o mesmo raciocínio vale para o dado interno de uma empresa.
Reddit encerra o acesso gratuito. Segundo o TechCrunch, o Reddit encerra os feeds RSS (a assinatura automática de conteúdo) em 2026 e a API pública (a porta por onde programas leem o dado) em 2027, e assistentes de IA que hoje consultam o Reddit precisarão de acordo comercial.
Google paga por conteúdo, e o preço é irregular. Segundo o Search Engine Journal, que cita reportagem do The Information, o Google paga cerca de 100 publicadores num piloto em que o conteúdo recebe quando contribui para respostas de IA. Alguns sites pequenos ganharam menos de US$ 1.000 em vários meses, um participante inicial ganha mais de US$ 1 milhão por ano, e alguns participantes dizem que não sabem como o valor é calculado. O mercado existe.
Stack Overflow: o acervo licenciado depende de quem continua escrevendo. A Prosus, dona do Stack Overflow, registrou no relatório anual de 2026 uma baixa contábil, perda reconhecida no balanço, de US$ 482 milhões, ligada principalmente ao Stack Overflow e a outra empresa do grupo e atribuída ao impacto da IA generativa.
O Stack Overflow licencia o acervo a empresas de IA, e o Google foi o primeiro parceiro do programa, segundo o GetLatka. Segundo a Gigazine, as perguntas novas no site caíram 78% em dezembro de 2025 na comparação anual.
Se a fonte de conteúdo encolhe, o acervo licenciado deixa de ser reposto, e quem licencia dado depende de quem continue produzindo dado. Os números mostram a queda e a baixa juntas, sem provar que uma causou a outra.
O que dá preço ao dado
Quatro fatores separam o dado que alguém paga do dado que ninguém quer:
- Escassez e demanda: dado que só a empresa tem, sobre um processo que alguém quer prever ou automatizar, pesa mais que texto genérico. Dado escasso que ninguém usa não tem comprador.
- Exclusividade: o mesmo dado vendido a um único comprador vale mais que o distribuído a todos.
- Prontidão: dado completo, consistente, atual e único, com os campos documentados, dá menos trabalho a quem vai usar.
- Direito resolvido: dado com origem documentada e permissão de uso para treinar modelo pode ser vendido, e dado de origem duvidosa vira risco.
O que o contrato precisa dizer
Quem pode treinar com o quê é cláusula de contrato. O escritório de advocacia Goodwin Procter descreveu os riscos em artigo de julho de 2026 sobre dado proprietário e IA em ciências da vida, com lições para outros setores. O texto separa três estruturas:
- o dono do modelo roda a análise com o seu dado;
- a empresa licencia o modelo e roda o próprio dado nele;
- várias empresas contribuem para um modelo compartilhado, cada uma mantendo o dado no próprio ambiente.
Em cada uma, o contrato precisa tratar de uso do dado, de propriedade do que sai do modelo e de direitos sobre versões do modelo ajustadas com o seu dado.
O contrato fica mais claro quando separa três tipos de dado, porque cada um entra e sai do modelo de um jeito diferente.
Dado de treino. É o material que o fornecedor usa para treinar ou ajustar um modelo, compartilhado com outros clientes ou só seu (ajuste fino é o treino adicional com dados próprios). Esse dado deixa influência nos pesos do modelo, os números em que ele guarda o que aprendeu, e a influência continua mesmo que os arquivos sejam apagados depois. Por isso apagar depois é proteção insuficiente, e a cláusula que protege proíbe o treino antes de ele acontecer.
Dado de consulta. É o que o modelo lê para responder a você, como a base de produtos que um assistente consulta. Os pesos não mudam, e quando o dado sai da base, o modelo perde o acesso a ele. O contrato ainda precisa dizer se o fornecedor guarda cópias do que você envia.
Dado de uso. São os comandos que as pessoas digitam na ferramenta e o que fazem com as respostas. Numa base grande de profissionais de uma área, como saúde ou direito, esse registro revela padrões de uso daquele segmento, matéria-prima para criar produtos voltados a ele. O contrato precisa dizer se o fornecedor guarda esse registro e se o usa para treinar, para desenvolver produto ou para compartilhar de forma agregada. Dentro da empresa, o mesmo registro mostra onde a IA ajuda e onde trava.
Para dado pessoal, a LGPD traz o princípio da finalidade: o uso para treinar IA precisa ser compatível com a finalidade informada ao titular, e o jurídico responde se é. A base legal para treinar modelo com dado de cliente precisa estar registrada antes do treino. Se o titular pedir a eliminação do dado, direito previsto na lei com exceções, pergunte também o que acontece com o modelo que já foi treinado com ele.
Inventário em três listas
Para saber se o dado da sua empresa é um ativo ou um risco, monte três listas curtas:
- O que a empresa registra e mais ninguém tem.
- Com que qualidade, medida pelo teste de uma semana.
- Com que direito, olhando contrato com fornecedores e clientes e a base legal de cada uso.
O que aparece nas três listas é ativo. O que aparece só na primeira é potencial, e o que falha na terceira é risco ainda não contabilizado. O uso imediato do inventário é decidir o que o fornecedor de IA pode fazer com o dado e o que o próprio agente vai usar. Vender dado é hipótese a testar: não existe mercado público para esse tipo de dado, então é preciso encontrar um comprador.
Onde começar amanhã
Escreva as cinco definições que mais geram discussão, com o nome de quem responde por cada uma, numa página compartilhada. Com isso, a pergunta “qual número está certo?” passa a ter uma pessoa para responder.
Agende o teste de uma semana. O sorteio dos 200 registros acontece na terça, sobre a base de uma decisão recorrente. Se a empresa já tem um piloto de IA rodando, comece por ele.
Abra o contrato de cada ferramenta de IA em uso e procure a cláusula sobre treinar modelos com os seus dados. Se não existir, pergunte ao fornecedor: os meus dados treinam um modelo que outros clientes usam? A resposta, por escrito, é o primeiro item do inventário de dado proprietário. Se for sim, peça que o fornecedor deixe de usar os seus dados no treino ou mude para um plano que não treine, e evite enviar dado sensível até ter isso. Faça o mesmo com as contas pessoais de ferramentas de IA que a equipe usa para trabalhar.
Perguntas frequentes
O que é qualidade de dados? Qualidade de dados é o grau em que o dado serve ao uso que a empresa quer fazer dele. O Gartner a define pela usabilidade e pela aplicabilidade do dado nos casos de uso prioritários da organização, inclusive os de IA. A definição é relativa ao uso: o mesmo cadastro pode ser bom para emitir nota fiscal e ruim para prever cancelamento. Na prática, mede-se por dimensões, como completude, precisão, consistência, atualidade, unicidade e validade.
Quais são as dimensões da qualidade de dados? A lista do DAMA UK, de 2013, tem seis dimensões: completude (está tudo aqui), precisão (bate com a realidade), consistência (diz a mesma coisa em todo lugar), atualidade (chega a tempo de decidir), unicidade (cada coisa aparece uma vez) e validade (segue o formato e a regra). Para IA, proponho uma sétima pergunta, a de representatividade: o dado cobre os casos em que a IA vai operar?
Por que dado ruim faz projeto de IA falhar? Porque o dado ruim chega ao modelo sem que ninguém o questione. Na IA preditiva, ele entra no treino e fica gravado no modelo. Na generativa, entra na consulta e vira resposta, a menos que alguém tenha instruído a IA a checar. O Gartner previu, em 2025, que 60% dos projetos de IA sem dado pronto para IA seriam abandonados até o fim de 2026. É uma previsão, e o texto do Gartner não mede projetos que já fracassaram.
Quanto custa a baixa qualidade de dados? O número mais citado é do Gartner: pelo menos US$ 12,9 milhões por ano, em média, segundo pesquisa de 2020 com empresas grandes, o que indica a ordem de grandeza. O custo da sua empresa se mede somando as horas semanais gastas corrigindo dado à mão, multiplicadas pelo custo da hora e por 52 semanas, mais o valor das decisões revistas depois de tomadas.
Quem é responsável pela qualidade de dados na empresa? A TI guarda, move e protege o dado, e o negócio responde pelo significado e pela regra. A definição de cada indicador, como cliente ativo ou venda concluída, precisa ter um nome do lado do negócio. Sem dono nomeado, duas áreas chegam a números diferentes para a mesma métrica e a decisão volta a ser disputa política. Um ponto de partida é nomear responsáveis para as cinco definições que mais geram discussão.
A LGPD exige qualidade dos dados? Para dado pessoal, sim, como princípio. O artigo 6º da Lei 13.709 de 2018 lista a qualidade dos dados no item V: garantia, aos titulares, de exatidão, clareza, relevância e atualização dos dados, de acordo com a necessidade e para o cumprimento da finalidade do tratamento. A exatidão é medida em relação à finalidade. A aplicação a cada caso é matéria para o jurídico da empresa.
Como aplicar o teste de qualidade de dados em uma semana? Escolha uma decisão recorrente, sorteie 200 registros da base que a alimenta, confira completude, validade e atualidade, rode a busca de duplicados na base inteira, confira precisão e consistência numa subamostra de 30 a 50 registros com uma fonte externa, avalie a sétima pergunta com quem conhece a operação, rastreie até a origem os dez números de maior peso e leve o resultado a quem decide. O teste indica onde investigar, e um assistente de IA ajuda nas fórmulas, nos duplicados e na página da reunião. Acima de 10% de falha numa dimensão, investigue a causa: o dado merece correção ou revisão humana antes de alimentar uma IA.
O que é dado pronto para IA? É o dado que passa nas seis perguntas para o uso de IA pretendido e cobre os casos em que a IA vai operar, a sétima pergunta. O Gartner usa o termo AI-ready. A prontidão é relativa ao caso de uso: o mesmo dado pode estar pronto para um relatório e não estar para um agente que age sem revisão.
O que é dado proprietário e por que ele tem valor? Dado proprietário é o que a empresa registra sobre o próprio negócio e que não está disponível publicamente, como histórico de pedidos, motivos de cancelamento e conversas de venda. Ele é a vantagem que o concorrente não copia. Casos de 2026, como Reddit e Google, mostram que há mercado para conteúdo licenciado e que o critério de preço não é público. Entre os fatores que dão valor ao dado estão escassez e demanda, exclusividade, prontidão e direito de uso resolvido.
O fornecedor de IA pode treinar com os meus dados? Depende do contrato. Treinar com os seus dados é o fornecedor usar o seu material para treinar ou ajustar um modelo, e usar a ferramenta com os seus dados é o modelo ler o dado para responder a você, sem aprender com ele. Procure a cláusula que separa os dois e pergunte ao fornecedor, por escrito, se os seus dados treinam um modelo compartilhado e o que ele faz com os comandos que a equipe digita. Para dado pessoal, a base legal do uso precisa estar registrada antes do treino.
Edney “InterNey” Souza atua com tecnologia desde 1990 como professor, palestrante e conselheiro consultivo em tecnologia, IA, dados e inovação. Participou da criação de sete startups ao longo da carreira. É professor na ESPM, Insper, PUCRS, USP e IBGC. É autor de vários e-books gratuitos sobre tecnologia, marketing, liderança e inovação, disponíveis aqui.
Descubra mais sobre Edney "InterNey" Souza
Assine para receber nossas notícias mais recentes por e-mail.
