A OpenAI começa a marcar texto gerado por IA na União Europeia. Marca d'água é indício, não veredito
O textGrain da OpenAI é opcional na API para clientes do mundo todo e chega ao ChatGPT e ao Codex na UE. Os próprios testes da OpenAI mostram por que a detecção não decide autoria.
Ouça este artigo · 6 min
Narração completa do artigo, gerada por IA.

Em 5 de outubro, a OpenAI explicou como vai cumprir a exigência do EU AI Act de tornar o texto gerado por IA identificável por máquina. A resposta é uma marca d’água estatística chamada textGrain, e a parte mais útil do anúncio é a lista do que uma marca d’água não consegue dizer. Quem pensa em plugar um detector em decisões de RH, compliance ou prevenção a fraude deveria ler essa parte primeiro.
O que a OpenAI está lançando, e onde
- API, no mundo todo, opcional. Desde 5 de outubro, clientes da API em qualquer país podem ativar o texto com marca d’água em modelos selecionados. Na API, a marca fica desligada por padrão.
- ChatGPT e Codex, só na União Europeia. Nas próximas semanas, o texto elegível de usuários de todos os planos na UE passa a sair com marca d’água invisível. A OpenAI diz que, de propósito, não fará disso um padrão global no lançamento.
- Detector restrito. Pesquisadores e organizações especializadas aprovados podem pedir acesso, concedido caso a caso. O detector não está aberto ao público e informa apenas se encontrou uma marca da OpenAI, sem identificar o usuário nem revelar prompts.
- Provedores de nuvem depois. A OpenAI diz que trabalha com parceiros de nuvem para oferecer a marca nos modelos acessados por eles “nas próximas semanas”.
O textGrain coloca um sinal estatístico invisível na escolha de palavras do modelo. A OpenAI diz não ver diferença relevante nos benchmarks com e sem marca no seu modelo de fronteira atual, afirma que o textGrain igualou ou superou outras técnicas testadas, inclusive o SynthID para texto, e pretende abrir o código.
O que os números da própria OpenAI dizem
Com uma meta de 1% de falso positivo, o detector encontrou a marca em cerca de 80% dos trechos de 200 tokens e em cerca de 95% dos trechos de 400 tokens, em conteúdo como respostas de psicologia. Em matemática, onde a escolha de palavras é mais restrita, a taxa foi bem menor. Edição pesa ainda mais: trocar 10% das palavras por sinônimos em trechos de 400 tokens derrubou a detecção de cerca de 92% para 66%; trocar 25% derrubou para 17%.
E vem a lista que importa. A marca d’água não mede quanto uma pessoa contribuiu. Não estabelece autoria jurídica nem responsabilidade. Não identifica o usuário. Não verifica se o conteúdo é correto. E não encontrar a marca não prova autoria humana: o texto pode ser curto, editado, traduzido, ou vir de outro modelo ou de outra empresa.
O que um resultado de detecção diz e não diz
- Um modelo da OpenAI gerou parte disto?
- Quanto uma pessoa contribuiu?
- Quem escreveu ou enviou?
- De quem é, quem responde?
- Está correto?
- Sem marca: foi uma pessoa?
Um sinal probabilístico, no máximoPrecisa de outra evidência
O que muda para os times
A regra europeia não vale no Brasil, mas pode valer para o seu produto. O Artigo 50 do EU AI Act está em vigor desde 2 de agosto de 2026, com prazo até 2 de dezembro de 2026 para sistemas que já estavam no mercado, segundo o resumo do escritório Baker Botts. Se a sua empresa oferece um recurso de IA generativa a usuários na UE, como uma fintech ou um SaaS brasileiro com clientes europeus, o dever de marcar pode recair sobre ela, como fornecedora do sistema. A opção na API vale para clientes do mundo todo, então a decisão é por produto e por mercado, com o jurídico.
No Brasil, a rotulagem chegou primeiro pelo setor. A resolução do TSE para as eleições de 2026 exige que conteúdo sintético multimídia em propaganda eleitoral seja identificado de forma explícita, e o segundo turno ainda vem pela frente. O foco é conteúdo multimídia, com aviso no próprio áudio, imagem ou vídeo, e a regra vale para campanhas, não para empresas em geral. Mas mostra o caminho provável: obrigações de transparência por setor, enquanto o PL 2338 segue parado, como discutimos ao mostrar o comprador assumindo o papel de regulador.
O pipeline pode apagar a marca. Fluxos de conteúdo editam, traduzem, resumem e encaixam texto em templates. Cada etapa enfraquece o sinal. Se a marca importa para um produto, ela precisa ser testada na saída real do sistema, e não na saída do modelo. Hoje você nem consegue fazer esse teste, porque o detector é restrito. Mais um motivo para manter registros próprios.
Seus logs são a proveniência mais forte. A marca diz pouco; os logs da aplicação dizem quem pediu o quê, qual modelo e versão respondeu, qual template e quais edições humanas vieram depois. Isso responde ao que a marca não responde. Esses logs têm dados pessoais e entram na política de retenção da LGPD como qualquer outro registro.
Detector não decide sobre pessoas. Com 1% de falso positivo, uma checagem em 100 mil documentos marca cerca de mil que nenhum modelo marcou, e deixa passar texto de IA editado. Em investigação de RH, disputa com fornecedor ou análise de fraude, o resultado é uma evidência para um revisor humano. Se a decisão for tomada só pelo detector, o titular pode pedir revisão com base no artigo 20 da LGPD, e a empresa vai precisar explicar um critério que nem a OpenAI considera conclusivo. É a mesma regra que defendemos ao falar de controles que geram evidência: evidência alimenta a decisão, não a substitui.
O que fazer agora
- Liste os produtos que geram texto para usuários na UE e avalie com o jurídico se a empresa é fornecedora para o Artigo 50.
- Decida a marca d’água da API por produto e documente o motivo.
- Teste onde o pipeline transforma o texto (edição, tradução, template) antes de contar com qualquer marca.
- Fortaleça os logs de proveniência: pedido, modelo e versão, template, edições humanas.
- Proíba por política decisões automatizadas com base em detecção em RH, fornecedores e fraude.
- Pergunte ao seu provedor de nuvem quando a marca chega aos modelos da OpenAI na plataforma dele.
Para fechar
A OpenAI foi franca: marca d’água em texto é um sinal fraco e probabilístico, que se degrada com edição e não diz quem escreveu, quanto, nem se é verdade. Ative onde a lei pede, mantenha registros melhores do que a marca e nunca deixe a presença ou a ausência dela decidir algo sobre uma pessoa.