← Todos os insights

Análise de notíciaRecorte: Brasil5 min de leitura

A OpenAI começa a marcar texto gerado por IA na União Europeia. Marca d'água é indício, não veredito

O textGrain da OpenAI é opcional na API para clientes do mundo todo e chega ao ChatGPT e ao Codex na UE. Os próprios testes da OpenAI mostram por que a detecção não decide autoria.

Ouça este artigo · 6 min

Narração completa do artigo, gerada por IA.

Uma impressão digital em tinta sobre papel texturizado, em duotone La Madre, ao lado das palavras Sinal, não prova
Foto: rawpixel (CC0)

Em 5 de outubro, a OpenAI explicou como vai cumprir a exigência do EU AI Act de tornar o texto gerado por IA identificável por máquina. A resposta é uma marca d’água estatística chamada textGrain, e a parte mais útil do anúncio é a lista do que uma marca d’água não consegue dizer. Quem pensa em plugar um detector em decisões de RH, compliance ou prevenção a fraude deveria ler essa parte primeiro.

O que a OpenAI está lançando, e onde

  • API, no mundo todo, opcional. Desde 5 de outubro, clientes da API em qualquer país podem ativar o texto com marca d’água em modelos selecionados. Na API, a marca fica desligada por padrão.
  • ChatGPT e Codex, só na União Europeia. Nas próximas semanas, o texto elegível de usuários de todos os planos na UE passa a sair com marca d’água invisível. A OpenAI diz que, de propósito, não fará disso um padrão global no lançamento.
  • Detector restrito. Pesquisadores e organizações especializadas aprovados podem pedir acesso, concedido caso a caso. O detector não está aberto ao público e informa apenas se encontrou uma marca da OpenAI, sem identificar o usuário nem revelar prompts.
  • Provedores de nuvem depois. A OpenAI diz que trabalha com parceiros de nuvem para oferecer a marca nos modelos acessados por eles “nas próximas semanas”.

O textGrain coloca um sinal estatístico invisível na escolha de palavras do modelo. A OpenAI diz não ver diferença relevante nos benchmarks com e sem marca no seu modelo de fronteira atual, afirma que o textGrain igualou ou superou outras técnicas testadas, inclusive o SynthID para texto, e pretende abrir o código.

O que os números da própria OpenAI dizem

Com uma meta de 1% de falso positivo, o detector encontrou a marca em cerca de 80% dos trechos de 200 tokens e em cerca de 95% dos trechos de 400 tokens, em conteúdo como respostas de psicologia. Em matemática, onde a escolha de palavras é mais restrita, a taxa foi bem menor. Edição pesa ainda mais: trocar 10% das palavras por sinônimos em trechos de 400 tokens derrubou a detecção de cerca de 92% para 66%; trocar 25% derrubou para 17%.

E vem a lista que importa. A marca d’água não mede quanto uma pessoa contribuiu. Não estabelece autoria jurídica nem responsabilidade. Não identifica o usuário. Não verifica se o conteúdo é correto. E não encontrar a marca não prova autoria humana: o texto pode ser curto, editado, traduzido, ou vir de outro modelo ou de outra empresa.

O que um resultado de detecção diz e não diz

Seis perguntas que vão fazer a uma marca d'água01Um modelo daOpenAI gerouparte disto?02Quanto umapessoacontribuiu?03Quem escreveuou enviou?04De quem é,quemresponde?05Está correto?06Sem marca:foi umapessoa?Um sinal probabilístico, no máximoPrecisa de outra evidência
  1. Um modelo da OpenAI gerou parte disto?
  2. Quanto uma pessoa contribuiu?
  3. Quem escreveu ou enviou?
  4. De quem é, quem responde?
  5. Está correto?
  6. Sem marca: foi uma pessoa?

Um sinal probabilístico, no máximoPrecisa de outra evidência

Só a primeira pergunta está no escopo, e mesmo essa resposta tem taxa de erro que cresce em texto curto ou editado.

O que muda para os times

A regra europeia não vale no Brasil, mas pode valer para o seu produto. O Artigo 50 do EU AI Act está em vigor desde 2 de agosto de 2026, com prazo até 2 de dezembro de 2026 para sistemas que já estavam no mercado, segundo o resumo do escritório Baker Botts. Se a sua empresa oferece um recurso de IA generativa a usuários na UE, como uma fintech ou um SaaS brasileiro com clientes europeus, o dever de marcar pode recair sobre ela, como fornecedora do sistema. A opção na API vale para clientes do mundo todo, então a decisão é por produto e por mercado, com o jurídico.

No Brasil, a rotulagem chegou primeiro pelo setor. A resolução do TSE para as eleições de 2026 exige que conteúdo sintético multimídia em propaganda eleitoral seja identificado de forma explícita, e o segundo turno ainda vem pela frente. O foco é conteúdo multimídia, com aviso no próprio áudio, imagem ou vídeo, e a regra vale para campanhas, não para empresas em geral. Mas mostra o caminho provável: obrigações de transparência por setor, enquanto o PL 2338 segue parado, como discutimos ao mostrar o comprador assumindo o papel de regulador.

O pipeline pode apagar a marca. Fluxos de conteúdo editam, traduzem, resumem e encaixam texto em templates. Cada etapa enfraquece o sinal. Se a marca importa para um produto, ela precisa ser testada na saída real do sistema, e não na saída do modelo. Hoje você nem consegue fazer esse teste, porque o detector é restrito. Mais um motivo para manter registros próprios.

Seus logs são a proveniência mais forte. A marca diz pouco; os logs da aplicação dizem quem pediu o quê, qual modelo e versão respondeu, qual template e quais edições humanas vieram depois. Isso responde ao que a marca não responde. Esses logs têm dados pessoais e entram na política de retenção da LGPD como qualquer outro registro.

Detector não decide sobre pessoas. Com 1% de falso positivo, uma checagem em 100 mil documentos marca cerca de mil que nenhum modelo marcou, e deixa passar texto de IA editado. Em investigação de RH, disputa com fornecedor ou análise de fraude, o resultado é uma evidência para um revisor humano. Se a decisão for tomada só pelo detector, o titular pode pedir revisão com base no artigo 20 da LGPD, e a empresa vai precisar explicar um critério que nem a OpenAI considera conclusivo. É a mesma regra que defendemos ao falar de controles que geram evidência: evidência alimenta a decisão, não a substitui.

O que fazer agora

  1. Liste os produtos que geram texto para usuários na UE e avalie com o jurídico se a empresa é fornecedora para o Artigo 50.
  2. Decida a marca d’água da API por produto e documente o motivo.
  3. Teste onde o pipeline transforma o texto (edição, tradução, template) antes de contar com qualquer marca.
  4. Fortaleça os logs de proveniência: pedido, modelo e versão, template, edições humanas.
  5. Proíba por política decisões automatizadas com base em detecção em RH, fornecedores e fraude.
  6. Pergunte ao seu provedor de nuvem quando a marca chega aos modelos da OpenAI na plataforma dele.

Para fechar

A OpenAI foi franca: marca d’água em texto é um sinal fraco e probabilístico, que se degrada com edição e não diz quem escreveu, quanto, nem se é verdade. Ative onde a lei pede, mantenha registros melhores do que a marca e nunca deixe a presença ou a ausência dela decidir algo sobre uma pessoa.

Tem um caso de uso de IA parado entre o protótipo e a produção?

Conte o que você quer colocar no ar. Respondemos com próximos passos honestos.

Converse sobre um caso de uso