Análise da Invisible Work

Eles não erraram por engano. Fizeram a conta, por escrito.

Documentos de dois processos judiciais contra a OpenAI e a Microsoft mostram executivos discutindo por escrito um risco que conheciam, e decidindo seguir em frente. Uma leitura da Invisible Work sobre o que isso muda na hora de avaliar qualquer fornecedor de IA.

Invisible Work10 min de leitura

Parte 1 / Entenda os dados

Dois processos, duas empresas, o mesmo padrão nos bastidores

Em setembro de 2026, dois processos contra a OpenAI e a Microsoft tornaram públicas mensagens que as empresas nunca pretenderam mostrar: conversas de Slack, e-mails e depoimentos sob juramento. Um dos processos é movido por autores de livros (Authors Guild v. OpenAI, documentos divulgados em 17 de setembro). [1] afirmação da fonte original O outro, por veículos de notícia, entre eles a própria Mother Jones, que publicou os trechos (petição de 4 de setembro, reportagem de 22 de setembro). [2] afirmação da fonte original Quem processa, o conteúdo em disputa e o argumento jurídico são diferentes. O jeito como as empresas falavam internamente sobre o problema é o mesmo.

Comecemos pelos livros. A Microsoft sabia desde abril de 2019 que a OpenAI usava o LibGen, um acervo de livros pirateados. Foi quando Sam Altman e Dario Amodei, então diretor de pesquisa da OpenAI, apresentaram uma primeira versão do GPT-3 a Bill Gates e a Kevin Scott, diretor de tecnologia da Microsoft, e contaram de onde vinha parte dos dados. [1] afirmação da fonte original Amodei comentou que, como base de treinamento, o LibGen era “um pouco mais duvidoso”. O pesquisador Sam McCandlish explicou por que isso não impediu o uso:

Citação direta do processo (Slack interno, 2019)

“Minha preocupação era só com a imagem: seria ruim aparecer no Hacker News algo como ‘openai usa dados protegidos de um site russo duvidoso’.” [1] afirmação da fonte original

A preocupação não era com a lei. Era com onde a notícia poderia sair. Em maio de 2020, Jack Clark, então diretor de políticas da OpenAI, escreveu sobre o efeito do trabalho da empresa sobre escritores: “nosso trabalho vai deixar gente sem emprego […] vai chegar uma hora em que artistas vão se queixar do que estamos fazendo, e provavelmente vamos ignorar e lançar mesmo assim”. [1] afirmação da fonte original Em 2022, Tarun Gogineni, contratado para melhorar a escrita dos modelos, disse que sua missão era fazer o GPT “terminar” os dois últimos livros de George R. R. Martin. Sobre os autores que acusavam a empresa de usar “dados roubados”, disse que as queixas não o comoviam muito, chamou o efeito de “disrupção econômica aceitável” e previu “a morte do leitor”, com “máquinas produzindo lixo para outras máquinas”. [1] afirmação da fonte original

No processo dos veículos de notícia, o tom é parecido. Um documento interno da Microsoft previa que “milhões de pessoas no mundo inteiro logo vão enxergar os grandes modelos sugando todo o trabalho delas como um roubo espantoso, de proporções inéditas”, e admitia que “quase ninguém criou seu conteúdo para que fosse usado assim, nem recebe por esse uso”. [2] afirmação da fonte original Brent Hecht, diretor de ciência aplicada da Microsoft, descreveu uma “espiral destrutiva” capaz de “ameaçar a base econômica dos fornecedores essenciais” da própria empresa. [2] afirmação da fonte original Satya Nadella afirmou sob juramento que empresas de IA não deveriam “acessar dados em violação aos termos de uso” de quem os publicou. [2] afirmação da fonte original Glen Weyl, que fundou uma unidade de pesquisa da Microsoft, escreveu que remunerar os criadores era “do interesse do meu empregador, do meu país e de vários outros grupos de que faço parte”. [2] afirmação da fonte original Nenhuma dessas três falas impediu o contrário na prática: as informações que identificavam o dono de cada texto (autor, aviso de direitos autorais, termos de uso) foram removidas sistematicamente dos dados antes do treinamento. [2] afirmação da fonte original

Trechos idênticos de 25 palavras, ChatGPT × Mother Jones
400 mil+
Encontrados num teste com 20 milhões de respostas do ChatGPT comparadas ao acervo da revista, segundo o processo movido pela Mother Jones e outros veículos.
Menos cliques em notícias, busca com IA vs. busca comum
90%
Segundo pesquisa interna da própria Microsoft, citada no mesmo processo.
Entre saber e apagar
3 anos
De abril de 2019 (apresentação a Bill Gates, com o uso do LibGen já revelado) a junho de 2022 (decisão de remover os arquivos, no que a OpenAI chamou de “Project Clear”).

O que fecha o argumento não é o uso em si. É o que aconteceu quando o risco de exposição apareceu. Em junho de 2022, um funcionário da OpenAI perguntou no Slack: “quanto devemos nos preocupar com as menções ao libgen? (estão por todo o google docs/slack/github…)”. [1] afirmação da fonte original Na mesma noite, o vice-presidente de pesquisa respondeu: “como a OpenAI está muito na mídia, este é o momento certo de tirar o Libgen dos nossos sistemas e servidores. O que seria preciso para isso?” [1] afirmação da fonte original A limpeza, batizada internamente de “Project Clear”, aconteceu naquele mesmo ano. Depois que os processos foram abertos, a OpenAI também criou um filtro para que seus modelos deixassem de reproduzir o texto dos veículos que a processavam, e apenas deles. Segundo a petição, “o objetivo […] não era impedir que os modelos da OpenAI violassem direitos autorais, mas impedir que os autores da ação reunissem provas da cópia para usar no processo”. [2] afirmação da fonte original Hecht, da Microsoft, chamou o efeito disso de “acobertamento acidental”, porque também dificultava que os donos do conteúdo soubessem o que tinha sido usado. [2] afirmação da fonte original

O que isso não prova

Os dois processos ainda não têm sentença. As citações vêm de petições de quem está processando, e quem processa escolhe o trecho mais favorável ao próprio argumento. A Mother Jones, inclusive, é parte no segundo processo, não uma observadora neutra. As empresas ainda vão apresentar sua defesa e o contexto de cada frase na Justiça, e as reportagens citadas não trazem esse outro lado. O que dá peso às citações é a origem (mensagens internas, entregues por ordem judicial, e não declarações preparadas para o público) e o fato de o mesmo padrão aparecer em dois processos diferentes, contra duas empresas, conduzidos por equipes jurídicas diferentes.

Termos deste texto, em uma frase

Discovery: no processo americano, a fase em que cada parte é obrigada a entregar à outra seus documentos internos, inclusive os que preferiria esconder. Petição: o documento em que uma das partes apresenta ao juiz os fatos e os argumentos, com as provas anexadas.

Parte 2 / First principles

Para dizer “não sabíamos”, ninguém pode ter escrito que sabia

A explicação mais comum quando uma empresa de tecnologia passa do limite é a do acidente: na pressa da corrida, alguém avançou rápido demais e só depois percebeu o problema. Pensar a partir dos fundamentos é inverter a pergunta: e se ninguém percebeu depois, porque todo mundo sabia antes e seguiu em frente? Nos dois casos, é o que os documentos mostram. McCandlish não escreveu “não sabíamos que era um problema”. Escreveu que o problema seria a notícia sair no Hacker News. Gogineni não disse que a queixa dos autores era infundada. Disse que ela não o comovia o suficiente para pesar mais que o produto.

Em 1957, os sociólogos Gresham Sykes e David Matza estudaram outra pergunta: como um jovem que continua achando errado roubar consegue roubar mesmo assim. A resposta deles foi que ninguém precisa deixar de saber que algo é errado para fazê-lo. Basta uma “técnica de neutralização”, uma justificativa que cala a consciência pelo tempo necessário. [5] afirmação da fonte original

Duas das cinco técnicas que Sykes e Matza descreveram aparecem quase ao pé da letra nas mensagens dos executivos: negar o dano (“não foi nada demais, dá para absorver o prejuízo”) e negar a vítima (“eles mereceram”). [5] afirmação da fonte original “Disrupção econômica aceitável” é negar o dano com vocabulário de consultoria. Dizer que a queixa dos autores não comove é negar a vítima com tom de reunião de trabalho.

O que este cruzamento não é

Sykes e Matza estudaram delinquência juvenil nos anos 1950, não decisões de empresas de tecnologia, e nunca comentaram estes casos. A leitura que aplica a teoria às mensagens acima é da Invisible Work.

Parte 2 / A prova que pesa mais

A intenção se discute. O que fizeram quando alguém podia ver, não

O argumento mais forte dos dois processos não é uma frase isolada. É a sequência de datas. Em abril de 2019, o uso do LibGen já era conhecido no topo das duas empresas, Bill Gates incluído. Por três anos, nada muda. Em junho de 2022, alguém pergunta no Slack se as menções ao LibGen “por todo lado” são um risco, porque “a OpenAI está muito na mídia”, e a remoção dos arquivos é decidida ali mesmo. [1] afirmação da fonte original O gatilho não foi a ilegalidade, que já existia havia três anos. Foi a chance de alguém de fora descobrir.

No processo dos veículos de notícia, o padrão se repete num prazo mais curto. Assim que as ações foram abertas, a OpenAI criou um filtro para não reproduzir o texto de quem a processava, e só dessas empresas. [2] afirmação da fonte original Se o objetivo fosse parar de violar direitos autorais, o filtro valeria para todos. Proteger apenas quem abriu um processo é proteger a defesa no processo, não o dono do conteúdo.

Parte 3 / O que fazer com isso

A pergunta certa não é se o fornecedor de IA é ético. É que conta ele já fez

A lição prática não é “desconfie de toda empresa de IA”. É entender que “não sabíamos” é uma afirmação que pode ser checada, não uma questão de fé, e que quem decide correr um risco sob pressão de mercado quase sempre deixa por escrito que sabia.

  1. Olhe o histórico, não só o discurso oficial.

    Termos de uso e notas de compliance dizem o que a empresa promete. O que ela já fez quando o risco de exposição aumentou (se corrigiu o problema para todos ou só para quem reclamou) diz o que ela pratica.

  2. Trate frases que minimizam o impacto como sinal de alerta.

    “É disrupção normal”, “todo mundo vai se adaptar”, “o impacto é aceitável”: no seu time ou no de um fornecedor, são o mesmo tipo de frase das citações acima. Sozinhas, não provam má-fé, mas indicam a hora de perguntar o que exatamente está sendo minimizado.

  3. Registre a decisão antes de agir, não depois.

    Se a empresa decidir seguir em frente mesmo sabendo de um risco (de direito autoral, de dado de cliente, de terceiros), registrar por escrito a decisão e o motivo antes de agir é o que diferencia um risco assumido de um risco escondido, caso um dia venha a público.

Parte 4 / Perguntas para levar adiante

Seis perguntas para separar risco assumido de risco escondido

Divididas em dois grupos: um sobre como avaliar quem fornece a IA que sua empresa usa, outro sobre como sua própria empresa fala de risco internamente.

Sobre um fornecedor de IA

  1. Da última vez que esse fornecedor enfrentou um risco jurídico ou de imagem, o que ele mudou: a regra para todos os clientes ou só para quem reclamou?
  2. O que o fornecedor diz sobre uso de dados e direitos autorais bate com o que ele já fez, ou só com o que ele promete?
  3. Alguém no seu time, fora do jurídico, já leu os termos de uso de verdade, e não só o resumo do material de vendas?

Sobre a sua própria empresa

  1. Existe hoje alguma decisão arriscada em andamento que ninguém registrou por escrito, com o motivo, antes de agir?
  2. Quando alguém minimiza um impacto negativo (“é normal”, “eles se adaptam”), alguém pergunta de volta: normal para quem, e com base em quê?
  3. Se as conversas internas da empresa se tornassem públicas amanhã, qual frase mais te preocuparia, e o que isso diz sobre uma decisão que já foi tomada?

Outra análise