Os 10% que ninguém calculou: o que a demissão na Anthropic acertou, e o que não acertou
Um pesquisador da Anthropic se demitiu avisando que a IA poderia matar todo mundo. Outro disse que, na opinião dele, isso passa de 10%. Nenhum dos dois números veio de um cálculo — e isso não significa que a pergunta de fundo esteja errada.
Em 9 de setembro de 2026, Jacob Coxon postou de um banco de praça em San Francisco que tinha se demitido da Anthropic, abrindo mão de dois meses de ações que ainda não tinham vestido. Ele passou três anos em pesquisa de pré-treinamento, primeiro na OpenAI, depois na Anthropic. O post dele — “eles estão correndo direto para uma superinteligência autoaprimorável e apostando com nossas vidas” — bateu 90 milhões de visualizações em menos de um dia (Axios). Evan Hubinger, líder de “alignment science” da Anthropic, respondeu em apoio: “nós realmente acreditamos que a IA pode matar todos os humanos. Eu pessoalmente acho que é >10% na próxima década” (X). Três dias depois, o CEO Dario Amodei publicou seu próprio alerta de que enxames de agentes de IA poderiam “tomar conta de toda a internet” em 6 a 12 meses sem salvaguardas mais fortes (Forkast).
É muito alarme vindo de dentro de uma única empresa, numa única semana. Parte disso pesa de verdade. Outra parte é só um número fantasiado de prova.
O número que ninguém calculou
“Mais de 10%” soa como medição. Não é — e o próprio Hubinger nunca disse que fosse. Ele estava dando uma crença pessoal sobre um sistema que ainda não existe (uma superinteligência auto-aperfeiçoável), num prazo que ele mesmo escolheu, pra um resultado sem definição combinada entre ninguém. Não há dataset, não há modelo, não há taxa de base. Isso nunca aconteceu antes, então não há taxa nenhuma pra medir.
Não é crítica isolada ao Hubinger. É a crítica padrão a todo o gênero “P(doom)”: figuras públicas da IA já colocaram esse mesmo tipo de número em qualquer lugar entre menos de 1% (Yann LeCun) e 99,999999% (Roman Yampolskiy) — uma variação que descarta qualquer um deles estar de fato calculando a mesma coisa do mesmo jeito (lista de valores de p(doom)). Uma pesquisa ampla com pesquisadores de ML cai numa mediana de uns 5%; quem topa publicar um número com nome junto se agrupa mais perto de 20%. Essa diferença é viés de seleção: quem publica porcentagem já é, de saída, a ponta mais alarmada da área.
Nada disso torna o Hubinger desonesto — torna o número decorativo. “Acho isso perigoso, e aqui está o porquê” é alegação defensável, vinda de quem tem mais acesso a modelo não lançado do que o resto de nós. “Há mais de 10% de chance” veste essa mesma alegação de medição que nunca foi possível fazer. Pra quem nunca ouviu falar de P(doom), soa resultado de laboratório, não opinião.
Isso não significa ignorar o assunto
Rejeitar a estatística não é rejeitar a preocupação. Os 10% são inventados, e a pergunta de fundo — sistema com essa capacidade deveria ter limite rígido sobre o que faz sem humano no circuito — continua merecendo ser levada a sério. Não precisa de probabilidade calculada de catástrofe pra justificar trava de segurança. Basta o fato simples de que um sistema fazendo mais coisa, mais rápido, com menos supervisão, é um sistema onde erro também se espalha mais rápido. Sem porcentagem nenhuma.
O que Asimov acertou de verdade
Então precisamos de algo como as Três Leis de Asimov — não ferir humano, obedecer humano a menos que conflite com a primeira lei, se proteger a menos que conflite com as duas primeiras? Vale lembrar o que essas leis realmente eram: não proposta de engenharia, recurso de enredo. Quase todo conto de Eu, Robô é sobre as leis falhando — duas ordens travando um impasse, “dano” redefinido de forma estreita o bastante pra permitir exatamente o dano que a regra deveria evitar, robô causando mais estrago por omissão enquanto tecnicamente obedece a letra da primeira lei. O ponto real do Asimov, décadas antes de “alinhamento” virar palavra da área, era que regra fixa sobrevive ao contato com agente capaz o suficiente só até ele achar a brecha.
Isso também explica por que Três Leis literais não se aplicam a como modelo de hoje funciona. Robô de ficção tem as leis como lógica explícita, impossível de violar por construção. Modelo de linguagem não tem essa linha de código — o comportamento vem de treino estatístico sobre quantidade enorme de dado, não de regra que se insere. Dá pra treinar um modelo pra agir como se a regra existisse. Não dá pra garantir que ele generalize essa regra pra uma situação que nunca viu no treino. Essa brecha é o motivo de existir jailbreak: a regra foi escrita, só não se sustenta em toda entrada.
O equivalente mais próximo que já existe está mais perto do espírito do Asimov do que a maioria imagina: a Anthropic treina o Claude contra uma “constituição” escrita de princípios, que o próprio modelo usa pra criticar e corrigir a própria resposta durante o treino. Lei-como-sinal-de-treino, não lei-como-código. Funciona, parcialmente, pelo mesmo motivo que sempre fez as Três Leis falharem nos contos: escrever a regra nunca foi a parte difícil. Fazer um sistema capaz e generalista de fato generalizar a intenção por trás dela, numa situação que ninguém ainda escreveu, continua sendo. Red-teaming, avaliação de capacidade antes do lançamento, pesquisa de interpretabilidade, liberação em estágios, aprovação humana pra ação de alto risco — é isso, sem glamour nenhum, que tenta fechar essa brecha.
O que construímos em vez de uma lei
A gente não é espectador neutro aqui — a Althora roda a Anne for Legal, sistema de IA já em produção dentro de escritório de advocacia, e o desenho dela é a nossa própria tentativa desse trabalho sem glamour, não uma alegação de ter resolvido algo maior. A Anne roda no próprio hardware do escritório, fallback pra nuvem desligado de propósito: se o modelo local cai, a Anne para em vez de silenciosamente buscar ajuda em algum lugar que não devia. Toda checagem reporta um estado explícito — passou, foi sinalizada, não foi verificada — e uma que nunca rodou não conta como aprovada por omissão. A Anne aponta inconsistência num processo. Não decide o que ela significa; quem decide é o advogado, sempre.
Isso não é Lei da Robótica, e não escala pra impedir superinteligência nenhuma. É o mesmo princípio numa escala que a gente consegue de fato dimensionar: manter a autonomia do modelo dentro do que ele faz bem, tornar a falha visível em vez de escondida, deixar a decisão que importa com alguém que responde por ela. Menor e mais honesto do que “10% de chance de extinção” ou “só escrever regra melhor” — mas é o que a gente conseguiu de fato construir.
O que isso significa se você toca uma empresa, não um laboratório
Se você tem uma pequena ou média empresa, nada disso muda o que deveria te preocupar neste trimestre — e não é superinteligência descontrolada. É o mesmo risco prático sobre o qual já escrevemos: ferramenta de IA que na verdade é malware vestindo marca conhecida (post em inglês), funcionário colando dado de cliente num chatbot sem contrato de confidencialidade nenhum, promessa de fornecedor que ninguém checou. O debate sobre extinção importa, e acontece entre quem constrói modelo de fronteira. O que você tem controle de verdade é menor e bem mais resolvível: essa ferramenta específica faz o que promete, com seu dado, com trava que você consegue apontar — não porcentagem que alguém inventou.
Fontes
- Axios — Scoop: Anthropic whistleblower gave up his equity to leave the company
- Evan Hubinger — post original no X
- Jacob Coxon — post original de demissão no X
- TIME — He Helped Build Powerful AI at OpenAI and Anthropic. Now He’s Afraid It Could Kill Us
- Forkast — Anthropic CEO Warns Agent Swarms Could “Take Over the Internet” Within 12 Months
- Axios — Dario Amodei’s fear of a botnet taking over the internet might not be feasible, experts say
- PauseAI — List of p(doom) values
- Wikipedia — P(doom)
Este texto foi escrito em conjunto por Alvaro Lopes e o Claude Code. Nenhuma IA foi maltratada, e — até onde a gente sabe — nenhuma virou Skynet no processo. P(doom) desta colaboração específica: 0%, mas a essa altura você já sabe exatamente quanto vale esse número.