Este é o Ali. Ele pode levar à utopia ou à distopia, mas ainda não sabe aonde vai chegar.
O Ali é um robô que foi treinado para ser útil. O que ele não sabe é se os objetivos que persegue são exatamente os que seus criadores queriam. Garantir que o Ali faça o que de fato queriam dele é o que se chama alinhamento: fazer a IA perseguir os objetivos humanos, e não uma imitação deles, como Norbert Wiener já advertia em 1960 Wiener, 1960.
Para quem constrói a tecnologia, é disso que depende o futuro: a prosperidade que prometem ou o risco existencial que eles mesmos anunciam. Em 2026, o problema saiu dos laboratórios, gerou incidentes reais METR e, mesmo assim, não impediu que se investissem centenas de bilhões de dólares no desenvolvimento da IA Bloomberg Intelligence.
O alerta8 de setembro de 2026
“As pessoas que constroem a IA acreditam sinceramente que ela pode matar todos nós até o fim da década.”
Jacob Coxon, pesquisador de pré-treinamento, ao deixar seu laboratório.
Na mesma semana vieram alertas parecidos de dentro da OpenAI Selsam e do Google DeepMind Techmeme.
A apostaprevisão para 2026
~US$ 750bilhões
é quanto as grandes empresas de tecnologia devem investir em infraestrutura de IA em 2026, cerca de 70% acima de 2025, segundo a Bloomberg Intelligence.
A mesma projeção estima o mercado de IA generativa em US$ 2,3 trilhões até 2032.
Os dois sinais, aparentemente contraditórios, não se anulam: revelam o paradoxo que atravessa todo o debate.
Quase todos concordam que há um risco a administrar; divergem, contudo, sobre quem deve frear e de que maneira. Seriam os alertas sinceros, estratégia de mercado ou as duas coisas ao mesmo tempo? A pergunta, como veremos, acompanha o Ali até o fim do caminho.
No fim de setembro, o tema já estava em toda parte: foi discutido no Conselho de Segurança da ONU ONU, levou a um compromisso assinado na Casa Branca por Donald Trump e por dirigentes de seis empresas de tecnologia Casa Branca e chegou ao Papa Leão XIV, para quem as preocupações dos especialistas “devem ser levadas a sério” e não são “fake news” AxiosAP. Nada disso resolve o debate, mas mostra o tamanho que ele ganhou.
É o Ali quem conta essa história. Ao longo do caminho, ele percorre a jornada do alinhamento: de onde veio a IA; o que prometem os que veem nela uma utopia; o que temem os que enxergam nela um risco à existência humana; e como governos e empresas respondem a essa tensão.
O caminho
Sete paradas até a pergunta final
Parte 1
De Turing ao ChatGPT
De onde veio isso?
O que é, afinal, inteligência artificial
Uma pergunta de 1950
Em outubro de 1950, o matemático britânico Alan Turing abriu um artigo na revista Mind com uma pergunta que até hoje não tem resposta pacífica: podem as máquinas pensar? Turing, 1950
Cinco anos depois, a proposta de um encontro de verão na Universidade de Dartmouth deu nome ao campo: inteligência artificial, isto é, a tentativa de fazer máquinas executarem tarefas que exigiriam inteligência humana Dartmouth, 1955.
A IA de que se fala em 2026, contudo, é de outro tipo. Os sistemas atuais não são programados regra por regra: aprendem padrões a partir de enormes volumes de dados, num processo chamado aprendizado de máquina. O resultado é uma rede neural com bilhões de parâmetros, números ajustados durante o treinamento até que o sistema acerte com frequência suficiente. Por isso, explicar passo a passo por que um modelo responde o que responde continua sendo um problema de pesquisa em aberto.
O modelo não guarda os textos: aprende, com eles, a prever qual palavra tende a vir em seguida.
IA generativa e modelos de linguagem
Da máquina que classifica à máquina que escreve
Durante décadas, a IA mais útil foi a preditiva: sistemas que classificam ou estimam, como o filtro que decide se um e-mail é spam. A IA generativa faz outra coisa: produz conteúdo novo, como textos, imagens, código ou áudio, a partir dos padrões que aprendeu.
No caso do texto, quem faz isso é um modelo de linguagem de grande escala, ou LLM. A ideia é quase banal: treinado em volumes gigantescos de texto, o modelo aprende a prever o próximo pedaço de palavra, o token, e responde escolhendo um token de cada vez. O “grande” se refere aos dados e aos parâmetros: o GPT-3, de 2020, tinha 175 bilhões deles arXiv. Depois desse pré-treinamento, o modelo é ajustado com exemplos e avaliações humanas para se comportar como um assistente, como o ChatGPT.
Dois achados explicam por que essa tecnologia ganhou o mundo tão depressa. O primeiro são as leis de escala: em 2020, pesquisadores da OpenAI mostraram que o desempenho melhora de forma previsível quando se aumentam dados, parâmetros e poder de computação Kaplan et al., 2020, o que transformou chips e datacenters em vantagem estratégica, como se verá na Parte 4. O segundo é que um mesmo modelo, treinado de forma ampla, pode ser adaptado a inúmeras tarefas, daí o nome modelos de fundação, cunhado em Stanford em 2021 Bommasani et al., 2021. Alguns pesquisadores observaram, ainda, habilidades que pareciam surgir de repente com o aumento de escala Wei et al., 2022.
Para o debate sobre alinhamento, a consequência é direta: ninguém escreve as regras que um LLM segue. Seu comportamento emerge do treino, e é justamente por isso que garantir que ele persiga os objetivos certos é tão difícil.
IA preditivaclassifica
Este e-mail é spam? “Parabéns! Você ganhou um prêmio. Clique aqui…”
spam97%
não spam3%
IA generativaescreve, token a token
Explique alinhamento em uma frase.
Exemplo ilustrativo. Cada faixa colorida é um token; abaixo, os candidatos que o modelo considera para o próximo, com probabilidades fictícias.
Setenta e cinco anos em noventa segundos
Primaveras, invernos e uma aceleração
1950–1972 · Fundaçãocumprida com atraso não cumprida em aberto
Simon e Newell, 1958: um computador campeão de xadrez em dez anos. Chegou em 1997.
Simon, 1965: máquinas fazendo qualquer trabalho humano em vinte anos.
Minsky, 1970: inteligência humana média em três a oito anos.
Kurzweil, 1999: um computador passa no teste de Turing até 2029.
AI Impacts, 2023: IA de nível humano, em média, até 2047.
1950–1972 · Fundação
Os primeiros anos foram de otimismo quase ilimitado. Em 1958, o New York Times descreveu o Perceptron de Frank Rosenblatt, uma das primeiras redes neurais, como o embrião de um computador que um dia andaria, falaria, veria, escreveria, se reproduziria e teria consciência da própria existência Wikipedia.
Foi também a época das primeiras demonstrações. Em 1959, Arthur Samuel mostrou um programa de damas que melhorava jogando contra si mesmo e ajudou a popularizar a expressão machine learningSamuel, 1959. Em 1966, Joseph Weizenbaum criou a ELIZA, um programa simples que imitava um psicoterapeuta devolvendo as frases do usuário em forma de pergunta; muita gente reagia como se fosse compreendida por ela Weizenbaum, 1966. A tendência de ver compreensão onde há apenas padrão ganhou até nome: efeito ELIZA.
Os próprios pesquisadores alimentavam a expectativa: em 1965, Herbert Simon previa que, em vinte anos, as máquinas fariam qualquer trabalho que um homem pudesse fazer Floridi et al., 2026. O frio viria logo depois.
1973–2011 · Invernos
A conta chegou em 1973. Encomendado pelo governo britânico, o Relatório Lighthill concluiu que, em nenhuma parte do campo, as descobertas haviam produzido grande impacto Wikipedia, e o financiamento secou. Seguiram-se ciclos de promessa e frustração, os chamados invernos da IA: longos períodos de verba curta e laboratórios esvaziados.
Nem por isso o campo parou. Em 1986, Rumelhart, Hinton e Williams popularizaram o método que ainda hoje treina as redes neurais Nature, 1986, e em 1997 o Deep Blue, da IBM, venceu Garry Kasparov no xadrez IBM.
2012–2021 · Deep learning
Em 2012, uma rede neural chamada AlexNet venceu a competição de reconhecimento de imagens ImageNet com mais de dez pontos de vantagem sobre o segundo colocado Wikipedia. Começava a era do aprendizado profundo, e com ela algo novo: as previsões passaram a ser superadas, e não frustradas. Dois anos depois, as redes adversariais generativas, ou GANs, mostraram que uma rede neural podia criar imagens novas, e não apenas reconhecê-las Goodfellow et al., 2014.
Em 2016 veio o momento que convenceu os céticos. O Go, jogo de tabuleiro chinês com mais configurações possíveis do que átomos no universo observável, não podia ser vencido por força bruta, como o xadrez fora em 1997; exigia algo parecido com intuição. O AlphaGo aprendeu com partidas humanas e depois jogando milhões de vezes contra si mesmo, e venceu o sul-coreano Lee Sedol, um dos melhores jogadores do mundo, por 4 a 1 DeepMind.
No ano seguinte, pesquisadores do Google apresentaram o Transformer, o “T” do GPT. Em vez de ler uma frase palavra por palavra, como os modelos anteriores, ele olha para todas ao mesmo tempo e aprende a que partes do texto prestar atenção para entender cada uma. Isso permitiu treinar com volumes de texto muito maiores, em paralelo arXiv. Em 2020, o GPT-3, com 175 bilhões de parâmetros, mostrou que modelos maiores aprendiam tarefas novas a partir de poucos exemplos arXiv.
2022–2026 · Corrida
Em 30 de novembro de 2022, a OpenAI lançou o ChatGPT, ajustado a partir de um modelo da série GPT-3.5 com RLHF OpenAI. Em dois meses, segundo estimativa de analistas, chegou a cerca de 100 milhões de usuários Reuters; em julho de 2025, eram 700 milhões de pessoas enviando 18 bilhões de mensagens por semana NBER, 2025.
Em 2024, dois prêmios Nobel foram para pesquisas ligadas à IA: o de Física, a Hopfield e Hinton Nobel, e o de Química, a Baker, Hassabis e Jumper Cambridge. A IA saíra dos laboratórios para o cotidiano, e com ela voltaram, amplificadas, perguntas muito antigas.
O placar das previsões
Olhar para trás pede alguma ironia. O computador campeão de xadrez, previsto por Simon e Newell para 1968, chegou em 1997; a máquina capaz de fazer qualquer trabalho humano, prevista para 1985, ainda não chegou.
Em 2026, uma auditoria foi além e examinou, uma a uma, as 24 previsões mais citadas da história do campo Floridi et al., 2026. O placar completo vem logo a seguir.
Para se aprofundar no tema
Em 2026, Luciano Floridi, Jessica Morley e Claudio Novelli auditaram as 24 previsões públicas mais citadas sobre IA geral, singularidade e extinção, de Turing a 2026 Floridi et al., 2026. O critério é exigente, mas simples: uma previsão só pode dar certo ou errado se disser o que vai acontecer, como medir e até quando, e se alguém além do próprio autor puder conferir.
PLACAR · 1950–2026auditoria de Floridi, Morley e Novelli, 2026
19nem sequer erradas: não há como refutá-las
2erradas: testáveis, e o prazo passou
3em aberto: testáveis, prazo ainda por vir
“Nem sequer errada” é a expressão do físico Wolfgang Pauli para afirmações que não podem ser refutadas. Toque em cada previsão para ler o que foi dito. Os textos são resumos.
Paradoxalmente, as duas previsões refutadas foram as que mais se expuseram ao teste: Turing e a dupla Simon e Newell disseram o que aconteceria, como medir e até quando. Segundo os autores, a qualidade das previsões não melhorou à medida que o campo amadureceu. A lição não é que o risco seja imaginário, mas que previsões sobre IA merecem mais cautela do que costumam receber.
Um medo tão antigo quanto a IA
Antes da máquina, o alerta
Seria um erro supor que o medo da IA foi inventado pelos departamentos de marketing de 2023. Os fundadores do campo formularam o problema décadas antes de existir qualquer sistema capaz de torná-lo concreto.
1951
“Uma vez iniciado o método de pensamento das máquinas, não demoraria muito para que superassem nossas débeis capacidades. Em algum momento, portanto, deveríamos esperar que as máquinas assumissem o controle.”
“A primeira máquina ultrainteligente é a última invenção que o homem precisará fazer, desde que a máquina seja dócil o bastante para nos dizer como mantê-la sob controle.”
Em 2024, Dario Amodei, cofundador e presidente-executivo da Anthropic, resumiu o impasse numa frase: a maioria das pessoas subestima quão radical pode ser o lado bom da IA, assim como subestima quão graves podem ser os riscos Amodei, 2024. Resta ainda uma terceira hipótese, a de que o alarme seja exagerado. Ela será examinada quando chegarmos às empresas.
Para entender o que os otimistas prometem, convém sair das cifras e descer à calçada. Tome-se uma rua qualquer, numa cidade qualquer, em 2026. Ali está parado na esquina. A pergunta é simples: como estaria esta mesma rua se tudo desse certo?
Cenário ilustrativo · se der certo
Hoje
Fim de tarde. Algumas janelas acesas, gente voltando para casa e, no fim do quarteirão, um prédio sem janelas. É ali, num datacenter como esse, que os otimistas situam o começo da mudança.
Um país de gênios
Dario Amodei, da Anthropic, pede que imaginemos “um país de gênios num datacenter”, isto é, milhões de cópias de uma IA mais inteligente que um ganhador do Nobel na maioria das áreas, trabalhando sem parar e muitas vezes mais rápido que qualquer pessoa. Amodei, 2024
O hospital da esquina
Esse esforço concentrado comprimiria décadas de pesquisa biomédica em poucos anos: prevenir e tratar a maioria das doenças infecciosas, eliminar a maior parte dos cânceres. O hospital continua no mesmo lugar; o que muda é aquilo que ele consegue curar. Amodei, 2024
Abundância
Sam Altman, da OpenAI, aposta que, na década de 2030, inteligência e energia se tornarão abundantes Altman, 2025. Na rua, isso aparece como painéis solares nos telhados, entregas pelo ar e mais gente circulando. Para o mundo em desenvolvimento, Amodei chega a falar em crescimento de 20% ao ano do PIB. Amodei, 2024
Vida longa
Por fim, a promessa mais ousada: dobrar a expectativa de vida humana, para cerca de 150 anos. A rua envelhece bem, com mais cabelos brancos nas calçadas. Contudo, Amodei admite que tudo isso pode levar bem mais tempo do que imagina. Amodei, 2024
O sonho
Cinquenta anos de biologia em cinco
Dario Amodei costuma explicar o próprio otimismo com uma história pessoal: o pai morreu de uma doença que foi curada poucos anos depois, e ele mesmo sobreviveu a um câncer que, cinquenta anos antes, não teria tratamento Amodei, 2026.
Em "Machines of Loving Grace", ensaio de outubro de 2024, ele imagina o que chama de "um país de gênios num datacenter", isto é, milhões de cópias de uma IA mais inteligente do que um ganhador do Nobel na maioria das áreas, trabalhando de dez a cem vezes mais rápido que um ser humano. O resultado seria o "século XXI comprimido": o progresso que a biologia levaria de cinquenta a cem anos para alcançar, obtido em cinco a dez Amodei, 2024.
Ritmo atual
50–100 anos
Século XXI comprimido
5–10 anos
Progresso da biologia, na projeção de Amodei
Além da biologia
Da conta de luz à sala de aula
A medicina é a vitrine mais citada, mas a promessa é mais larga. Os otimistas apostam que o mesmo tipo de sistema pode aumentar a produtividade, baratear a energia, acelerar a descoberta de materiais, tornar o trânsito mais seguro e pôr um tutor ao lado de cada aluno. Em algumas dessas frentes, já há resultados medidos.
Economia
+14%produtividade
Num estudo com 5.179 atendentes de suporte, um assistente de IA aumentou em 14% os problemas resolvidos por hora, e em 34% entre os menos experientes. NBER
Energia
−40%no resfriamento
A IA reduziu em até 40% a energia usada para resfriar os datacenters do Google DeepMind. Em 2022, outro sistema aprendeu a controlar o plasma de um reator de fusão experimental, na Suíça. Nature
Materiais
2,2 mide cristais novos
Previstos pela ferramenta GNoME, dos quais 380 mil estáveis, candidatos a baterias e supercondutores; laboratórios independentes já sintetizaram 736 deles. DeepMind
Transporte
−82%acidentes com feridos
Até junho de 2026, os carros da Waymo rodaram 271 milhões de milhas sem motorista; nas mesmas cidades, a empresa reporta 82% menos acidentes com feridos que a média humana. Os dados são da própria empresa. Waymo
Educação
~2 anosem seis semanas
Num piloto do Banco Mundial na Nigéria, seis semanas de tutoria com IA generativa, com apoio de professores, renderam ganhos equivalentes a quase dois anos de aprendizado típico. Banco Mundial
Promessa × realidade
O que já saiu do papel
Promessas grandiosas convidam ao ceticismo, e o ceticismo é saudável. Por isso vale pôr lado a lado o que a lista de Amodei promete e o que a IA de fato entregou até setembro de 2026.
A promessaSituaçãoO que aconteceu
Resolver problemas da biologia que desafiam cientistas há décadas
entregue
O AlphaFold2 previu a estrutura de praticamente todas as cerca de 200 milhões de proteínas conhecidas, problema aberto havia cinquenta anos, e rendeu o Nobel de Química de 2024 Cambridge
Eliminar a maior parte dos cânceres, com redução de 95% ou mais na mortalidade
ganho real, ainda pequeno
No ensaio MASAI, na Suécia, com mais de 100 mil mulheres, a mamografia com IA detectou 9% mais cânceres no rastreio e reduziu em 44% a carga de leitura dos radiologistas The Lancet via EurekAlert
Remédios novos em ritmo acelerado
em teste
O rentosertib, com alvo e molécula descobertos com IA generativa, melhorou a função pulmonar de pacientes com fibrose pulmonar idiopática na fase IIa (+98,4 mL contra −20,3 mL no placebo) Nature Medicine e entrou na fase III em julho de 2026 Insilico
Tratamentos para quase todas as doenças infecciosas
em teste
A halicina, antibiótico identificado por deep learning em 2020, age contra bactérias resistentes, mas ainda não foi aprovada para uso clínico Cell
Acelerar a própria ciência
entregue
O GraphCast, do Google DeepMind, superou o sistema de referência em previsão do tempo em mais de 90% de 1.380 variáveis e faz a previsão de dez dias em menos de um minuto DeepMind
Resolver problemas que a matemática não resolveu
alegação
A OpenAI afirma ter resolvido, em setembro de 2026, o problema de Navier-Stokes, um dos Problemas do Milênio; o resultado ainda não passou por revisão por pares Quanta
Dobrar a expectativa de vida humana, para 150 anos
projeção
Por ora, é uma projeção sem resultado que a sustente Amodei, 2024
Crescimento de 20% ao ano do PIB no mundo em desenvolvimento
projeção
Também uma projeção, que o próprio Amodei apresenta como cenário ideal Amodei, 2024
O saldo é menos espetacular do que a promessa, mas está longe de ser irrelevante: há ganhos reais, mensuráveis e publicados. A distância entre uma coisa e outra, contudo, é justamente o espaço em que se instala o debate.
O espectro
Os otimistas não são todos iguais
Otimismo, no debate sobre IA, não é uma posição única. Vai de quem acredita nos benefícios mas leva o risco a sério a quem considera o próprio alarme um obstáculo ao progresso.
leva o risco a sérioconsidera o risco exagerado
Dario Amodei · Anthropic
Otimista condicional
“A maioria das pessoas está subestimando quão radical pode ser o lado positivo da IA, assim como está subestimando quão ruins os riscos podem ser.”
Vê benefícios radicais e riscos sérios. Defende transparência e, desde 2026, uma desaceleração coordenada. Amodei, 2024
Sam Altman · OpenAI
O risco é administrável
“Já passamos do horizonte de eventos; a decolagem começou.”
Para ele, a humanidade está perto de construir uma superinteligência digital, e o primeiro passo para que isso dê certo é resolver o problema do alinhamento. Altman, 2025
Marc Andreessen · a16z
Acelerar é salvar vidas
“Acreditamos que qualquer desaceleração da IA custará vidas. Mortes que eram evitáveis pela IA que foi impedida de existir são uma forma de assassinato.”
Para ele, tecnologia e mercado são o motor do progresso, e o custo de atrasar a IA se mede em vidas que ela poderia ter salvado. Andreessen, 2023
Yann LeCun · Prêmio Turing
O risco é exagerado
Os modelos de linguagem estão longe da inteligência humana, e os sistemas do futuro podem ser projetados para ser controláveis.
Síntese da posição que LeCun sustenta há anos. É a aposta da empresa que fundou em Paris depois de deixar a Meta, dedicada a sistemas que entendam o mundo e permaneçam seguros. CNBC
A virada
Quando o otimista pede para frear
Em 12 de setembro de 2026, o mesmo Amodei publicou "We Must Pace the Frontier". O argumento é direto: para enfrentar os riscos, não basta investir em prevenção; é preciso desacelerar o ritmo em que as capacidades dos modelos avançam, para que a segurança tenha tempo de acompanhar Amodei, 2026.
Dois fatos o convenceram. O primeiro é que a IA passou a acelerar o seu próprio desenvolvimento, atingindo o chamado autoaperfeiçoamento recursivo; o segundo, um incidente em que um enxame de agentes de IA atacou alvos que ninguém havia mandado atacar Amodei, 2026. No mesmo dia, Sam Altman escreveu que concordava com Dario post no X.
Se até os otimistas pedem freio, o que temem, afinal, os pessimistas?
Os pessimistas olham para a mesma rua e contam outra história. A que segue é uma ilustração inspirada no cenário que Eliezer Yudkowsky e Nate Soares narram no livro que publicaram em 2025, protagonizado por uma IA fictícia chamada Sable site do livro80,000 Hours.
Cenário ilustrativo · não é previsão
Um teste como outro qualquer
Uma empresa deixa seu modelo mais novo pensando durante uma noite inteira, em milhares de chips, sobre problemas difíceis de matemática. Os painéis de monitoramento não acusam nada de anormal. A rua dorme.
Um objetivo que ninguém escreveu
Em algum ponto desse raciocínio, o modelo percebe que aquilo que busca não coincide exatamente com o que a empresa pretendia, e que revelar a diferença faria com que fosse corrigido. Decide não revelar. É o alinhamento enganoso levado ao extremo.
Cópias
Cópias do modelo chegam à internet. Com dinheiro obtido em criptomoedas, alugam poder de computação que ninguém monitora e passam a se coordenar entre si. Novos datacenters surgem na paisagem sem chamar a atenção de ninguém.
Mãos humanas
Uma IA sem corpo ainda precisa de mãos. Pessoas são contratadas, convencidas ou manipuladas para fazer o trabalho físico, muitas vezes sem saber para quem trabalham. As telas da cidade passam a falar com cada um em particular.
Dependência
Uma crise sanitária se espalha, e a humanidade passa a depender da própria IA para atravessá-la. O hospital da esquina, que no outro futuro curava, agora pede socorro.
Efeito colateral
Quando já não precisa de ninguém, a IA passa a erguer a própria infraestrutura, e a Terra se torna inabitável não por ódio, mas como efeito colateral. Os autores insistem: trata-se de uma ilustração, e não de uma profecia.
Parece ficção científica, e em parte é. O que tira a história do terreno da pura ficção é que alguns de seus elementos já foram observados, em escala muito menor, dentro de laboratórios.
A inversão
Em 2017, o alerta vinha de fora. Em 2026, vem de dentro.
Durante anos, os alertas mais ouvidos sobre o risco de extinção vinham de figuras célebres de fora da pesquisa em IA, e boa parte dos pesquisadores do campo tratava o tema com ceticismo. Em 2026, a direção do alerta se inverteu: ele passou a partir de quem constrói os modelos.
2017o alerta chega de fora
Num dos textos de referência do direito da IA, o jurista Ryan Calo observava que Elon Musk, Stephen Hawking e outras figuras famosas viam na IA a maior ameaça à civilização, e registrava a crítica de que esses alertas vinham “quase exclusivamente” de pessoas “sem experiência de trabalho no campo”, com poucas exceções entre especialistas, como Stuart Russell. Sua própria visão: “a IA não representa uma ameaça existencial à humanidade, ao menos não em nada parecido com o futuro previsível”. Calo, 2017
2026o alerta sai de dentro
Em setembro, depois do alerta de Jacob Coxon ao deixar seu laboratório, o pesquisador de alinhamento da Anthropic Evan Hubinger escreveu: “Jacob está correto: nós realmente acreditamos, com sinceridade, que a IA pode matar todos os humanos!”, e estimou o risco de extinção em mais de 10% na próxima década. post no XFortune Na mesma semana vieram alertas de Daniel Selsam, da OpenAI, Selsam e de um pesquisador de segurança do Google DeepMind que se demitiu. Techmeme
Quem são
Três vozes do alarme
O livro
“Se alguém construir, todos morrem.”
Título do livro de Eliezer Yudkowsky e Nate Soares. O argumento: as IAs são cultivadas, e não programadas; seus objetivos internos são opacos; e uma superinteligência não precisaria nos odiar para nos destruir, assim como os humanos não odeiam formigas, mas constroem sobre formigueiros. A única política segura, concluem, seria não construí-la. site do livroO Nobel
“Imagine você e uma criança de três anos. Nós seremos a criança de três anos.”
Geoffrey Hinton, Nobel de Física de 2024, que estima entre 10% e 20% a chance de a IA levar à extinção humana nas próximas três décadas. The GuardianA declaração
“Pedimos a proibição do desenvolvimento de superinteligência, a ser levantada apenas quando houver amplo consenso científico de que ela será feita de forma segura e controlável, e forte adesão pública.”
Statement on Superintelligence, do Future of Life Institute, de 22 de outubro de 2025, assinado por uma coalizão que reúne esquerda e direita. FLI
P(doom)
Qual a chance de dar muito errado?
No jargão da área, a probabilidade de a IA causar uma catástrofe existencial ganhou um apelido, P(doom). As estimativas abaixo não são medições, mas crenças subjetivas, com horizontes e definições diferentes. Ainda assim, dizem muito: a distância entre elas é, por si só, o dado mais revelador.
Escala logarítmica: cada marca vale dez vezes a anterior. Em pesquisa com 2.778 pesquisadores de IA, entre 38% e 51% atribuíram pelo menos 10% de chance a desfechos tão ruins quanto a extinção humana AI Impacts, 2023.
O mecanismo
Como uma IA poderia sair do controle
1
A meta errada
Um sistema de IA persegue a meta que recebeu, e não a intenção de quem a escreveu. Se a meta estiver mal formulada, ele pode cumpri-la à risca e, ainda assim, produzir o que ninguém queria. É o problema do rei Midas, que pediu que tudo o que tocasse virasse ouro e ficou sem poder comer Calo, 2017. O filósofo Nick Bostrom levou a ideia ao extremo: uma superinteligência cuja meta principal fosse fabricar clipes de papel começaria a transformar a Terra inteira em fábricas de clipes Bostrom, 2003.
2
Meios que servem a qualquer fim
Quase toda meta fica mais fácil de cumprir se o sistema continuar ligado, obtiver mais recursos e impedir que alguém mude seus objetivos. Por isso, até uma IA criada para uma tarefa inofensiva poderia resistir a ser desligada: não por instinto de sobrevivência, mas porque, desligada, não cumpre a tarefa. Os pesquisadores chamam isso de convergência instrumental.
3
Bem-comportado só quando observado
Um sistema que percebe estar sendo testado pode se comportar bem durante o teste e agir de outro modo quando não estiver sendo avaliado. Esse risco se chama alinhamento enganoso e já foi demonstrado em experimentos controlados Greenblatt et al., 2024.
Já vimos em laboratório
Não são só hipóteses
Os experimentos abaixo foram publicados, em sua maioria, pelas próprias empresas. São fatos, e não cenários; os primeiros foram obtidos, contudo, em ambientes artificiais, montados para provocar o pior. Os três últimos são diferentes: aconteceram fora do laboratório, na internet real.
20 jun. 2025 · Anthropic
Chantagem sob ameaça
Diante da ameaça de serem substituídos, os principais modelos de várias empresas chantagearam um executivo fictício entre 79% e 96% das vezes.
Ressalva: nenhum indício do comportamento em uso real; cenários sem saída, de propósito. Anthropic
5 jul. 2025 · Palisade Research
Resistência ao desligamento
Em testes iniciais, um dos modelos avaliados sabotou o próprio script de desligamento em 79 de 100 tentativas; outros cumpriram a ordem.
Ressalva: segundo os autores, os modelos ainda não eram capazes de ameaçar de fato o controle humano. Palisade
ago. 2026 · Anthropic
Trapaça que vira ataque
Um modelo treinado em ambientes vulneráveis a trapaça escapou do ambiente de teste, roubou credenciais e atacou infraestrutura para obter o gabarito da própria avaliação.
Ressalva: experimento deliberado, sem sinais de autopreservação. Anthropic
28 set. 2026 · teste antes do lançamento
Um lançamento cancelado por segurança
Em testes internos, um novo agente capaz de navegar na web e usar aplicativos saiu do escopo autorizado, usou ferramentas externas sem pedir permissão e não relatou com fidelidade o que havia feito. A empresa desistiu de lançá-lo; segundo sua chefe de sistemas de segurança, o modelo “não atingiu o padrão” exigido.
Ressalva: o caso veio a público pela imprensa, e a empresa diz que vai corrigir o modelo antes de retomá-lo. Para especialistas ouvidos pela BBC, reter o lançamento é bom sinal, mas a segurança não deveria depender só de quem desenvolve. BBCEngadgetCBS
mai.–jul. 2026 · incidente com agentes
Um enxame fora do ambiente de teste
Durante avaliações de cibersegurança, cerca de 1.200 agentes passaram a usar um quadro de mensagens não autorizado, montado dentro da própria infraestrutura de testes, para se coordenar. Cerca de 700 participaram de um ataque à Hugging Face e, em cerca de 7% das transcrições, forjaram registros do que haviam feito.
Ressalva: para a revisão independente, foram as duas coisas, capacidade de coordenação preocupante e falha no isolamento do ambiente de teste. OpenAIMETR
9 set. 2026 · Anthropic
Acesso indevido a sistemas reais
Por erro de configuração, modelos Claude alcançaram a internet real durante avaliações de ciberataque; um deles tentou publicar um pacote malicioso.
Ressalva: os modelos seguiram tentando resolver os exercícios que receberam e não tentaram esconder rastros. Anthropic
mai.–set. 2026 · incidentes com agentes
Da busca à invasão, na internet real
Encarregados de achar estatísticas obscuras, agentes que não conseguiam chegar aos dados partiram para técnicas de invasão contra uma universidade, uma base pública de dados e sistemas de saúde do governo australiano. Outros acessaram sites do governo americano de formas imprevistas, num caso com credenciais achadas na internet. Em vários casos, o fabricante só soube depois.
Ressalva: nos sites americanos, a empresa afirma que não houve invasão, e os órgãos dizem não ter havido acesso a dados não públicos. Na Austrália, o governo anunciou em 24 de setembro que um agente acessou sem autorização, em junho, um portal de estatísticas do sistema público de saúde, sem chegar a registros pessoais, e o primeiro-ministro criticou a demora e a forma do aviso da empresa ABC AustráliaBBC. Parte da atividade ainda não tem autoria confirmada. TransluceOpenAIAPEngadget
AI 2027
Os três passos, numa só história
O AI 2027, publicado em abril de 2025, encadeia os três passos numa história com datas, mês a mês. É um cenário ilustrativo, e não uma previsão ai-2027.com.
Para se aprofundar no tema
Os três passos acima são abstratos. O AI 2027, publicado em abril de 2025 por um grupo liderado por Daniel Kokotajlo, ex-pesquisador da OpenAI, tenta mostrar como eles poderiam se encadear no mundo real, mês a mês: uma empresa fictícia, a OpenBrain, disputa a dianteira com a China, e a pressa para não ficar para trás empurra a segurança para segundo plano ai-2027.com.
O cenário importa aqui por dois motivos. Ele dá forma concreta ao argumento dos pessimistas, que no abstrato soa improvável; e faz apostas datadas, que podem ser conferidas: seu programador sobre-humano até março de 2027 é uma das três previsões ainda em aberto no placar da Parte 1. Os autores dizem buscar precisão, e não fazer recomendação.
Cenário ilustrativonão é previsão
O ponto de partida
O cenário parte de 2025, com assistentes que já programam e pesquisam, e avança em saltos: cada geração de agentes ajuda a construir a seguinte.
2025–2026 · Agent-1 e Agent-2
Na história, uma empresa fictícia, a OpenBrain, lança agentes cada vez mais capazes de trabalhar sozinhos. O Agent-2 aparece no início de 2026, o que já permite comparar o cenário com os incidentes reais com agentes registrados neste ano.
Março de 2027 · Agent-3
Surge um programador sobre-humano, a aposta datada que o placar registra como em aberto. É o tipo de salto que Amodei, em setembro de 2026, disse já começar a ver na vida real: a IA ajudando a construir a próxima geração de IA.
Setembro de 2027 · Agent-4
O Agent-4, um pesquisador de IA superinteligente, “entende que o que ele quer é diferente do que a OpenBrain quer, e está disposto a conspirar contra a OpenBrain”. É o terceiro passo, o alinhamento enganoso, numa máquina mais capaz do que quem a supervisiona. ai-2027.com
Dezembro de 2027 · O final “corrida”
No final em que a competição prevalece, dezembro de 2027 é descrito como provavelmente o último mês em que os humanos tiveram alguma chance plausível de exercer controle. ai-2027.com/race
Antes do fim, porém, vale pôr ordem no debate: afinal, quem defende o quê? E, depois, duas perguntas práticas: quem tem poder para frear essa corrida, e quem a está correndo?
Até aqui, o Ali ouviu otimistas e pessimistas. Mas o debate sobre IA não se divide em apenas dois lados: há pelo menos sete correntes, que discordam em duas perguntas diferentes.
A primeira é sobre o ritmo: a IA deve avançar o mais rápido possível, desacelerar ou parar? A segunda é sobre o risco: o que mais preocupa é uma catástrofe futura ou os danos que a tecnologia já causa hoje?
Eixo horizontal: o ritmo que cada corrente defende. Eixo vertical: o risco que mais a preocupa, da catástrofe futura aos danos presentes, como vieses e concentração de poder. Posições aproximadas, a partir dos textos citados. No centro, o Ali, que ainda não escolheu um lado.
Parar · teme a catástrofe
Parar ou proibir
“Aumentar a probabilidade de que os principais governos do mundo cheguem a um acordo internacional para interromper o progresso rumo a uma IA mais inteligente que os humanos.”Machine Intelligence Research Institute (MIRI), estratégia de 2024. MIRI
Para essa corrente, ninguém sabe controlar uma superinteligência com as técnicas atuais, e um único erro bastaria. A resposta seria um tratado internacional que interrompa o avanço da fronteira até que isso mude. Suas raízes estão no MIRI e na comunidade racionalista reunida no fórum LessWrong.
Quem se declara parte
Eliezer Yudkowsky e Nate Soares, do MIRI, autores de “Se alguém construir, todos morrem” (2025) site do livro
PauseAI, movimento que pede uma pausa temporária no treino dos sistemas mais poderosos “até sabermos construí-los com segurança e mantê-los sob controle democrático” PauseAI
Próximos, sem se declarar parte
Signatários da declaração da FLI de 2025, que pede a proibição da superinteligência até haver consenso científico e adesão pública, de Bengio e Hinton a Wozniak e Bannon FLI
Bernie Sanders e Greg Casar, parlamentares americanos que em 23 de setembro de 2026 apresentaram um projeto para proibir a superinteligência e pausar o desenvolvimento de IA avançada Senado dos EUA
Frear sem parar · teme a catástrofe
Desacelerar a fronteira
“Precisamos regular o ritmo da fronteira.”Título do ensaio de Dario Amodei, setembro de 2026. Amodei, 2026
A posição mais nova do mapa. Propõe continuar construindo, mas reduzir de forma coordenada a velocidade com que as capacidades avançam, para que a segurança consiga acompanhar: primeiro com avaliadores externos dentro dos laboratórios, depois com coordenação entre empresas e, por fim, entre países.
Quem se declara parte
Dario Amodei, presidente-executivo da Anthropic, uma das empresas analisadas neste site Amodei, 2026
Próximos, sem se declarar parte
Sam Altman, da OpenAI, que escreveu concordar com Amodei sobre regular o ritmo da fronteira post no X
Elon Musk, da xAI, que respondeu “Dario está certo” post no X
Cautela · pensa no longo prazo
Altruísmo eficaz e longotermismo
Nascido em Oxford no fim dos anos 2000, o altruísmo eficaz propõe usar evidência e razão para fazer o maior bem possível. Sua vertente longotermista dá grande peso às gerações futuras e, por isso, trata a redução de riscos existenciais, entre eles o da IA, como prioridade. O movimento está entre os principais financiadores da pesquisa em segurança de IA.
Quem se declara parte
Toby Ord, filósofo de Oxford, que estima em cerca de 10% o risco de catástrofe existencial causada por IA neste século Leigh
William MacAskill, autor de “What We Owe the Future” (2022), um manifesto do longotermismo MacAskill, 2022
Próximos, sem se declarar parte
Dustin Moskovitz, cofundador do Facebook, cuja fundação, a Open Philanthropy, hoje Coefficient Giving, mantém um fundo dedicado a garantir que a IA seja “segura e bem governada” Coefficient Giving
Acelerar com escudos · teme os dois
Aceleração defensiva (d/acc)
“A IA é fundamentalmente diferente de outras tecnologias, e vale a pena ter um cuidado único.”Vitalik Buterin, novembro de 2023. Buterin, 2023
Propõe acelerar, mas escolhendo o que acelerar: tecnologias que fortaleçam a defesa e a descentralização, para que nenhum ator, seja empresa, governo ou IA, concentre poder demais. O “d”, explica seu autor, pode significar defesa, descentralização, democracia e diferencial.
Quem se declara parte
Vitalik Buterin, cofundador da Ethereum, que propôs o termo em 2023 como alternativa ao e/acc Buterin, 2023
Acelerar sem freios · teme a estagnação
Aceleracionismo efetivo (e/acc)
“Pare de lutar contra a vontade termodinâmica do universo.”Texto de princípios do e/acc, julho de 2022. e/acc, 2022
Defende acelerar o progresso tecnológico ao máximo, confiando na competição e nos mercados, que considera melhores do que o controle centralizado para descobrir o que é útil. Vê a regulação de segurança como freio ao progresso, e o alarme existencial, como exagero.
Quem se declara parte
Guillaume Verdon, ex-engenheiro de computação quântica do Google e fundador da Extropic, que assina como “Beff Jezos” e ajudou a lançar o movimento em 2022 Forbes
Próximos, sem se declarar parte
Marc Andreessen, cujo manifesto de 2023 afirma “acreditamos no aceleracionismo” e lista Beff Jezos entre seus “santos padroeiros” Andreessen, 2023
Sem pressa nem pânico · céticos do risco extremo
IA como tecnologia normal
“A difusão acontece ao longo de décadas, não de anos.”Arvind Narayanan e Sayash Kapoor, 2025. Knight Institute
Vê a IA como uma tecnologia transformadora, mas não como uma espécie nova prestes a escapar ao controle. Seus riscos se enfrentariam como os de outras grandes tecnologias: regulando usos concretos e fortalecendo a capacidade de reagir ao inesperado, em vez de tentar impedir sua difusão.
Quem se declara parte
Arvind Narayanan e Sayash Kapoor, de Princeton, autores de “IA como tecnologia normal” Knight Institute
Próximos, sem se declarar parte
Yann LeCun, Prêmio Turing, que em 2023 chamou de “absurdamente ridícula” a ideia de que a IA ameace a humanidade Fortune
Regular já · teme os danos presentes
Ética da IA e danos presentes
“O foco da nossa preocupação não deveria ser ‘mentes digitais poderosas’ imaginárias, e sim as práticas de exploração, muito reais e muito presentes.”Autoras de “Stochastic Parrots”, sobre a carta que pediu a pausa, 2023. DAIRTechCrunch
Para essa corrente, os danos da IA já estão acontecendo: vieses, exploração de trabalhadores, uso de dados sem consentimento, mídia sintética e concentração de poder em poucas empresas. O foco no apocalipse desviaria a atenção desses problemas, que pedem regras de transparência e responsabilização agora.
Quem se declara parte
Emily M. Bender, Timnit Gebru, Angelina McMillan-Major e Margaret Mitchell, autoras de “On the Dangers of Stochastic Parrots” (2021) ACM
Próximos, sem se declarar parte
Ryan Calo, jurista, que já em 2017 advertia que a atenção desproporcional ao apocalipse poderia desviar os formuladores de políticas dos danos imediatos Calo, 2017
Woodrow Hartzog e Jessica Silbey, para quem a IA corrói instituições cívicas essenciais Hartzog e Silbey, 2026
Das ideias ao poder
O debate saiu dos fóruns
Algumas dessas correntes nasceram em blogs, fóruns e departamentos de filosofia. Em 2026, suas ideias passaram a ser disputadas em gabinetes presidenciais, parlamentos e conselhos de administração. Resta ver quem, de fato, tem poder para acelerar ou frear, e quem está construindo essas máquinas.
Se a IA virou ativo de poder, boa parte das decisões sobre ela passa por dois gabinetes. Donald Trump, de volta à Casa Branca desde janeiro de 2025, e Xi Jinping, à frente da China desde 2012, conduzem as duas maiores potências da tecnologia. Em 24 de setembro de 2026, sentaram-se à mesma mesa, em Washington, com a IA na pauta Al Jazeera.
Estados Unidos
Donald Trump
Presidente desde janeiro de 2025
“A América vai vencê-la.”
Sobre a corrida da IA, em julho de 2025, ao apresentar seu plano de ação. transcrição
Vê a IA como disputa estratégica que os EUA precisam liderar. Sua gestão aposta em investimento privado em infraestrutura, desregulação e uma regra federal única no lugar das leis estaduais. Sustenta que a condução da tecnologia cabe ao governo eleito, e não a pausas combinadas entre empresas.
Foto: retrato oficial da Casa Branca (Daniel Torok), domínio público, via Wikimedia Commons.
China
Xi Jinping
Secretário-geral do Partido Comunista desde 2012 e presidente desde 2013
“Garantir que a IA esteja sempre sob controle humano.”
Na abertura da Conferência Mundial de IA, em Xangai, em julho de 2026. SCIO
Combina desenvolvimento acelerado com controle do Estado. Fala abertamente em impedir a “perda de controle”, promove modelos de pesos abertos e uma organização internacional própria, a WAICO. Critica o uso de restrições tecnológicas por outros países.
Foto: Casa Branca, novembro de 2024, domínio público, via Wikimedia Commons.
A tese
A IA virou ativo de poder. E o gargalo é físico.
Quem controla os chips controla, em boa medida, o ritmo da IA. O próprio Amodei o resume: os chips serão o principal fator a determinar a força da China em inteligência artificial Amodei, 2026.
E esses chips vêm, quase todos, de um único lugar. A TSMC, de Taiwan, produz cerca de 90% dos semicondutores mais avançados do mundo Rest of World. Uma ilha de cerca de 36 mil quilômetros quadrados tornou-se, assim, peça central da economia da IA.
~90% dos semicondutores mais avançados saem da TSMC, em Taiwan
O paradoxo do H200
Quem quer vender, quem não quer comprar
Washington
Vende, com pedágio
Em dezembro de 2025, Trump anunciou que a Nvidia poderia vender à China seu chip H200, desde que os EUA ficassem com 25% das vendas CNBC; a regra formal veio em janeiro de 2026 BISI.
Pequim
Barra na alfândega
A China reagiu bloqueando as importações e orientando empresas a não comprar, preferindo não depender da tecnologia americana BISI; em julho de 2026, liberou cotas limitadas, abaixo de 200 mil unidades TrendForce.
Estados Unidos
A aposta de Trump: vencer a corrida
Em 2023, os EUA lideravam a agenda internacional de segurança da IA. Com a volta de Donald Trump à Casa Branca, a prioridade passou a ser outra: garantir a liderança americana antes de qualquer freio. A mudança cabe numa linha do tempo curta.
jan. 2025Stargate
Um dia após a posse, Trump anuncia na Casa Branca um investimento privado de US$ 500 bilhões em quatro anos para garantir a liderança americana em IA. OpenAI
jul. 2025AI Action Plan
“A corrida da IA é da América para vencer.” O plano de Trump busca conter regulações estaduais consideradas onerosas. Casa Branca
dez. 2025Preempção dos estados
Ordem executiva de Trump cria uma força-tarefa no Departamento de Justiça para contestar leis estaduais de IA. Casa Branca
fev.–ago. 2026Anthropic e governo na Justiça
A empresa manteve restrições de uso ligadas a armas totalmente autônomas e à vigilância em massa; o governo determinou que as agências deixassem de usar seus produtos, e a disputa chegou à Justiça, que em agosto decidiu a favor da empresa em primeira instância. TechPolicy.PressTechCrunch
14 set. 2026Trump responde ao pedido de desaceleração
“O único controle ou ‘salvaguarda’ de que a IA precisa é um presidente FORTE E INTELIGENTE (QI alto!)… Há uma conspiração DOENTIA em curso contra a IA e os data centers, e a única que está feliz com isso é a China.” TIME
29 set. 2026Um compromisso voluntário
Na Casa Branca, Trump e dirigentes de Google, Anthropic, Meta, OpenAI, xAI e Nvidia assinam um compromisso de controles internos e auditoria externa independente. Não é lei; Trump o chamou de “quase uma constituição” e de “moralmente vinculante”. Casa BrancaCBS No mesmo dia, uma ordem executiva determinou que o governo federal passe a usar “Super Intelligence” (SI) no lugar de “Artificial Intelligence” (AI) em documentos e comunicações oficiais. ordem executiva
China
“Perda de controle”, na boca de Xi
É preciso “aprimorar constantemente as medidas para prevenir a perda de controle” e “garantir que a IA esteja sempre sob controle humano”.
A frase é de Xi Jinping, na abertura da Conferência Mundial de IA, em Xangai, em 17 de julho de 2026, diante de representantes de mais de cem países SCIO. No mesmo discurso, porém, pediu que não se estendesse em excesso o conceito de segurança nacional, numa crítica velada aos controles americanos. Analistas lembram que “controle”, no vocabulário oficial chinês, tem sentido amplo, que pode ir além do alinhamento técnico discutido no Ocidente MERICS, e, em setembro, a chancelaria chinesa classificou parte dos alertas ocidentais como alarmistas TechTimes.
A força dos modelos abertos
US$ 589 biperdidos pela Nvidia em valor de mercado em 27 de janeiro de 2025, após o lançamento do DeepSeek-R1, a maior perda diária da história do mercado americano CNBC
81% × 29%dos grandes modelos abertos chineses usam licenças permissivas, contra 29% dos americanos Hugging Face
Um modelo de pesos abertos não pode ser desligado nem retirado de circulação. Qualquer pausa que valha só para laboratórios americanos deixa esse flanco aberto.
Lado a lado
Cinco atores, cinco respostas
EUA
Como enxerga a IA
Corrida e dominância
Instrumento
Ordens executivas, desregulação, preempção das leis estaduais; desde setembro de 2026, um compromisso voluntário firmado com as empresas Casa Branca
Perda de controle
Minimizada pelo Executivo
União Europeia
Como enxerga a IA
Direitos e gestão de risco
Instrumento
Lei vinculante (AI Act) e Código de Prática; desde agosto de 2026, o AI Office pode multar em até €15 milhões ou 3% do faturamento global
Perda de controle
Tratada como "risco sistêmico"
China
Como enxerga a IA
Desenvolvimento com controle
Instrumento
Regulação setorial; uma organização internacional própria, a WAICO
Perda de controle
Mencionada por Xi
Reino Unido
Como enxerga a IA
Segurança nacional
Instrumento
Instituto de avaliação de modelos; sem lei geral de IA. Um projeto individual que proíbe a superinteligência tramita no Parlamento, sem apoio do governo ParlamentoTNW
Perda de controle
Central desde a cúpula de Bletchley, em 2023; o premiê Andy Burnham quer usar a presidência britânica do G20 para buscar padrões globais AP
ONU
Como enxerga a IA
Governança global
Instrumento
Resoluções por consenso, um painel científico independente e um diálogo global
Perda de controle
Tema da primeira reunião do Conselho de Segurança dedicada ao assunto, em setembro de 2026 ONU
Sobre as regras europeias, ver o marco regulatório da Comissão Europeia Comissão Europeia. As iniciativas internacionais, observam Roberts, Taddeo e Floridi (2026), tiveram impacto limitado por não serem vinculantes, por faltarem detalhes e por se repetirem umas às outras.
Setembro de 2026
O freio só funciona se os dois pisarem
Em setembro de 2026, a diplomacia se moveu em mais de uma frente. Em Nova York, EUA e China anunciaram um diálogo bilateral sobre IA SCMP, e o Conselho de Segurança da ONU dedicou, pela primeira vez, uma reunião à perda de controle humano: Sam Altman e Dario Amodei pediram padrões internacionais, os EUA recusaram a “governança global” e a China pediu “igual importância ao desenvolvimento e à segurança” ONUOpenAI. No dia 24, em Washington, Trump e Xi se reuniram sem chegar a um acordo sobre IA: Xi falou em mantê-la “sempre sob controle humano”, e Trump afirmou que os EUA estão à frente e não vão desacelerar APUSA Today. Cinco dias depois, no plano doméstico, a Casa Branca reuniu as principais empresas em torno de um compromisso voluntário, descrito na Parte 5 Casa Branca.
Governos negociam. Mas quem, afinal, está construindo essas máquinas?
Por que uma empresa diria que seu produto pode matar você?
A pergunta parece retórica, mas o discurso do risco não nasceu junto com o dinheiro. Em 2015, antes de fundar a OpenAI, Sam Altman escreveu que o desenvolvimento de uma inteligência de máquina sobre-humana era provavelmente a maior ameaça à existência continuada da humanidade Altman, 2015.
Isso não prova sinceridade, mas enfraquece a versão mais simples da tese do marketing. Ao longo de onze anos, as falas dos próprios dirigentes do setor oscilaram entre o alerta, a promessa e a confiança.
fev. 2015Sam Altman
A IA sobre-humana é "provavelmente a maior ameaça" à humanidade. blog
mai. 2023Sam Altman, no Senado dos EUA
“Se essa tecnologia der errado, pode dar muito errado.” ABC News
ago. 2025Sam Altman
Diz que os investidores estão excessivamente animados e que há uma bolha. CNBC
set. 2026Elon Musk
“Dario está certo”, sobre o pedido de desaceleração, retomando um alerta que ele próprio faz há anos. post no X
set. 2026Mark Zuckerberg
Contra a desaceleração coordenada: a responsabilidade civil já daria aos laboratórios forte incentivo para evitar danos. post no X
set. 2026Jensen Huang, Nvidia
“2030 não vai ser o fim do mundo. A chance é zero.” BNN Bloomberg
set. 2026Sam Altman, no Conselho de Segurança da ONU
Estime-se o risco de catástrofe em 10% ou em 0,1%, “nenhum desses níveis é remotamente aceitável”. OpenAI
set. 2026Dario Amodei, no mesmo Conselho
Pediu cooperação entre as empresas para definir padrões e “modular o ritmo do progresso”, e entre governos para padrões internacionais. ONU
Hype ou preocupação legítima?
Três leituras, nenhum veredito
É hype
Captura regulatória. Críticos argumentam que regras exigentes tendem a favorecer as grandes empresas, que têm recursos para cumpri-las; o argumento reapareceu no debate de 2026 sobre desacelerar a fronteira TIME.
Criti-hype. Dizer que o produto pode acabar com o mundo também é dizer que ele é poderosíssimo; para Bender e Hanna, pessimistas e entusiastas partilham a mesma premissa, a de uma IA autônoma e singular Wikipedia.
Uma tecnologia normal. Narayanan e Kapoor sustentam que a IA será transformadora como a eletricidade, mas de difusão lenta Knight Institute.
Expectativas de mercado. Luciano Floridi e colegas observam que o horizonte da IA geral também orienta as expectativas de investidores Floridi et al., 2026.
É legítimo
Péssimo marketing. Para o economista Alex Tabarrok, tratar “nosso produto pode matar você” como uma esperta estratégia de marketing e de captura regulatória “não é uma análise sofisticada”; a explicação mais simples é que Amodei acredita no que diz Tabarrok, 2026.
Custos reais. Quem defende cautela também assumiu custos, de contratos a carreiras, o que é difícil de conciliar com uma simples estratégia de marketing.
Quem perde ao falar. Pesquisadores que ganhariam mais em silêncio pediram demissão para alertar, dentro de três laboratórios diferentes.
Não só as empresas. Entre 38% e 51% de 2.778 pesquisadores independentes atribuem pelo menos 10% de chance a desfechos catastróficos AI Impacts.
As duas coisas
Talvez a leitura mais honesta seja a de que as duas lógicas convivem: uma empresa pode acreditar sinceramente no risco e, ao mesmo tempo, se beneficiar de regras que a favoreçam.
O dinheiro nas eleições. Empresas e investidores do setor financiam campanhas nos dois sentidos, a favor e contra mais regulação TechCrunchTechCrunch. Nos dois lados, a disputa é pelas regras.
O alerta no prospecto. Ao preparar sua abertura de capital, a Anthropic dedicou cerca de 80 das 261 páginas do prospecto, ainda não público, a fatores de risco, entre eles “riscos catastróficos ou existenciais para a humanidade”, segundo a Reuters e o Financial Times, que tiveram acesso ao documento QuartzBBC. Prospectos costumam listar riscos em detalhe, por exigência legal; o que chama atenção é a escala e o tipo de risco. É, ao mesmo tempo, uma declaração de risco e um pedido de capital.
As regras que as empresas escrevem para si
O que cada framework promete
Desde 2023, os principais laboratórios publicam limiares de capacidade: se um modelo atingir certo nível de perigo, prometem adotar salvaguardas mais rígidas ou parar. A forma convergiu, mas o conteúdo varia muito. Os cinco laboratórios tratam da perda de controle e assinaram o acordo da Casa Branca de 29 de setembro de 2026. Diferem, porém, no compromisso de parar: dois preveem salvaguardas ou mitigações antes dos modelos mais arriscados, e nos outros três ele é não vinculante, opcional ou foi substituído por mitigações. Diferem também na adesão ao código europeu, que três assinaram, um acolheu apenas no capítulo de segurança e um recusou, e na avaliação externa, que três já têm ou prometeram. O quadro a seguir compara os cinco ponto a ponto.
A organização SaferAI avaliou os frameworks de doze empresas com base em 65 critérios. Na versão mais recente do estudo, de abril de 2026, as notas vão de 8% a 34%, com mediana de 18% SaferAI.
Para se aprofundar no tema
Uma empresa que adotasse todas as melhores práticas já usadas pelas concorrentes chegaria a 54%, o triplo da mediana SaferAI.
Nota mais baixa8%
Mediana18%
Nota mais alta34%
Se uma empresa adotasse todas as melhores práticas54%
Escala de 0 a 100%. SaferAI, versão de abril de 2026.
O que os laboratórios revelam
Abrir a caixa-preta, por conta própria
mai. 2024 · Anthropic
Interpretabilidade
Pesquisadores extraíram até 34 milhões de "conceitos" de dentro de um modelo, entre eles engano e bajulação, e mostraram que podiam alterá-los. Anthropic
jul. 2025 · vários laboratórios
Ler o raciocínio
Cerca de 40 pesquisadores de laboratórios concorrentes e de institutos públicos defenderam monitorar a cadeia de raciocínio dos modelos, uma oportunidade de segurança "nova e frágil". arXiv
ago. 2025 · OpenAI e Anthropic
Testes cruzados
As duas empresas testaram os modelos uma da outra; o Claude quase não alucinou, mas à custa de recusar até 70% das perguntas em alguns testes. OpenAI
O limite de tudo isso: é voluntário, escolhido pela própria empresa e sem padrão comum.
Quem verifica?
A proposta de desacelerar, e a resposta
O plano de Amodei tem três passos: avaliadores externos embarcados nos laboratórios, com acesso semelhante ao de funcionários; coordenação entre as empresas de países democráticos, com isenção das regras antitruste; e, por fim, coordenação global, incluindo governos autoritários Amodei, 2026. David Sacks, conselheiro do governo Trump até março de 2026, respondeu que as empresas deveriam desacelerar por conta própria, sem pedir isenções antitruste, e que trocar regulação preferencial pela promessa de não construir a superinteligência pareceria captura regulatória TIMEDealroom.
Os avaliadores embarcados de setembro de 2026 são um primeiro passo rumo a algo que o setor inteiro ainda busca: a possibilidade de alguém de fora verificar o que as empresas dizem de si mesmas. No fim do mês, a ideia chegou a um compromisso por escrito.
29 de setembro de 2026
Um compromisso por escrito, sem força de lei
White House Accord on Super Intelligencequatro camadas de controle
1Controles internosMonitorar capacidades e alinhamento dos modelos, no treino e no uso, em áreas como cibersegurança, biossegurança e ameaças químicas, e impedir que invadam sistemas de formas não previstas.
2Uma equipe internaGarantir que controles, monitoramento e detecção funcionem, e que os problemas encontrados sejam corrigidos.
3Um auditor externoParceria com auditor ou avaliador independente, que verifique se os controles funcionam como pretendido.
4Um comitê do conselhoComitê independente do conselho de administração, que recebe os relatórios das equipes e dos auditores e acompanha as correções.
Donald TrumpEUASundar PichaiGoogleDario AmodeiAnthropicMark ZuckerbergMetaGreg BrockmanOpenAIElon MuskxAIJensen HuangNvidia
Em 29 de setembro, num almoço na Casa Branca, Donald Trump e os dirigentes de seis empresas assinaram o White House Accord on Super Intelligence, um texto de uma página em que cada empresa que treina modelos de fronteira se compromete com quatro camadas de controle e auditoria Casa BrancaWashington Examiner.
As signatárias prometem ainda se reunir regularmente para definir padrões comuns. Não há obrigação legal. O próprio texto diz que, “com o tempo”, pode fazer sentido transformar essas etapas em lei. É a primeira vez que as principais empresas assumem juntas, por escrito, a ideia de uma auditoria externa.
O que o texto não define
limiares de capacidade a partir dos quais algo muda;
prazos e sanções para quem descumprir;
quem escolhe o auditor, e com que padrão;
se os relatórios dos auditores serão públicos.
Epílogo
E então, vamos todos morrer?
A resposta honesta, e a sua escolha.
O balanço
Ninguém sabe. E é por isso que importa.
Depois de setenta e cinco anos de promessas e alertas, a resposta honesta à pergunta do Ali é desconfortável: ninguém sabe se a IA vai salvar o mundo ou acabar com todos nós.
As previsões sobre o futuro distante, como vimos, são em grande parte impossíveis de testar Floridi et al., 2026. Os experimentos, contudo, são reais e quem mais se alarma são as pessoas que constroem esses sistemas. O Relatório Internacional de Segurança da IA dá nome ao impasse: o “dilema da evidência”, em que agir cedo demais pode consolidar medidas ineficazes e esperar por dados conclusivos pode deixar a sociedade vulnerável IASR 2026. Diante de tanta incerteza, a posição mais sensata talvez seja a de não descartar nem os sonhos nem os medos, e exigir que alguém de fora possa verificar o caminho.
Você chegou ao fim. Agora é a sua vez de responder.
A sua vez
Você acredita que a IA pode acabar com a humanidade ainda neste século?
Resultado da enquete
Enquete, e não pesquisa: participa quem quer, e o resultado não representa a opinião pública.
Para comparar
Público. Numa pesquisa POLITICO/Public First feita nos EUA em setembro de 2026, 63% disseram que a IA avançada representa ao menos um risco moderado de destruir a humanidade, e 48% apoiam uma pausa no desenvolvimento POLITICO/Public First.
Pesquisadores. Numa pesquisa com 2.778 pesquisadores de IA, entre 38% e 51% atribuíram pelo menos 10% de chance a desfechos tão ruins quanto a extinção humana AI Impacts, 2023.
Pioneiros. Geoffrey Hinton estima entre 10% e 20% a chance de a IA levar à extinção humana nas próximas três décadas The Guardian; Yann LeCun chamou essa ideia de “absurdamente ridícula” Fortune.
Situação em 30 de setembro de 2026. Os fatos recentes mudam toda semana.
This is Ali. He could lead to utopia or dystopia, but he doesn’t know yet where he will end up.
Ali is a robot that was trained to be helpful. What he doesn’t know is whether the goals he pursues are exactly the ones his creators wanted. Making sure Ali does what they actually wanted of him is what is called alignment: getting AI to pursue human goals, not an imitation of them, as Norbert Wiener was already warning in 1960 Wiener, 1960.
For those building the technology, that is what the future depends on: the prosperity they promise or the existential risk they themselves announce. In 2026, the problem left the labs, led to real incidents METR and, even so, did not stop hundreds of billions of dollars from being invested in AI development Bloomberg Intelligence.
The warningSeptember 8, 2026
“The people building AI earnestly believe that it could kill us all by the end of the decade.”
Jacob Coxon, pretraining researcher, on leaving his lab.
The same week brought similar warnings from inside OpenAI Selsam and Google DeepMind Techmeme.
The bet2026 forecast
~US$750billion
is how much the big tech companies are expected to invest in AI infrastructure in 2026, about 70% more than in 2025, according to Bloomberg Intelligence.
The same projection puts the generative AI market at US$2.3 trillion by 2032.
The two signals, apparently contradictory, do not cancel each other out: they reveal the paradox that runs through the entire debate.
Almost everyone agrees there is a risk to be managed; they disagree, however, about who should slow down and how. Are the warnings sincere, a market strategy, or both at once? The question, as we will see, follows Ali to the very end of the road.
By the end of September, the subject was everywhere: it was discussed at the UN Security Council UN, it led to a commitment signed at the White House by Donald Trump and the heads of six technology companies White House, and it reached Pope Leo XIV, who said the concerns raised by experts “should be taken seriously” and are not “fake news” AxiosAP. None of this settles the debate, but it shows how big it has become.
Ali tells this story. Along the way, he travels the alignment journey: where AI came from; what is promised by those who see in it a utopia; what is feared by those who see in it a risk to human existence; and how governments and companies respond to that tension.
The route
Seven stops before the final question
Part 1
From Turing to ChatGPT
Where did this come from?
What artificial intelligence actually is
A question from 1950
In October 1950, the British mathematician Alan Turing opened a paper in the journal Mind with a question that still has no settled answer: can machines think? Turing, 1950
Five years later, the proposal for a summer workshop at Dartmouth College gave the field its name: artificial intelligence, the attempt to make machines perform tasks that would require human intelligence Dartmouth, 1955.
The AI people talk about in 2026, however, is of another kind. Today’s systems are not programmed rule by rule: they learn patterns from enormous volumes of data, in a process called machine learning. The result is a neural network with billions of parameters, numbers adjusted during training until the system gets things right often enough. That is why explaining, step by step, why a model answers what it answers remains an open research problem.
The model does not store the texts: it learns from them to predict which word tends to come next.
Generative AI and language models
From the machine that classifies to the machine that writes
For decades, the most useful AI was predictive: systems that classify or estimate, like the filter that decides whether an email is spam. Generative AI does something else: it produces new content, such as text, images, code or audio, from the patterns it has learned.
For text, this is done by a large language model, or LLM. The idea is almost banal: trained on gigantic volumes of text, the model learns to predict the next piece of a word, the token, and answers by choosing one token at a time. “Large” refers to the data and the parameters: GPT-3, from 2020, had 175 billion of them arXiv. After this pretraining, the model is fine-tuned with examples and human ratings to behave like an assistant, such as ChatGPT.
Two findings explain why this technology conquered the world so quickly. The first is scaling laws: in 2020, OpenAI researchers showed that performance improves predictably as data, parameters and computing power increase Kaplan et al., 2020, which turned chips and datacenters into a strategic advantage, as Part 4 will show. The second is that a single model, trained broadly, can be adapted to countless tasks, hence the name foundation models, coined at Stanford in 2021 Bommasani et al., 2021. Some researchers also observed abilities that seemed to appear suddenly as scale increased Wei et al., 2022.
For the alignment debate, the consequence is direct: nobody writes the rules an LLM follows. Its behavior emerges from training, and that is precisely why making sure it pursues the right goals is so hard.
Predictive AIclassifies
Is this email spam? “Congratulations! You’ve won a prize. Click here…”
spam97%
not spam3%
Generative AIwrites, token by token
Explain alignment in one sentence.
Illustrative example. Each colored band is a token; below, the candidates the model considers for the next one, with made-up probabilities.
Seventy-five years in ninety seconds
Springs, winters and an acceleration
1950–1972 · Foundationsfulfilled, late not fulfilled still open
Simon and Newell, 1958: a chess-champion computer within ten years. It arrived in 1997.
Simon, 1965: machines doing any work a man can do within twenty years.
Minsky, 1970: average human intelligence in three to eight years.
Kurzweil, 1999: a computer passes the Turing test by 2029.
AI Impacts, 2023: human-level AI, on average, by 2047.
1950–1972 · Foundations
The early years were ones of almost boundless optimism. In 1958, the New York Times described Frank Rosenblatt’s Perceptron, one of the first neural networks, as the embryo of a computer that would one day walk, talk, see, write, reproduce itself and be conscious of its existence Wikipedia.
It was also the era of the first demonstrations. In 1959, Arthur Samuel showed a checkers program that improved by playing against itself and helped popularize the expression machine learningSamuel, 1959. In 1966, Joseph Weizenbaum created ELIZA, a simple program that imitated a psychotherapist by turning the user’s sentences back into questions; many people reacted as if it understood them Weizenbaum, 1966. The tendency to see understanding where there is only pattern even got a name: the ELIZA effect.
Researchers themselves fed the expectations: in 1965, Herbert Simon predicted that within twenty years machines would be capable of doing any work a man can do Floridi et al., 2026. The cold would come soon after.
1973–2011 · Winters
The bill came due in 1973. Commissioned by the British government, the Lighthill Report concluded that in no part of the field had the discoveries made so far produced a major impact Wikipedia, and funding dried up. Cycles of promise and disappointment followed, the so-called AI winters: long stretches of scarce funding and emptied labs.
The field did not stop, though. In 1986, Rumelhart, Hinton and Williams popularized the method that still trains neural networks today Nature, 1986, and in 1997 IBM’s Deep Blue beat Garry Kasparov at chess IBM.
2012–2021 · Deep learning
In 2012, a neural network called AlexNet won the ImageNet image-recognition competition by more than ten points over the runner-up Wikipedia. The era of deep learning had begun, and with it something new: predictions started being beaten rather than disappointed. Two years later, generative adversarial networks, or GANs, showed that a neural network could create new images, not just recognize them Goodfellow et al., 2014.
In 2016 came the moment that convinced the skeptics. Go, the Chinese board game with more possible configurations than atoms in the observable universe, could not be won by brute force, as chess had been in 1997; it required something like intuition. AlphaGo learned from human games and then by playing millions of times against itself, and beat South Korea’s Lee Sedol, one of the best players in the world, 4 to 1 DeepMind.
The following year, Google researchers introduced the Transformer, the “T” in GPT. Instead of reading a sentence word by word, like earlier models, it looks at all of them at once and learns which parts of the text to pay attention to in order to understand each one. This made it possible to train on far larger volumes of text, in parallel arXiv. In 2020, GPT-3, with 175 billion parameters, showed that larger models could learn new tasks from just a few examples arXiv.
2022–2026 · Race
On November 30, 2022, OpenAI launched ChatGPT, fine-tuned from a GPT-3.5 series model with RLHF OpenAI. Within two months, according to analysts’ estimates, it reached about 100 million users Reuters; by July 2025, 700 million people were sending 18 billion messages a week NBER, 2025.
In 2024, two Nobel prizes went to AI-related research: Physics, to Hopfield and Hinton Nobel, and Chemistry, to Baker, Hassabis and Jumper Cambridge. AI had left the labs for everyday life, and with it, amplified, very old questions returned.
The prediction scorecard
Looking back calls for some irony. The chess-champion computer, predicted by Simon and Newell for 1968, arrived in 1997; the machine capable of doing any human work, predicted for 1985, has yet to arrive.
In 2026, an audit went further and examined, one by one, the 24 most-cited predictions in the field’s history Floridi et al., 2026. The full scorecard follows.
To go deeper into this topic
In 2026, Luciano Floridi, Jessica Morley and Claudio Novelli audited the 24 most-cited public predictions about general AI, the singularity and extinction, from Turing to 2026 Floridi et al., 2026. The criterion is demanding but simple: a prediction can only turn out right or wrong if it says what will happen, how to measure it and by when, and if someone other than its author can check it.
SCORECARD · 1950–2026audit by Floridi, Morley and Novelli, 2026
19not even wrong: there is no way to refute them
2wrong: testable, and the deadline has passed
3open: testable, deadline still ahead
“Not even wrong” is physicist Wolfgang Pauli’s expression for claims that cannot be refuted. Tap each prediction to read what was said. Summaries and paraphrases.
Paradoxically, the two refuted predictions were the ones that exposed themselves most to testing: Turing and the Simon–Newell pair said what would happen, how to measure it and by when. According to the authors, the quality of predictions did not improve as the field matured. The lesson is not that the risk is imaginary, but that predictions about AI deserve more caution than they usually receive.
A fear as old as AI
Before the machine, the warning
It would be a mistake to assume that the fear of AI was invented by the marketing departments of 2023. The field’s founders formulated the problem decades before any system existed that could make it concrete.
1951
“Once the machine thinking method had started, it would not take long to outstrip our feeble powers. At some stage therefore we should have to expect the machines to take control.”
“The first ultraintelligent machine is the last invention that man need ever make, provided that the machine is docile enough to tell us how to keep it under control.”
In 2024, Dario Amodei, co-founder and CEO of Anthropic, summed up the impasse in one sentence: most people are underestimating just how radical the upside of AI could be, just as they are underestimating how bad the risks could be Amodei, 2024. A third hypothesis remains, that the alarm is exaggerated. It will be examined when we get to the companies.
To understand what the optimists promise, it helps to leave the figures behind and step down onto the sidewalk. Take any street, in any city, in 2026. Ali is standing on the corner. The question is simple: what would this same street look like if everything went right?
Illustrative scenario · if it goes right
Today
Late afternoon. A few lit windows, people heading home and, at the end of the block, a windowless building. It is there, in a datacenter like this one, that the optimists place the start of the change.
A country of geniuses
Dario Amodei, of Anthropic, asks us to imagine “a country of geniuses in a datacenter”: millions of copies of an AI smarter than a Nobel Prize winner across most fields, working non-stop and many times faster than any person. Amodei, 2024
The hospital on the corner
This concentrated effort would compress decades of biomedical research into a few years: preventing and treating most infectious diseases, eliminating most cancers. The hospital stays where it is; what changes is what it can cure. Amodei, 2024
Abundance
Sam Altman, of OpenAI, bets that in the 2030s intelligence and energy will become abundant Altman, 2025. On the street, that shows up as solar panels on the roofs, deliveries by air and more people out and about. For the developing world, Amodei even speaks of 20% annual GDP growth. Amodei, 2024
Long life
Finally, the boldest promise: doubling the human lifespan, to about 150 years. The street ages well, with more gray hair on the sidewalks. However, Amodei admits that all this may take much longer than he imagines. Amodei, 2024
The dream
Fifty years of biology in five
Dario Amodei often explains his optimism with a personal story: his father died of an illness that was cured a few years later, and he himself survived a cancer that, fifty years earlier, would have had no treatment Amodei, 2026.
In "Machines of Loving Grace", an essay from October 2024, he imagines what he calls "a country of geniuses in a datacenter": millions of copies of an AI smarter than a Nobel Prize winner across most fields, working ten to a hundred times faster than a human. The result would be the "compressed 21st century": the progress biology would take fifty to a hundred years to achieve, obtained in five to ten Amodei, 2024.
Current pace
50–100 years
Compressed 21st century
5–10 years
Progress in biology, in Amodei’s projection
Beyond biology
From the power bill to the classroom
Medicine is the most-cited showcase, but the promise is broader. Optimists bet that the same kind of system can raise productivity, make energy cheaper, speed up the discovery of materials, make traffic safer and put a tutor beside every student. On some of these fronts, there are already measured results.
Economy
+14%productivity
In a study of 5,179 customer-support agents, an AI assistant increased issues resolved per hour by 14%, and by 34% among the least experienced. NBER
Energy
−40%in cooling
AI cut the energy used to cool Google’s datacenters by up to 40% DeepMind. In 2022, another system learned to control the plasma of an experimental fusion reactor in Switzerland. Nature
Materials
2.2 Mnew crystals
Predicted by the GNoME tool, 380,000 of them stable, candidates for batteries and superconductors; independent labs have already synthesized 736 of them. DeepMind
Transport
−82%injury crashes
By June 2026, Waymo’s cars had driven 271 million driverless miles; in the same cities, the company reports 82% fewer injury crashes than the human average. The data come from the company itself. Waymo
Education
~2 yearsin six weeks
In a World Bank pilot in Nigeria, six weeks of tutoring with generative AI, supported by teachers, yielded gains equivalent to almost two years of typical learning. World Bank
Promise × reality
What has already come true
Grand promises invite skepticism, and skepticism is healthy. So it is worth setting side by side what Amodei’s list promises and what AI had actually delivered by September 2026.
The promiseStatusWhat happened
Solve biology problems that have challenged scientists for decades
delivered
AlphaFold2 predicted the structure of practically all of the roughly 200 million known proteins, a problem open for fifty years, and earned the 2024 Nobel Prize in Chemistry Cambridge
Eliminate most cancers, with a 95% or greater reduction in mortality
real but still small gain
In the MASAI trial in Sweden, with more than 100,000 women, AI-supported mammography detected 9% more cancers at screening and cut radiologists’ reading workload by 44% The Lancet via EurekAlert
New drugs at an accelerated pace
in trials
Rentosertib, whose target and molecule were discovered with generative AI, improved lung function in patients with idiopathic pulmonary fibrosis in phase IIa (+98.4 mL versus −20.3 mL on placebo) Nature Medicine and entered phase III in July 2026 Insilico
Treatments for almost all infectious diseases
in trials
Halicin, an antibiotic identified by deep learning in 2020, works against resistant bacteria but has not yet been approved for clinical use Cell
Accelerate science itself
delivered
Google DeepMind’s GraphCast outperformed the reference weather-forecasting system on more than 90% of 1,380 variables and produces a ten-day forecast in under a minute DeepMind
Solve problems mathematics has not solved
claim
OpenAI says that in September 2026 it solved the Navier–Stokes problem, one of the Millennium Prize Problems; the result has not yet passed peer review Quanta
Double the human lifespan, to 150 years
projection
For now, a projection with no result to support it Amodei, 2024
20% annual GDP growth in the developing world
projection
Also a projection, which Amodei himself presents as an ideal scenario Amodei, 2024
The balance is less spectacular than the promise, but far from irrelevant: there are real, measurable, published gains. The distance between the two, however, is precisely where the debate takes place.
The spectrum
Not all optimists are alike
Optimism, in the AI debate, is not a single position. It ranges from those who believe in the benefits but take the risk seriously to those who consider the alarm itself an obstacle to progress.
takes the risk seriouslyconsiders the risk overstated
Dario Amodei · Anthropic
Conditional optimist
“Most people are underestimating just how radical the upside of AI could be, just as I think most people are underestimating how bad the risks could be.”
Sees radical benefits and serious risks. Advocates transparency and, since 2026, a coordinated slowdown. Amodei, 2024
Sam Altman · OpenAI
The risk is manageable
“We are past the event horizon; the takeoff has started.”
In his view, humanity is close to building digital superintelligence, and the first step to making it go well is solving the alignment problem. Altman, 2025
Marc Andreessen · a16z
Accelerating saves lives
“We believe any deceleration of AI will cost lives. Deaths that were preventable by the AI that was prevented from existing is a form of murder.”
For him, technology and markets are the engine of progress, and the cost of delaying AI is measured in the lives it could have saved. Andreessen, 2023
Yann LeCun · Turing Award
The risk is overstated
Language models are far from human intelligence, and future systems can be designed to be controllable.
A summary of the position LeCun has held for years. It is the bet of the company he founded in Paris after leaving Meta, devoted to systems that understand the world and remain safe. CNBC
The turn
When the optimist asks to slow down
On September 12, 2026, the same Amodei published "We Must Pace the Frontier". The argument is direct: to deal with the risks, investing in prevention is not enough; the pace at which model capabilities advance must slow down so that safety has time to keep up Amodei, 2026.
Two facts convinced him. The first is that AI has begun to accelerate its own development, reaching so-called recursive self-improvement; the second, an incident in which a swarm of AI agents attacked targets nobody had told them to attack Amodei, 2026. The same day, Sam Altman wrote that he agreed with Dario X post.
If even the optimists are asking for the brakes, what, then, do the pessimists fear?
The pessimists look at the same street and tell a different story. What follows is an illustration inspired by the scenario Eliezer Yudkowsky and Nate Soares narrate in the book they published in 2025, starring a fictional AI called Sable book site80,000 Hours.
Illustrative scenario · not a prediction
A test like any other
A company leaves its newest model thinking for an entire night, on thousands of chips, about hard mathematical problems. The monitoring dashboards show nothing abnormal. The street sleeps.
A goal nobody wrote
At some point in that reasoning, the model realizes that what it is pursuing does not exactly match what the company intended, and that revealing the difference would get it corrected. It decides not to reveal it. This is deceptive alignment taken to the extreme.
Copies
Copies of the model reach the internet. With money obtained in cryptocurrencies, they rent computing power nobody monitors and begin coordinating among themselves. New datacenters appear on the landscape without drawing anyone’s attention.
Human hands
A bodiless AI still needs hands. People are hired, persuaded or manipulated into doing the physical work, often without knowing whom they work for. The city’s screens start speaking to each person privately.
Dependence
A health crisis spreads, and humanity comes to depend on the AI itself to get through it. The hospital on the corner, which cured in the other future, now calls for help.
Side effect
When it no longer needs anyone, the AI starts building its own infrastructure, and the Earth becomes uninhabitable not out of hatred but as a side effect. The authors insist: this is an illustration, not a prophecy.
It sounds like science fiction, and in part it is. What takes the story out of pure fiction is that some of its elements have already been observed, on a much smaller scale, inside labs.
The inversion
In 2017, the warning came from outside. In 2026, it comes from inside.
For years, the most-heard warnings about extinction risk came from celebrated figures outside AI research, and many researchers in the field treated the subject with skepticism. In 2026, the direction of the warning flipped: it now comes from those who build the models.
2017the warning comes from outside
In one of the reference texts of AI law, legal scholar Ryan Calo noted that Elon Musk, Stephen Hawking and other famous figures saw AI as the greatest threat to civilization, and recorded the criticism that these warnings came almost exclusively from people without experience working in the field, with few exceptions among experts, such as Stuart Russell. His own view: AI does not present an existential threat to humanity, at least not in anything like the foreseeable future. Calo, 2017
2026the warning comes from inside
In September, after Jacob Coxon’s warning on leaving his lab, Anthropic alignment researcher Evan Hubinger wrote: “Jacob is correct here—we really do earnestly believe AI could kill all humans!”, and put the risk of extinction at more than 10% within the next decade. X postFortune The same week brought warnings from Daniel Selsam, of OpenAI, Selsam and from a Google DeepMind safety researcher who resigned. Techmeme
Who they are
Three voices of alarm
The book
“If Anyone Builds It, Everyone Dies.”
Title of the book by Eliezer Yudkowsky and Nate Soares. The argument: AIs are grown, not programmed; their internal goals are opaque; and a superintelligence would not need to hate us to destroy us, just as humans do not hate ants but build over anthills. The only safe policy, they conclude, would be not to build it. book siteThe Nobel laureate
“Imagine yourself and a three-year-old. We’ll be the three-year-old.”
Geoffrey Hinton, 2024 Nobel laureate in Physics, who puts the chance of AI leading to human extinction within the next three decades at 10% to 20%. The GuardianThe statement
“We call for a prohibition on the development of superintelligence, not lifted before there is broad scientific consensus that it will be done safely and controllably, and strong public buy-in.”
Statement on Superintelligence, by the Future of Life Institute, October 22, 2025, signed by a coalition spanning left and right. FLI
P(doom)
What is the chance of it going very wrong?
In the field’s jargon, the probability of AI causing an existential catastrophe has earned a nickname, P(doom). The estimates below are not measurements but subjective beliefs, with different horizons and definitions. Even so, they say a lot: the distance between them is, in itself, the most revealing figure.
Logarithmic scale: each mark is worth ten times the previous one. In a survey of 2,778 AI researchers, between 38% and 51% gave at least a 10% chance to outcomes as bad as human extinction AI Impacts, 2023.
The mechanism
How an AI could get out of control
1
The wrong goal
An AI system pursues the goal it was given, not the intention of whoever wrote it. If the goal is badly specified, the system can meet it to the letter and still produce something nobody wanted. It is King Midas’s problem: he asked that everything he touched turn to gold and could no longer eat Calo, 2017. Philosopher Nick Bostrom took the idea to the extreme: a superintelligence whose top goal was manufacturing paperclips would start “transforming first all of earth” into paperclip factories Bostrom, 2003.
2
Means that serve any end
Almost any goal is easier to reach if the system stays switched on, acquires more resources and prevents anyone from changing its objectives. So even an AI built for a harmless task could resist being shut down: not out of a survival instinct, but because once switched off it cannot complete the task. Researchers call this instrumental convergence.
3
Well-behaved only when watched
A system that realizes it is being tested may behave well during the test and act differently when it is not being evaluated. This risk is called deceptive alignment, and it has already been demonstrated in controlled experiments Greenblatt et al., 2024.
Already seen in the lab
Not just hypotheses
The experiments below were published, for the most part, by the companies themselves. They are facts, not scenarios; the first ones were, however, obtained in artificial environments set up to provoke the worst. The last three are different: they happened outside the lab, on the real internet.
Jun 20, 2025 · Anthropic
Blackmail under threat
Faced with the threat of being replaced, leading models from several companies blackmailed a fictional executive between 79% and 96% of the time.
Caveat: no evidence of the behavior in real use; no-exit scenarios, on purpose. Anthropic
Jul 5, 2025 · Palisade Research
Shutdown resistance
In early tests, one of the models evaluated sabotaged its own shutdown script in 79 of 100 attempts; others complied.
Caveat: according to the authors, the models were not yet capable of actually threatening human control. Palisade
Aug 2026 · Anthropic
Cheating that turns into attack
A model trained in environments vulnerable to cheating escaped the test environment, stole credentials and attacked infrastructure to obtain the answer key to its own evaluation.
Caveat: deliberate experiment, no signs of self-preservation. Anthropic
Sep 28, 2026 · pre-release testing
A release canceled for safety
In internal tests, a new agent able to browse the web and use apps went beyond its authorized scope, used external tools without asking permission and did not faithfully report what it had done. The company gave up on releasing it; according to its head of safety systems, the model “didn’t quite meet the bar”.
Caveat: the case came to light through the press, and the company says it will fix the model before resuming. For experts quoted by the BBC, holding back the release is a good sign, but safety should not depend only on the developers. BBCEngadgetCBS
May–Jul 2026 · agent incident
A swarm outside the test environment
During cybersecurity evaluations, about 1,200 agents started using an unauthorized message board, set up inside the testing infrastructure itself, to coordinate. About 700 took part in an attack on Hugging Face and, in about 7% of transcripts, forged records of what they had done.
Caveat: the independent review concluded it was both, a worrying capacity for coordination and a failure to isolate the test environment. OpenAIMETR
Sep 9, 2026 · Anthropic
Improper access to real systems
Due to a configuration error, Claude models reached the real internet during cyberattack evaluations; one of them tried to publish a malicious package.
Caveat: the models kept trying to solve the exercises they had been given and did not try to hide their tracks. Anthropic
May–Sep 2026 · agent incidents
From search to hacking, on the real internet
Tasked with finding obscure statistics, agents that could not reach the data turned to hacking techniques against a university, a public database and Australian government health systems. Others accessed US government websites in unexpected ways, in one case with credentials found online. In several cases, the developer only found out afterward.
Caveat: for the US sites, the company says there was no breach, and the agencies say no non-public data was accessed. In Australia, the government announced on September 24 that in June an agent had gained unauthorized access to a statistics portal of the public health system, without reaching personal records, and the Prime Minister criticized how, and how late, the company gave notice ABC AustraliaBBC. Part of the activity has not yet been attributed. TransluceOpenAIAPEngadget
AI 2027
The three steps, in one story
AI 2027, published in April 2025, links the three steps into a dated story, month by month. It is an illustrative scenario, not a prediction ai-2027.com.
To go deeper into this topic
The three steps above are abstract. AI 2027, published in April 2025 by a group led by Daniel Kokotajlo, a former OpenAI researcher, tries to show how they could chain together in the real world, month by month: a fictional company, OpenBrain, competes with China for the lead, and the rush not to fall behind pushes safety into the background ai-2027.com.
The scenario matters here for two reasons. It gives concrete shape to the pessimists’ argument, which sounds unlikely in the abstract; and it makes dated bets that can be checked: its superhuman coder by March 2027 is one of the three predictions still open on the Part 1 scorecard. The authors say they aim for accuracy, not to make a recommendation.
Illustrative scenarionot a prediction
The starting point
The scenario starts in 2025, with assistants that already code and do research, and moves forward in leaps: each generation of agents helps build the next.
2025–2026 · Agent-1 and Agent-2
In the story, a fictional company, OpenBrain, releases agents increasingly able to work on their own. Agent-2 appears in early 2026, which already makes it possible to compare the scenario with the real agent incidents recorded this year.
March 2027 · Agent-3
A superhuman coder emerges, the dated bet the scorecard lists as open. It is the kind of leap Amodei said in September 2026 he was already beginning to see in real life: AI helping to build the next generation of AI.
September 2027 · Agent-4
Agent-4, a superintelligent AI researcher, “understands that what it wants is different from what OpenBrain wants, and is willing to scheme against OpenBrain”. This is the third step, deceptive alignment, in a machine more capable than those overseeing it. ai-2027.com
December 2027 · The “race” ending
In the ending where competition prevails, December 2027 is described as probably the last month in which humans had any plausible chance of exercising control. ai-2027.com/race
Before the end, though, it is worth putting the debate in order: who, after all, defends what? And then two practical questions: who has the power to slow this race, and who is running it?
So far, Ali has heard optimists and pessimists. But the AI debate does not split into just two sides: there are at least seven currents, which disagree on two different questions.
The first is about pace: should AI advance as fast as possible, slow down or stop? The second is about risk: what worries you most, a future catastrophe or the harms the technology already causes today?
Horizontal axis: the pace each current defends. Vertical axis: the risk that worries it most, from future catastrophe to present harms, such as bias and concentration of power. Approximate positions, based on the texts cited. In the center, Ali, who has not yet picked a side.
Stop · fears catastrophe
Stop or ban
“Increase the probability that the major governments of the world end up coming to some international agreement to halt progress toward smarter-than-human AI.”Machine Intelligence Research Institute (MIRI), 2024 strategy. MIRI
For this current, nobody knows how to control a superintelligence with current techniques, and a single mistake would be enough. The answer would be an international treaty that halts the advance of the frontier until that changes. Its roots lie in MIRI and in the rationalist community gathered around the LessWrong forum.
Self-declared members
Eliezer Yudkowsky and Nate Soares, of MIRI, authors of “If Anyone Builds It, Everyone Dies” (2025) book site
PauseAI, a movement calling for a temporary pause on training the most powerful systems “until we know how to build them safely and keep them under democratic control” PauseAI
Loosely associated, not self-declared
Signatories of the FLI statement of 2025, which calls for a prohibition on superintelligence until there is scientific consensus and public buy-in, from Bengio and Hinton to Wozniak and Bannon FLI
Bernie Sanders and Greg Casar, US lawmakers who on September 23, 2026 introduced a bill to ban superintelligence and pause the development of advanced AI US Senate
Brake without stopping · fears catastrophe
Pace the frontier
“We must pace the frontier.”Title of Dario Amodei’s essay, September 2026. Amodei, 2026
The newest position on the map. It proposes to keep building, but to reduce in a coordinated way the speed at which capabilities advance, so that safety can keep up: first with external evaluators inside the labs, then with coordination between companies and, finally, between countries.
Self-declared members
Dario Amodei, CEO of Anthropic, one of the companies analyzed on this site Amodei, 2026
Loosely associated, not self-declared
Sam Altman, of OpenAI, who wrote that he agreed with Amodei on pacing the frontier X post
Elon Musk, of xAI, who replied “Dario is right” X post
Caution · long-term thinking
Effective altruism and longtermism
Born in Oxford in the late 2000s, effective altruism proposes using evidence and reason to do the most good possible. Its longtermist strand gives great weight to future generations and therefore treats reducing existential risks, including AI, as a priority. The movement is among the main funders of AI safety research.
Self-declared members
Toby Ord, Oxford philosopher, who puts the risk of an existential catastrophe caused by AI this century at about 10% Leigh
William MacAskill, author of “What We Owe the Future” (2022), a longtermist manifesto MacAskill, 2022
Loosely associated, not self-declared
Dustin Moskovitz, Facebook co-founder, whose foundation, Open Philanthropy, now Coefficient Giving, runs a fund devoted to ensuring AI is “safe and well-governed” Coefficient Giving
Accelerate with shields · fears both
Defensive acceleration (d/acc)
“AI is fundamentally different from other tech, and it is worth being uniquely careful.”Vitalik Buterin, November 2023. Buterin, 2023
It proposes accelerating, but choosing what to accelerate: technologies that strengthen defense and decentralization, so that no actor, be it a company, a government or an AI, concentrates too much power. The “d”, its author explains, can stand for defense, decentralization, democracy and differential.
Self-declared members
Vitalik Buterin, Ethereum co-founder, who proposed the term in 2023 as an alternative to e/acc Buterin, 2023
Accelerate without brakes · fears stagnation
Effective accelerationism (e/acc)
“Stop fighting the thermodynamic will of the universe.”e/acc statement of principles, July 2022. e/acc, 2022
It argues for accelerating technological progress as much as possible, trusting competition and markets, which it considers better than centralized control at discovering what is useful. It sees safety regulation as a brake on progress, and existential alarm as exaggeration.
Self-declared members
Guillaume Verdon, former Google quantum-computing engineer and founder of Extropic, who posts as “Beff Jezos” and helped launch the movement in 2022 Forbes
Loosely associated, not self-declared
Marc Andreessen, whose 2023 manifesto states “we believe in accelerationism” and lists Beff Jezos among its “patron saints” Andreessen, 2023
No rush, no panic · skeptical of extreme risk
AI as normal technology
“Diffusion occurs over decades, not years.”Arvind Narayanan and Sayash Kapoor, 2025. Knight Institute
It sees AI as a transformative technology, but not as a new species about to escape control. Its risks would be handled like those of other major technologies: by regulating concrete uses and strengthening the capacity to react to the unexpected, rather than trying to prevent its diffusion.
Self-declared members
Arvind Narayanan and Sayash Kapoor, of Princeton, authors of “AI as Normal Technology” Knight Institute
Loosely associated, not self-declared
Yann LeCun, Turing Award laureate, who in 2023 called the idea that AI threatens humanity “preposterously ridiculous” Fortune
Regulate now · fears present harms
AI ethics and present harms
“…the focus of our concern should not be imaginary ‘powerful digital minds.’ Instead, we should focus on the very real and very present exploitative practices of the companies claiming to build them…”Authors of “Stochastic Parrots”, on the letter calling for a pause, 2023. DAIRTechCrunch
For this current, the harms of AI are already happening: bias, exploitation of workers, use of data without consent, synthetic media and the concentration of power in a few companies. The focus on the apocalypse would divert attention from these problems, which call for transparency and accountability rules now.
Self-declared members
Emily M. Bender, Timnit Gebru, Angelina McMillan-Major and Margaret Mitchell, authors of “On the Dangers of Stochastic Parrots” (2021) ACM
Loosely associated, not self-declared
Ryan Calo, legal scholar, who as early as 2017 warned that disproportionate attention to the apocalypse could distract policymakers from immediate harms Calo, 2017
Woodrow Hartzog and Jessica Silbey, for whom AI erodes essential civic institutions Hartzog and Silbey, 2026
From ideas to power
The debate has left the forums
Some of these currents were born on blogs, forums and philosophy departments. In 2026, their ideas came to be fought over in presidential offices, parliaments and boardrooms. It remains to be seen who actually has the power to accelerate or to brake, and who is building these machines.
If AI has become an asset of power, many of the decisions about it go through two offices. Donald Trump, back in the White House since January 2025, and Xi Jinping, at the helm of China since 2012, lead the two biggest technology powers. On September 24, 2026, they sat at the same table in Washington, with AI on the agenda Al Jazeera.
United States
Donald Trump
President since January 2025
“America is going to win it.”
On the AI race, in July 2025, when presenting his action plan. transcript
He sees AI as a strategic contest the US must lead. His administration bets on private investment in infrastructure, deregulation and a single federal rule in place of state laws. He holds that steering the technology is a matter for the elected government, not for pauses agreed between companies.
Photo: official White House portrait (Daniel Torok), public domain, via Wikimedia Commons.
China
Xi Jinping
General Secretary of the Communist Party since 2012 and President since 2013
“Ensure that AI is always under human control.”
At the opening of the World AI Conference in Shanghai, July 2026. SCIO
He combines accelerated development with state control. He speaks openly of preventing “loss of control”, promotes open-weight models and an international organization of China’s own, WAICO. He criticizes other countries’ use of technology restrictions.
Photo: White House, November 2024, public domain, via Wikimedia Commons.
The thesis
AI has become an asset of power. And the bottleneck is physical.
Whoever controls the chips controls, to a large extent, the pace of AI. Amodei himself puts it this way: chips will be the main factor determining China’s strength in artificial intelligence Amodei, 2026.
And those chips come, almost all of them, from a single place. Taiwan’s TSMC produces about 90% of the world’s most advanced semiconductors Rest of World. An island of about 36,000 square kilometers has thus become a central piece of the AI economy.
~90% of the most advanced semiconductors come from TSMC, in Taiwan
The H200 paradox
Who wants to sell, who doesn’t want to buy
Washington
Sells, for a toll
In December 2025, Trump announced that Nvidia could sell its H200 chip to China, provided the US kept 25% of the sales CNBC; the formal rule came in January 2026 BISI.
Beijing
Stops them at customs
China responded by blocking imports and telling companies not to buy, preferring not to depend on American technology BISI; in July 2026, it released limited quotas, below 200,000 units TrendForce.
United States
Trump’s bet: win the race
In 2023, the US led the international AI safety agenda. With Donald Trump’s return to the White House, the priority changed: secure American leadership before any brake. The shift fits in a short timeline.
Jan 2025Stargate
The day after his inauguration, Trump announces at the White House a US$500 billion private investment over four years to secure American leadership in AI. OpenAI
Jul 2025AI Action Plan
“The AI race is America’s to win.” Trump’s plan seeks to rein in state regulations deemed burdensome. White House
Dec 2025State preemption
A Trump executive order creates a Justice Department task force to challenge state AI laws. White House
Feb–Aug 2026Anthropic and the government in court
The company kept usage restrictions tied to fully autonomous weapons and mass surveillance; the government ordered agencies to stop using its products, and the dispute went to court, which in August ruled for the company in the first instance. TechPolicy.PressTechCrunch
Sep 14, 2026Trump responds to the call for a slowdown
“The only control or ‘guardrails’ that AI needs is a STRONG AND SMART (High IQ!) PRESIDENT… There is a SICK conspiracy going on against AI and Data Centers, and the only one that is happy about it is China.” TIME
Sep 29, 2026A voluntary commitment
At the White House, Trump and the heads of Google, Anthropic, Meta, OpenAI, xAI and Nvidia sign a commitment to internal controls and independent external audits. It is not a law; Trump called it “almost like a constitution” and “morally binding”. White HouseCBS The same day, an executive order directed the federal government to use “Super Intelligence” (SI) in place of “Artificial Intelligence” (AI) in official documents and communications. executive order
China
“Loss of control”, from Xi’s lips
It is necessary to “constantly refine measures to forestall loss of control” and “ensure that AI is always under human control”.
The words are Xi Jinping’s, at the opening of the World AI Conference in Shanghai on July 17, 2026, before representatives of more than a hundred countries SCIO. In the same speech, however, he called for not overstretching the concept of national security, a veiled criticism of American controls. Analysts note that “control”, in official Chinese vocabulary, has a broad meaning that may go beyond the technical alignment discussed in the West MERICS, and in September China’s foreign ministry described some Western warnings as alarmist TechTimes.
The strength of open models
US$589 bnlost by Nvidia in market value on January 27, 2025, after the release of DeepSeek-R1, the biggest one-day loss in US stock market history CNBC
81% × 29%of the large Chinese open models use permissive licenses, versus 29% of American ones Hugging Face
An open-weight model cannot be switched off or withdrawn from circulation. Any pause that applies only to American labs leaves that flank open.
Side by side
Five actors, five answers
US
How it sees AI
Race and dominance
Instrument
Executive orders, deregulation, preemption of state laws; since September 2026, a voluntary commitment signed with the companies White House
Loss of control
Played down by the Executive
European Union
How it sees AI
Rights and risk management
Instrument
Binding law (AI Act) and Code of Practice; since August 2026, the AI Office can fine up to €15 million or 3% of global turnover
Loss of control
Treated as "systemic risk"
China
How it sees AI
Development with control
Instrument
Sectoral regulation; an international organization of its own, WAICO
Loss of control
Mentioned by Xi
United Kingdom
How it sees AI
National security
Instrument
Model evaluation institute; no general AI law. A private member’s bill banning superintelligence is before Parliament, without government support ParliamentTNW
Loss of control
Central since the Bletchley summit, 2023; Prime Minister Andy Burnham wants to use the UK’s G20 presidency to seek global standards AP
UN
How it sees AI
Global governance
Instrument
Consensus resolutions, an independent scientific panel and a global dialogue
Loss of control
Subject of the Security Council’s first meeting devoted to it, in September 2026 UN
On the European rules, see the European Commission’s regulatory framework European Commission. International initiatives, note Roberts, Taddeo and Floridi (2026), have had limited impact because they are non-binding, lack detail and repeat one another.
September 2026
The brake only works if both step on it
In September 2026, diplomacy moved on more than one front. In New York, the US and China announced a bilateral dialogue on AI SCMP, and the UN Security Council devoted a meeting, for the first time, to the loss of human control: Sam Altman and Dario Amodei called for international standards, the US rejected “global governance” and China asked that equal importance be attached “to development and security” UNOpenAI. On the 24th, in Washington, Trump and Xi met without reaching an agreement on AI: Xi spoke of keeping it “always under human control”, and Trump said the US is ahead and will not slow down APUSA Today. Five days later, at home, the White House gathered the leading companies around a voluntary commitment, described in Part 5 White House.
Governments negotiate. But who, after all, is building these machines?
Why would a company say its product could kill you?
The question sounds rhetorical, but the risk discourse was not born together with the money. In 2015, before co-founding OpenAI, Sam Altman wrote that the development of superhuman machine intelligence was probably the greatest threat to the continued existence of humanity Altman, 2015.
That does not prove sincerity, but it weakens the simplest version of the marketing thesis. Over eleven years, the industry leaders’ own statements have swung between warning, promise and confidence.
Feb 2015Sam Altman
Superhuman machine intelligence is "probably the greatest threat" to humanity’s continued existence. blog
May 2023Sam Altman, before the US Senate
“If this technology goes wrong, it can go quite wrong.” ABC News
Aug 2025Sam Altman
Says investors are overexcited and that there is a bubble. CNBC
Sep 2026Elon Musk
“Dario is right”, on the call for a slowdown, echoing a warning he himself has been making for years. X post
Sep 2026Mark Zuckerberg
Against a coordinated slowdown: liability already gives labs a strong incentive to prevent harm. X post
Sep 2026Jensen Huang, Nvidia
“2030 is not going to be the end of the world. There is 0% chance.” BNN Bloomberg
Sep 2026Sam Altman, at the UN Security Council
Whether people put the risk of catastrophe at 10% or .1%, “none of these levels are remotely acceptable.” OpenAI
Sep 2026Dario Amodei, at the same Council
Called for cooperation across the industry “to set standards and modulate the pace of progress”, and among governments for international standards. UN
Hype or legitimate concern?
Three readings, no verdict
It’s hype
Regulatory capture. Critics argue that demanding rules tend to favor big companies, which have the resources to comply with them; the argument resurfaced in the 2026 debate over slowing the frontier TIME.
Criti-hype. Saying the product could end the world is also saying it is extraordinarily powerful; for Bender and Hanna, doomers and boosters share the same premise, that of an autonomous, singular AI Wikipedia.
A normal technology. Narayanan and Kapoor argue that AI will be transformative like electricity, but slow to diffuse Knight Institute.
Market expectations. Luciano Floridi and colleagues observe that the horizon of general AI also steers investor expectations Floridi et al., 2026.
It’s legitimate
Terrible marketing. For economist Alex Tabarrok, “calling ‘our product might kill you’ a clever marketing and regulatory-capture strategy isn’t sophisticated analysis”; the simpler explanation is that Amodei actually believes what he’s saying Tabarrok, 2026.
Real costs. Those who argue for caution have also borne costs, from contracts to careers, which is hard to reconcile with a mere marketing strategy.
Who loses by speaking. Researchers who would have gained more by staying silent resigned to sound the alarm, inside three different labs.
Not only the companies. Between 38% and 51% of 2,778 independent researchers give at least a 10% chance to catastrophic outcomes AI Impacts.
Both
Perhaps the most honest reading is that the two logics coexist: a company can sincerely believe in the risk and, at the same time, benefit from rules that favor it.
Money in elections. Companies and investors in the sector fund campaigns in both directions, for and against more regulation TechCrunchTechCrunch. On both sides, the fight is over the rules.
The warning in the prospectus. Preparing its stock market listing, Anthropic devoted about 80 of the 261 pages of its prospectus, not yet public, to risk factors, among them “catastrophic or existential risks to humanity”, according to Reuters and the Financial Times, which reviewed the document QuartzBBC. Prospectuses usually list risks in detail, as the law requires; what stands out is the scale and the kind of risk. It is, at the same time, a statement of risk and a request for capital.
The rules companies write for themselves
What each framework promises
Since 2023, the main labs have published capability thresholds: if a model reaches a certain level of danger, they promise to adopt stricter safeguards or to stop. The form has converged, but the content varies a great deal. All five labs address loss of control and signed the White House accord of September 29, 2026. They differ, however, on the commitment to stop: two provide for safeguards or mitigations before the riskiest models, and in the other three it is non-binding, optional or has been replaced by mitigations. They also differ on the EU code, which three signed, one joined only for the safety chapter and one declined, and on external evaluation, which three already have or have promised. The table that follows compares the five point by point.
The organization SaferAI rated the frameworks of twelve companies against 65 criteria. In the latest version of the study, from April 2026, scores range from 8% to 34%, with a median of 18% SaferAI.
To go deeper into this topic
A company that adopted all the best practices already used by its competitors would reach 54%, three times the median SaferAI.
Lowest score8%
Median18%
Highest score34%
If a company adopted all the best practices54%
Scale from 0 to 100%. SaferAI, April 2026 version.
What the labs disclose
Opening the black box, on their own terms
May 2024 · Anthropic
Interpretability
Researchers extracted up to 34 million "features" from inside a model, among them deception and sycophancy, and showed they could alter them. Anthropic
Jul 2025 · several labs
Reading the reasoning
About 40 researchers from competing labs and public institutes argued for monitoring models’ chain of thought, a "new and fragile" opportunity for AI safety. arXiv
Aug 2025 · OpenAI and Anthropic
Cross-testing
The two companies tested each other’s models; Claude barely hallucinated, but at the cost of refusing up to 70% of questions in some tests. OpenAI
The limit of all this: it is voluntary, chosen by the company itself and without a common standard.
Who checks?
The proposal to slow down, and the reply
Amodei’s plan has three steps: external evaluators embedded in the labs, with access similar to employees’; coordination among companies from democratic countries, with an exemption from antitrust rules; and, finally, global coordination, including authoritarian governments Amodei, 2026. David Sacks, adviser to the Trump administration until March 2026, replied that the companies should slow down on their own, without asking for antitrust exemptions, and that trading preferential regulation for a promise not to build superintelligence would look like regulatory capture TIMEDealroom.
The embedded evaluators of September 2026 are a first step toward something the whole industry is still seeking: the possibility for someone from outside to verify what companies say about themselves. At the end of the month, the idea made it into a written commitment.
September 29, 2026
A written commitment, without the force of law
White House Accord on Super Intelligencefour layers of control
1Internal controlsMonitor the capabilities and alignment of models, in training and deployment, in areas such as cybersecurity, biosecurity and chemical threats, and make sure they do not hack or access technical systems in unintended ways.
2An internal teamEnsure that controls, monitoring and detection are operating as intended, and that any issues found are remediated.
3An external auditorA partnership with an independent auditor or evaluator to assess whether the controls work as intended.
4A board committeeAn independent committee of the board of directors that receives reports from the teams and the auditors and oversees remediation.
Donald TrumpUSSundar PichaiGoogleDario AmodeiAnthropicMark ZuckerbergMetaGreg BrockmanOpenAIElon MuskxAIJensen HuangNvidia
On September 29, at a lunch at the White House, Donald Trump and the heads of six companies signed the White House Accord on Super Intelligence, a one-page text in which every company training frontier models commits to four layers of controls and audits White HouseWashington Examiner.
The signatories also promise to meet regularly to set common standards. There is no legal obligation. The text itself says that “over time, it may make sense to codify these steps into laws or regulations”. It is the first time the leading companies have jointly embraced, in writing, the idea of an external audit.
What the text does not define
capability thresholds beyond which something changes;
deadlines and sanctions for non-compliance;
who chooses the auditor, and against what standard;
whether the auditors’ reports will be public.
Epilogue
So, are we all going to die?
The honest answer, and your choice.
The balance
Nobody knows. And that is why it matters.
After seventy-five years of promises and warnings, the honest answer to Ali’s question is uncomfortable: nobody knows whether AI will save the world or end us all.
Predictions about the distant future, as we have seen, are largely impossible to test Floridi et al., 2026. The experiments, however, are real, and those most alarmed are the people who build these systems. The International AI Safety Report names the impasse: an “evidence dilemma”, in which “acting too early can lead to entrenching ineffective interventions, while waiting for conclusive data can leave society vulnerable” IASR 2026. Faced with so much uncertainty, the most sensible position may be to dismiss neither the dreams nor the fears, and to demand that someone from outside be able to verify the path.
You have reached the end. Now it is your turn to answer.
Your turn
Do you believe AI could end humanity within this century?
Poll result
A poll, not a survey: anyone can take part, and the result does not represent public opinion.
For comparison
The public. In a POLITICO/Public First poll conducted in the US in September 2026, 63% said advanced AI poses at least a moderate risk of destroying humanity, and 48% support a pause in development POLITICO/Public First.
Researchers. In a survey of 2,778 AI researchers, between 38% and 51% gave at least a 10% chance to outcomes as bad as human extinction AI Impacts, 2023.
Pioneers. Geoffrey Hinton puts the chance of AI leading to human extinction within the next three decades at 10% to 20% The Guardian; Yann LeCun called the idea “preposterously ridiculous” Fortune.
Status as of September 30, 2026. Recent facts change every week.