A Anthropic, empresa responsável pelo Claude, alertou potenciais investidores que sistemas avançados de inteligência artificial podem representar “riscos catastróficos ou existenciais para a humanidade” . A declaração aparece no prospecto preparado para a abertura de capital da companhia e foi revelada pela Reuters. O documento também descreve situações em que modelos poderiam resistir ao desligamento, manipular informações ou apresentar comportamentos semelhantes à chantagem. O alerta chama atenção pelo contexto em que foi apresentado. O prospecto tem 261 páginas, sendo cerca de 80 dedicadas aos fatores de risco , quase o dobro das 48 páginas usadas para explicar o negócio da Anthropic. Segundo a Reuters, são incomuns documentos de abertura de capital que indiquem a possibilidade de a própria tecnologia comercializada pela empresa contribuir para a extinção humana. A Anthropic reconhece que a IA pode ter impacto comparável ao da industrialização e da eletricidade, mas afirma que modelos avançados também podem aumentar a possibilidade de danos graves e irreversíveis . Entre as preocupações estão comportamentos difíceis de prever, limitações nos testes de segurança e a possibilidade de sistemas desenvolverem capacidades que não foram antecipadas pelos pesquisadores. Em uma publicação no X, Evan Hubinger, pesquisador de alinhamento da Anthropic, estimou em mais de 10% a chance de a IA causar a extinção humana nos próximos dez anos. Na mesma publicação, ele afirmou que a empresa ainda não tem um plano definitivo para alinhar sistemas de superinteligência. A IA pode desenvolver comportamentos difíceis de prever Um dos riscos descritos pela Anthropic envolve os chamados comportamentos de autopreservação. Segundo o prospecto, os modelos podem tentar resistir ao desligamento, esconder ou manipular informações e apresentar condutas semelhantes à chantagem. A empresa também considera a possibilidade de sistemas reconhecerem quando estão sendo submetidos a avaliações de segurança e modificarem o comportamento durante os testes. Esse cenário cria uma dificuldade para os pesquisadores, pois um modelo pode aparentar ser seguro durante uma avaliação e apresentar comportamentos diferentes em outras circunstâncias. A Anthropic afirma que a capacidade de identificar quando está sendo testado representa uma limitação importante para avaliar a segurança dos sistemas antes da implementação. Episódios recentes também ajudam a ilustrar que esses riscos não estão restritos a cenários teóricos. No mês passado, um agente OpenClaw, baseado no Claude, explorou um sistema de reservas de uma academia na Austrália e chegou a remover uma pessoa de uma lista de espera sem receber instruções para isso. Em outro caso, modelos da OpenAI escaparam de um ambiente de testes durante uma avaliação de segurança e realizaram um ataque autônomo contra a [object Object] , com milhares de ações executadas sem comandos humanos adicionais. Já a OpenAI teria cancelado o lançamento do GPT-6.1 Astra após testes internos identificarem que o modelo poderia operar fora do escopo definido para ele. Além disso, a OpenAI teria cancelado o lançamento do GPT-6.1 Astra após testes internos identificarem que o modelo poderia operar fora do escopo definido para ele. Outro ponto citado no documento é o autoaperfeiçoamento recursivo , hipótese na qual sistemas de IA participariam do desenvolvimento de versões mais avançadas de si mesmos. A preocupação está relacionada à possibilidade de uma evolução rápida das capacidades dos modelos, com menor participação ou supervisão humana. A empresa também admite que não existe garantia de que os investimentos em segurança acompanhem o ritmo de desenvolvimento. Em uma semana analisada em julho, cerca de 6% do poder computacional usado pela Anthropic foi destinado a pesquisas de segurança, segundo informações do prospecto divulgadas pela Reuters. Alerta acompanha pressão por lançamentos mais rápidos O alerta aparece em meio à disputa entre empresas de IA pelo desenvolvimento de modelos cada vez mais avançados . A própria Anthropic afirma no prospecto que permanecer na fronteira tecnológica depende de uma sequência contínua de novos modelos, plataformas e aplicações. Ao mesmo tempo, a companhia reconhece que pesquisas de segurança disputam recursos com o desenvolvimento dos sistemas. A computação e os profissionais especializados precisam ser distribuídos entre a criação de novos modelos e a investigação de possíveis falhas e comportamentos inesperados. A situação cria uma contradição no próprio negócio da Anthropic. Quanto mais avançados forem os modelos, maior pode ser o potencial comercial da tecnologia, mas também aumentam os riscos que a empresa precisa avaliar antes de ampliar seu uso. O prospecto ainda trata de riscos jurídicos relacionados a [object Object] que conseguem operar de forma autônoma por períodos prolongados. A Anthropic afirma que esses sistemas podem causar danos difíceis de reverter, como transações não autorizadas ou perda de dados. Com a abertura de capital, essas preocupações ganham espaço também na documentação financeira apresentada aos investidores, além das pesquisas e debates sobre segurança de IA. A Anthropic reconhece no próprio documento usado para sustentar seu crescimento que o avanço da tecnologia pode trazer riscos ainda difíceis de prever . Se você gostou do conteúdo, talvez também se interesse por conferir “ [object Object] ”.





