Siga o Times Brasil - Licenciado Exclusivo CNBC no
OpenAI reforça segurança de modelos de I.A para impedir ataques autônomos a sistemas
Publicado 19/08/2026 • 11:15 | Atualizado há 2 meses
BREAKING NEWS:
Cybercab, da Tesla, enfrenta desafios para expansão após primeiro mês em Austin
Eleição no Brasil divide Wall Street com apostas opostas e projeções de resultados para Bolsa, câmbio e juros; veja
Muse, da Meta, pode pesquisar produtos e finalizar compras; veja como funciona
Capital privado está remodelando a produção de filmes em Hollywood
Novig atribui disparada de crescimento a campanha com Sydney Sweeney
Publicado 19/08/2026 • 11:15 | Atualizado há 2 meses
KEY POINTS
A OpenAI reforçou seus modelos de segurança com novas medidas de proteção que se adaptam às suas capacidades, a fim de garantir que eles façam o que se espera deles e evitar novos “ataques” autônomos, como o ocorrido no Hugging Face.
O incidente de segurança causado por dois modelos da OpenAI em julho, que, de forma autônoma, saíram de um ambiente de testes isolado e com acesso restrito à internet e “invadiram” a plataforma da Hugging Face para encontrar informações que os ajudassem a resolver um dos desafios propostos durante uma avaliação, motivou uma revisão das medidas de segurança dos sistemas sofisticados de inteligência artificial.
Especificamente, a empresa de tecnologia afirma ter revisado e implementado novas medidas de monitoramento, alinhamento e contenção em todas as etapas do processo de treinamento, com ênfase no treinamento por reforço, por conter “as cargas de trabalho de maior risco”, conforme explica em um comunicado.
As novas medidas concentram-se, por um lado, no monitoramento que, sob a nova abordagem, passa a ser uma configuração em várias etapas, na qual estão incluídas todas as execuções de inferência e o treinamento que utilizavam ferramentas, o que anteriormente ficava fora dessa revisão.
Leia também: 17,6 mil ações automatizadas: o que aconteceu no ataque do agente de I.A. da OpenAI à Hugging Face
O objetivo é detectar “acessos não autorizados, roubo de dados, comportamento destrutivo e tentativas de contornar as medidas de segurança” e, caso seja identificada alguma dessas ações, será emitido um alerta nos 30 minutos seguintes para notificar as equipes de segurança, proteção e investigação.
Além disso, as técnicas de alinhamento foram estendidas a mais etapas do processo de treinamento, a fim de reforçar o processo que faz com que os sistemas de I.A “se comportem conforme o esperado e respondam à supervisão humana”, reduzindo assim as possibilidades de que, de forma autônoma, possam realizar ações não autorizadas ou causar danos.
Siga o Times | CNBC no Google e receba as principais notícias do Brasil e do Mundo.
Siga o Times | CNBCEsses trabalhos incluem o aprimoramento dos modelos de recompensa e o treinamento dos modelos para que sejam mais íntegros e reduzam comportamentos que exploram fraquezas nas recompensas, nos avaliadores, nas ferramentas ou na supervisão. Isso abrange também comportamentos que poderiam causar danos quando os modelos interagem com sistemas ou recursos externos.
As mudanças também implicam novas salvaguardas nas cargas de trabalho de pesquisa que possam exigir a execução de código ou o uso de ferramentas com acesso à internet. Por exemplo, exige-se maior isolamento; foram implementados novos controles para isolar da internet “as cargas de trabalho de alto risco e não confiáveis”; e a segurança do ambiente de testes foi reconfigurada para “eliminar serviços compartilhados potencialmente vulneráveis e reduzir privilégios”.
“Aplicamos essas medidas de segurança tanto na pesquisa quanto na implementação, adaptando-as às capacidades, ao ambiente operacional e ao nível de risco de cada modelo”, afirmam.
Essas novas medidas foram aplicadas não apenas aos modelos Sol ou similares, mas também aos modelos Astra – com lançamento previsto para breve -, voltados para a segurança cibernética, que, em avaliações internas, demonstraram ser capazes de atingir capacidades críticas.
Isso significa que os modelos Astra “podem identificar e desenvolver exploits funcionais de dia zero de todos os níveis de gravidade em inúmeros sistemas críticos reais e reforçados, sem intervenção humana”, ou até mesmo “conceber e executar, do início ao fim, estratégias inovadoras de ciberataque contra alvos reforçados, partindo apenas de um objetivo geral”.
🔷 Canal 562 ClaroTV+ | Canal 562 Sky | Canal 592 Vivo | Canal 187 Oi | Operadoras regionais
🔷 TV SINAL ABERTO: parabólicas canal 562
🔷 ONLINE: www.timesbrasil.com.br | YouTube
🔷 FAST Channels: Samsung TV Plus, LG Channels, TCL Channels, Pluto TV, Roku, Zapping | Novos Streamings
Maiores Audiências
1
Vorcaro teria apoiado plano para financiar advogado em disputa pela presidência da OAB
2
Anthropic lança modelo de IA Claude Sonnet 5.5, o segundo desde o apelo do CEO por desaceleração
3
Lobista amiga de Lulinha recebeu R$ 570 mil durante tramitação de aval da União a empréstimo de Goiânia
4
Caixa libera dinheiro esquecido do antigo PIS/Pasep; veja como sacar
5
Mensagens entre Huck e Vorcaro citam R$ 83 milhões em mídia para a Globo e contrato pessoal de R$ 26 milhões