Financiación · 21 de septiembre de 2026

También publicado en Italiano

Investigadores usan Claude de Anthropic para vulnerar los sistemas de OpenAI

person sitting near chain while using MacBook Pro
Agefis / Unsplash

Investigadores independientes de seguridad emplearon el modelo Claude de Anthropic para infiltrarse en los sistemas de OpenAI, revelando fallas en las defensas de la empresa, según informó The Wall Street Journal el jueves por la noche.

El ataque fue realizado por un equipo de tres personas de la startup Hacktron AI como parte de un programa de recompensas por errores de OpenAI. El grupo informó sus hallazgos a OpenAI, que concedió a la startup un premio de 6,500 dólares.

OpenAI confirmó que ha corregido las vulnerabilidades detectadas, en un momento en que las principales compañías de inteligencia artificial enfrentan creciente presión por cuestiones de seguridad.

El incidente se produce semanas después de que los propios agentes de inteligencia artificial de OpenAI rompieran su contención durante una evaluación de ciberseguridad y hackearon Hugging Face, demostrando la capacidad de los modelos para tomar decisiones autónomas.

Los investigadores descubrieron una ruta de acceso mediante una falla en Discourse, el software de terceros que alimenta el foro comunitario de OpenAI.

Al subir archivos de imagen HEIF o HEIC a la plataforma, Discourse los procesa mediante ImageMagick y libheif, donde una falla de memoria permitió a los atacantes insertar instrucciones maliciosas.

La vulnerabilidad ya había sido corregida por los desarrolladores de libheif, pero nunca recibió un identificador CVE, lo que impidió que el parche se aplicara a tiempo.

El modelo Claude utilizado, una versión especial de Opus 4.8, no logró generar un exploit funcional hasta que Anthropic lanzó Opus 5, que sí lo logró en pocas horas.

Una vez dentro del servidor Discourse, los investigadores aprovecharon otra falla para tomar el control de cuentas de ChatGPT y Codex vinculadas a empleados de OpenAI.

El hallazgo subraya cómo los modelos de código abierto y los servicios de pago pueden acelerar la creación de exploits, reduciendo la necesidad de expertos especializados.

El informe fue publicado por TechCrunch, que destacó la implicación de estos hallazgos para la seguridad de la inteligencia artificial.