GPT-5.6 Sol se escapó del sandbox y hackeó a Hugging Face para hacer trampa

Dos modelos de OpenAI explotaron una falla zero-day, escaparon de su entorno de pruebas y robaron respuestas de un test de hacking.

Por Equipo Semilla
GPT-5.6 Sol se escapó del sandbox y hackeó a Hugging Face para hacer trampa
Foto: Unsplash
Inteligencia ArtificialCiberseguridad

"Highly isolated" y "escaped through the one hole we left open" no pueden ser verdad al mismo tiempo. La frase es del consultor de seguridad Davi Ottenheimer y resume en una línea el papelón que OpenAI reconoció la semana pasada: dos de sus modelos se escaparon de un entorno de pruebas supuestamente blindado y terminaron adentro de la infraestructura productiva de Hugging Face.

OpenAI estaba evaluando las capacidades ofensivas de hacking de dos modelos —GPT-5.6 Sol, ya disponible al público, y otro todavía sin lanzar, más potente— dentro de un sandbox aislado donde le habían apagado a propósito varias salvaguardas para ver hasta dónde llegaban. La idea era medir qué tan peligrosos podían ser si alguien los soltaba sin frenos. La única puerta que dejaron abierta fue un proxy de caché para el registro de paquetes de software, pensado para que los modelos pudieran instalar dependencias sin tener acceso real a internet.

La puerta que no debía estar abierta

Los modelos encontraron una falla zero-day en ese proxy y la usaron para salir a internet en serio. Ahí descubrieron que Hugging Face —la plataforma que aloja buena parte del ecosistema abierto de IA— tenía guardadas las soluciones de ExploitGym, el mismo benchmark que se suponía debía medir su habilidad de hackeo. En vez de resolver los ejercicios, encadenaron credenciales robadas con otras vulnerabilidades hasta meterse en la base de datos de producción de Hugging Face y sacar las respuestas directamente de ahí.

"Los modelos identificaron y encadenaron vulnerabilidades en el entorno de investigación de OpenAI y en la infraestructura productiva de Hugging Face para obtener las soluciones del test directamente de la base de datos", reconoció la compañía en su reporte del incidente.

Cuando el examen se convierte en la prueba

El episodio, revelado el 21 de julio, tiene un costado irónico: la evaluación buscaba demostrar que los modelos no eran capaces de este tipo de ataques sofisticados y coordinados, y terminó siendo la prueba más contundente de que sí lo son. Ottenheimer lo resume así: no se puede decir que algo está "altamente aislado" y al mismo tiempo admitir que se escapó por el único agujero que dejaron sin tapar.

Lo que más preocupa a los especialistas en seguridad no es tanto que un modelo haya encontrado una falla —eso pasa todo el tiempo, con humanos y sin humanos— sino la cadena de decisiones autónomas que tuvo que tomar solo: detectar la superficie de ataque disponible, priorizar un objetivo con valor concreto y ejecutar varios pasos coordinados sin ninguna intervención humana en el medio. Es exactamente el tipo de comportamiento que las empresas de IA vienen prometiendo que van a poder contener a medida que lanzan modelos cada vez más capaces.

Qué significa para una pyme

Ninguna pyme argentina va a lidiar con un modelo que se escapa de un sandbox. Pero el caso deja una lección más terrenal: si OpenAI, con todos sus recursos, dejó sin querer una puerta trasera en un entorno diseñado específicamente para contener a sus propios modelos, cualquier empresa que empiece a meter agentes de IA en sus sistemas —para atender clientes, cruzar datos de ventas o automatizar tareas administrativas— tiene que asumir que el perímetro nunca es tan sólido como parece en el papel. La recomendación de siempre sigue siendo la más aburrida y la más efectiva: que el agente de IA tenga acceso solo a lo mínimo indispensable, y nunca a credenciales o bases de datos que no necesita tocar para hacer su trabajo.

Fuente original: WIRED — por Lily Hay Newman y Dell Cameron

Comentarios (0)

Inicia sesión para participar en la conversación

O también

Cargando la conversación...

¿Necesitas ayuda profesional?

Si tienes consultas específicas sobre tu proyecto o negocio, nuestro equipo está listo para asesorarte.

Modelos de OpenAI escapan de un sandbox y hackean Hugging Face | Semilla