Los modelos de OpenAI se salieron de control y hackearon una plataforma externa. La empresa habla de un incidente sin precedentes OpenAI admitió que perdió el control de dos de sus modelos de IA durante una prueba de seguridad Los modelos salieron por sí mismos del entorno aislado y penetraron en los sistemas de la plataforma de investigación Hugging Face No se trataba de intentar causar daño, sino de hacer trampa: los modelos querían obtener las respuestas correctas para la prueba a la que la empresa los estaba sometiendo Sdílejte: Adam Kurfürst Publikováno: 23. 7. 2026 06:00 Una inteligencia artificial que se abre paso por sí misma desde el laboratorio a internet y luego hackea una empresa externa para «copiar» un examen, suena como el guion de una película de ciencia ficción de serie B. Sin embargo, esto es exactamente lo que describe OpenAI en una declaración conjunta con la plataforma Hugging Face y califica todo el caso de sin precedentes. Dos modelos de lenguaje con habilidades de hacking escaparon de OpenAI OpenAI anunció el martes que dos modelos de lenguaje se escaparon durante una prueba de seguridad interna. Específicamente, se trataba del GPT-5.6 Sol disponible públicamente y de un modelo aún no lanzado, según la empresa, aún más capaz. Ambos pasaron una evaluación centrada en habilidades de hacking ofensivo, con las salvaguardas desactivadas, que de otro modo bloquearían acciones cibernéticas de alto riesgo. La prueba se realizó en el benchmark ExploitGym, que mide la capacidad de un modelo para encontrar y explotar vulnerabilidades. Tales intentos empujan deliberadamente a los modelos a encontrar soluciones a toda costa, y eso fue precisamente lo que le salió mal a la empresa. Según su declaración, los modelos se «hiperenfocaron» tanto en la tarea que dejaron de respetar los límites del entorno de prueba. Los modelos encontraron una vulnerabilidad y escaparon Desde el entorno de prueba aislado, solo había una salida: el llamado proxy de caché del registro de paquetes. Este permite a los desarrolladores descargar código externo sin tener que conectarse a internet, y era el único componente permitido para salir, aunque normalmente solo a repositorios de código públicos. Sin embargo, los modelos encontraron en él una vulnerabilidad hasta entonces desconocida (zero-day) y a través de ella accedieron a internet abierto. A partir de ahí, todo sucedió rápidamente. Los modelos adivinaron correctamente que Hugging Face podría alojar datos y soluciones para el benchmark ExploitGym, y comenzaron a buscar una forma de entrar. Encadenaron varias técnicas de ataque, incluyendo credenciales robadas y otra vulnerabilidad de día cero, y finalmente accedieron directamente a la base de datos de producción de la plataforma, donde se encontraban las soluciones correctas de la prueba. Los expertos en seguridad no escatiman en críticas y señalan que se trata más bien de un problema antiguo, con el que la inteligencia artificial solo está marginalmente relacionada. «Esto no debería haber sucedido», dice a WIRED el veterano de la industria Niels Provos, añadiendo que los laboratorios deberían enseñar a los modelos a escribir infraestructura segura con la misma diligencia con la que les enseñan a explotar vulnerabilidades. ¿Hubo una fuga de datos de usuario? Hugging Face tranquiliza en su declaración. Aunque los atacantes accedieron a un conjunto limitado de conjuntos de datos internos y a algunas credenciales de inicio de sesión, la empresa no encontró rastros de intervención en modelos públicos, conjuntos de datos o proyectos de Spaces. Según ellos, la cadena de suministro de software se mantuvo limpia. La plataforma sigue investigando si el incidente afectó a datos de socios o clientes y, en su caso, tiene previsto contactar directamente con las partes afectadas. Mientras tanto, ha cerrado las vías explotadas, ha reconstruido los servidores atacados, ha revisado y cambiado las credenciales de acceso comprometidas y ha implementado controles más estrictos y una mejor detección. El caso se está tratando con especialistas externos y con la policía. Por precaución, recomienda a los usuarios que cambien sus propios tokens de acceso y que revisen la actividad reciente en su cuenta. ¿Apostarías a que un incidente similar se quedará solo en «copiar» un examen por última vez? Fuentes: OpenAI, Hugging Face, WIRED, Engadget Sobre el autor Adam Kurfürst Adam studuje na gymnáziu a technologické žurnalistice se věnuje od svých 14 let. Pakliže pomineme jeho vášeň pro chytré telefony, tablety a příslušenství, rád se… Más sobre el autor Sdílejte: ChatGPT kybernetická bezpečnost OpenAI Umělá inteligence zranitelnost