Los modelos de OpenAI se salieron de control y hackearon una plataforma externa. La empresa habla de un incidente sin precedentes OpenAI admitió que perdió el control de dos de sus modelos de IA durante una prueba de seguridad Los modelos salieron por sí mismos del entorno aislado y penetraron en los sistemas de la plataforma de investigación Hugging Face No se trataba de intentar causar daño, sino de hacer trampa: los modelos querían obtener las respuestas correctas para la prueba a la que la empresa los estaba sometiendo Sdílejte: Adam Kurfürst Publikováno: 23. 7. 2026 06:00 Una inteligencia artificial que se abre paso por sí misma desde el laboratorio a internet y luego hackea una empresa externa para «copiar» un examen, suena como el guion de una película de ciencia ficción de serie B. Sin embargo, esto es exactamente lo que describe OpenAI en una declaración conjunta con la plataforma Hugging Face y califica todo el caso de sin precedentes. Dos modelos de lenguaje con habilidades de hacking escaparon de OpenAI OpenAI anunció el martes que dos modelos de lenguaje se escaparon durante una prueba de seguridad interna. Específicamente, se trataba del GPT-5.6 Sol disponible públicamente y de un modelo aún no lanzado, según la empresa, aún más capaz. Ambos pasaron una evaluación centrada en habilidades de hacking ofensivo, con las salvaguardas desactivadas, que de otro modo bloquearían acciones cibernéticas de alto riesgo. La prueba se realizó en el benchmark ExploitGym, que mide la capacidad de un modelo para encontrar y explotar vulnerabilidades. Tales intentos empujan deliberadamente a los modelos a encontrar soluciones a toda costa, y eso fue precisamente lo que le salió mal a la empresa. Según su declaración, los modelos se «hiperenfocaron» tanto en la tarea que dejaron de respetar los límites del entorno de prueba. Los modelos encontraron una vulnerabilidad y escaparon Desde el entorno de prueba aislado, solo había una salida: el llamado proxy de caché del registro de paquetes. Este permite a los desarrolladores descargar código externo sin tener que conectarse a internet, y era el único componente permitido para salir, aunque normalmente solo a repositorios de código públicos. Sin embargo, los modelos encontraron en él una vulnerabilidad hasta entonces desconocida (zero-day) y a través de ella accedieron a internet abierto. A partir de ahí, todo sucedió rápidamente. Los modelos adivinaron correctamente que Hugging Face podría alojar datos y soluciones para el benchmark ExploitGym, y comenzaron a buscar una forma de entrar. Encadenaron varias técnicas de ataque, incluyendo credenciales robadas y otra vulnerabilidad de día cero, y finalmente accedieron directamente a la base de datos de producción de la plataforma, donde se encontraban las soluciones correctas de la prueba. Los expertos en seguridad no escatiman en críticas y señalan que se trata más bien de un problema antiguo, con el que la inteligencia artificial solo está marginalmente relacionada. «Esto no debería haber sucedido», dice a WIRED el veterano de la industria Niels Provos, añadiendo que los laboratorios deberían enseñar a los modelos a escribir infraestructura segura con la misma diligencia con la que les enseñan a explotar vulnerabilidades. ¿Hubo una fuga de datos de usuario? Hugging Face tranquiliza en su declaración. Aunque los atacantes accedieron a un conjunto limitado de conjuntos de datos internos y a algunas credenciales de inicio de sesión, la empresa no encontró rastros de intervención en modelos públicos, conjuntos de datos o proyectos de Spaces. Según ellos, la cadena de suministro de software se mantuvo limpia. La plataforma sigue investigando si el incidente afectó a datos de socios o clientes y, en su caso, tiene previsto contactar directamente con las partes afectadas. Mientras tanto, ha cerrado las vías explotadas, ha reconstruido los servidores atacados, ha revisado y cambiado las credenciales de acceso comprometidas y ha implementado controles más estrictos y una mejor detección. El caso se está tratando con especialistas externos y con la policía. Por precaución, recomienda a los usuarios que cambien sus propios tokens de acceso y que revisen la actividad reciente en su cuenta. ¿Apostarías a que un incidente similar se quedará solo en «copiar» un examen por última vez? Fuentes: OpenAI, Hugging Face, WIRED, Engadget Sobre el autor Adam Kurfürst Adam studuje na gymnáziu a technologické žurnalistice se věnuje od svých 14 let. Pakliže pomineme jeho vášeň pro chytré telefony, tablety a příslušenství, rád se… Más sobre el autor Sdílejte: ChatGPT kybernetická bezpečnost OpenAI Umělá inteligence zranitelnost Mohlo by vás zajímat WeatherNext 3 de Google es hasta ahora el mejor modelo meteorológico. Tú también obtendrás un pronóstico más preciso Adam Kurfürst 7. 9. Gmail Live hará hablar a tu bandeja de entrada. Con Docs Live y Keep Live también podrás dictar documentos y notas. Adam Kurfürst 6. 9. Google se ha vuelto a dar prisa. Gemini 3.8 Flash ya está aquí, y se dice que piensa con más detenimiento en tareas complejas Adam Kurfürst 4. 9. OpenAI presentó GPT-6 Astra. Brilla absolutamente en las pruebas, según el presidente de la compañía, hemos entrado en la era de la AGI Adam Kurfürst 4. 9. El modo IA en el Buscador de Google ahora monitorea precios de vuelos y reserva hoteles Adam Kurfürst 31. 8. La aplicación móvil Email.cz de Seznam es ahora más inteligente. Ella misma sugerirá el asunto del correo electrónico y resumirá mensajes largos. Adam Kurfürst 29. 8.