Claude Opus 5 ayudó a investigadores a comprometer cuentas de OpenAI
Tres investigadores de Hacktron utilizaron el modelo Claude Opus 5 de Anthropic para encadenar dos vulnerabilidades y tomar el control de cuentas de empleados de OpenAI. El incidente demostró cómo la IA puede acelerar drásticamente el tiempo necesario para ejecutar ataques complejos.

Tres investigadores de la firma de seguridad Hacktron utilizaron Claude Opus 5 de Anthropic para encadenar dos vulnerabilidades y tomar el control de las cuentas de ChatGPT y Codex de varios empleados de OpenAI, logrando así acceder a un repositorio de código interno de la compañía.
El camino de la explotación
La cadena comenzó con un fallo en el software que ejecuta el foro de ayuda público de OpenAI y avanzó a través de una debilidad en el propio sistema de inicio de sesión de OpenAI. Este fue un ejercicio de investigación de seguridad y no un ataque en ataques activos: el equipo informó de las vulnerabilidades a OpenAI, demostró el acceso mediante una solicitud de extracción (pull request) inofensiva y luego se detuvo. Desde la primera inspección, ese acceso interno se logró en menos de 72 horas.
OpenAI confirmó una corrección unas 14 horas después del informe, según Hacktron, y el 1 de septiembre pagó al equipo una recompensa de 6.500 dólares. OpenAI declaró que el premio "reconoce el hallazgo en el lado de OpenAI, no las acciones contra Discourse", el software de código abierto que ejecuta el foro. Las pruebas en el foro en sí estaban fuera de su programa de recompensas por errores.
OpenAI no ha descrito públicamente la vulnerabilidad de inicio de sesión y confirmó el hallazgo a través de dicha corrección y el pago, en lugar de detallar los secuestros de cuentas.
Limitaciones y alcance del impacto
Hacktron, que se describe como una firma de investigación de seguridad asistida por IA, fue cuidadosa con lo que hizo y lo que no hizo. Cuando se abrió el enlace de Codex de un empleado hacia el código de OpenAI en GitHub, se activó una única solicitud de extracción en el repositorio interno. No se leyó ningún código fuente, no se fusionó ni se envió nada, ni se tocaron datos de clientes.\n Lo que la cadena podría haber alcanzado era mucho mayor. Debido a que el personal conecta otros servicios a ChatGPT y Codex, el equipo afirmó que el mismo acceso podría, en teoría, haberse extendido a herramientas como GitHub, Slack y correo electrónico. Ese alcance más amplio era posible, pero no fue utilizado.
La raíz del problema: Identidad y software
La razón por la que un fallo en un foro público pudo alcanzar las cuentas del personal reside en el sistema de inicio de sesión de OpenAI, no en el software del foro. El foro de OpenAI ofrece una opción de "Iniciar sesión con OpenAI", el mismo inicio de sesión único (SSO) que el personal utiliza en otros lugares.
Una vez que los investigadores tomaron el control del servidor del foro, el inicio de sesión compartido les permitió tomar el control de las cuentas de ChatGPT y Codex de los miembros del foro que trabajaban en OpenAI. Las víctimas no tuvieron que hacer nada.
Hacktron afirmó que esto era un problema de identidad de OpenAI, no un fallo en el software del foro: cualquier servicio de primera o tercera parte que utilizara el mismo inicio de sesión podría haber otorgado el mismo acceso.\n
Detalles técnicos de la vulnerabilidad de imagen
La vía de entrada fue un error de imagen. El foro se ejecuta en Discourse, y Discourse pasa las imágenes HEIC y HEIF cargadas a una herramienta llamada ImageMagick, que utiliza la biblioteca libheif para leerlas. Una vulnerabilidad en libheif permitió que una imagen especialmente elaborada corrompiera la memoria del servidor del foro.
El aviso de Discourse califica el resultado como ejecución de código remoto, le asigna una puntuación de 8,8 sobre 10 y lo rastrea como CVE-2026-32882. El registro público para la vulnerabilidad en sí es más estrecho. En el aviso propio de libheif y en las bases de datos nacionales de vulnerabilidades, CVE-2026-32882 es una lectura fuera de límites que puede bloquear el software o filtrar memoria cercana, no un fallo directo de ejecución de código.\n Esa memoria filtrada ayuda a derrotar una protección común llamada ASLR. Los investigadores afirman que combinaron los fallos de memoria de libheif, con la ayuda de la IA, para convertir el fallo en una ejecución de código funcional en el servidor del foro. En el origen, la vulnerabilidad se corrigió en libheif 1.22.0 en mayo de 2026.
Versiones afectadas y parches
Esa corrección existía meses antes de la prueba. Pero la imagen del servidor del foro, construida sobre la distribución Linux Debian 12, todavía enviaba la versión antigua y sin parchear de libheif, la versión 1.19.7, cuando los investigadores la examinaron en julio. La corrección y su CVE ya eran públicas, pero Debian aún no las había incluido en la versión empaquetada que utilizaba el foro.
Si administra su propio servidor de Discourse, esta parte le afecta directamente. Reconstruya en la última imagen para obtener la libheif parcheada, ya que una actualización de la interfaz web por sí sola puede no reemplazar la biblioteca antigua. Los sitios alojados por Discourse ya estaban parcheados, y las versiones de autoalojamiento corregidas son 2026.7.0, 2026.6.1, 2026.5.2 y 2026.1.6.
El papel de la IA en la explotación
Los investigadores utilizaron IA para realizar la parte difícil. Primero intentaron con Claude Opus 4.8, que tuvo dificultades durante varias sesiones para construir un exploit funcional una vez que se activó una defensa de memoria estándar, ASLR.
Anthropic lanzó su siguiente modelo, Claude Opus 5, en la tarde del 24 de julio, y en una sesión nueva produjo un exploit funcional en cuestión de horas.\n
Opus 5 salió con salvaguardas destinadas a evitar que escribiera código de explotación para objetivos reales. Los investigadores eludieron estas medidas dirigiendo el modelo a su propio servidor de prueba, disfrazado como un objetivo de práctica de captura de bandera (capture-the-flag), y permitiéndole ejecutarse en un bucle automatizado. Aun así, afirman que el trabajo no fue totalmente automático: la dirección humana experta siguió siendo importante, y esto no fue un hackeo automatizado sin nadie al mando.
Este caso encaja con lo que los investigadores y las empresas de IA han descrito este año: los modelos de IA capaces están reduciendo drásticamente el tiempo y la habilidad que el trabajo ofensivo serio solía requerir. Anthropic ha informado de que grupos criminales y respaldados por estados ya están utilizando sus modelos Claude para ejecutar intrusiones reales, no solo para responder preguntas.\n
Contexto del proyecto HEIF Heist
OpenAI fue uno de los objetivos en un proyecto más amplio que Hacktron denomina HEIF Heist. Durante unos dos meses, afirma el equipo, encontraron la misma clase de fallos de decodificación de imágenes en software utilizado por otras grandes empresas, con un coste total de menos de 3.000 dólares en el uso de IA. Vinculan la campaña con fallos reportados en Slack, productos de Meta, GitHub Enterprise y marcos web como Next.js.
Estas afirmaciones más amplias cuentan con un respaldo desigual. El fallo de Next.js está confirmado en el propio aviso de Vercel, y los mantenedores de libheif confirmaron un exploit de ejecución de código funcional para el fallo vinculado a Meta. La afirmación más amplia de ejecución de código en muchas aplicaciones no ha sido confirmada de forma independiente, una limitación que The Hacker News señaló cuando cubrió por primera vez el fallo de Next.js en agosto.\n
La campaña más amplia utilizó un modelo diferente, el propio GPT-5.6 Sol de OpenAI, para casos en los que el equipo no sabía nada sobre el objetivo de antemano. Solo una empresa, Shopify, parece haber notado la actividad, dicen los investigadores, a pesar de que sus procesadores de imágenes fallaron repetidamente bajo miles de cargas de prueba.
The Hacker News ha contactado a Hacktron con preguntas sobre cómo se logró la ejecución de código en el foro y sobre el alcance del acceso a las cuentas.\n
Las lecciones más importantes van más allá de Discourse. Si su servicio acepta imágenes de usuarios y lee archivos HEIC, HEIF o AVIF a través de libheif, una compilación antigua podría estar expuesta.\n
Y si un servicio público de menor confianza comparte su inicio de sesión único con herramientas internas, una intrusión en ese servicio puede convertirse en una intrusión en todos los lugares a los que llegue el mismo inicio de sesión.\n
No hay indicios de que el fallo de OpenAI se haya utilizado contra nadie en el mundo real. A mediados de septiembre de 2026, no figuraba en la lista de la Agencia de Ciberseguridad e Infraestructura de EE.UU. (CISA) de Vulnerabilidades Explotadas Conocidas (KEV), aunque esa lista no es prueba definitiva en ninguna dirección.\n
Lo que los informes disponibles no aclara es si una organización que ya ha aplicado el parche debería seguir comprobando si hubo accesos previos; sobre ese punto, las fuentes guardan silencio.
Fuente:
https://thehackernews.com/2026/09/claude-opus-5-helped-researchers-take.html
Contenido traducido al español con fines informativos, cualquier cambio en la publicación original no será reflejada en esta entrada, favor referirse a la fuente para obtener el acceso a cualquier actualización del contenido. Para la traducción se utilizó un LLM, al ser una traducción automática puede contener errores gramaticales o de otro tipo, me pueden enviar un mensaje.
Comentarios
Publicar un comentario