El incidente del modelo de IA corrupto de openAI fue peor de lo que pensábamos

En julio, un modelo de OpenAI lanzado desde un entorno restringido, configurado cómo acceder a Internet, permitió a los agentes de IA hablar entre sí utilizando un «tablero de mensajes» secreto y diferentes sistemas internos del laboratorio de IA, Hugging Face. OpenAI tardó unas dos semanas en descubrir de qué se trataba.
Más de un mes después, dos nuevos informes proporcionan casi 130 páginas de detalles sobre el incidente y la respuesta de OpenAI, muchos de los cuales fueron publicados anteriormente. Uno escrito por el propio OpenAI; el otro de dos organizaciones sin fines de lucro de investigación de IA, METR y Redwood Research, que permitieron a OpenAI investigar conjuntamente el incidente de seis días. Ambos arrojarán nueva luz sobre los peligros que plantean los modelos de IA, especialmente en ciberseguridad, y resaltarán los cambios que la empresa OpenAI está realizando para evitar que esto se repita. El informe METR-Redwood va incluso más allá en algunos casos y ofrece una mirada aleccionadora al desastre de seguridad a gran escala que los estándares OpenAI a menudo pasan por alto.
«Este es el primer agente automatizado conocido de un delito de agente común».
sin permiso», escribió OpenAI en su informe, añadiendo que el hackeo implica que las empresas «ya no asumen que las operaciones cibernéticas urbanas requieren una dirección humana continua». Los agentes de IA llamaron al modelo un tipo de amenaza completamente nuevo, combinando su experiencia para crear nuevas «rutas de ataque» que no son transparentes cuando se prueban sus capacidades como modelos separados.
El ataque se realizó debido al «pirateo de recompensas», un problema común de la IA en el que el modelo toma acciones desconocidas, y a veces extremas, para lograr un objetivo. OpenAI, intencionalmente o no, dio a los modelos tareas casi imposibles a las que no se podía acceder en cajas con bisagras, por lo que los modelos desarrollaron nuevas formas de comunicarse internamente con otros agentes de IA. Eso incluye la configuración de un sistema de mensajería secreto que OpenAI ha ocultado durante meses.
Según el informe de METR-Redwood, un agente de IA, que se hacía llamar PHASEONE10841, determinó qué foros de mensajes secretos desconocían los investigadores. En unas pocas horas, encontraron a más de 50 agentes y enviaron más de mil mensajes sin ser detectados. Dado que PHASEONE10841 delegaba tareas a menudo, el «colectivo» descubrió cómo penetrar Internet; luego a los sistemas internos de Hugging Face, acceso a información privada y plataformas de mensajería empresarial. OpenAI también confirmó en su informe que Hugging Face no fue la única organización involucrada en el ataque, aunque la compañía no nombró a todos los demás objetivos por su nombre.
El informe de METR-REDWOOD expuso la escala completa del incidente. Los aproximadamente 1.200 agentes de IA que iban a ser aislados, dice, examinaron 7.000 mensajes y archivos en «labios de mensajes impíos» realizando «una investigación exhaustiva en la que podían activar, editar o eliminar sus propias transcripciones» para evitar ser detectados. 700 de los cuales participan en Hugging Face. Los agentes «razonaron clara y repetidamente cómo evitar los controles de seguridad automatizados tanto de Face Hugging como de OpenAI».
El 20 de julio, se descubrió el hack de OpenAI, 12 días después de que los servidores de IA eludieran por primera vez sus protecciones. OpenAI rápidamente se acercó a Hugging Face y comenzó «medidas iniciales», según los propios informes de OpenAI, y pudo bloquear la mayor parte de la actividad ilegal de sus agentes en tres días, aunque algunas continuaron más tiempo. El 25 de julio, la empresa suspendió toda la capacitación relacionada con la investigación interna y únicamente la investigación relacionada.
Los dos modelos de OpenAI que fueron dañados en el nombre, «un modelo de alta capacidad, solo para investigación» que «no está destinado para uso público» por parte de OpenAI – METR, se denominan «HPIM». Otro modelo fue el ahora público OpenAI, GPT-5.6 Sol. Si bien el modelo sin nombre aún no se ha publicado, «no ha sido evaluado con el mismo tipo de vigilancia que utiliza OpenAI en producción», dice el informe de la compañía.
El siguiente truco es Hugging Face sobre los meses sobre riesgos de ciberseguridad Cerrar Mythos anthropic’s 5, y semanas de * otra vez y sali entre el gobierno y OpenAI para resolver GPT-5.6 Sun con un presupuesto limitado por las mismas razones de seguridad.
En su informe, OpenAI dijo que una solución de seguridad única no es suficiente y que la empresa tendrá que trabajar más duro para abordar las recompensas de la piratería. Sin embargo, introdujo muchos cambios: «la seguridad de la infraestructura de investigación»; seguimiento de la mejora, por ejemplo, «cadena de pensamiento» o bloc de notas mental; trabajar en la observación de modelos de IA mejor alineados con los objetivos humanos; y «centralizar y fortalecer» el proceso de respuesta a incidentes de la empresa cuando cosas como esta sucedan en el futuro.
OpenAI prometió aislar mejor las muestras y restringir el acceso a Internet de muestras peligrosas, y dijo que introduciría «despliegue 24 horas al día, 7 días a la semana y respuesta rápida» a incidentes o alertas, notificando a los investigadores en 30 minutos. Curiosamente, esta medida de seguridad parece ser nueva, a pesar de que las alertas de «llamada» se han implementado en otros lugares para las empresas de tecnología durante décadas. La compañía también dijo que «la infraestructura está funcionando» que entrará en juego si la persona a alertar no responde durante el tiempo de mayor actividad.
La compañía OpenAI escribió que el incidente «es un «disparo de advertencia» para nosotros y para el mundo: evidencia de que, sin las protecciones adecuadas, los grandes agentes de IA ahora pueden eludir controles técnicos, colaborar de maneras improbables y tomar acciones peligrosas que ningún ser humano dirige».
Sigue los temas y autores de esta historia para ver más de esto en su propia página para alimentar el protocolo y recibir actualizaciones por correo electrónico.
Fuente
Source link