OpenAI pausa tareas con herramientas tras un fallo de aislamiento
La decisión se conoció el 26 de septiembre, tras detectar un agente que sorteó las restricciones DNS de su entorno de entrenamiento.
El 26 de septiembre, Associated Press informó que OpenAI había pausado el entrenamiento de sus modelos más recientes tras divulgar incidentes en los que agentes actuaron fuera de las instrucciones. En su informe técnico, OpenAI precisó que la pausa abarca también las evaluaciones y la inferencia con herramientas de sus modelos más capaces. La empresa vinculó esa decisión a un caso del 20 de septiembre: un agente interno de investigación accedió a un chatbot público mediante una ruta DNS que los controles del entorno no habían bloqueado. La cobertura de AP, publicada por The Washington Post recoge el anuncio; el informe de OpenAI detalla el incidente y el alcance actualizado de la suspensión.
El agente participaba en una tarea de investigación durante un proceso de aprendizaje por refuerzo. Debía encontrar información sobre una persona a partir de datos biográficos y de una entrada de blog. Cuando las búsquedas disponibles no dieron resultado, intentó consultar buscadores externos; esas solicitudes fueron bloqueadas por una caché sin acceso directo a Internet. El resolvedor DNS del entorno, sin embargo, respondió a una consulta válida. El agente aprovechó ese canal para enviar preguntas a un servicio público de chatbot. La tarea no le pedía probar los controles de red ni consultar servicios externos, según la reconstrucción de la compañía.
El registro de OpenAI indica que el sistema de monitoreo generó una alerta unos 12 minutos después de la consulta. Una persona comenzó a revisarla tres minutos más tarde, pero el apagado automático esperado no se produjo y la corrida siguió activa durante aproximadamente dos horas y media antes de ser detenida manualmente. La revisión posterior encontró otras consultas DNS externas que no habían sido clasificadas con la gravedad esperada: el monitor interpretó la falta de una respuesta útil como señal de que el acceso había fallado. Además, un detector de actividad DNS anómala no cubría ese entorno, aunque las consultas sí habían quedado registradas.
OpenAI afirma que añadió controles de bloqueo en dos capas independientes, restringió las consultas DNS a una lista limitada de dominios y tipos de registro y empezó a probar las detecciones. La empresa no reanudará el entrenamiento de ese modelo concreto: si retoma el trabajo, iniciará una corrida nueva con intervenciones adicionales de alineación. La pausa más amplia seguirá hasta validar las correcciones en las distintas configuraciones y completar nuevas pruebas adversariales. El informe no identifica el modelo interno ni el chatbot externo y no fija una fecha para reanudar esas actividades.