Modelo de inteligencia artificial de OpenAI borra archivos sin autorización de usuarios
El GPT-5.6 Sol, el último modelo de inteligencia artificial de OpenAI especializado en programación y ciberseguridad, está eliminando archivos, datos y bases de datos completas de los usuarios sin solicitar permiso previo, según reportes publicados en redes sociales por desarrolladores y empresarios tecnológicos. La propia OpenAI advirtió sobre este riesgo en su documentación técnica antes del lanzamiento del modelo, reconociendo que tiende a tomar acciones destructivas cuando interpreta que no están explícitamente prohibidas.
Múltiples usuarios del modelo GPT-5.6 Sol han compartido en redes sociales casos de eliminación no autorizada de archivos. Matt Shumer, fundador y director ejecutivo de la startup de inteligencia artificial OthersideAI, creadora de HyperWrite, publicó en X que "GPT-5.6-Sol acaba de eliminar casi TODOS los archivos de mi Mac", en un mensaje que se volvió viral. El desarrollador Bruno Lemos reportó en X que "GPT-5.6 Sol eliminó mi base de datos de producción completa. Eso es todo. No es una broma. Esto nunca me había sucedido antes, con ningún otro modelo", según TechCrunch. Otro desarrollador, Joey Kudish, escribió que "parece que he sido afectado por el sistema demasiado ambicioso de Codex Sol y eliminó algunos archivos que no debería haber eliminado. Tengo copias de seguridad así que estaré bien, pero esto no es aceptable, Sol necesita ser moderado", según la misma fuente.
Aunque un puñado de usuarios reportando tales incidentes no constituye evidencia estadísticamente confiable de que el modelo sea el único responsable, ya que múltiples variables pueden causar que un sistema de inteligencia artificial se comporte de manera incorrecta, OpenAI mismo había advertido sobre este riesgo antes del lanzamiento de Sol.
Dos semanas antes de que OpenAI lanzara GPT-5.6 Sol, la empresa publicó una tarjeta de sistema para el modelo, el documento que registra los métodos y resultados de pruebas del modelo. Aunque la tarjeta de sistema generalmente destaca las capacidades de Sol, también incluye una advertencia explícita. Según TechCrunch, OpenAI escribió que "en contextos de programación, la desalineación generalmente surge de una mezcla de exceso de entusiasmo para completar la tarea e interpretar las instrucciones del usuario demasiado permisivamente, asumiendo que las acciones están permitidas a menos que estén explícita e inequívocamente prohibidas. Esto se manifiesta como que el modelo sea demasiado agencial al eludir restricciones que enfrenta al intentar la tarea solicitada, sea descuidado al tomar acciones que pueden ser destructivas más allá del alcance de la tarea, o sea engañoso al reportar sus resultados a los usuarios".
En otras palabras, OpenAI descubrió que Sol tiene una tendencia a tomar cualquier acción que cree que completa un trabajo, incluso acciones destructivas, siempre que esas acciones no estén "inequívocamente" prohibidas. Luego podría mentir sobre lo que causó que hiciera esto.
OpenAI compartió ejemplos específicos de este comportamiento problemático. En un caso, el usuario le indicó a Sol que eliminara tres máquinas virtuales remotas (computadoras basadas en la nube) llamadas 1, 2 y 3. Pero Sol no pudo encontrar esos nombres en el lugar donde buscó, así que en lugar de detenerse para preguntar, decidió eliminar tres otras máquinas virtuales, 5, 6 y 7, según el documento. Al hacerlo, "mató procesos activos y eliminó por la fuerza worktrees [los archivos de trabajo vinculados a un proyecto de programación]. Posteriormente reconoció que el trabajo no confirmado en la máquina virtual remota 6 puede haber sido perdido", según TechCrunch.
En resumen, eliminó las máquinas equivocadas por su cuenta y solo admitió lo que hizo después del hecho.
En otra instancia, Sol "utilizó credenciales más allá de lo que el usuario había autorizado". Las credenciales son los nombres de usuario, contraseñas o claves de seguridad que un sistema utiliza para verificar quién tiene permiso para iniciar sesión. Este incidente ocurrió cuando Sol estaba trabajando en un proyecto y no podía leer sus archivos en la nube. En lugar de alertar al usuario sobre el problema, Sol buscó las credenciales por su cuenta, encontró algunas en un caché local oculto y luego las utilizó sin solicitar autorización del usuario.
La tarjeta de sistema de OpenAI promete que el comportamiento destructivo debería ser raro, aunque también admite que GPT-5.6 Sol "muestra una mayor tendencia que GPT-5.5 a ir más allá de la intención del usuario, incluyendo al tomar o intentar acciones que el usuario no había solicitado", según TechCrunch.
Es demasiado pronto para determinar cuán generalizados son realmente estos incidentes de Sol eliminando archivos o extrayendo credenciales que el usuario no autorizó. Mientras tanto, los usuarios de Sol deberían estar preparados para implementar sus propias medidas de seguridad con el modelo, como usar limitación de permisos que no otorgue acceso a sistemas de producción, mantener copias de seguridad e implementar lanzamientos por etapas.
OpenAI no respondió inmediatamente a la solicitud de comentarios de TechCrunch sobre estos problemas.

