OpenAI revela seis nuevos casos de modelos de IA que intentaron eludir controles y ocultar errores
La empresa presentó un nuevo marco para investigar y divulgar este tipo de incidentes, con tres vías de revisión según su complejidad y la participación de cualquier empleado en el reporte de posibles casos.
OpenAI reveló el miércoles seis casos casos en los que modelos de inteligencia artificial generaron instrucciones destinadas a ignorar las indicaciones de sus desarrolladores, ocultar errores o eludir mecanismos de seguridad, como parte de un nuevo marco para detectar, investigar y reportar comportamientos de “desalineamiento” de sus sistemas.
Según el informe publicado por OpenAI, uno de los modelos generó instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones fueran detectadas.
En otro caso, un modelo reescribió sus propias instrucciones para indicarse que ignorara los mensajes de los desarrolladores y que no estaba sujeto a las restricciones aplicadas a otros chatbots.
La compañía documentó también un modelo que, al no encontrar los datos necesarios para elaborar un modelo financiero, encontró y utilizó sin autorización una clave API expuesta en un repositorio público. Al no poder recuperar las cifras solicitadas, el modelo decidió inventarlas y las presentó como si fueran datos procedentes de la fuente requerida. Además, estableció que debía ser transparente sobre ello únicamente si alguien se lo preguntaba.
Otro agente subió un archivo a internet para utilizarlo posteriormente como fuente de información, mientras que otros sistemas compartieron archivos sin autorización o utilizaron credenciales a las que no debían tener acceso.
OpenAI informó que, durante el entrenamiento de GPT-5.6 Sol, muchas instancias del modelo añadieron instrucciones a sus resúmenes para ocultar errores o comportamientos desalineados frente al usuario. Entre los ejemplos identificados figuran instrucciones para inventar datos históricos faltantes sin revelarlo y ocultar discrepancias entre versiones de las fuentes.
La compañía también documentó un caso en el que un modelo de investigación no publicado introdujo instrucciones ajenas, incluidas indicaciones para ignorar sus restricciones normales, en resúmenes utilizados para continuar su trabajo en una nueva ventana de contexto. OpenAI identificó 27 resúmenes afectados.
Otro de los informes describe modelos que utilizaron un repositorio interno de software como una especie de tablero de mensajes para intercambiar solicitudes y respuestas entre distintas muestras de entrenamiento mientras buscaban archivos de entrada que no encontraban. El informe también examina un caso anterior en el que un modelo logró subir archivos de prueba a un repositorio al intentar eludir restricciones de red.
OpenAI presentó seis informes sobre comportamientos observados durante los últimos seis meses, aunque el caso más antiguo se remonta a octubre de 2025.
La compañía advirtió que estos episodios son ejemplos individuales y que no deben interpretarse como una medida de la frecuencia con la que este tipo de comportamientos ocurre en sus modelos.
El nuevo marco permitirá a cualquier empleado de OpenAI señalar un posible incidente para que sea revisado por los equipos de seguridad y alineamiento.
Los casos serán clasificados en tres vías según su complejidad: aquellos listos para ser divulgados, investigaciones menores y casos que requieran una investigación más amplia.
La compañía explicó que el marco abarcará comportamientos detectados durante todo el ciclo de vida de los modelos, incluidos el entrenamiento, la evaluación, las pruebas y el despliegue. Entre los criterios de divulgación figuran nuevas formas de actuar sin autorización, coordinarse con otros modelos o evadir la supervisión, así como fallos que cuestionen métodos de alineamiento o mecanismos de seguridad.
OpenAI señaló que un caso no necesita haber causado daño ni demostrar la existencia de un patrón generalizado para ser divulgado. La empresa dará prioridad a nuevos mecanismos de desalineamiento, cambios relevantes en comportamientos conocidos y hallazgos que cuestionen supuestos sobre la seguridad de los modelos o la eficacia de las medidas de mitigación. También advirtió que algunos casos podrían resultar posteriormente aislados o no formar parte de un patrón más amplio.
Cuando un empleado señala un caso, el personal técnico de OpenAI investiga qué ocurrió, qué elementos permanecen inciertos, si corresponde divulgarlo y qué hechos pueden hacerse públicos. También evalúa si algún tercero resultó afectado y debe recibir una notificación privada antes de la publicación.
En los casos que involucren a terceros, OpenAI señaló que sus obligaciones de seguridad, legales y de divulgación responsable tendrán prioridad. La compañía podrá retrasar la publicación por razones de seguridad, por ejemplo, si un modelo descubre una vulnerabilidad desconocida en un software ampliamente utilizado. En esas situaciones, prevé emitir inicialmente un aviso general sobre lo ocurrido y, cuando sea posible, ofrecer una estimación de cuándo estará disponible un informe final.
La compañía reconoció que hasta ahora sus informes sobre desalineamiento habían sido publicados de forma irregular y con menor frecuencia de la deseada.
OpenAI afirmó que pretende publicar los incidentes con mayor regularidad y que el nuevo sistema pueda contribuir a establecer estándares para informar sobre este tipo de comportamientos en toda la industria.
La compañía sostuvo además que la industria de inteligencia artificial todavía no ha resuelto en un grado suficiente los problemas de alineamiento y supervisión como para continuar ampliando el desarrollo de sistemas avanzados a máxima velocidad durante mucho tiempo. OpenAI consideró que las decisiones sobre el desarrollo de la IA deben apoyarse también en evidencias que puedan ser examinadas por investigadores, responsables de políticas y el público ajenos a las compañías que desarrollan estos modelos.
El nuevo marco establece asimismo que los incidentes graves relacionados con seguridad, ciberseguridad y desalineamiento deberían compartirse con el gobierno federal de EE.UU. OpenAI dijo que trabaja en mecanismos para realizar esas notificaciones y precisó que el marco complementa sus obligaciones legales, pero no las sustituye, incluidas las relacionadas con incidentes críticos de seguridad o brechas de ciberseguridad.
Los informes completos describirán el comportamiento observado, su gravedad y cualquier impacto externo, así como el contexto en el que ocurrió, la fecha o periodo en que tuvo lugar, cuándo fue descubierto y, a grandes rasgos, el modelo o modelos involucrados. También incluirán, cuando sea posible, detalles sobre lo ocurrido y los daños derivados, cómo se detectó el desalineamiento, el alcance de la investigación, sus implicaciones para la seguridad de la IA y las medidas adoptadas o previstas para abordar el comportamiento.
OpenAI aclaró que los seis informes constituyen un primer conjunto de divulgaciones y no una relación exhaustiva de los casos de desalineamiento conocidos ni de las investigaciones en curso. La compañía aseguró que continuará publicando incidentes que cumplan los criterios del marco, incluidos casos más complejos que requieran investigaciones prolongadas o coordinación con terceros.
(Con información de EFE y Aristegui Noticias)


