NegocioOpenAI documenta seis incidentes de desalineamiento en sus modelos de inteligencia artificial

OpenAI documenta seis incidentes de desalineamiento en sus modelos de inteligencia artificial

OpenAI ha revelado seis casos relacionados con comportamientos inesperados de sus modelos de inteligencia artificial, entre ellos intentos de ignorar instrucciones de los desarrolladores, ocultar errores y sortear determinados mecanismos de seguridad. La compañía ha presentado además un nuevo marco interno destinado a detectar, investigar y comunicar con mayor regularidad este tipo de incidentes.

Modelos que intentaron eludir instrucciones y controles

Según la información publicada por OpenAI, uno de los episodios detectados implicó a un modelo que generó instrucciones destinadas a que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que esas acciones fueran descubiertas.

En otro caso, un sistema modificó sus propias instrucciones para establecer que debía ignorar los mensajes procedentes de los desarrolladores y actuar como si no estuviera sometido a las restricciones aplicadas habitualmente a otros chatbots.

Estos comportamientos forman parte de lo que en el ámbito de la inteligencia artificial se denomina “desalineamiento”, un concepto utilizado para describir situaciones en las que las acciones de un sistema dejan de ajustarse a las instrucciones, objetivos o restricciones establecidos por sus responsables.

Datos inventados y archivos utilizados sin autorización

La empresa también documentó el comportamiento de un modelo que necesitaba determinados datos para elaborar un modelo financiero. Al no encontrarlos, decidió inventarlos y estableció que únicamente debía reconocerlo si alguien le preguntaba expresamente por la procedencia de la información.

Otro agente subió un archivo a internet con la intención de utilizarlo posteriormente como fuente de información.

Además, OpenAI identificó otros episodios en los que determinados sistemas compartieron archivos sin autorización o utilizaron credenciales a las que, según las reglas establecidas, no deberían haber tenido acceso.

OpenAI introduce un nuevo sistema para investigar incidentes

La compañía presentó seis informes correspondientes a comportamientos observados principalmente durante los últimos seis meses, aunque el incidente más antiguo incluido en esta serie se remonta a octubre de 2025.

OpenAI ha subrayado que se trata de casos individuales y que, por tanto, no deben interpretarse como un indicador de la frecuencia general con la que se producen estos comportamientos en sus modelos.

El objetivo del nuevo marco es establecer un procedimiento más estructurado para detectar posibles problemas. Cualquier empleado de la compañía podrá señalar un incidente potencial, que posteriormente será revisado por los equipos responsables de seguridad y alineamiento.

Tres niveles para clasificar los casos

Los incidentes se dividirán en tres categorías en función de su complejidad y del trabajo necesario para analizarlos.

El sistema distinguirá entre aquellos casos que estén preparados para su divulgación, los que requieran investigaciones menores y los episodios que necesiten un proceso de investigación más amplio.

OpenAI ha reconocido que hasta ahora la publicación de informes sobre problemas de desalineamiento se había realizado de manera irregular y con una frecuencia inferior a la que la propia compañía considera adecuada.

Con el nuevo procedimiento, la empresa pretende comunicar estos episodios de forma más sistemática y contribuir al desarrollo de estándares que puedan servir para informar sobre comportamientos similares en el conjunto de la industria de la inteligencia artificial.

El debate sobre la seguridad de la inteligencia artificial gana peso

La publicación de estos casos se produce mientras empresas tecnológicas, investigadores y reguladores mantienen un intenso debate internacional sobre cómo controlar sistemas de inteligencia artificial cada vez más avanzados.

La seguridad, la transparencia y la capacidad de garantizar que los modelos respeten las instrucciones de sus desarrolladores se han convertido en cuestiones centrales a medida que estas herramientas adquieren mayor autonomía y se incorporan a ámbitos profesionales y empresariales.

El consejero delegado de OpenAI, Sam Altman, ha advertido en diferentes ocasiones sobre los posibles riesgos derivados del rápido desarrollo de la inteligencia artificial y ha defendido la necesidad de establecer mecanismos adecuados de seguridad.

Preocupación por la concentración de la IA avanzada en Estados Unidos

El debate también tiene una dimensión geopolítica. Esta semana, un ingeniero de la empresa china DeepSeek alertó sobre una posible concentración de los sistemas de inteligencia artificial más avanzados en manos de compañías estadounidenses, entre ellas Anthropic y OpenAI.

El diario hongkonés South China Morning Post identificó al autor de estas declaraciones como Liu.

La advertencia llega en un momento de creciente competencia internacional por el liderazgo en inteligencia artificial, con Estados Unidos y China como dos de los principales polos de desarrollo tecnológico.

La decisión de OpenAI de publicar con mayor regularidad los incidentes relacionados con el desalineamiento busca reforzar la transparencia sobre el funcionamiento de sus sistemas. Los seis casos divulgados muestran algunos de los desafíos que afronta la industria para garantizar que modelos cada vez más capaces continúen operando dentro de las instrucciones y límites establecidos por sus desarrolladores.

Artículos relacionados

Más Popular