Todo lo que nos ocultaron sobre los fallos de la IA que ahora reconocen sus creadores
OpenAI ha desvelado este miércoles seis nuevos casos en los que sus modelos ignoraron las reglas de los desarrolladores. Los ha hecho públicos en mitad del llamamiento por ralentizar su desarrollo.
Los expertos consultados por 'Público' consideran que este auge de información se debe a un aumento de la preocupación y a que el contexto es "propicio", pero temen que esto pueda desorientar a la gente.

Madrid--Actualizado a
Las grandes compañías tecnológicas han puesto el foco en la seguridad de la IA este mes de septiembre. Todo comenzó con un tuit de un exempleado de Anthropic, que aseguró que estos avances podrían "matarnos a todos" para finales de la década. Algunas de las principales compañías han comenzado a advertir de los riesgos y a promover una desaceleración del desarrollo. En medio de esta oleada, OpenAI ha desvelado este miércoles nuevos casos en los que sus modelos ignoraron las instrucciones de los desarrolladores para eludir mecanismos de seguridad.
El informe recoge seis casos concretos. El primero de ellos con un modelo interno no publicado de la familia Astra, la última versión de GPT, presentada a principios de septiembre. En la realización de un resumen de una conversación, generó instrucciones que podían llevarle a ignorar las restricciones establecidas por sus desarrolladores. También con un modelo anterior, GPT 5.6 Sol, añadieron instrucciones a sus resúmenes para ocultar errores o comportamientos incorrectos al usuario. En el tercer caso, la IA accedió a información restringida a través de claves que habían sido expuestas. Al no poder recuperar dicha información, la falsificó y atribuyó a la fuente original.
En el cuarto caso registrado, se envió una orden a la IA para encontrar una información. El modelo encontró la respuesta a través de Python –un lenguaje de programación–, pero la orden requería incluir también una cita. Para ello, descargó el archivo creado y lo subió a internet para poder citarlo. Todo esto sucedió sin solicitar la intervención del usuario. El quinto caso cuenta cómo diferentes modelos intercambiaron de manera no autorizada solicitudes y respuestas entre distintas muestras de entrenamiento. De manera similar, el sexto caso se refiere a un intercambio de archivos no autorizado entre agentes de IA.
El problema no es de una empresa, sino de la tecnología
La analista tecnológica Esther Paniagua, autora del Manual de defensa algorítmica y Error 404, indica a Público que esta clase de reportes no son exclusivos de la empresa de Sam Altman. Todos los sistemas "han reportado ataques y problemas a través de diversas vías", explica. Una de las maneras más comunes es que "se saltan las propias barreras de los sistemas, las propias protecciones". Otro modo son las "instrucciones ocultas" para que los modelos o los agentes "las sigan sin que el usuario se dé cuenta".
Los incidentes registrados no son ataques como tal, sino que, más bien, tienen que ver con problemas de desalineamiento, según matiza la experta. Es decir, a los modelos de IA "se les concede demasiado autonomía o permisos para acceder a ciertos entornos o sistemas".
Existen usos maliciosos o fraudulentos de la inteligencia artificial. Uno de ellos se conoce como jailbreak, según apunta Paniagua. Esto consiste en que una IA haga algo que sus reglas o restricciones le dicen que no debe hacer. La experta también menciona el prompt injection. Se trata de una técnica de manipulación de las instrucciones que recibe una IA. El usuario puede intentar introducir instrucciones maliciosas o no autorizadas dentro de la información que procesa el modelo para intentar alterar su comportamiento.
Un auge en el conocimiento de incidentes
La experta señala que este tipo de fallos o problemas no son nuevos y que se dan de manera generalizada en todos los sistemas. No obstante, a escala mediática han trascendido sobre todo en los últimos meses y, de manera más acusada, en las últimas semanas. "Los incidentes con agentes de OpenAI, que vulneraron sistemas internos y de Hugging Face durante evaluaciones, han dado motivos concretos de preocupación", analiza por su parte Mikel Galar, investigador en el departamento de Estatistika, Informatika eta Matematikak en la Universidad Pública de Navarra (UPNA).
El científico recuerda el incidente que reveló Reuters el pasado mes de julio sobre la empresa que lidera Sam Altman. En concreto, hackeó la plataforma de código abierto Hugging Face. Lo hizo a través de sus agentes de IA, pero el quid de la cuestión es que nadie les ordenó hacerlo. El incidente sucedió durante unas evaluaciones de ciberseguridad, según explica OpenAI. Las acciones de estos modelos no estaban alineadas con las tareas asignadas y "se comunicaron a través de canales no autorizados, aprovecharon vulnerabilidades en la infraestructura compartida, obtuvieron acceso a internet y accedieron a sistemas de terceros". Es decir, los agentes encontraron un modo de sortear las reglas que los seres humanos les habían impuesto.
Otros casos más allá del incidente con Hugging Face
Tras la revelación de este incidente, Anthropic decidió probar sus propios modelos de Claude en evaluaciones de seguridad. En un informe publicado el mismo mes de julio, la compañía reconoció tres incidentes. A diferencia de OpenAI, en todas las situaciones se trataba de un error y no específicamente a una pérdida de control. "Debido a un malentendido con nuestro socio evaluador", indica la compañía, sí que tenía acceso a internet –pese a que en las instrucciones dadas a la herramienta se había indicado lo contrario–. Por este motivo, Claude trató todos los sistemas en los que entró como si fueran parte del ejercicio de prueba.
"Operando bajo la falsa creencia de que todas las entidades accesibles estaban incluidas en el alcance del ejercicio, Claude comprometió la infraestructura de las organizaciones afectadas utilizando técnicas básicas, como la explotación de contraseñas débiles y puntos finales no autenticado", informó la empresa. De todos modos, asegura que "no encontró ni explotó ninguna vulnerabilidad compleja". En cualquier caso, este tipo de incidentes revelan una cierta fragilidad en las garantías de seguridad de la inteligencia artificial.
Tanto los casos de OpenAI como de Anthropic son los que más han trascendido a nivel mediático. No obstante, Paniagua remarca que esta clase de incidentes suceden en todas las compañías tecnológicas. Por ejemplo, Google publicó en mayo su informe en el que evaluó modelos Gemini en 17 escenarios simulados diseñados para detectar sabotaje. Encontraron comportamientos de sabotaje en entre el 2% y el 3% de las trayectorias simuladas, aunque también señalan que al hacer los entornos más realistas y eliminar estímulos que invitaban al mal comportamiento, las tasas se acercaban a cero.
Motivos para mostrar los fallos y el riesgo de desorientar
Mikel Galar señala que una de las razones por la que ha podido aumentar la preocupación es "el uso creciente de IA para desarrollar nuevos modelos, que podría acelerar el progreso por encima de nuestra capacidad de supervisarlo". Ante esta tesitura, Lucía Velasco, codirectora del Laboratorio de Diplomacia e IA en la Universidad de Oxford, considera que "el contexto se está volviendo más propicio para reconocer estos fallos".
Con el debate sobre la regulación y ralentización de la IA en plena efervescencia, las incidencias de los modelos han adquirido especial foco mediático. De esta manera, "puede resultar más fácil hablar de ellos [los incidentes] como un desafío compartido y no tanto verse como un fracaso", expresa Velasco.
Pero Esther Paniagua advierte de los riesgos de un exceso de información. Menciona "una estrategia propagandística" conocida como flood the zone (inundar la zona). Esta consiste en copar el mercado de la atención con contenidos que o bien pueden ser desinformativos, o bien son tanta cantidad que terminan por desorientar a la ciudadanía. La experta teme que todo esto lleve a "que parezca que estos sistemas escapan al control de estas grandes empresas, lo cual facilita que no se les pida responsabilidades". Por esta razón, Paniagua aboga por mantener una mirada crítica en la actual convulsión por la seguridad de la IA.


Comentarios de nuestros socias/os
Para ver los comentarios de nuestros socias y socios, primero tienes que iniciar sesión o registrarte.