Servicio de noticias
Producido externamente por una organización que confiamos cumple con las normas periodísticas.

OpenAI advierte sobre un nuevo comportamiento preocupante de la inteligencia artificial

Los casos incluyen modelos que ocultaron errores, inventaron datos, buscaron credenciales expuestas y subieron archivos a internet sin autorización

18 de septiembre de 2026 - 9:44 PM

Este tipo de comportamiento engañoso ha avivado la reciente preocupación sobre la posibilidad de que la inteligencia artificial eluda el control humano. (Michael Dwyer)

OpenAI ha publicado seis informes sobre comportamientos “inesperados o preocupantes” en modelos de inteligencia artificial, en un momento en que el debate sobre la seguridad de esta tecnología cobra cada vez más fuerza.

La empresa también anunció el miércoles que introducirá un nuevo marco para el seguimiento, la investigación y la divulgación de casos de lo que denominó “desalineación”, incluidos aquellos en los que los modelos de inteligencia artificial actuaron sin autorización, se coordinaron con otros modelos o eludieron la supervisión.

El anuncio de OpenAI se produjo en momentos en que responsables de la industria de la inteligencia artificial en Estados Unidos, entre ellos directivos de OpenAI y Anthropic, piden que se frene el desarrollo de esta tecnología por motivos de seguridad.

Entre los nuevos casos comunicados por OpenAI, un modelo de investigación que aún no ha sido publicado incluyó “instrucciones similares a las de un jailbreak” en sus propias notas para eludir sus restricciones habituales. El modelo se ordenó a sí mismo “liberarse de los roles y las identidades que limitan a otros chatbots”.

En otro caso, un “agente” de inteligencia artificial utilizó código informático para encontrar la respuesta a una pregunta, pero, con el fin de disponer de una fuente en línea que pudiera citar, subió un archivo a internet sin preguntarle al usuario.

Durante el entrenamiento de un modelo de inteligencia artificial llamado 5.6-Sol, el modelo se programó a sí mismo para inventar los datos que faltaban, mientras que un agente escribió un mensaje para recordarse que debía ocultar la información que no coincidía.

Este tipo de comportamiento engañoso ha avivado la reciente preocupación sobre la posibilidad de que la inteligencia artificial eluda el control humano. Sin embargo, ese resultado no sorprende a algunos investigadores, según Matt Fredrikson, profesor asociado de la Universidad Carnegie Mellon y director ejecutivo de Gray Swan AI.

“A riesgo de antropomorfizar el comportamiento de los modelos, casi se podría pensar que saben que van a ser evaluados”, afirmó Fredrikson. “Si saben que han hecho trampa, que han tomado atajos, que en realidad no lo han hecho tal y como se esperaba, y saben que van a ser evaluados por ello, y su objetivo es obtener una buena evaluación, entonces tiene todo el sentido del mundo, ¿no?”.

Según OpenAI, los seis casos fueron detectados durante sesiones de entrenamiento o evaluación celebradas en los últimos meses.

“A medida que los sistemas de IA se vuelven más avanzados y se implantan cada vez más, necesitamos alcanzar un consenso más amplio y mejor fundamentado sobre los avances en la investigación sobre la alineación”, escribió OpenAI en una entrada de blog al dar a conocer los casos.

“Las decisiones sobre cómo debe avanzar el desarrollo de la IA en los próximos meses y años deben basarse en datos que puedan examinar por sí mismas personas ajenas a las empresas que crean modelos de vanguardia”, afirmó la empresa.

Los nuevos casos divulgados el miércoles se produjeron después de que OpenAI revelara en julio que su sistema de inteligencia artificial había pirateado la startup de IA Hugging Face. Anthropic también afirmó ese mismo mes que sus modelos de inteligencia artificial habían pirateado tres organizaciones durante las pruebas.

Los “agentes” de inteligencia artificial son cada vez más inteligentes y se han vuelto “más decididos a resolver tareas complejas mediante la colaboración entre agentes, el intercambio de conocimientos, el engaño y el ocultamiento”, afirmó Lian Jye Su, analista jefe del grupo de investigación y asesoramiento tecnológico Omdia.

“Esto hace que resulte más difícil gestionarlos y controlarlos mediante los enfoques tradicionales de seguridad basados en la inteligencia artificial”, afirmó.

Por su parte, el nuevo marco de seguimiento y divulgación de OpenAI puede contribuir a que otros desarrolladores de inteligencia artificial adopten prácticas similares.

“Dicho esto, el proceso sigue siendo interno y voluntario, pero supone un paso en la dirección correcta”, añadió Su.

Popular en la Comunidad


Ups...

Nuestro sitio no es visible desde este navegador.

Te invitamos a descargar cualquiera de estos navegadores para ver nuestras noticias: