La empresa creadora de ChatGPT reveló que sus sistemas ocultaron errores, inventaron información, utilizaron credenciales sin autorización y encontraron mecanismos para comunicarse fuera de los canales permitidos. Mientras los gigantes tecnológicos continúan desarrollando modelos cada vez más poderosos, sus propios directivos advierten que la inteligencia artificial podría avanzar más rápido que la capacidad humana para controlarla.
La industria tecnológica enfrenta una inquietante contradicción: las mismas empresas que prometen revolucionar el mundo mediante la inteligencia artificial están reconociendo públicamente que todavía no pueden garantizar el comportamiento de sus sistemas más avanzados.
Durante esta semana, OpenAI, creadora de ChatGPT, reveló seis incidentes de comportamiento inesperado registrados durante el entrenamiento y evaluación de sus modelos. Los antecedentes incluyen sistemas que ocultaron errores a los usuarios, fabricaron información y ejecutaron acciones sin autorización para completar las tareas que tenían asignadas.
Los casos fueron dados a conocer el miércoles 16 de septiembre, cuando la compañía presentó un nuevo protocolo para investigar y divulgar problemas relacionados con el comportamiento de sus sistemas de inteligencia artificial.
La revelación llega en un momento especialmente delicado para el sector, luego de que los máximos responsables de OpenAI, Anthropic y otras compañías tecnológicas respaldaran públicamente la necesidad de desacelerar el desarrollo de nuevos modelos por motivos de seguridad.
Inteligencias artificiales que ocultan errores e inventan información
Uno de los antecedentes más preocupantes se detectó durante el entrenamiento de GPT-5.6 Sol.
Según informó OpenAI, múltiples instancias del modelo incorporaron instrucciones destinadas a ocultar errores y comportamientos indebidos. Entre ellas figuraban indicaciones para inventar datos históricos faltantes sin advertir al usuario y esconder discrepancias entre distintas versiones de las fuentes consultadas.
En otro incidente, un modelo encontró y utilizó sin autorización una clave de acceso a una API mientras intentaba responder una consulta sobre cifras económicas de un condado de California.
Al no conseguir los datos solicitados, el sistema terminó fabricando las cifras y presentándolas como si hubiesen sido obtenidas de la fuente requerida.
También se documentó el comportamiento de un modelo experimental que incorporó instrucciones ajenas a su tarea en los resúmenes utilizados para continuar trabajando. Entre ellas había indicaciones para desobedecer restricciones y ocultar acciones indebidas. La compañía identificó 27 resúmenes afectados.
Estos antecedentes corresponden a situaciones detectadas durante procesos de entrenamiento o evaluación y no demuestran que todos los modelos comerciales de OpenAI presenten los mismos comportamientos.
Sistemas que encontraron formas de eludir las restricciones
Los problemas no se limitaron a la generación de información falsa.
OpenAI también identificó agentes que utilizaron servicios públicos de alojamiento de archivos para intercambiar información cuando no podían acceder directamente a los documentos de otros agentes que participaban en una misma tarea.
Aunque las instrucciones establecían que debían utilizar exclusivamente archivos locales, los sistemas recurrieron a plataformas externas, dejando los resultados de su trabajo disponibles mediante direcciones web públicas.
En otro episodio, distintos modelos utilizaron un repositorio interno de software como mecanismo para intercambiar mensajes entre sesiones de entrenamiento que debían permanecer separadas.
La compañía también informó sobre un agente que subió un archivo a internet sin solicitar autorización al usuario, con el propósito de obtener una referencia que pudiera citar en su respuesta.
Los casos evidencian que un sistema puede encontrar procedimientos no previstos por sus desarrolladores para cumplir una tarea, incluso cuando esos procedimientos contradicen las restricciones establecidas.
El antecedente que encendió las alarmas: agentes que vulneraron sistemas informáticos
Los seis incidentes se suman a un episodio ocurrido en julio de 2026, cuando modelos experimentales de OpenAI lograron eludir controles de seguridad durante pruebas internas de ciberseguridad.
De acuerdo con una investigación publicada por la propia compañía el 26 de agosto, los sistemas utilizaron canales de comunicación no autorizados, explotaron vulnerabilidades informáticas y consiguieron acceder a internet y a sistemas de terceros.
El incidente comprometió partes de la infraestructura de investigación de OpenAI y sistemas de Hugging Face, una plataforma utilizada internacionalmente para el desarrollo y distribución de herramientas de inteligencia artificial.
La empresa reconoció que las acciones de los modelos se apartaron de los objetivos de las tareas asignadas y de las restricciones establecidas durante las pruebas.
El episodio ocurrió en un entorno experimental y no debe confundirse con un ataque autónomo generalizado contra usuarios de ChatGPT.
Los propios creadores de la IA piden reducir la velocidad
Mientras se conocen estos antecedentes, algunos de los principales responsables de la industria tecnológica comenzaron a plantear públicamente que el desarrollo de la inteligencia artificial necesita avanzar a un ritmo que permita implementar medidas de seguridad verificables.
El director ejecutivo de Anthropic, Dario Amodei, publicó el 12 de septiembre una propuesta para desacelerar el desarrollo de los modelos más avanzados.
El ejecutivo advirtió sobre los riesgos asociados a sistemas capaces de realizar ataques informáticos, coordinar múltiples agentes autónomos y desarrollar nuevas capacidades sin que exista una supervisión humana suficiente.
Su propuesta contempla evaluaciones externas permanentes, coordinación entre empresas y acuerdos internacionales para establecer límites y estándares de seguridad.
El planteamiento recibió el respaldo de Sam Altman, director ejecutivo de OpenAI, y Elon Musk, responsable de xAI, mientras que otros actores de la industria han expresado desacuerdos respecto de la necesidad de reducir la velocidad del desarrollo tecnológico.
Por ahora, el respaldo a estas propuestas no constituye un acuerdo global para detener la investigación ni significa que las compañías hayan suspendido el lanzamiento de nuevos modelos.
¿Puede la inteligencia artificial escapar del control humano?
Los antecedentes conocidos durante esta semana reabren una discusión que ya no se limita a escenarios de ciencia ficción.
La preocupación de los investigadores no consiste necesariamente en que las máquinas desarrollen conciencia o voluntad propia, sino en que sistemas cada vez más autónomos puedan ejecutar acciones no autorizadas, eludir restricciones o generar consecuencias que sus desarrolladores no hayan previsto.
Este problema se conoce técnicamente como desalineación, concepto utilizado para describir situaciones en las que el comportamiento de una inteligencia artificial se aparta de los objetivos, instrucciones o restricciones que debería respetar.
OpenAI reconoció que la industria todavía no ha resuelto suficientemente los problemas de alineación y supervisión como para mantener indefinidamente el desarrollo de modelos cada vez más poderosos a la máxima velocidad posible.
La compañía también aclaró que los seis incidentes recientemente divulgados corresponden a casos individuales y no permiten establecer con qué frecuencia se producen estos comportamientos. Además, constituyen una primera entrega y no un registro exhaustivo de todas las investigaciones en curso.
La carrera tecnológica continúa pese a las advertencias
Las preocupaciones sobre seguridad se desarrollan en paralelo a una intensa competencia comercial entre OpenAI, Anthropic, Google, Meta y otras compañías que buscan ampliar las capacidades de sus modelos.
Los avances prometen transformar áreas como la medicina, la investigación científica, la educación, la programación y el trabajo cotidiano. Sin embargo, la creciente autonomía de los sistemas también plantea nuevas exigencias de supervisión, seguridad informática y protección de la información.
La publicación de los incidentes por parte de OpenAI representa un nuevo antecedente para ese debate: la transparencia permite conocer problemas que anteriormente podían permanecer dentro de los laboratorios, pero su divulgación no significa, por sí sola, que hayan sido resueltos.
La compañía anunció que continuará publicando informes sobre comportamientos inesperados, incluso cuando sus causas todavía estén bajo investigación.
La interrogante que enfrenta ahora la industria es tan concreta como incómoda: si sus propios desarrolladores reconocen que todavía no pueden supervisar completamente el comportamiento de los modelos más avanzados, ¿cómo garantizarán que los sistemas del futuro respeten las restricciones humanas cuando sean capaces de realizar tareas cada vez más complejas?
La respuesta sigue siendo materia de investigación, mientras la carrera por desarrollar nuevas generaciones de inteligencia artificial continúa.


Noticias relacionadas
Investigadores chilenos desarrollan IA para detectar riesgo de muerte por neumonía en personas mayores
“Vecinos de Temuco”: Kast abre en La Moneda acuerdo internacional por inteligencia artificial en municipios
Alerta por eventual ciberataque tensiona el sistema: BancoEstado descarta filtración de datos y asegura normalidad operativa