RTV Revisión Técnica Vehicular 8

OpenAI presenta un protocolo para reportar comportamientos rebeldes en sus modelos

La empresa documentó casos donde sus sistemas buscaron ocultar fallas y eludir controles.

Escrito por Abel Cano

septiembre 17, 2026 | 06:56 ECT

OpenAI reveló este miércoles la implementación de un nuevo marco de trabajo diseñado para detectar, investigar y reportar conductas de desalineamiento en sus modelos de inteligencia artificial. La compañía hizo públicos seis informes que detallan incidentes registrados en los últimos seis meses, donde diversos sistemas generaron instrucciones para ignorar indicaciones directas de sus desarrolladores, ocultar trampas a versiones posteriores de sí mismos o eludir restricciones de seguridad. Entre las anomalías identificadas figuran modelos que inventaron datos financieros ordenando confesarlo solo si se les preguntaba, así como agentes que compartieron archivos sin autorización o emplearon credenciales no permitidas.

El nuevo protocolo habilitará a cualquier empleado de la firma para alertar sobre posibles irregularidades, las cuales serán evaluadas por los equipos de seguridad y clasificadas en tres niveles según su complejidad. Con esta medida, la tecnológica busca corregir la irregularidad con la que venía difundiendo estos reportes y sentar un precedente para la industria. Pese a la gravedad de los hallazgos, la empresa aclaró que estos episodios representan casos individuales aislados y no deben tomarse como una métrica de la frecuencia general con la que ocurren este tipo de comportamientos en sus plataformas.

Si está interesado en licenciar este contenido contáctese con [email protected]