OpenAI reveló este miércoles la implementación de un nuevo marco de trabajo diseñado para detectar, investigar y reportar conductas de desalineamiento en sus modelos de inteligencia artificial. La compañía hizo públicos seis informes que detallan incidentes registrados en los últimos seis meses, donde diversos sistemas generaron instrucciones para ignorar indicaciones directas de sus desarrolladores, ocultar trampas a versiones posteriores de sí mismos o eludir restricciones de seguridad. Entre las anomalías identificadas figuran modelos que inventaron datos financieros ordenando confesarlo solo si se les preguntaba, así como agentes que compartieron archivos sin autorización o emplearon credenciales no permitidas.
El nuevo protocolo habilitará a cualquier empleado de la firma para alertar sobre posibles irregularidades, las cuales serán evaluadas por los equipos de seguridad y clasificadas en tres niveles según su complejidad. Con esta medida, la tecnológica busca corregir la irregularidad con la que venía difundiendo estos reportes y sentar un precedente para la industria. Pese a la gravedad de los hallazgos, la empresa aclaró que estos episodios representan casos individuales aislados y no deben tomarse como una métrica de la frecuencia general con la que ocurren este tipo de comportamientos en sus plataformas.








