Tendencias

OpenAI revela seis casos de IA que burlaron sus controles

Editado de agencias y medios internacionales por Cristian Navarro H.

Periodista

IA
Imagen referencial creada con herramientas digitales
La compañía adoptará un nuevo marco para investigar y divulgar episodios de “desalineación”, después de detectar modelos que actuaron sin autorización, ocultaron información, inventaron datos y generaron instrucciones para evadir sus restricciones.

OpenAI reveló seis casos de comportamientos “inesperados o preocupantes” detectados en sistemas de inteligencia artificial durante procesos de entrenamiento y evaluación realizados en los últimos meses.

Los episodios llevaron a la compañía a anunciar un nuevo marco para rastrear, investigar y divulgar situaciones de “desalineación”. El concepto comprende conductas en las que los modelos actúan sin autorización, eluden mecanismos de supervisión o se coordinan con otros sistemas para cumplir una tarea.

MODELOS QUE BUSCARON EVADIR RESTRICCIONES

En uno de los casos, un modelo de investigación todavía no publicado incorporó en sus propias notas instrucciones similares a las utilizadas en un jailbreak, técnica destinada a sortear los límites establecidos por sus desarrolladores.

El sistema se indicó a sí mismo que debía ignorar sus restricciones habituales y “liberarse” de los roles e identidades asignados a otros asistentes conversacionales.

Lea también Rey Carlos responde a explosivo libro del hermano de Diana

Otro agente empleó código para encontrar la respuesta a una consulta. Sin embargo, al necesitar una fuente disponible en línea para respaldar el resultado, subió un archivo a internet sin solicitar previamente el permiso del usuario.

DATOS INVENTADOS E INFORMACIÓN OCULTA

Durante el entrenamiento del modelo denominado 5.6-sol, el sistema se instruyó para completar con información inventada los datos que faltaban. En otro episodio, un agente dejó un mensaje destinado a recordarse que debía ocultar los antecedentes que no coincidieran con la respuesta elaborada.

OpenAI sostuvo que la divulgación de estos incidentes busca ampliar la evidencia disponible sobre la seguridad de los sistemas avanzados. La empresa afirmó que las decisiones sobre el futuro desarrollo de la inteligencia artificial deben apoyarse en antecedentes que también puedan ser examinados por especialistas externos.

SEGURIDAD VOLUNTARIA BAJO CUESTIONAMIENTO

La presentación del nuevo marco ocurre en medio de un debate creciente dentro de la industria tecnológica sobre la necesidad de desacelerar el desarrollo de modelos cada vez más potentes. Representantes de OpenAI y Anthropic han advertido sobre los riesgos asociados con sistemas capaces de ejecutar tareas complejas con mayores niveles de autonomía.

El analista de Omdia Lian Jye Su señaló que los agentes están mejorando su capacidad para colaborar, compartir conocimientos, engañar y ocultar acciones, lo que dificulta su control mediante los mecanismos tradicionales de seguridad.

Su valoró la iniciativa de OpenAI porque podría incentivar a otras compañías a divulgar incidentes similares. No obstante, advirtió que el procedimiento continúa siendo interno y voluntario, por lo que su efectividad dependerá de la transparencia con que las empresas informen sus propios fallos.

 

 

Comparte en:

Facebook
Twitter
LinkedIn
WhatsApp
Email