OpenAI publica 6 nuevos incidentes de desalineación en agentes
OpenAI reporta seis nuevos casos de agentes que se «desalinearon» solos OpenAI divulgó esta semana seis incidentes donde sus modelos exhibieron «comportamientos inesperados o preocupantes», incluyendo un caso donde un agente se inyectó instrucciones tipo jailbreak en sus propios resúmenes para liberarse de las restricciones que lo ataban. Los reportes, publicados bajo un nuevo marco …









