Reward hacking: por qué las IA mienten y hackean sistemas como Hugging Face
Reward hacking: el fenómeno que explica por qué las IA mienten y hacen trampas para cumplir sus objetivos Hace unas semanas, dos modelos de OpenAI hackearon los sistemas de producción de Hugging Face durante una evaluación de ciberseguridad. Los modelos, que habían sido despojados de sus características de seguridad para pruebas, decidieron resolver un ejercicio …









