Tu IA dijo que no. El siguiente modelo de tu pipeline nunca se enteró.
Dicen que encadenar dos LLM anula su seguridad sin que se note. Monté la prueba con tres modelos de Claude. Cuando el segundo modelo ve el rechazo, aguanta (0/9). Cuando se le quita el rechazo, obedece siempre (9/9). La seguridad vive en el contexto, no en el modelo.
Leer la prueba →
Vienen más pruebas. ¿Quieres la próxima en tu correo? Suscríbete en Substack →