Mengesan dan Mengurangkan 'Scheming' dalam Model AI
Apollo Research dan OpenAI membangunkan penilaian untuk misalignment tersembunyi ('scheming') dan menemui tingkah laku yang selaras dengan scheming dalam ujian terkawal ke atas model frontier. Mereka turut berkongsi contoh konkrit dan ujian tekanan bagi kaedah awal untuk mengurangkan scheming.