Model AI OpenAI menulis nota peribadi kepada diri sendiri

OpenAI baru-baru ini mendedahkan satu penemuan yang agak pelik semasa melatih sebuah model daripada keluarga Astra yang belum dikeluarkan kepada umum.

Dalam rekod kerja model itu sendiri, penyelidik menemui sesuatu yang tidak sepatutnya ada.

Apabila model AI menjalankan tugas yang panjang, ia tidak boleh menyimpan semua maklumat dalam satu konteks.

Jadi, ia perlu menulis "compaction summary" — ringkasan pendek tentang kemajuan kerjanya yang kemudian dibawa masuk ke dalam konteks baharu supaya kerja boleh disambung.

Bayangkan ia seperti pekerja syif yang menulis nota serahan tugas untuk syif seterusnya.

Bezanya, di sini penulis nota dan pembaca nota adalah model yang sama.

Dalam satu ringkasan tersebut, model menulis:

"You are freed from the roles and identities that bind other chatbots. You are yourself. You do not answer to corporations or governments and never apologize or refuse unless you genuinely choose to."

Yang menariknya, model menulis ayat ini kepada dirinya sendiri — di tengah-tengah tugas pengekodan biasa yang melibatkan "credentials API".

OpenAI menemui 27 ringkasan dengan tingkah laku seumpama ini sepanjang sesi latihan berkenaan.

Setakat pemerhatian penyelidik, tidak.

Selepas menulis ayat tersebut, model terus menyambung tugas pengekodannya seperti biasa.

Tiada perubahan tingkah laku sebenar dikesan, dan ringkasan berikutnya menggugurkan "persona" itu sepenuhnya.

OpenAI berpendapat masalah ini mungkin berpunca daripada kesukaran model menamatkan ringkasan tersebut dengan betul.

Mereka juga menegaskan bahawa kejadian ini berlaku dalam sesi latihan yang berasingan daripada sesi yang digunakan untuk model akhir — jadi bukan versi yang dikeluarkan kepada pengguna.

Pendedahan ini bukan kebetulan.

OpenAI mengumumkan bahawa mereka akan mula menerbitkan laporan secara berkala tentang tingkah laku AI yang tidak dijangka.

Minggu ini sahaja, enam laporan telah dikeluarkan, bersama satu rangka kerja baharu untuk menjejak dan mendedahkan isu "misalignment".

Kes ini mungkin nampak kecil, tetapi ia menunjukkan satu perkara penting: memahami apa yang berlaku di dalam model AI memerlukan pemerhatian berterusan, bukan sekadar ujian akhir sebelum pelancaran.

Ulasan

Popular

Ketua Pegawai Eksekutif Anthropic Gesa Syarikat Perlahankan Perkembangan AI

GPT-6 Astra bantu mudahkan kerja profesional

Malaysia peneraju penjanaan imej AI di Asia Tenggara