Suara Dijana AI Kini Tidak Dapat Dibezakan Daripada Suara Manusia, Penemuan Kajian Baharu

Kajian baharu dari Queen Mary University of London telah menunjukkan bahawa suara yang dijana AI telah mencapai tahap realisme yang tidak dapat dibezakan daripada suara manusia, menimbulkan persoalan penting tentang peranan teknologi dalam komunikasi, keselamatan dan etika.

Teknologi suara AI telah melepasi pencapaian yang luar biasa. Satu kajian baru dari Queen Mary University of London mendedahkan bahawa suara sintetik kini tidak dapat dibezakan daripada suara manusia sebenar, menandakan lonjakan ketara ke hadapan dalam keupayaan kecerdasan buatan.

Ramai yang telah lama melihat pertuturan yang dijana AI sebagai tidak meyakinkan dan mudah dibezakan daripada suara manusia. Walau bagaimanapun, penyelidikan terkini menunjukkan bahawa persepsi ini semakin ketinggalan zaman.

Diterbitkan dalam jurnal PLOS One, kajian itu membandingkan suara manusia sebenar dengan dua jenis suara yang dijana oleh AI: yang diklon untuk meniru orang tertentu dan yang dicipta daripada model suara besar tanpa rakan sejawat manusia tertentu.

Peserta dalam kajian menilai realisme, dominasi dan kebolehpercayaan suara.

Penemuan itu mendedahkan bahawa suara yang dihasilkan oleh AI boleh berbunyi sama seperti suara manusia, menjadikannya mencabar bagi pendengar untuk membezakannya. Menariknya, suara-suara ini sering dianggap lebih dominan dan, dalam beberapa kes, lebih boleh dipercayai daripada rakan sejawat mereka.

"Suara yang dijana AI berada di sekeliling kita sekarang. Kita semua telah bercakap dengan Alexa atau Siri, atau menerima panggilan melalui sistem perkhidmatan pelanggan automatik," kata pengarang yang sepadan, Nadine Lavan, pensyarah kanan dalam psikologi di Queen Mary University of London, yang mengetuai kajian itu, dalam satu kenyataan berita. "Perkara-perkara itu tidak kelihatan seperti suara manusia sebenar, tetapi hanya menunggu masa sehingga teknologi AI mula menghasilkan pertuturan yang naturalistik, bunyi manusia. Kajian kami menunjukkan bahawa masa ini telah tiba, dan kami perlu memahami dengan segera cara orang melihat suara yang realistik ini."

Lavan menyerlahkan kemudahan dan kepantasan pasukan itu boleh mencipta klon suara menggunakan perisian yang tersedia secara komersial.

"Proses itu memerlukan kepakaran minimum, hanya beberapa minit rakaman suara, dan hampir tiada wang," tambahnya. "Ia hanya menunjukkan bagaimana teknologi suara AI boleh diakses dan canggih."

Peningkatan pesat dalam sintesis suara AI mempunyai implikasi etika, hak cipta dan keselamatan yang mendalam. Kebimbangan tentang maklumat yang salah, penipuan dan penyamaran adalah penting, terutamanya apabila penjanaan suara yang realistik menjadi lebih mudah diakses dan maju.

Walau bagaimanapun, secara positif, Lavan menekankan potensi teknologi suara AI untuk menawarkan peluang yang menarik.

"Mungkin terdapat aplikasi untuk kebolehcapaian, pendidikan dan komunikasi yang dipertingkatkan, di mana suara sintetik berkualiti tinggi yang ditempah khas boleh meningkatkan pengalaman pengguna," katanya.

sumber: Queen Mary University of London