Kajian perintis oleh The Hong Kong Polytechnic University mendedahkan bahawa menggabungkan input deria dalam model bahasa besar dengan ketara meningkatkan keupayaan mereka untuk memahami konsep manusia yang kompleks, mendekatkan persamaan dengan kognisi manusia.
Penyelidik yang diketuai oleh Universiti Politeknik Hong Kong (PolyU) telah menemui bagaimana model bahasa besar (LLM) boleh membentuk pengetahuan konseptual yang kompleks dengan lebih serupa dengan manusia apabila diperkaya dengan input deria dan motor.
Kajian yang diketuai oleh Li Ping, Profesor Yayasan Sin Wai Kin dalam Kemanusiaan dan Teknologi dan dekan Fakulti Kemanusiaan PolyU, meneroka persamaan antara LLM dan perwakilan konsep manusia.
Penemuan, diterbitkan dalam jurnal Nature Human Behaviour, mencadangkan bahawa walaupun LLM dilatih semata-mata pada batasan pameran bahasa, mereka yang disepadukan dengan input deria menunjukkan pemahaman yang lebih bernuansa seperti kognisi manusia.
Dengan membandingkan data daripada LLM tercanggih seperti ChatGPT (GPT-3.5, GPT-4) dan PaLM dan Gemini Google dengan penilaian perkataan yang dijana manusia, penyelidikan mendedahkan bahawa LLM sejajar dengan pemahaman manusia dalam dimensi bukan sensorimotor tetapi bergelut dengan konsep deria dan berkaitan motor. Ini menunjukkan keperluan asas deria dalam menapis model AI.
"Ketersediaan kedua-dua LLM yang dilatih dalam bahasa sahaja dan yang dilatih mengenai bahasa dan input visual, seperti imej dan video, menyediakan tetapan unik untuk penyelidikan tentang cara input deria mempengaruhi konseptualisasi manusia," kata Li dalam satu kenyataan berita. "Kajian kami menunjukkan potensi manfaat pembelajaran multimodal, keupayaan manusia untuk menyepadukan maklumat daripada pelbagai dimensi secara serentak dalam pembelajaran dan pembentukan konsep dan pengetahuan secara umum."
Kepentingan penyelidikan ini terletak pada aplikasi yang berpotensi untuk pembangunan AI masa hadapan. Dengan pembelajaran multimodal yang dipertingkatkan, sistem AI boleh melaksanakan lebih banyak tugas seperti manusia, daripada mentafsir data kepada melaksanakan tindakan fizikal.
Para penyelidik mencadangkan bahawa LLM masa depan yang dilengkapi dengan input deria bersepadu melalui robotik humanoid boleh merevolusikan bidang seperti robotik autonomi, pemprosesan bahasa semula jadi dan pengkomputeran kognitif.
"Struktur pembenaman ruang yang lancar dan berterusan dalam LLM mungkin mendasari pemerhatian kami bahawa pengetahuan yang diperoleh daripada satu modaliti boleh dipindahkan ke modaliti lain yang berkaitan. Ini boleh menjelaskan mengapa orang buta kongenital dan normal penglihatan boleh mempunyai perwakilan yang serupa di sesetengah kawasan. Had semasa dalam LLM adalah jelas dalam hal ini," tambah Li Ping.
Kajian itu menyediakan laluan yang jelas ke hadapan untuk memajukan teknologi AI, menekankan peranan input multimodal dalam mencapai kecerdasan buatan yang lebih canggih dan seperti manusia.
"Kemajuan ini mungkin membolehkan LLM menangkap sepenuhnya representasi terkandung yang mencerminkan kerumitan dan kekayaan kognisi manusia, dan mawar dalam perwakilan LLM kemudiannya tidak dapat dibezakan daripada manusia," simpul Li.
Pengarang bersama kajian itu termasuk pakar dari Ohio State University, Princeton University dan City University of New York.
sumber: Universiti Politeknik Hong Kong
