【科普氪|孩子只听几千万个词就能学会语言,大模型为什么做不到?】据我们目前所知,人类彼此交谈至少已有10万年。在这漫长的时间里,世界上只有一种存在,能够把人类语言学到近乎完美流利:人类的孩子。
现在,出现了第二种。ChatGPT发布不过四年,我们已经习惯了与手机和电脑自然对话。各种大语言模型,语言能力已经足够流畅,甚至可以相当逼真地模拟人类交流。
但大模型学会语言所需要的数据,远远超过人类。一个大语言模型在训练中接触的文字量,可以达到一个人学习母语过程中所接触语言量的数万乃至数十万倍。
而孩子通常在1岁左右,就已经开始掌握语言。一个成长在语言环境丰富家庭里的孩子,到青春期前大约会听到1亿个词;如果加上阅读,到20岁时接触的语言总量可能达到3亿词左右。
这个数字与现代大模型相比,仍然小得惊人。为什么孩子能够用如此有限的数据,学会如此复杂的语言?越来越多研究者开始尝试逆向工程儿童学习语言的方式。
孩子究竟是怎么做到的,至今仍是一个谜。各国的学者们对此有非常多的推测。而不少研究者,已经把语言模型当作一种“语言实验对象”。
过去,人类一直是唯一能够使用复杂语言进行对话的存在。现在,第一次出现了另一种既不是人、也不是动物的“语言使用者”。大模型正反过来成为研究人类认知的实验工具。(来源:麻省理工科技评论)
