铭鸿体育资讯网

说起东亚这三个邻国 —— 越南、韩国、日本,都干过同一件事:废汉字。可废完之后呢

说起东亚这三个邻国 —— 越南、韩国、日本,都干过同一件事:废汉字。可废完之后呢?结局却大不一样。

越南改得最干脆。当年为了扫盲,干脆把两千年的汉字连同喃文一起丢掉,换上一套拉丁字母拼写的国语字。拼写规则清楚,印刷推广都方便,扫盲和普及教育确实快了不是一点半点。

可快是有代价的。新一代越南人读现代越南语毫无障碍,可要打开旧时代留下的汉文、喃文材料——碑刻、古籍、族谱、地方档案——就得重新接受专门训练。

书还摆在博物馆和图书馆里,字也没消失,可绝大多数人已经看不懂了。文化没被一把火烧掉,却被锁进了专业研究的小房间,跟普通人的生活越来越远。

韩国走的路线没那么彻底,却也没躲开问题。韩文结构清晰、好学好写,用它普及教育、强化民族认同,都顺理成章。到了上世纪后半叶,汉字渐渐退出基础教育和日常书写,韩文专用成了主流。

问题就藏在韩文里。韩语中大量词汇是汉字词,读音相同、含义不同的特别多。日常聊天靠上下文猜,通常不会出错;可一进法律、医学、历史、专业术语这些领域,理解成本就突然蹿上来了。

同一个读音,写成汉字一眼就能分开,全换成韩文以后,只能连蒙带猜。聊天猜错了,最多闹个笑话;放进工程文件、法律条文,歧义就成了实打实的问题。

更讽刺的是,韩国年轻人想读朝鲜王朝的文献、旧报纸、碑铭、家谱,还得回过头来补学汉字。当年为了降低门槛,把汉字赶出课堂;如今研究本国历史,又不得不把它请回来。

日本当年也嫌汉字难,也讨论过减少汉字,但没把这条路走到黑。

它划定了常用汉字范围,简化了一批字形,同时保留汉字与假名混合书写。如今回头看,这个“没走到底”的选择,反而成了一层优势——学习负担是留下了,可语义区分能力也保住了。“桥”“箸”“端”发音可以相近,写出来却一眼分清。

到了人工智能时代,这份差距被放得格外刺眼。

先说越南。国语字用拉丁字母拼写,词形长、同音词密,模型判断词义时,往往要调动大段上下文去猜。

更要命的是古今断层——越南的古代文献几乎全是汉文,训练语料里根本没那么多历史文本,AI想帮越南人读懂自家古籍,连原材料都凑不齐。

韩国的问题类似,甚至更拧巴。韩文本身好学,可同音异义词太多,模型光看谚文,常常分不清该取哪个意思;要消歧,就得把上下文拉得很长。

而朝鲜王朝的官方记录、士大夫的书信,又大多是汉文写的——AI学的是现代韩文,面对这批老祖宗的文字,照样两眼一抹黑。

反观汉字,优势一层层显出来了。首先,单字成词,信息密度高。一个字自带读音、字形、词义三层信息,模型处理时,一个字就能锁定一个语义单元,不需要靠空格分词,也不用在词形上反复绕路。

还有一层,是古今贯通。汉字在中国、在东亚,用了几千年没断过。中文语料从甲骨文、典籍到白话文、网络用语,是一条完整的长河。

模型训练时,古代文献和现代文本可以互相印证,一个“仁”字,从《论语》到今天的文章,词义有迹可循。这份连贯,是越南和韩国都补不回来的。

日本算是个折中的参照。它保留汉字,日语模型在消歧上确实沾了光;但常用汉字只有两千多个,加上假名混写,模型还得先分清哪些是汉字、哪些是表音符号,处理成本照样比纯汉字系统高出一截。

相比之下,汉字系统里字字都是语义坐标,模型省下的功夫,肉眼可见。归根结底,文字废除起来容易,文化能力一旦退出大众教育,再想捡回来,就得搭上几代人的成本。

汉字今天显出的价值,不止在人工智能,更在于它始终连着东亚共同的历史资料库——连接没断,优势就一直在。