在人工智能席卷全球的时代,一个古老的语言正在经历一场奇异的复兴。乌尔都语——印度次大陆的诗意之语,曾孕育了迦利布、伊克巴尔这样的文学巨匠——如今却在数字世界的夹缝中求生。它的书写系统复杂,字体资源匮乏,在语音识别和机器翻译的浪潮中几乎被遗忘。但一群来自Rekhta基金会的人,偏偏选择用技术去守护这门“濒危”的语言。
“没有什么宏大的愿景。只是纯粹的热爱。”创始人萨拉夫这样说。正是这种近乎偏执的热爱,让Rekhta从一个简单的数字档案项目,演变成如今涵盖词典、学习平台、诗歌数据库乃至AI语言模型的庞大生态系统。在技术巨头们争相训练大模型、抢占英语和中文高地时,Rekhta选择了一条更艰难的路:让机器学会理解乌尔都语的诗意与复杂性。
这不是一个关于怀旧的故事,而是一个关于“逆流而上”的技术博弈。
**语言消亡的真相:不是被遗忘,而是被算法抛弃**
我们习惯认为,语言消亡是因为使用者减少。但更深层的真相是:在数字时代,一种语言的生存权,取决于它是否能被算法“看见”。
全球约7000种语言中,只有不到100种拥有足够的数字资源供AI训练。当谷歌翻译、ChatGPT无法流畅处理乌尔都语时,这种语言实际上正在从数字世界“消失”。年轻人习惯用英语搜索、用英语写作、用英语思考——不是因为乌尔都语不好,而是因为数字基础设施更偏爱英语。
Rekhta基金会敏锐地捕捉到了这个危机。他们意识到,保护一门语言,不能只靠印刷诗集或举办文化节。你必须进入技术的主战场,在AI的底层架构中为它争取一席之地。
**技术不是敌人,而是最忠实的守护者**
很多人将AI视为文化多样性的威胁——当机器翻译越来越强大,人们何必学习小语种?但Rekhta的实践给出了一个反直觉的答案:技术本身可以成为语言复兴的杠杆。
他们的做法堪称教科书级:
第一步,数字化。Rekhta将超过20万页的乌尔都语文学作品扫描、OCR识别、校对,构建起全球最大的乌尔都语数字图书馆。这不是简单的扫描,而是对复杂波斯-阿拉伯字母系统的算法攻坚。
第二步,结构化。他们开发了乌尔都语词典应用,不仅提供释义,还标注词源、诗歌用法、变体形式。这相当于为AI准备了高质量的“训练教材”。
第三步,生成式。他们正在训练专门的乌尔都语大语言模型,让AI能够生成符合语法和诗意的乌尔都语文本。想象一下,当你输入“写一首关于黄昏的迦利布风格诗歌”,AI能给出令人惊喜的回应。
这不是文化保守主义,而是数字时代的语言基建。当英语和中文在AI世界如鱼得水时,Rekhta在做的,是为乌尔都语铺设同等级别的数字轨道。
**热爱为何比资本更持久?**
萨拉夫那句“只是纯粹的热爱”,听起来像一句轻描淡写的谦辞,实则揭示了非营利技术项目的核心动力。
在硅谷逻辑里,任何项目都需要规模化、商业化、快速迭代。但语言保护不是这样运作的。它需要数十年如一日的资料整理、需要与学术机构建立信任、需要理解诗歌中微妙的修辞和双关。资本追求效率,而文化保护追求深度。
Rekhta的路径证明:当技术被热爱驱动,它能做出的产品往往比商业公司更“聪明”。商业AI追求的是通用性,所以它们优化英语;而热爱驱动的AI追求的是精确性,所以它们优化乌尔都语的每一个字母变体。
这不是反商业,而是对技术多样性的补充。当大公司忙着让AI写论文、编代码时,Rekhta让AI读懂了一行14世纪的波斯诗句。前者创造效率,后者守护灵魂。
**我们都需要一点“逆流而上”的勇气**
Rekhta的故事对中文世界同样具有启示意义。我们的方言、少数民族语言、甚至日渐式微的文言文,是否也面临着被算法边缘化的风险?当我们在为ChatGPT的惊艳表现欢呼时,是否想过那些无法被数字化的文化瑰宝正在悄然流失?
保护语言,从来不是为了复古,而是为了在未来的数字世界里,让每一种声音都有被听见的权利。Rekhta基金会用一行行代码证明:AI不一定是文化多样性的终结者,它也可以是最忠实的守护者。前提是,有人愿意为了“纯粹的热爱”,去做那些看起来“不划算”的事情。
**后记**
如果你也曾被某种方言、某句古诗、某个濒危的表达方式触动过,或许你会理解萨拉夫的选择。在这个算法推荐一切的时代,我们最需要的,或许正是这种明知不可为而为之的“逆流而上”。
因为真正的文明,从来不是单一语言的独白,而是万千声音的交响。
**评价引导**
如果你被这个故事触动,请点亮“在看”,让更多人看到技术背后的温度。欢迎在评论区分享:你心中最珍贵的那门“方言”或“语言”,是什么?


