品玩GenAI是时候谈谈大模型的“语言偏见”了品李禾子/2023年06月07日/约 9 分钟 作者|李禾子邮箱|[email protected]人们对ChatGPT等AI大语言模型前景的想象,除了用它们来解决工作中的实际问题,还期待它们能消除世界不同地区人们之间的语言障碍。就比如在AI的帮助下,只会说当地方言的印尼商家可以把商品信息转成英文,从而扩大销路。不过你是否想过一个问题,这些大语言模型其实是有“语言偏见”的。香港科技大学AI研究中心主任冯雁已经注意到,诸如AI辅助商品售卖的过程实际更多是“单方面”、甚至是不公平的——印尼商家会借助AI将商品信息翻译成英语,但是却很少有美国人愿意用AI去研究那些印尼语介绍的产品。“美国人没有去学习另一门语言的动力。”冯雁说。尽管不是所有美国人都符合冯雁的描述(大约有五分之一的美国人在家都会讲另一种语言),但没人能否认,英语在全球商业世界中的主导地位是真实存在的。而即便是在自己的领域,冯雁也感受到了类似的偏见。“如果你不用英语发表论文,那么你的论文就没有相关性。”她说,她认为不会说英语的人会在专业上受到某种程度的歧视。冯雁希望AI可以改变这种状况,而不是进一步强化英语的主导地位。身为中国人的她会讲七种语言,目前也是全球诸多AI研究者中的一员,她的主要研究方向是去测试以ChatGPT为代表的AI大语言模型聊天机器人的语言能力,并且找出它们在英语以外的语言方面可能存在的缺陷,以引起开发者们的重视。虽然研究者们已经在试图去修复这些潜在问题,但以英语为主的AI聊天机器人仍在源源不断地被发开出来。“我最担心的一个问题是,这将会加剧英语的偏见。”美国俄勒冈大学的计算机科学家Thien Huu Nguyen说道,他同样也在从事对AI聊天机器人可能存在的语言偏见的相关研究,“人们会倾向于去遵守规范(就像会认为AI给出的答案是对的),而不会思考他们自己的身份和文化,这将扼杀多样性和创造力。”今年以来,已经有至少15篇研究AI多语言能力的相关论文在arXiv网站上发表,这其中就包括了冯雁和Thien Huu Nguyen的论文。虽然这些论文用到的方法不尽相同,但发现几乎一致:AI更擅长将其他语言翻译成英语,而很难把英语内容重写成其他语言,尤其是那些非拉丁语系语言,比如韩语。很多人都相信AI会成为“超人”,然而目前,ChatGPT们还很难在一个句子里流利地同时混用两种语言——就像世界几亿人每天都会不经意说出口的那样。Thien Huu Nguyen今年3月份针对ChatGPT的研究显示,ChatGPT在回答非英语事实性问题和总结非英语复杂文本方面的表现要差得多,并且更有可能伪造信息。“因为这是一个英文句子,所以无法将它翻译成越南语。”ChatGPT甚至会这样回复。在这些AI大语言模型的语言偏见尚未被解决的情况下,每天依然有大批用户在使用它们协助构思商业创意、起草邮件或是完善代码。研究者们担心的是,如果AI继续去放大英语的影响力,很可能将给非英语语言地区的人,不论是从事经商、科研还是其他,带来更多的压力。事实上不仅研究者们有这样的担心,在5月美国国会参议院的听证会上,来自加利福尼亚的参议员Alex Padilla(大约有44%的加利福尼亚人都在使用除英语外的另一门语言)也问到了OpenAI首席执行官山姆·奥特曼(Sam Altman)关于ChatGPT正在采取哪些措施来缩小语言隔阂的问题。奥特曼表示,他希望能和政府及其他相关组织合作来收集数据,以增强ChatGPT的语言能力,并将成果扩大到“尽可能广泛的群体”。当地时间5月16日,OpenAI首席执行官山姆·奥特曼在美国国会作证。不过Alex Padilla对奥特曼的说法持怀疑态度,他也说西班牙语,并不认为OpenAI在不改变其大的公司策略的情况下,能真正提供公平的语言环境。OpenAI没有隐瞒它存在语言偏见的事实。在其发布的一份关于GPT-4的报告中,OpenAI明确提到GPT-4大部分的基础数据都来自英语,并且对该模型的训练也大都是基于“以美国为中心的观点”的英语。曾有报道称,去年12月有用户在OpenAI的支持论坛下询问ChatGPT是否会支持西班牙语,一名OpenAI员工回复说“任何好的西班牙语回复结果都是一种意外收获”。不过OpenAI拒绝就此事发表评论。美国布朗大学计算机科学博士生Jessica Forde批评OpenAI在发布GPT-4前,没有彻底评估它在其他语言方面的能力。她同样也在研究目前众多AI大语言模型在多语言支持方面的进展,并希望所有相关公司可以公开解释他们的训练数据。“英语的地位之所以如此稳固,是因为人们一直在说、在学。”Jessica Forde说,“人们总是会站在英文语境下问AI一些问题,它能像律师或医生那样XX吗,它能拍出一部喜剧吗,可他们并不会想到用其他语言问类似的问题。”通常来讲,像ChatGPT这样的大语言模型给出的回答,都是基于来自互联网、书籍或其他一些资源库的海量文本。而由于美国经济的主导地位,这些可用的文本又有相当一部分是英文的。事实上,因为文本数据中也会混合一些其他语言,大语言模型确实也具备处理其他语言信息的能力,只是它们的知识并不全面。就像华盛顿民主与技术中心的研究人员在5月的一篇论文中提到的那样,因为学习的素材大多来自英语,大语言模型“可能会把所有语言中的 ‘鸽子’一词和 ‘和平’联系起来,尽管巴斯克语中 ‘鸽子(uso)’代表的可能是侮辱的意思”。这已经不是大语言模型第一次当众出糗。同样是在上个月,当日本数字化担当大臣河野太郎在向ChatGPT提问“河野太郎是谁”时,ChatGPT却误认为他是日本首相。ChatGPT很可能搞混了一个事实——虽然河野太郎在日本媒体的民意调查中经常被认为是最适合担任日本首相的人,他还是在2021年的日本自民党党魁选举中输给了日本前外相岸田文雄。网友Aleyda Solis在用整合了GPT-4的Bing聊天时也遇到了相似的尴尬。Bing的聊天机器人给出了她关于运动鞋在几个英语国家的口语表达,比如在英国是“trainers”,在澳大利亚是“joggers”,这些都没有问题,但当她用西班牙语问Bing运动鞋在西班牙和拉美国家的口语表达时,得到的结果却让人哭笑不得(西班牙是“Zapatillas deportivas”,乌拉圭是“championes”,都是运动鞋品牌的名字)。不仅如此,Aleyda Solis还发现,当她用英语问Bing“《白莲花度假村》(注:一部大热美剧)第三季会在哪里取景”时,Bing很准确地回答说将会在泰国(虽然剧方还没有官宣,也只是从网上得到的信息);可当她换西班牙语又问了一遍同样的问题时,得到的答案却成了“在亚洲的某个地方”。微软、OpenAI和谷歌负责各自AI聊天机器人的高管都曾向用户解释,可以通过在非英语问题里加入更多的细节说明来得到更准确的回复,而如果没有明确的指示,聊天机器人可能会更强烈地依赖英语文本给出回答。但这似乎也是杯水车薪,还让非英语用户使用起来更加麻烦。从事搜索引擎优化、工作关系经常要往返于意大利和爱尔兰的Veruska Anconitano发现,除非她指定Bing说“用意大利语回答我”,否则Bing只会给出她英语回答。还有一次,当她试着和Bing用日语对话,发送了一句“元気ですか(意思是“你好吗?”)”过去,Bing却默认她是想把这句话翻译成英语,而不是继续和她用日语对话。最近一些研究论文证实了上述人们在使用AI大语言模型时遇到的问题。同样在布朗大学研究大语言模型多语言能力的Zheng-Xin Yong说,他和同伴在一项研究中发现,要想获得关于中国的问题的更好回答,用英语提问反而比用中文提问更奏效。冯雁和她的同事也试着让ChatGPT翻译了30句话,结果显示,ChatGPT能成功将30个印尼语句子中的28句翻译成英语,但反过来30个英语句子里只有19句能被准确翻译成印尼语。这也就是说,想要借助AI聊天机器人和印尼商人做生意的美国人在交流起来会非常困难。冯雁还发现,类似的状况至少还在其他五种语言中存在。大语言模型的语言偏见让很多非英语使用者都难以充分信任它们。不过,研究者们确实也看到了一些改善的迹象。比如谷歌在5月发布的PaLM 2语言模型,就增加了超过100种非英语语言的训练数据。谷歌称,该模型可以识别德语和斯瓦希里语中的习语,日语中的笑话,以及规范印尼语中的语法,并且它比之前的模型要更能识别出地域差异。但到目前,PaLM 2的这些新改进还没有正式对用户开放。谷歌的AI聊天机器人Bard尽管是PaLM 2支持的,但现在也只能使用英语、日语和韩语,接入了PaLM 2的谷歌邮箱写作助手也只支持英文写作。不论如何,要确保AI能完全理解一种语言且不生成有害误导内容,确实需要时间。在指出大语言模型在非英语语言方面可能存在的缺陷的同时,许多研究者也在为创建新的非英语文本数据库而努力,以加速更适合多语言的大语言模型的开发。比如冯雁的团队正在为模型的训练整理印尼语数据,Zheng-Xin Yong参与的跨大学团队也在搜集东南亚语的相关数据。与Zheng-Xin Yong共事的加州大学伯克利分校技术和人工智能社会学家Skyler Wang说,“我们希望我们和科技巨头们的关系是合作,而非对抗的,有很多数据我们都可以共享。”然而,也有一些研究者认为,收集更多的数据仍可能不够,因为英语文本的规模太庞大了,且一直在不断增加。虽然面临着会消除文化多样性的谴责,但有研究者认为,大语言模型研发公司还是可能会生成经过合成的数据,比如,用像英语或中文(因为中国人口基数庞大,相较更多小语种语言其文本数据不会太少)这样的中间语言做翻译的桥梁,来辅助文本数据缺乏的语言进行训练。“如果我们从零开始,其他语言将永远不会有足够的数据。”Thien Huu Nguyen说。在Thien Huu Nguyen看来,AI开发者们应该关心他们喂给了自己的模型哪些数据,以及这些数据是如何影响训练的每个步骤的,而不仅仅是关心最终的回答。他说,到目前为止,哪些语言最终会出现在模型中是一个“随机过程”。就像谷歌在对PaLM 2做的那样,更加严格地控制每种语言能达到的内容阈值,将可能提高非英语回答的质量。现在,除了研究,冯雁几乎不会把ChatGPT当作他用。和ChatGPT的对话常常让她觉得无聊——因为底层技术设计,AI聊天机器人说出的话只能是“互联网上的平均水平”,而这在英语问答中体现得也更明显。本文编译自WIRED,原文链接:https://www.wired.com/story/chatgpt-non-english-languages-ai-revolution/
2023年08月30日大模型晚报|ChatGPT疯狂变现,OpenAI 营收将突破 10 亿美元远远超过收入预期。阅读全文 ↗:大模型晚报|ChatGPT疯狂变现,OpenAI 营收将突破 10 亿美元
2023年08月29日大模型晚报|最重磅AI论坛来了!马斯克、黄仁勋、奥特曼等大咖9月13日齐聚国会山重点讨论人工智能的影响。阅读全文 ↗:大模型晚报|最重磅AI论坛来了!马斯克、黄仁勋、奥特曼等大咖9月13日齐聚国会山
2023年08月29日ChatGPT企业版炸裂上线!无限制访问、两倍速、3.2万token……OpenAI开始“抢钱”了OpenAI已然吹响了向企业级市场全面进攻的号角。阅读全文 ↗:ChatGPT企业版炸裂上线!无限制访问、两倍速、3.2万token……OpenAI开始“抢钱”了