Geek Savvy

OpenAI 指出:ChatGPT 等 AI 模型的开发无法脱离受版权保护的数据!

Image

在人工智能(AI)的快速发展中,大型语言模型如ChatGPT的诞生,无疑是技术进步的里程碑。然而,这些模型的开发过程并非一帆风顺,它们的成长离不开海量数据的滋养,其中不乏受版权保护的内容。OpenAI,作为ChatGPT的开发商,近日在英国上议院通信和数字事务特别委员会的调查中承认,如果没有这些版权内容,ChatGPT等AI模型的开发将无从谈起。

Image

ChatGPT和DALL-E等AI模型之所以能够展现出强大的能力,是因为它们通过大量的数据进行训练。这些数据中,有一部分是从互联网上公开获取的,并不总是得到了版权持有人的许可。这种“自由奔放”的数据抓取方式在学术机器学习研究中并不新鲜,但随着深度学习AI模型逐渐商业化,这种做法开始受到更严格的审查。

OpenAI在提交给上议院的文件中明确表示,如果只使用“一个世纪前”的公共领域书籍和图画进行训练,将无法训练出能够满足当代公民需求的AI系统。这意味着,为了开发出能够理解和生成现代语言的AI模型,必须使用包括博客文章、照片、论坛帖子、软件代码片段和政府文件在内的版权内容。

去年12月,《纽约时报》对OpenAI及其重要投资者微软提起诉讼,指控他们在产品中未经许可非法使用了该报的内容。对此,OpenAI在本周一的回应中坚称,该诉讼毫无根据,并重申了其对新闻业的支持以及与新闻机构的合作关系。OpenAI的辩护主要基于“合理使用”的法律原则,这一原则允许在特定情况下,未经所有者许可有限使用受版权保护的内容。

Image

OpenAI在其博客文章中强调,使用公开可获取的互联网素材训练AI模型属于合理使用,这一观点得到了长期以来广泛接受的先例的支持。公司认为,这一原则对创作者是公平的,对创新者是必要的,对美国的竞争力也至关重要。这并非OpenAI首次就其AI训练数据提出合理使用辩护。早在去年8月份,OpenAI在回应喜剧演员Sarah Silverman的版权诉讼时,就以合理使用为由捍卫了其使用公开可获取素材的做法。

然而,这种对版权内容的依赖也引发了关于AI伦理和法律边界的讨论。一方面,AI模型需要大量的数据来学习和模仿人类的语言和行为,这在很大程度上依赖于现有的文化和知识产出。另一方面,版权保护旨在鼓励创新和创作,而不受限制地使用版权内容可能会对原创作者的权益构成威胁。

Image

在这场关于版权和创新的辩论中,OpenAI和其他AI开发商面临着挑战。他们需要在尊重版权的同时,确保AI模型能够接触到足够的数据来提高其性能。这不仅涉及到法律层面的合理使用原则,也涉及到技术层面的创新和伦理层面的责任。

随着AI技术的不断进步,我们可能会看到更多关于版权和AI训练数据使用的案例。这些案例将为法律制定者、技术开发者和版权持有人提供宝贵的经验,帮助他们更好地理解如何在保护知识产权和推动技术创新之间找到平衡点。

在未来,AI开发商可能需要更加透明地披露他们的数据来源,确保在训练过程中尊重版权持有人的权益。同时,法律制定者可能需要重新审视现有的版权法律,以适应AI时代的新挑战。这可能包括制定新的指导原则,明确在AI训练中使用版权内容的界限和条件。

未来已来,将至已至!

Image