人工智能训练数据已耗尽马斯克赞同其他人工智能专家的观点,认为目前可用于训练人工智能模型的真实世界数据已所剩无几。他指出:“我们现在基本上已经耗尽了人类知识的总和,用于人工智能训练。这基本上发生在去年。”作为人工智能初创公司xAI的创始人,马斯克的这番言论,呼应了前OpenAI首席科学家伊利亚·苏茨克弗在去年12月的NeurIPS机器学习大会上的观点。苏茨克弗当时表示,人工智能行业已经达到了他所说的“数据巅峰”,并预测训练数据的缺乏将迫使行业改变目前模型开发的方式。马斯克认为,合成数据--由人工智能模型自身生成的数据--是未来的发展方向。“补充真实世界数据的唯一方法是合成数据,人工智能会创造训练数据,”他说。“通过合成数据,人工智能将进行自我评估,并经历自我学习的过程。”包括微软、Meta、OpenAI和Anthropic在内的其他公司已经在使用合成数据来训练其旗舰人工智能模型。据市场调研公司Gartner估计,到2024年,用于人工智能和分析项目的数据中有60%将是合成生成的。使用合成数据进行训练还有其他优势,比如节省成本。人工智能初创公司Writer声称,其几乎完全使用合成数据源开发的Palmyra X 004模型,开发成本仅为70万美元,相比之下,一个类似规模的OpenAI模型的估计开发成本为460万美元。然而,合成数据也有其缺点。一些研究表明,合成数据可能导致模型崩溃,即模型变得不那么“有创造力”--并且更加有偏见--在其输出中,最终严重损害其功能。因为模型创造合成数据,如果用于训练这些模型的数据存在偏见和局限性,其输出也将受到类似的影响。