内容安全作为平台生态发展的基础防线,对于生成式大模型而言,要做好内容风控,确保内容安全,面临的挑战是前所未有的。 其一,输入/输出要求高:需要明确区分可以提问和不可以提问的内容。针对一些必须正确回答的问题,首先要正确识别用户输入的情感语义,同时保证必须输出内容的正确性。其二,违规类型不可预测:AIGC 生成的数据内容有高度的不可预测性,违规类型也可能是全新的。目前也出现了某些用户恶意利用大模型多轮对话、结合上下文语义进行作恶,因此需要结合具体场景制定对应的审核策略。其三,审核时效性要求高:大模型的应用场景与传统的社交场景有区别,大模型通常是采用流式的输出,受限于 AI 输出速率,审核时效要求在毫秒级别。其四,模型价值观构建难:有部分大模型公司直接使用开源基座模型,或者是经过了微调,但是由于训练数据未清洗的原因,模型的价值观可能与主流价值观不一致。