[转载]RAG和Long-Form对LLM幻觉影响的分析数据
上一篇文章《大模型商业应用天王山之战——消灭LLM幻觉》讲到了大语言模型的幻觉问题,今天就看到这篇非常短,但都是数据实证的文章,于是作为一个补充转载分享给大家。
简介
当模型产生不正确或捏造的反应时,“幻觉”已经成为一个“包罗万象”的短语。能够测量幻觉是控制幻觉的第一步。
正如下面的视频所示,看到RAG均衡器是什么是非常有趣的,以及与没有RAG相比,引入RAG时模型性能的差异如何小得多。
我喜欢这种方法的地方在于,它专注于大语言模型可能用于的不同任务,从聊天到总结等等。
这对于企业生成AI团队来说是一个实用的基准,它需要满足任务类型的可变性。例如,一个适合聊天的模型可能不适用于文本摘要。
该研究还提到了环境的力量,幻觉的基准需要考虑到环境。检索增强生成(RAG)作为在推理时为大语言模型提供上下文参考的一种途径已经得到普及。
假定在上下文质量方面存在细微差别,但是度量有RAG和无RAG任务的LLM性能的可变性是至关重要的。
带有RAG的问答
检索增强生成(RAG)是一种混合方法,结合了基于检索的信息和LLM生成知识的元素。
在像GPT-3这样的大型语言模型(大语言模型)的背景下,检索增强生成通常涉及使用两步过程:
检索:模型首先从已有的知识库或外部数据库中检索相关信息。这个检索步骤帮助模型收集与给定任务或查询相关的特定和上下文相关的信息。 生成:在检索相关信息后,模型使用该信息生成连贯且符合上下文的响应。此生成步骤允许模型基于检索到的内容生成新颖且上下文丰富的语言。
Galileo分析
OpenAI的GPT-4-0613表现最好,在使用RAG进行问答时最不可能产生幻觉。
虽然GPT-4-0613表现最好,但更快、更实惠的GPT-3.5-turbo-0613/-1106型号的表现几乎与GPT-4-0613相同。
Huggingface的Zephyr-7b是性能最好的开源模型,超过了Meta的10倍大的Llama-2-70b,证明了更大的模型并不总是更好。
我们发现TII UAE的Falcon-40b和Mosaic ML的MPT-7b在这种任务类型中表现最差。
推荐: GPT-3.5-turbo-0613
无RAG的问答
这项任务需要提出一个带有问题的模型,并依赖于大语言模型内部训练的知识,而不需要RAG或微调或任何参考外部信息源。
Galileo的分析
OpenAI的GPT-4表现最好,在没有RAG的问答中最不可能产生幻觉。
OpenAI的模型在该任务类型中排名最高,突出了它们在一般知识用例中的实力。
在开源模型中,Meta最大的模型Llama2-70b表现最好。
Meta的llama2-7b-chat模型和Mosaic的ML的MPT-7b-instruct模型表现不佳,并且最有可能在此任务类型中产生幻觉。
**推荐:GPT-4-0613 **
Long-Form文本生成
使用生成式AI来制作全面而有凝聚力的文本组合,如报告、文章、论文或叙述,需要在庞大的数据集上训练AI模型。这种训练使模型能够掌握上下文,维护主题相关性,并在扩展段落中模仿自然的写作风格。
Galileo的分析
开放AI的GPT-4-0613表现最好,在长格式文本生成中最不可能产生幻觉
Open AI的GPT-3.5-turbo-1106和GPT-3.5-turbo-0613的性能都与GPT-4相当,与GPT-4相比,具有潜在的成本节约和性能提升。
令人惊讶的是,Meta的开源Llama2-70b-chat与GPT-4相当,为这种任务类型提供了一个经济高效的解决方案。
我们发现TII UAE的Falcon-40b和Mosaic ML的MPT-7b在这种任务类型中表现最差。
推荐:lama2-70b-chat
这是一篇翻译转载的文章,原文:https://cobusgreyling.medium.com/llm-hallucination-index-3df61301b3b0
近期文章:
用弹子球机讲述LLM原理——如何用损失函数、梯度下降做训练和微调
Rerank——RAG中百尺竿头更进一步的神器,从原理到解决方案
全新ChatGLM3-6B针对七项RAG能力的评测,谁最适合RAG?