科普大模型能干什么,以及专业术语
文中参考文档点击阅读原文打开, 同时推荐2个学习环境:
1、懒人Docker镜像, 已打包200+插件:《最好的PostgreSQL学习镜像》
2、有web浏览器就能用的云起实验室: 《免费体验PolarDB开源数据库》
3、PolarDB开源数据库内核、最佳实践等学习图谱: https://www.aliyun.com/database/openpolardb/activity
走向方生方死! 大模型现在的等级划分有意义吗?
背景
系列文章:
《AI大模型+全文检索+tf-idf+向量数据库+我的文章 系列之6 - 科普 : 大模型到底能干什么? 模型已经出现等级划分了? 专业术语?》 《AI大模型+全文检索+tf-idf+向量数据库+我的文章 系列之5 - 在 Apple Silicon Mac 上微调(fine-tuning)大型语言模型(LLM) 并发布GGUF 》 《AI大模型+全文检索+tf-idf+向量数据库+我的文章 系列之4 - RAG 自动提示微调(prompt tuning)》 《AI大模型+全文检索+tf-idf+向量数据库+我的文章 系列之3 - 微调后, 我的数字人变聪明了 》 《AI大模型+全文检索+tf-idf+向量数据库+我的文章 系列之2 - 我的数字人: 4000余篇github blog文章投喂大模型中》 《AI大模型+全文检索+tf-idf+向量数据库+我的文章 系列之1 - 低配macbook成功跑AI大模型 LLama3:8b, 感谢ollama》
科普 : 大模型到底能干什么? 模型已经出现等级划分了? 专业术语?
1 大模型到底能干什么
https://www.promptingguide.ai/applications
https://docs.mistral.ai/getting-started/models/
1、Mistral Small
简单的任务:分类、客户支持、翻译或文本生成。
例如
判断垃圾邮件 简单的智能客服系统, 例如智能电话客服、政府办事客服等 简单的聊天文本生成
2、Mistral 8x22B
中等任务,需要中等推理能力:数据提取、文档摘要、撰写电子邮件、撰写职位描述或撰写产品描述。
3、Mistral Large
复杂任务,需要强大的推理能力或高度专业化:合成文本生成、代码生成(包括填空和代码补全)、检索式问答(RAG)或代理、数学推理和科学发现任务。
4、其他:
将文本转换成 1024 维嵌入向量。向量相似检索和检索增强生成式应用(RAG)都依赖 文本to向量的转换模型。
能力对比(等级划分)
Mistral Large > Mistral 8x22B > Mistral Small > Mixtral 8x7B > Mistral 7B
要获得越强的能力, 就需要更大的算力和内存. ollama 上的Mistral 7B大概需要4G内存. 原来我一直在玩的是最低端的大模型, 不过已经很厉害了. 当然并不是说小模型就不能做复杂任务, 只是效果可能没那么好.
$ ollama list
NAME ID SIZE MODIFIED
phi3:14b 1e67dff39209 7.9 GB 6 seconds ago
llama3.1:8b 62757c860e01 4.7 GB 13 seconds ago
gemma2:9b ff02c3702f32 5.4 GB 7 hours ago
mistral:latest f974a74358d6 4.1 GB 7 hours ago
mistral是一个开源+商业的大模型, 手册写得还不错, 作为LLM入门学习是的不错选择.
mistral 模型用法参考:
https://docs.mistral.ai/getting-started/stories/
2 专业术语
https://docs.mistral.ai/getting-started/glossary/
1、LLM 大型语言模型
大型语言模型 (LLM),例如 Mistral AI 模型,是在海量文本数据上训练的 AI 模型,旨在预测句子中的下一个词。它们能够理解和生成文本的方式类似于人类沟通,可以回答问题、起草文件、总结文本、提取信息、翻译语言、编写代码等等。
2、Text generation 文本生成
大型语言模型中的文本生成是指根据给定的输入提示生成连贯且上下文相关的文本。这些模型,例如 Mistral AI,在海量文本数据上训练,通过提供前文作为上下文来预测句子中的下一个词。这种能力使它们能够生成类似人类沟通的文本,可用于各种应用,包括回答问题、起草文件、总结文本、翻译语言和编码。
3、Tokens 文本令牌
令牌(Tokens)是语言模型处理的最小单位,通常代表单词或子词等常见字符序列。为了使语言模型理解文本,必须将其转换为数值表示。这可以通过将文本编码成一系列令牌来实现,每个令牌都被分配一个唯一的数字索引。将文本转换为令牌的过程称为标记化或分词(tokenization)。
一种广泛使用的分词算法是字节对编码(BPE),它最初将文本中的每个字节视为单独的令牌。然后,BPE 迭代地向词汇表中添加最常见令牌对的新令牌,用新的令牌替换对的出现,直到不再进行替换为止。这对于语言模型处理文本产生了紧凑且有效的表示。
4、Mixture of Experts (MoE) 专家混合
专家混合(MoE)是 Mixtral 8x7b 和 Mixtral 8x22b 的基础架构。它是一种神经网络架构,在 Transformer 块中包含专家层,允许模型以更低的计算量进行预训练,同时保持与密集模型相同的质量。
通过用稀疏的 MoE 层替换密集的前馈网络 (FFN) 层来实现这一点,MoE 层包含多个“专家”(FFN)。一个门控网络或路由器决定将哪些输入tokens发送到哪个专家进行计算。
MoE 提供了高效的预训练和更快的推理等优势,但也带来了挑战,例如在微调期间过拟合以及高内存需求。然而,MoE 通过动态地将输入标记分配给专门的专家进行处理,是一种实现降低计算成本的同时提高模型质量的有价值方法。
MoE训练耗费更多资源但是得到的模型在同等质量下更省资源.
5、RAG 检索增强生成
检索增强生成(RAG)是一种 AI 框架,将大型语言模型 (LLM) 和信息检索系统的能力结合起来。RAG 的主要步骤有:
检索:从向量知识库中检索与问题相关的信息; select text as 相关信息 from t_knowledge order by text_s_vector(文本对应的向量) <=> '问题对应的向量' limit x;生成:将相关信息插入到提示中,以便 LLM 结合相关信息和问题输出结果。
RAG 有用于回答问题或生成利用外部知识(包括最新信息和特定领域的信息)的内容。RAG 使模型能够访问并利用其训练数据之外的信息,从而减少幻觉并提高大模型回复的准确性。
6、Fine-tuning 微调
微调是大型语言模型中的一种过程,用于预训练模型适应特定任务或领域。它涉及在较小的、特定于任务的数据集上继续训练的过程,并调整模型的参数以优化其在新数据集上的性能/质量。这使模型通过强化学习在特定任务场景的相关素材,提高目标任务上的性能/质量。
微调与从头开始训练模型相比,微调可以在更少的数据和计算资源下实现最先进的性能/质量。
7、Function calling 函数调用
函数调用允许 Mistral 模型连接到外部工具并调用外部函数或 API,以执行超出模型自身能力的任务。这使模型能够访问和利用外部工具和资源来提高其性能并提供更准确的响应。函数调用可用于诸如检索实时数据、执行计算、访问数据库以及与其他系统或服务交互等任务。它提高了模型的准确性、效率和通用性。查看我们的 Function Calling 指南以了解更多信息。
8、Embeddings 嵌入/向量
嵌入/向量是文本的矢量表示,通过它们在高维向量空间中的位置捕获段落的语义含义。这些向量捕捉文本的语义含义和上下文,使模型能够更有效地理解和生成语言。Mistral AI Embedding API 提供了用于文本的前沿、最先进的嵌入,可用于许多 NLP 任务。查看我们的 Embedding 指南以了解更多信息。
参考
https://www.promptingguide.ai/applications
https://docs.mistral.ai/getting-started/models/
https://docs.mistral.ai/getting-started/glossary/
本期彩蛋-配图为cuug陈老师,恭喜 CUUG获得PostgreSQL数据库认证与培训合作伙伴
文章中的参考文档请点击阅读原文获得.
欢迎关注我的github (https://github.com/digoal/blog) , 学习数据库不迷路.
近期正在写公开课材料, 未来将通过视频号推出, 欢迎关注视频号: