说个暴论\n \n \n \n\n这个暴论需要叠加很多 buff,但我还是想说:建议个人和小团队不要碰大模型训练!\n\n1 、哪些人是例外?\n\n如果你为了发论文尽快毕业,那该练还是得练,还要变着花样练。\n\n如果你是全栈的超级个体,能解决数据、模型、推理和资金等全链路,那么请勇敢冲。\n\n本文基本只讨论 LLM 和 VLM。除此之外,我想象不到个人和小团队还有什么理由去训练大模型。\n\n 2 、不训练大模型怎么办?\n\n企业私有数据,不能调用外部 API,不训练怎么办?\n\n做好开源 LLM+RAG 的部署。在没有触及 RAG 的性能边界之前,不要微调模型。\n\n常见方案是对一些图片 or PDF 文件做好 OCR,转为 Markdown,在每次问答前,将需要的上下文塞给 LLM,拿到的结果就不会太有问题。\n\nRAG 自带在线持续学习的特性,非常适合业务场景。\n\n开源LLM对一些特定领域的效果非常差,怎么办?\n\n还是得先试试 RAG,不行就试试 In-context Learning,在上下文中,教 LLM一些领域知识。\n\n128K 的上下文长度非常关键! 这个可以降低你 RAG 的门槛,以及提高 LLM 对领域知识的掌握。\n\n我真的很难想象,现在还有什么特殊的领域,LLM 一点办法都没有。\n\n有推荐的方案么?\n\n如果你能调用外部 API,那么就根据业务要求,选择性价比最高的一款。\n\n能不自己部署模型,就不自己部署。硬件成本和维护成本,对于小团队来说可能是压垮骆驼的一座大山。\n\n选择调用 API 的时候,你会发现,全世界最聪明的人和最听话的 AI,都在抢着为你服务。你完全不用管有几台服务器,你可以在任意时间,随便拉高并发量。随心切换更强的模型,或者更便宜的模型。\n\n这里给腾讯云混元大模型做个推荐,它的性价比和能力就很不错。\n\n大厂基座模型团队之外的 AI 人,需要先了解现有 LLM 的性能边界,敏锐地分辨出现有模型能力和过去方案的差异,能否给当前的业务带来新的变化,然后快速解决现有业务的难题。\n\n不要在低收益的赛道上无意义地投入,错位竞争,降维打击,也许更有效。\n\n本文授权自知乎答主强化学徒,原文见:https://zhuanlan.zhihu.com/p/5851457581
说个暴论
这个暴论需要叠加很多 buff,但我还是想说:建议个人和小团队不要碰大模型训练!
1 、哪些人是例外?
如果你为了发论文尽快毕业,那该练还是得练,还要变着花样练。
如果你是全栈的超级个体,能解决数据、模型、推理和资金等全链路,那么请勇敢冲。
本文基本只讨论 LLM 和 VLM。除此之外,我想象不到个人和小团队还有什么理由去训练大模型。
2 、不训练大模型怎么办?
企业私有数据,不能调用外部 API,不训练怎么办?
做好开源 LLM+RAG 的部署。在没有触及 RAG 的性能边界之前,不要微调模型。
常见方案是对一些图片 or PDF 文件做好 OCR,转为 Markdown,在每次问答前,将需要的上下文塞给 LLM,拿到的结果就不会太有问题。
RAG 自带在线持续学习的特性,非常适合业务场景。
开源LLM对一些特定领域的效果非常差,怎么办?
还是得先试试 RAG,不行就试试 In-context Learning,在上下文中,教 LLM一些领域知识。
128K 的上下文长度非常关键! 这个可以降低你 RAG 的门槛,以及提高 LLM 对领域知识的掌握。
我真的很难想象,现在还有什么特殊的领域,LLM 一点办法都没有。
有推荐的方案么?
如果你能调用外部 API,那么就根据业务要求,选择性价比最高的一款。
能不自己部署模型,就不自己部署。硬件成本和维护成本,对于小团队来说可能是压垮骆驼的一座大山。
选择调用 API 的时候,你会发现,全世界最聪明的人和最听话的 AI,都在抢着为你服务。你完全不用管有几台服务器,你可以在任意时间,随便拉高并发量。随心切换更强的模型,或者更便宜的模型。
这里给腾讯云混元大模型做个推荐,它的性价比和能力就很不错。
大厂基座模型团队之外的 AI 人,需要先了解现有 LLM 的性能边界,敏锐地分辨出现有模型能力和过去方案的差异,能否给当前的业务带来新的变化,然后快速解决现有业务的难题。
不要在低收益的赛道上无意义地投入,错位竞争,降维打击,也许更有效。
本文授权自知乎答主强化学徒,原文见:https://zhuanlan.zhihu.com/p/5851457581
言简意赅聊技术 , 1