飞雪无情

接近Chat-GPT 3.5!OpenBuddy 330亿参数模型正式启动内测

在本周早些时候,我们发布了全球首个基于 Falcon、可商用的中文跨语言模型 OpenBuddy-Falcon-7B,模型除了具备跨语言能力外,还具备一定程度的理解能力和认知能力。模型一经发布,便受到了来自业界的热烈欢迎和赞誉,对此我们感到非常欣喜和自豪。

今天,我们非常高兴地宣布:我们正在训练中的 30B(330亿参数)的大模型:OpenBuddy-LLaMA-30B已经到了一个可以公开展示的阶段,正式开始面向各位爱好者进行内测。

330亿参数模型:显著增强的理解能力和顿悟能力

相比之前发布的 7B 模型,30B 模型拥有显著增强的理解能力和顿悟能力,能够更加深入地思考、理解用户需求,具备更强的可塑性和潜力。

无需专门训练,30B模型能够高质量地完成各类1-shot甚至zero-shot的任务。在多数情况下,用户仅需在聊天中举一个例子或写一个简短的操作说明,模型就能根据用户的意图,完成复杂的任务。

例如:用户要求用JSON写一首诗,模型能在写诗的同时,保持正确的JSON的结构,两个任务不会相互干扰。

Image

在数据分析领域,复杂SQL语句的编写涉及到高难度的逻辑过程,30B模型能够正确理解用户的需求,并写出对应的语句:

Image

同时,我们惊喜地发现,相比之前的模型,30B模型的跨语言能力得到进一步增强,能够理解中文意思相近的英文单词间的细微差异,并做出辨析。

Image

此外,30B模型还涌现出了更强的顿悟能力,模型能理解某个概念的本质,并运用比喻的方式,向不同知识背景的用户提供定制化的诠释,而非死记硬背训练集中的数据。

Image

在模型训练期间,我们召集了一批不同文化背景的志愿者,通过双盲测试 + 对回复进行评价的方式,为我们的 30B 模型进行了比较性测试。

初步双盲测试结果显示,OpenBuddy-LLaMA-30B 模型在多种场景的对话中,质量与 ChatGPT-3.5 接近,甚至在某些中文场景中,取得了优于 ChatGPT-3.5的成绩。

题外话:关于近期Falcon和LLaMA模型之间的争议

最近几天,Falcon和LLaMA模型的跑分指标,引起了不同利益相关方之间的论战。

作为同时训练过Falcon、LLaMA两种模型的开源、非盈利团队,我们目前可以说的是:Falcon模型和LLaMA模型都是非常强大的模型基座。Falcon模型由于训练集更加多样化等原因,在幽默感、批判性思考等指标上或许具备更强的潜力;相应地,LLaMA模型训练时吸收了大量的学术论文数据,在学术、答题等场景上也有一定的优势。

因此,我们不能基于几行测试代码输出的做题分数,来武断地评价模型的优劣性。我们相信,未来开源社区将会出现更加公允、中立、利益无关、由人类的体验为主导的量化评测指标,为开源模型的不断演进提供指引。


加入开源社区,即刻参与内测!

现在,我们认为我们的 30B 模型已经进入了可以面向社区成员内测的阶段。如果您还没有加入我们的开源社区,请关注我们的公众号“开源智友”,并回复“加群”,即可获得邀请,进入社区群。

在群里,您将能够与其他志愿者一起参与内测,并为我们的模型提供宝贵的反馈意见。

如果您已经加入了我们的开源社区微信群,请阅读群公告,获得进一步操作的指引。

我们非常期待来自各界人士的反馈意见,你们的意见对仍处于测试阶段的30B模型的进一步完善非常重要。我们相信,未来,正式版OpenBuddy-LLaMA-30B模型将会为中文跨语言模型领域带来新的突破。

同时,欢迎点击“阅读原文”链接,Star我们的GitHub仓库,下载我们现已公开的7B、13B模型权重和相关代码。

(本文由OpenBuddy模型协助撰写)