数据STUDIO

号称史上最强、击败 LLaMA 的大模型 Falcon (猎鹰) 开源了?

Image

Image2023 年 5 月 25 日,TII(阿联酋阿布扎比技术创新研究所)宣布阿联酋首个大型人工智能模型“猎鹰 40B”开源,供研究和商业使用。Falcon(猎鹰) 是一种具有 400 亿个参数的基础大型语言模型 (LLM),在 1 万亿个令牌上进行了训练。虽然 Falcon 的参数比 LLaMA 小,但性能却更加强大。

Image

高级技术研究委员会 (ATRC) 秘书长 HEFaisal Al Bannai 表示:“将 Falcon 40B 开源是我们致力于促进 AI 创新的一个重要里程碑。” “我们正在中断 LLM 访问,并使研究人员和企业家能够提出最具创新性的用例。我们将通过 VentureOne 以计算能力作为资金进一步支持这些提交,帮助推进繁荣的研究生态系统。”

Falcon 于 2023 年 3 月首次亮相,展示了卓越的性能并强调了阿联酋对技术进步的承诺。基于斯坦福大学的 HELM LLM 基准测试工具,Falcon 40B 在使用显着更少的训练计算能力方面优于其著名的同类产品。该工具仅占 OpenAI 的 GPT-3 训练计算的 75%、DeepMind 的 Chinchilla AI 的 40% 以及谷歌 PaLM-62B 训练计算的 80%。

TII 首席执行官 Ray O. Johnson 博士表示:“计算能力在加快 AI 系统训练和实现用例更快实施方面发挥着关键作用。作为推动技术创新的新燃料,提供此类支持的举措将是改变游戏规则,增强创新者的能力,并使他们能够突破项目的界限,取得显着进步。”

Falcon 40B 是由 TII 的人工智能和数字科学研究中心 (AIDRC) 领导的一项突破。同一团队还在去年推出了世界上最大的阿拉伯语 NLP 模型 NOOR,并有望很快开发和发布 Falcon 180B。

Image
Image

据介绍,Falcon-40B 是 400 亿参数的因果解码器模型,它在 RefinedWeb 的 1000B token 上进行训练,并使用精选数据集增强。它在 Huggingface 的 OpenLLM 排行榜上排首位,其性能优于 LLaMA、MPT、RedPajama 和 StableLM 等。

Image

如何使用模型

from transformers import AutoTokenizer, AutoModelForCausalLM
import transformers
import torch

model = "tiiuae/falcon-40b"

tokenizer = AutoTokenizer.from_pretrained(model)
pipeline = transformers.pipeline(
    "text-generation",
    model=model,
    tokenizer=tokenizer,
    torch_dtype=torch.bfloat16,
    trust_remote_code=True,
    device_map="auto",
)
sequences = pipeline(
   "Girafatron is obsessed with giraffes, the most glorious animal on the face of this Earth. Giraftron believes all other animals are irrelevant when compared to the glorious majesty of the giraffe.\nDaniel: Hello, Girafatron!\nGirafatron:",
    max_length=200,
    do_sample=True,
    top_k=10,
    num_return_sequences=1,
    eos_token_id=tokenizer.eos_token_id,
)
for seq in sequences:
    print(f"Result: {seq['generated_text']}")

训练数据

Falcon-40B在RefinedWeb[1]的1,000B tokens上进行了训练,这是一个高质量的过滤和重复的网络数据集,我们用策划的语料进行了强化。我们策划的语料库中的重要组成部分受到了The Pile(Gao et al., 2020[2])的启发。

Data sourceFractionTokensSources
RefinedWeb-English75%750Bmassive web crawl
RefinedWeb-Europe7%70BEuropean massive zeb crawl
图书6%60B
对话5%50BReddit, StackOverflow, HackerNews
Code5%50B
技术2%20BarXiv, PubMed, UPSTO, etc.

RefinedWeb-Europe 由以下语言组成:

LanguageFraction of multilingual dataTokens
German26%18B
Spanish24%17B
French23%16B
Italian7%5B
Portuguese4%3B
Polish4%3B
Dutch4%3B
Romanian3%2B
Czech3%2B
Swedish2%1B

使用 Falcon- 7B[3] / 40B[4]分词器对数据进行分词。

训练程序

Falcon-40B 在 384 个 A100 40GB GPU 上进行训练,使用 3D 并行策略(TP=8,PP=4,DP=12)结合 ZeRO。

训练超参数

Hyperparameter Value Comment
Precision bfloat16 
Optimizer AdamW 
Learning rate 1.85e-4 4B tokens warm-up, cosine decay to 1.85e-5
Weight decay 1e-1 
Z-loss 1e-4 
Batch size 1152 100B tokens ramp-up

速度、尺寸、时间

训练于2022年12月开始,历时两个月。

Falcon 作为开源大模型,已公开源代码和模型权重,可供研究和商业使用 —— 但其采用的许可证却引起了广泛争议。

  • **开发者:https://www.tii.ae;
  • 模型类型: Causal decoder-only;
  • 语言 (NLP):英语、德语、西班牙语、法语(意大利语、葡萄牙语、波兰语、荷兰语、罗马尼亚语、捷克语、瑞典语的能力有限);
  • License:TII Falcon LLM License[5].

Falcon 采用了自拟的 TII Falcon LLM License —— 在 Apache License 的基础上进行了一系列修改。Apache License 是非常流行的开源许可证,对商业使用友好。使用者修改代码只需满足相关需求即可将新作品作为开源或商业产品发布 / 销售。

Image

TII Falcon LLM License 和 Apache License 的相似之处是,授予使用、修改和分发许可作品的广泛许可,要求在分发中包含许可文本和归属,并具有责任限制、担保豁免权。

不过 TII Falcon LLM License 要求它的用例需支付商业用途特许权使用费 —— 收入超过 100 万美元的任何商业应用都要收 10% 的授权费。

Image

此外,TII Falcon LLM License 对如何发布或分发作品也有额外限制, 比如要求归属于「Falcon LLM technology from the Technology Innovation Institute」。

对于 TII 的做法,有人认为,Falcon 的许可证基于 Apache License 进行了魔改,不属于真正的开源。也有人表示,TII 打着 Apache 的旗号将 Falcon 包装成开源,但却有诸多限制,这种做法损害了 Apache 软件基金会来之不易的信誉和品牌。

Image

事实上,Falcon 的做法和 Unreal 虚幻引擎类似。虚幻引擎的 License 分为两种:发行许可和创作许可,创作许可不能用于游戏制作。至于发行许可,如果基于虚幻引擎开发的游戏总收益高于 100 万美元,则将会被收取游戏总收益的 5%,低于 100 万美元都是免费使用。

问题来了,你认可 Falcon 的做法吗?

参考资料

[1]

RefinedWeb: https://huggingface.co/datasets/tiiuae/falcon-refinedweb

[2]

Gao et al., 2020: https://arxiv.org/abs/2101.00027

[3]

使用 Falcon- 7B: https://huggingface.co/tiiuae/falcon-7b

[4]

40B: https://huggingface.co/tiiuae/falcon-40b

[5]

TII Falcon LLM License: https://huggingface.co/tiiuae/falcon-40b/blob/main/LICENSE.txt

🏴‍☠️宝藏级🏴‍☠️ 原创公众号『数据STUDIO』内容超级硬核。公众号以Python为核心语言,垂直于数据科学领域,包括可戳👉Python|MySQL|数据分析|数据可视化|机器学习与数据挖掘|爬虫 等,从入门到进阶!

长按👇关注- 数据STUDIO -设为星标,干货速递ImageImage