AI 资讯:Claude 2、Bard 和 xAI
Claude 2
Claude 2[1] 已经可用(注:目前只对美国和英国地区开放,大家想要访问,还是需要绕个道)。Claude 2 的性能更强,提供更长的回应,可通过 API 和新的公开测试网站 claude.ai[2] 进行访问。
Claude 2 在编程、数学和推理等方面相比前代模型有了显著的提升。它在律师资格考试的多选部分得分为 76.5%,在 GRE 阅读和写作考试中的得分位于 90 分位数以上,且在定量推理方面表现与中位申请者相似。Claude 2 在安全性上也有所改进,更无害,更难以引发冒犯或危险的输出。API 对企业的提供价格与 Claude 1.3 相同。
你可以把 Claude 看作是一个友好、热情的同事或个人助手,它可以用自然语言指导你完成许多任务。在努力提高模型性能和安全性的同时,增加了输入和输出长度。用户可以在每个提示中输入多达 100K 个 token,这意味着 Claude 可以处理数百页的技术文档,甚至是一本书。Claude 现在也可以写更长的文件,从备忘录到信件到故事,一次性可以写出几千个 token。
Bard
Bard’s latest update: more features, languages and countries[3]
Bard[4] 作为一款人工智能工具,旨在帮助用户探索好奇心,增强想象力,并最终让你的想法得以实现。如今,Bard 已经推出了最大的扩展更新,包括在世界上大多数地区和最广泛使用的语言中提供服务,并推出新的特性,以帮助用户更好地定制体验,提高创造力并完成更多的工作。以下是一些主要的更新内容:
更多地区和语言的支持
你现在可以在 40 多种语言中,包括阿拉伯语、中文、德语、印地语和西班牙语等与 Bard 进行交互。同时,Bard 的服务也扩展到了更多地区,包括巴西和整个欧洲。
获取更定制的回复
最新 Bard 回复更能满足你的需求:
听见回复:有时候,大声听一遍有助于你从不同的角度看待你的想法。从现在起,你可以听取 Bard 的回复。例如,你想听取一个词的正确发音,或者是听一首诗或者一个剧本,只需输入一个提示,然后选择声音图标,就可以听到 Bard 的答复。
调整 Bard 的回复:你现在可以改变 Bard 回复的语调和风格,有五个选项可以选择:简单、长篇、短篇、专业或是随便。例如,你可以让 Bard 帮助你编写一篇关于复古扶手椅的市场清单,然后通过下拉菜单来缩短回复。
提高生产力
新上线四个新特性,帮助你完成更多的工作:
固定并重命名对话:你可以固定并重命名与 Bard 的对话,以方便以后查看。例如,如果你请 Bard 帮你比较夏季户外运动,你可以稍后再看一下这些提示。
导出代码到其他地方:现在除了Google Colab,你还可以将 Python 代码导出到 Replit。
与朋友分享回复:简化网络分享 Bard 聊天记录(部分或全部)的过程。通过可分享的链接,你可以与其他人分享你的想法和创造。
在提示中使用图片:之前在 I/O 大会上宣布将 Google Lens 的功能引入到 Bard 中。无论你想获取关于一张图片的更多信息,还是需要帮助编写一个标题,你现在都可以上传带有提示的图片,Bard 会分析这张照片来提供帮助。
无论你是有个初步的想法,一个完全成形的概念,还是只是需要头脑风暴,都可以试试 Bard。
xAI
Elon Musk 新成立的人工智能公司 xAI 已经在 x.ai[5] 发布,详细介绍了其使命和团队。公司的目标是“理解宇宙的真实本质”。除了 Musk 外,该团队还包括曾在 DeepMind[6]、OpenAI[7]、Google Research[8]、Microsoft Research[9]、Tesla[10] 和 University of Toronto[11] 工作的团队成员。该团队目前由领导 AI 安全中心的研究员 Dan Hendrycks[12] 担任顾问。
据称,尽管 xAI 与 Musk 的 X Corp 是分开的,但它将与 X(Twitter),Tesla 和其他公司紧密合作(有报道称 Musk 寻求从 SpaceX 和 Tesla 获得资金以启动它)。我们首次听说 xAI 是在今年 4 月份,当时文件显示 Musk 在内华达州成立了这家公司。Musk 在 2015 年曾是 OpenAI 的联合创始人。然而,他在 2018 年离开了这个组织,以避免与 Tesla 发生利益冲突,因为 Tesla 也在该领域进行了大量工作。此后,他公开批评了 OpenAI,并告诉 Tucker Carlson 他正在研发一个叫做 “TruthGPT” 的项目(Elon Musk 宣布 TruthGPT,一种寻求真相的人工智能!)。
📌 团队成员他们为这个领域贡献了一些最广泛使用的方法,如 Adam 优化器,Batch Normalization,Layer Normalization 以及对抗性示例的发现。他们还引入了如 Transformer-XL,Autoformalization,Memorizing Transformer,Batch Size Scaling 和 μTransfer 等创新技术和分析。他们曾参与并领导了该领域的一些重大突破,如 AlphaStar[13]、AlphaCode[14]、Inception[15]、Minerva[16]、GPT-3.5[17] 和 GPT-4[18]。
相关论文
Adam: A Method for Stochastic Optimization[19]
介绍了一种名为 Adam 的一阶梯度优化算法,用于随机目标函数。这种方法实现简单、计算效率高、内存需求小、对梯度的对角线重标定不变,非常适合处理数据量和参数量较大的问题。此外,Adam 还适用于非平稳目标和噪声大或稀疏梯度的问题。其超参数具有直观的解释,通常无需大量调整。论文还讨论了与 Adam 相关的其他算法,并对该算法的理论收敛性进行了分析,提供了与在线凸优化框架下最佳已知结果相媲美的收敛速度的遗憾界限(regret bound)。实证结果显示,Adam 在实践中表现良好,与其他随机优化方法相比具有优势。
📌 遗憾界限在机器学习和强化学习的环境中,遗憾(regret)是一个用来衡量学习算法性能的关键指标。在一个在线学习或者决策制定问题中,遗憾界限(regret bound)定义为学习算法选择的动作序列与最优动作序列之间的累计奖励差距的上界。
举例来说,假设我们正在考虑一个多臂老虎机问题,在这个问题中,一个算法需要在每个时间步选择一个老虎机(动作)来拉动。每个老虎机都有一个未知的奖励分布。算法的目标是最大化其总奖励。在这个上下文中,"遗憾"被定义为最优策略(总是拉动期望奖励最大的老虎机)所能获得的总奖励与算法实际获得的总奖励之间的差值。如果我们能证明某个算法的遗憾界限为一个随时间步数增长的函数(例如,对数函数或者平方根函数),那么就可以说这个算法在足够长的时间里可以达到最优性能。
遗憾界限的一个重要作用是,它为比较不同算法提供了一种公平的标准。一个算法的遗憾界限越小,就说明这个算法在平均情况下越能接近最优性能。因此,遗憾界限是机器学习研究者在设计和分析新算法时非常关心的一个量。
Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift[20]
提出了一种名为 Batch Normalization 的方法,用于减少内部协变量偏移,加速深度神经网络的训练。该方法通过将标准化作为模型架构的一部分,对每个训练小批次进行标准化,解决了因为每层输入分布的变化而导致的训练困难问题。Batch Normalization 可以使用更高的学习率,减轻参数初始化的要求,有时甚至可以消除 Dropout 的需要。在最先进的图像分类模型上应用,Batch Normalization 可以在更少的训练步骤内达到相同的精度,甚至超过原始模型的性能。
Layer Normalization[21]
介绍了一种名为 Layer Normalization 的方法,通过标准化神经元的活动来减少深度神经网络的训练时间。与批标准化不同的是,Layer Normalization 在训练和测试时执行完全相同的计算,并且可以很直接地应用到循环神经网络中。实证结果显示,Layer Normalization 在稳定循环网络中的隐藏状态动态方面非常有效,与先前公布的技术相比,可以大大减少训练时间。
Intriguing properties of neural networks[22]
研究了深度神经网络的两个引人入胜的属性。首先,作者发现高级单元与高级单元的随机线性组合之间没有区别,这意味着神经网络的高层中的语义信息更多地包含在空间中,而不是个别单元中。其次,作者发现深度神经网络学习的输入输出映射在很大程度上都是相当不连续的。通过应用一种特定的、几乎无法察觉的扰动,可以使网络误分类一个图像。此外,这种扰动的特性并非学习的随机产物:相同的扰动可能会导致另一个网络(该网络在不同的数据集子集上训练)误分类同一个输入。
Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context[23]
提出了一种新的神经网络结构 Transformer-XL,使其能够学习超过固定长度的依赖性,而不会破坏时间连贯性。其方法不仅能够抓取更长期的依赖性,而且解决了上下文碎片化问题。在许多数据集上,Transformer-XL 均获得了最佳表现。
Autoformalization with Large Language Models[24]
提出大型语言模型有望实现自动形式化,即将自然语言数学自动转化为正式规范和证明。研究者发现大型语言模型能够正确地将一大部分(25.3%)数学竞赛问题完美地翻译为 Isabelle/HOL 的形式规范,并以此方法改进了先前的神经定理证明器。
Memorizing Transformers[25]
将语言模型与记忆功能相结合,使其能够在推断时读取和记忆新数据,即立即获取新知识。该工作在多个基准测试和任务中,证明了通过对过去输入的内部表示进行记忆,可以提高语言模型的性能。
Which Algorithmic Choices Matter at Which Batch Sizes? Insights From a Noisy Quadratic Model[26]
通过大规模实验和噪声二次模型(NQM)的分析,研究了批量大小与优化算法属性(包括加速和预处理)的关系。发现使用预处理的优化算法,如 Adam 和 K-FAC,可以得到比带有动量的随机梯度下降更大的批量大小。
Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer[27]
提出了一种新的超参数(HP)调整范例 muTransfer。muTransfer 的思想是在最大更新参数化(muP)中对目标模型进行参数化,然后在较小的模型上间接调整 HP,并将其零样本转移到全尺寸模型,即不直接调整后者。在 Transformer 和 ResNet 等模型上验证了 muTransfer 的效果。
References
Claude 2: https://www.anthropic.com/index/claude-2
[2]claude.ai: https://claude.ai
[3]Bard’s latest update: more features, languages and countries: https://blog.google/products/bard/google-bard-new-features-update-july-2023
[4]Bard: https://bard.google.com
[5]x.ai: https://x.ai
[6]DeepMind: https://deepmind.com
[7]OpenAI: https://openai.com
[8]Google Research: https://research.google
[9]Microsoft Research: https://www.microsoft.com/en-us/research
[10]Tesla: https://tesla.com
[11]University of Toronto: https://www.utoronto.ca
[12]Dan Hendrycks: https://people.eecs.berkeley.edu/~hendrycks
[13]AlphaStar: https://www.nature.com/articles/s41586-019-1724-z
[14]AlphaCode: https://www.science.org/doi/10.1126/science.abq1158
[15]Inception: https://arxiv.org/pdf/1409.4842.pdf
[16]Minerva: https://ai.googleblog.com/2022/06/minerva-solving-quantitative-reasoning.html
[17]GPT-3.5: https://platform.openai.com/docs/models/gpt-3-5
[18]GPT-4: https://openai.com/research/gpt-4
[19]Adam: A Method for Stochastic Optimization: https://arxiv.org/abs/1412.6980
[20]Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift: https://arxiv.org/abs/1502.03167
[21]Layer Normalization: https://arxiv.org/abs/1607.06450
[22]Intriguing properties of neural networks: https://arxiv.org/abs/1312.6199
[23]Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context: https://arxiv.org/abs/1901.02860
[24]Autoformalization with Large Language Models: https://arxiv.org/abs/2205.12615
[25]Memorizing Transformers: https://arxiv.org/abs/2203.08913
[26]Which Algorithmic Choices Matter at Which Batch Sizes? Insights From a Noisy Quadratic Model: https://arxiv.org/abs/1907.04164
[27]Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer: https://arxiv.org/abs/2203.03466