GenAI新世界

5月20日 AI 头条 | 月之暗面开始灰度测试付费方案

Image

划重点:
  • 月之暗面开始灰度测试付费方案

  • OpenAI超级对齐团队解散

  • Altman 回应OpenAI 股权问题

  • Meta 发布混合模态基座模型Chameleon,挑战 GPT-4o

  • 美国两位配音演员对AI音频公司 Lovo 提起诉讼

  • 微软或因未提供 AI 风险信息被欧盟罚款数十亿美元

  • Coze 功能更新,上线Web SDK

  • 谷歌发布 3D 生成模型 CAT3D,可快速生成 3D 内容

  • ElevenLabs 发布新功能Audio Native ,可自动生成播客

资讯详情:
月之暗面开始灰度测试付费方案
据科创板日报报道,Kimi近日开始小范围测试含不同价格和对应时长的打赏方案。
据月之暗面表示,该功能目前正在进行小范围的灰度测试,旨在为用户在服务高峰期提供更高优先权的使用权。据悉,月之暗面提供了多个不同的价格和时长供用户选择,包括5.2元/4天,9.99元/8天,28.8元/23天,49.9元/40天,99元/93天,399元/365天。
Image
OpenAI安全主管离职,超级对齐团队解散
据财联社报道,OpenAI安全主管、超级智能对齐团队负责人Jan Leike在社交平台宣布离开OpenAI。
Jan Leike透露,他与OpenAI高层在公司的核心优先事项上存在长期分歧,双方的分歧严重到无法调和的地步。团队在推动其研究项目和争取计算资源时遇到了重大阻碍,缺乏资源严重影响研究的进度和质量。OpenAl公司证实, 该公司不再将所谓的超级对齐团队作为一个独立的实体,而是将该团队更深入地整合到其研究工作中,以帮助公司实现其安全目标。
Image
Altman 回应OpenAI 股权问题
据界面新闻报道,OpenAI 前员工 Kelsey Piper 在社交媒体爆料,OpenAI 以股权为条件,制定了令员工认为不合理的离职条款。
Sam Altman 对此事回应称,“我们从未收回任何人的既得权益,如果人们不签署分离协议(或不同意不贬损协议),我们也不会这样做。既得权益就是既得权益。”Altman 补充表示,在OpenAI之前的离职文件中,确实有一条关于潜在股权取消的规定。他表示:“虽然我们从未收回过任何股权,但这不应该出现在我们的任何文件或沟通中。这是我的责任,也是我在经营 OpenAI 的过程中为数不多真正感到尴尬的一次;我不知道会发生这种情况,但我应该知道。”
Image
Meta 发布混合模态基座模型Chameleon,挑战 GPT-4o
据 Arxiv 页面显示,Meta 近日发表论文,介绍旗下自研的混合模态基座模型Chameleon。
Meta表示,Chameleon有助于生成交错的文本和图像序列并进行推理,从而实现全面的多模式文档建模。与传统模型不同,Chameleon采用了统一的架构,通过对图像进行类似文本的标记化处理,对两种模式一视同仁。
Image
美国两位配音演员对AI音频公司 Lovo 提起诉讼
据 The Warp 报道,两名美国配音演员近日对 AI 音频公司 Love 提起诉讼,指控该公司在未经许可的情况下复制他们的声音,并利用 AI 配音与其展开竞争。
两名配音演员 Paul Lehrman 和 Linnea Sage 表示,Lovo公司诱骗他们发送声音样本,然后利用这些样本开始销售他们声音的AI版本。两人指控 Lovo 公司欺诈、虚假宣传并侵犯了他们的公开权。他们要求赔偿 500 万美元。
Image
微软或因未提供 AI 风险信息被欧盟罚款数十亿美元
据 TechCrunch 报道,欧盟近日想微软发出警告,根据最新的数字服务法案,微软能会被处以高达其全球年营业额 1%的罚款,因为该公司未能对一项以其生成式人工智能工具为重点的信息请求(RFI)做出回应。
早在今年 3 月,欧盟就曾要求微软和其他一些科技巨头提供有关生成式人工智能工具所带来的系统性风险的信息。周五,欧盟委员会称微软未能提供其要求的部分文件。不过,欧盟委员会新闻稿的更新版对措辞进行了调整,删除了之前关于欧盟没有收到微软答复的说法。修改后的版本称,欧盟 "在提出初步信息要求后 "正在加强执法行动。欧盟委员会要求微软在 5 月 27 日之前提供所要求的数据,否则将面临执法风险。
Image
Coze 功能更新,上线Web SDK
据字节跳动官方消息,AI机器人开发平台 Coze 近日上线全新功能Web SDK,使得用户可以更便捷地将机器人嵌入到自己的网页上,进一步拓宽了聊天机器人的应用场景。
Coze平台的Web SDK上线,为用户提供了一个强大的工具,让他们能够轻松地在自己的网页上集成智能聊天机器人,从而提升用户体验,实现更高效的客户服务和互动。
Image
谷歌发布 3D 生成模型 CAT3D,可快速生成 3D 内容
据 Arxiv 页面显示,谷歌近日发布3D生成模型 CAT3D,通过使用多视角扩散模型来创建3D场景。
CAT3D能够在一分钟内完成整个3D场景的创建,这比现有的单图像和少视图3D场景创建方法要快得多。该模型不仅支持单图像输入,还能够处理多图像输入,从而生成更加丰富和详细的3D场景。CAT3D利用多视图扩散模型,可以根据任意数量的输入图像和目标新视图生成高度一致的场景新视图。
Image
ElevenLabs 发布新功能Audio Native ,可自动生成播客
ElevenLabs 近日宣布,推出全新 AI 功能 Audio Native ,可以将博客、新闻网站和其他网页内容转换成高质量的播客语音。
该功能利用 ElevenLabs 的文本转语音服务,自动生成网页内容的高质量人声旁白。支持实时生成语音旁白,用户无需等待即可收听。该模型兼容多种内容管理系统(CMS)和框架,如 React、Ghost、Squarespace、Webflow、Framer、WordPress 等。提供详细的集成指南,帮助用户在不同平台上集成 Audio Native。用户可以选择多种语音生成旁白,满足不同场景和听众需求。提供发音词典功能,确保品牌特定词语的正确发音。
Image
今日重点论文:
哥伦比亚大学
《LoRA Learns Less and Forgets Less》
LoRA是一种低秩适应方法,可以通过仅训练选定的权重矩阵的低秩扰动来节省内存。虽然在大多数情况下,LoRA表现不及完全微调,但它表现出更好的正则化效果,可以帮助维护基础模型在目标域之外任务的性能,并且可以产生更多样化的生成结果。论文通过比较在编程和数学领域的指令微调和持续预训练数据情况下,LoRA和完全微调的性能,发现LoRA在大多数情况下表现不及完全微调,但它表现出更好的正则化效果。实验使用了两个数据集,并提出了使用LoRA进行微调的最佳实践。论文地址:
https://arxiv.org/abs/2405.09673v1
Meta
《Chameleon: Mixed-Modal Early-Fusion Foundation Models》
Chameleon试图解决如何在任意顺序下理解和生成图像和文本的问题。Chameleon是一种早期融合的基于令牌的混合模态模型,可以在任意顺序下理解和生成图像和文本。它的关键思路是提出了一种适用于早期融合、基于令牌、混合模态设置的稳定训练方法、对齐配方和架构参数化。
论文地址:
https://arxiv.org/abs/2405.09818v1
桑迪亚国家实验室
《Probabilistic transfer learning methodology to expedite high fidelity simulation of reactive flows》
本文文旨在提出一种新的概率迁移学习框架,以增强机器学习模型在低维流形中正确预测热化学状态的能力,特别是在数据稀疏的情况下。论文提出了一种基于贝叶斯神经网络和自编码器的新型概率迁移学习框架,通过降低状态空间的维度和从源域到目标域的知识扩散来提高机器学习模型的预测准确性。
论文地址:
https://arxiv.org/abs/2405.10944v1
林雪平大学
《DINO as a von Mises-Fisher mixture model》
本文旨在解决自监督预训练中Siamese网络的自蒸馏方法的问题,提出了一种新的DINO-vMF方法,以更好地表示图像。本文提出了一种DINO-vMF方法,将DINO和其衍生物解释为von Mises-Fisher组件的混合模型,并在计算聚类分配概率时添加适当的归一化常数,以增加模型的灵活性。
论文地址:
https://arxiv.org/abs/2405.10939v1
Image