GenAI新世界

2 月 29 日 AI 头条:字节跳动正秘密研发多款AI产品

Image
  • 字节跳动秘密研发多款AI产品
  • Meta 已经开始训练Llama 3
  • 苹果今年将在生成式 AI 领域有大动作
  • 英伟达发布StarCoder2 的 LLMs 系列模型。
  • Adobe 推出 AI 音乐生成工具Project Music GenAI Control
  • Pika Labs 更新,增加嘴唇同步功能
  • 阿里巴巴发布 Emo ,可以生成高自然度视频
  • Lightricks 发布 LTX Studio,一键生成微电影
  • Morph联手 Stability AI,公布AI 视频编辑产品Morph Studio
  • Playground 发布最新的文本到图像生成模型Playgroundv2.5
今日AI重点事件:
字节跳动秘密研发多款AI产品
据界面新闻报道,字节跳动正在 AI 大模型领域秘密研发多个产品,包括多模态数字人产品以及 AI 生图、文生视频等。
目前,字节跳动在AI大模型相关产品的研发上采取从模型层到应用层的全面布局、多条腿走路的模式。
Image
Meta 已开始训练 Llama 3 
据  HT Tech 报道,Meta 现已开始对 Llama 3 的训练工作,预计会在今年7月发布最新版本。
据报道,Meta 将专注于如何提升 Llama 3 模型的性能,使其在大语言模型竞争中取得优势。
Image
苹果今年将在生成式 AI 领域有大动作
苹果 CEO Tim Cook今天在股东大会上再次谈及了苹果的AI 计划。
Cook表示,苹果将在 2024 年在生成式人工智能领域“开辟新天地(break new ground)”,他强调:“我们相信这将为用户带来变革性的机遇。”
Image
英伟达发布StarCoder2 的 LLMs 系列模型。
据英伟达官方消息,英伟达近日联合 Hugging Face 和 ServiceNow,发布了名为 StarCoder2 的 LLMs 系列模型。StarCoder2 经过 619 门编程语言培训,可以执行源代码生成、工作流生成、文本摘要等专业任务。
该系列模型包括一个由 ServiceNow 训练的 30 亿参数模型、一个由 Hugging Face 训练的 70 亿参数模型和一个由英伟达训练的 150 亿参数模型。
Adobe 推出 AI 音乐生成工具Project Music GenAI Control
Adobe 近日发布了名为“Project Music GenAI Control”的全新 AI 音乐创作工具原型。该工具利用生成式人工智能技术,帮助用户无需专业音频制作经验即可创作和编辑音乐。
用户只需输入文本描述,Project Music GenAI Control 就能生成对应风格的音乐。用户还可以使用集成的编辑控件自定义生成的音乐,调整重复模式、速度、强度和结构。此外,该工具可以重新混音音乐片段,并生成循环音频,非常适合内容创作者制作背景音乐和配乐。
Image

Pika Labs 更新,增加嘴唇同步功能

Pika Labs近日宣布增加全新唇同步功能,可以实现AI视频生成器的逼真口型运动和语音生成,该技术由ElevenLabs提供技术支持。

阿里巴巴发布 Emo ,可以生成高自然度视频

阿里巴巴近日发布 Emo 框架,用户可以借助 EMO框架生成视频。只需要一段音频和人物肖像图片,既可以生成一段人物说话的视频,同时保持自然的面部表情和口型。

Image

Lightricks 发布 LTX Studio,一键生成微电影

据 CSDN 报道,AI平台Lightricks 近日发布生成式 AI 电影制作平台 LTX Studio,用户可以通过输入文本来生成超过25秒的微电影。该平台还只是对视频的镜头切换、角色、场景、灯光进行控制。

Image

Morph联手 Stability AI,公布AI 视频编辑产品Morph Studio

Stability AI近日宣布,将联手Morph,推出一款AI 视频编辑产品Morph Studio,目前已经开始内测。

Image

Playground 发布最新的文本到图像生成模型Playgroundv2.5

Playground宣布,最新的文本到图像生成模型 Playground v2.5 现已正式发布。

新版本提升了图像的美学质量,特别强调颜色和对比度的增强、改进了多纵横比图像生成,可以生成各种比例图像以及人像细节的提升。

今日重点论文:
瑞士统计物理计算实验室:
《A Phase Transition between Positional and Semantic Learning in a Solvable Model of Dot-Product Attention》
论文提供了一个简单的架构,可以学习实现解决方案的位置或语义机制。在高维数据和足够的样本数量下,论文提供了非线性自注意力层的全局最小值的封闭形式描述。论文比较了dot-product attention layer和线性位置基准的性能,并证明了前者在使用语义机制时优于后者。
论文地址:
https://arxiv.org/abs/2402.03902v1
谷歌:
《Towards Accurate Differential Diagnosis with Large Language Models》
本文提出了一种针对诊断推理优化的大型语言模型,该模型在独立运行时的表现超过了未经辅助的医生。实验表明,使用该模型辅助医生进行诊断能够显著提高诊断准确性和全面性。
论文地址:
https://arxiv.org/abs/2312.00164v1
卡耐基梅隆大学:
《Mamba: Linear-Time Sequence Modeling with Selective State Spaces》
论文提出了Mamba模型,Mamba模型通过将SSM参数作为输入的函数来实现内容为基础的推理,从而解决了传统模型在离散模态下的弱点,并设计了一种硬件感知并行算法,在递归模式下实现了快速推理。
论文地址:
https://arxiv.org/abs/2312.00752v1
腾讯AI实验室:
《YOLO-World: Real-Time Open-Vocabulary Object Detection》
论文提出了一种新的可重参数化视觉语言路径聚合网络(RepVL-PAN)和区域-文本对比损失的方法,以促进视觉和语言信息之间的交互。

论文地址:

https://arxiv.org/abs/2401.17270v2

Image