- 英伟达发布StarCoder2 的 LLMs 系列模型。
- Adobe 推出 AI 音乐生成工具Project Music GenAI Control
- Lightricks 发布 LTX Studio,一键生成微电影
- Morph联手 Stability AI,公布AI 视频编辑产品Morph Studio
- Playground 发布最新的文本到图像生成模型Playgroundv2.5
据界面新闻报道,字节跳动正在 AI 大模型领域秘密研发多个产品,包括多模态数字人产品以及 AI 生图、文生视频等。目前,字节跳动在AI大模型相关产品的研发上采取从模型层到应用层的全面布局、多条腿走路的模式。据 HT Tech 报道,Meta 现已开始对 Llama 3 的训练工作,预计会在今年7月发布最新版本。据报道,Meta 将专注于如何提升 Llama 3 模型的性能,使其在大语言模型竞争中取得优势。苹果 CEO Tim Cook今天在股东大会上再次谈及了苹果的AI 计划。Cook表示,苹果将在 2024 年在生成式人工智能领域“开辟新天地(break new ground)”,他强调:“我们相信这将为用户带来变革性的机遇。”英伟达发布StarCoder2 的 LLMs 系列模型。据英伟达官方消息,英伟达近日联合 Hugging Face 和 ServiceNow,发布了名为 StarCoder2 的 LLMs 系列模型。StarCoder2 经过 619 门编程语言培训,可以执行源代码生成、工作流生成、文本摘要等专业任务。该系列模型包括一个由 ServiceNow 训练的 30 亿参数模型、一个由 Hugging Face 训练的 70 亿参数模型和一个由英伟达训练的 150 亿参数模型。Adobe 推出 AI 音乐生成工具Project Music GenAI ControlAdobe 近日发布了名为“Project Music GenAI Control”的全新 AI 音乐创作工具原型。该工具利用生成式人工智能技术,帮助用户无需专业音频制作经验即可创作和编辑音乐。用户只需输入文本描述,Project Music GenAI Control 就能生成对应风格的音乐。用户还可以使用集成的编辑控件自定义生成的音乐,调整重复模式、速度、强度和结构。此外,该工具可以重新混音音乐片段,并生成循环音频,非常适合内容创作者制作背景音乐和配乐。Pika Labs 更新,增加嘴唇同步功能
Pika Labs近日宣布增加全新唇同步功能,可以实现AI视频生成器的逼真口型运动和语音生成,该技术由ElevenLabs提供技术支持。
阿里巴巴发布 Emo ,可以生成高自然度视频
阿里巴巴近日发布 Emo 框架,用户可以借助 EMO框架生成视频。只需要一段音频和人物肖像图片,既可以生成一段人物说话的视频,同时保持自然的面部表情和口型。
Lightricks 发布 LTX Studio,一键生成微电影
据 CSDN 报道,AI平台Lightricks 近日发布生成式 AI 电影制作平台 LTX Studio,用户可以通过输入文本来生成超过25秒的微电影。该平台还只是对视频的镜头切换、角色、场景、灯光进行控制。
Morph联手 Stability AI,公布AI 视频编辑产品Morph Studio
Stability AI近日宣布,将联手Morph,推出一款AI 视频编辑产品Morph Studio,目前已经开始内测。
Playground 发布最新的文本到图像生成模型Playgroundv2.5
Playground宣布,最新的文本到图像生成模型 Playground v2.5 现已正式发布。
新版本提升了图像的美学质量,特别强调颜色和对比度的增强、改进了多纵横比图像生成,可以生成各种比例图像以及人像细节的提升。
《A Phase Transition between Positional and Semantic Learning in a Solvable Model of Dot-Product Attention》论文提供了一个简单的架构,可以学习实现解决方案的位置或语义机制。在高维数据和足够的样本数量下,论文提供了非线性自注意力层的全局最小值的封闭形式描述。论文比较了dot-product attention layer和线性位置基准的性能,并证明了前者在使用语义机制时优于后者。https://arxiv.org/abs/2402.03902v1《Towards Accurate Differential Diagnosis with Large Language Models》本文提出了一种针对诊断推理优化的大型语言模型,该模型在独立运行时的表现超过了未经辅助的医生。实验表明,使用该模型辅助医生进行诊断能够显著提高诊断准确性和全面性。https://arxiv.org/abs/2312.00164v1《Mamba: Linear-Time Sequence Modeling with Selective State Spaces》论文提出了Mamba模型,Mamba模型通过将SSM参数作为输入的函数来实现内容为基础的推理,从而解决了传统模型在离散模态下的弱点,并设计了一种硬件感知并行算法,在递归模式下实现了快速推理。https://arxiv.org/abs/2312.00752v1《YOLO-World: Real-Time Open-Vocabulary Object Detection》论文提出了一种新的可重参数化视觉语言路径聚合网络(RepVL-PAN)和区域-文本对比损失的方法,以促进视觉和语言信息之间的交互。论文地址:
https://arxiv.org/abs/2401.17270v2