GenAI新世界

6月18日 AI 头条 | 潞晨Open-Sora开源再升级!支持任意风格,一键生成高质量短片

Image

划重点:

  • 潞晨Open-Sora开源再升级!支持任意风格,一键生成高质量短片

  • Runway 发布第三代视频生成模型,90 秒生成 10 秒片段

  • 腾讯视频号拟限制数字人带货

  • 亚马逊公布2.3亿美元资助计划,加速生成式 AI 应用发展

  • 谷歌将 Gemini 移动应用引入印度 支持九种印度语言

  • 盘古大模型 5.0、全新小艺将亮相华为 HDC2024 开发者大会

  • Luma AI 发布预告,将推出视频编辑功能Dream Machine

  • DeepSeek发布开源模型DeepSeek-Coder-V2

  • Adobe 将在本周内发布更新,为 Acrobat 增加文生图功能

  • 哔哩哔哩大语言模型 Index-1.9B 发布

资讯详情:

潞晨Open-Sora开源再升级!支持任意风格,一键生成高质量短片
潞晨Open-Sora团队在720p高清文生视频质量和生成时长上实现了突破性进展!全新升级的Open-Sora不仅支持无缝产出任意风格的高质量短片,团队还选择继续全部开源!
通过他们的模型权重,能够生成各种酷炫的短片,比如海浪海螺亲密接触、森林秘境、逼真的人物肖像、赛博朋克风短片,还能生成有趣生动的动画镜头,带来极具表现力的视觉体验。即使是电影级别的镜头制作,也能轻松应对。
潞晨的Open-Sora模型以其卓越的性能揭示了视频生成领域的广阔前景,而他们的模型权重和训练代码已经全面开源,感兴趣的朋友可以访问他们的GitHub项目。
GitHub地址:
https://github.com/hpcaitech/Open-Sora
Image

Runway 发布第三代视频生成模型,90 秒生成 10 秒片段

据Runway 官方消息,Runway 现已发布 Gen-3 Alpha 视频生成模型。

据 Runway 表示, Gen-3 Alpha 是在为大规模多模态训练而建立的新基础设施上训练出来的。与 Gen-2 相比,它在保真度、一致性和运动方面都有了重大改进,也是向建立通用世界模型迈出的一步。通过对视频和图像的联合训练,Gen-3 Alpha 将支持 Runway 的文本到视频、图像到视频和文本到图像工具,以及现有的控制模式(如运动画笔、高级摄像机控制、导演模式),以及即将推出的可对结构、风格和运动进行更精细控制的工具。

Image

腾讯视频号拟限制数字人带货

据腾讯官方消息,腾讯对《视频号橱窗达人「发布低质量内容」实施细则》进行修订,修订内容于今年 6 月 7 日-6 月 13 日进行意见征集。

据最新的修订方案,使用插件、AI 等工具生成虚拟形象进行直播;提供、售卖、教学或展示平台不提倡传播的内容:如讲解和售卖虚拟人代播软件等涉及虚拟人/数字人直播,将被视频号明确列入低质量内容,并进行违规处理。

Image

亚马逊公布2.3亿美元资助计划,加速生成式 AI 应用发展

亚马逊云科技官方消息,亚马逊云科技将向全球的初创企业提供2.3亿美元的自主,帮助这些企业开发生成式 AI 引用。

这部分资金将用于为初创企业提供指导、教育和免费的 AWS 云服务,促进这些企业进一步使用 AI 和 ML 技术。作为整体资助的一部分,亚马逊将启动第二批 AWS Generative AI Accelerator 计划,为 80 家使用生成式 AI 解决复杂挑战的顶级早期初创企业提供为期 10 周的系统性指导。

Image

谷歌将 Gemini 移动应用引入印度 支持九种印度语言

据谷歌官方消息,谷歌将把Gemini移动应用引入印度市场,除英语外还支持包括印地语、孟加拉语、泰米尔语等九种印度主要本地语言。

该应用允许用户以任何支持语言进行打字或语音交互,利用Gemini人工智能助手获取帮助。此前,Gemini应用于今年2月在美国首次推出,随后陆续覆盖欧洲、东亚等多个海外市场。印度版Gemini应用还内置了访问"Gemini Advanced"付费高级体验的选项。

Image

盘古大模型 5.0、全新小艺将亮相华为 HDC2024 开发者大会

据华为官方消息,华为 HDC 2024 开发者大会将于 6 月 21 日-23 日在东莞松山湖举行,官方表示将在大会带来盘古大模型 5.0 和全新小艺。

据介绍,小艺是华为推出的全场景设备智慧语音助手,提供语音对话、图文识别、服务建议、设备智慧能力和设备互联管理功能;盘古大模型是华为旗下涵盖金融、政务、制造、矿山、气象、铁路等领域行业的大模型和能力集,拥有 NLP、多模态、科学计算等大模型。

Image

Luma AI 发布预告,将推出视频编辑功能Dream Machine

据 Luma AI 官方消息,即将推出全新功能Dream Machine,可对生成的视频进行编辑。

Luma 表示,用户通过Dream Machine可以轻松进行各种复杂的视频修改和调整。不管是更换背景还是对人物和对象进行调整都可以通过文字轻松完成。

此外,Luma AI还发布了一项名为“Extend”的创新视频功能。这项功能能够智能分析视频内容,并根据用户的提示,在保持原有视频风格和人物对象一致性的基础上,延长视频的长度。

Image

DeepSeek发布开源模型DeepSeek-Coder-V2

据 DeepSeek 官方消息,DeepSeek 发布了一款名为 DeepSeek-Coder-V2的开源模型,这一模型在代码和数学能力方面超越了 GPT-4-Turbo。

DeepSeek-Coder-V2的性能在全球范围内名列前茅,其代码生成和数学算术能力尤为突出。这一模型及其相关代码、论文已全部开源,供免费商用使用,无需申请。模型提供两种规模:236B 参数和16B 参数,以满足不同的应用需求。

Image

Adobe 将在本周内发布更新,为 Acrobat 增加文生图功能

据 Adobe 官方消息,Adobe 将会在本周内发布为 Acrobat 应用增加图像生成功能。

Adobe 公司表示 Acrobat 应用程序将引入全新的“Generate Image”功能,用户可以选择 PDF 文件中的某段内容,调用 AI 来生成图片,此外用户还可以调整生成图片的样式和大小,让其更契合整个 PDF 文档内容。

Image

哔哩哔哩大语言模型 Index-1.9B 发布

哔哩哔哩官方消息,哔哩哔哩现已发布Index 系列模型中的轻量版本Index-1.9B 系列,该模型已在Hugging face 和Github上开源。

本次开源的 Index-1.9B 系列包含以下模型:

Index-1.9B base: 基座模型,具有 19 亿 非词嵌入参数量,在2.8T 中英文为主的语料上预训练,多个评测基准上与同级别模型比处于领先。

Index-1.9B pure: 基座模型的对照组,与 base 具有相同的参数和训练策略,不同之处在于我们严格过滤了该版本语料中所有指令相关的数据,以此来验证指令对 benchmark 的影响 (详见 2.3 章节)。

Index-1.9B chat: 基于 index-1.9B base 通过 SFT 和 DPO 对齐后的对话模型,我们发现由于预训练中引入了较多定向清洗对话类语料,聊天的趣味性明显更强。

Index-1.9B character: 在SFT 和 DPO 的基础上引入了 RAG 来实现fewshots角色扮演定制。

Image

今日重点论文:

复旦大学:

《Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B》

该算法通过将蒙特卡罗树搜索与启发式自我改进机制相结合,构建一个搜索树,利用改进的UCB公式来优化探索-开发平衡,并通过迭代的选择、自我改进、自我评估和反向传播过程来提高大型语言模型的决策框架。论文通过实验表明,MCT Self-Refine算法在解决奥林匹克级数学问题方面具有显著的优势,可以在多个数据集上提高成功率。论文为大型语言模型在复杂推理任务中的应用提供了基础,并为未来的人工智能集成提供了可能。

论文地址:

https://arxiv.org/abs/2406.07394v2

纽约大学:

《Can Language Models Serve as Text-Based World Simulators?》

论文旨在探讨当前语言模型是否能够作为文本世界模拟器,避免手动编码所需的高昂成本和复杂性。为此,研究人员建立了一个新的基准测试 ByteSized32-State-Prediction,包含文本游戏状态转换数据集和相关游戏任务,以直接量化LLM作为文本世界模拟器的能力。通过建立基准测试,使用GPT-4模型对文本游戏状态进行预测,发现LLM作为文本世界模拟器的表现仍不可靠,需要进一步创新。

论文地址:

https://arxiv.org/abs/2406.06485v1

OpenAI:

《The Prompt Report: A Systematic Survey of Prompting Techniques》

研究团队建立提示术语的分类体系,解决术语混淆的问题。该体系包括33个术语的分类体系,分别涵盖了58种文本提示技术和40种其他提示技术。同时进行了自然语言前缀提示的元分析。论文提供了一个全面的提示技术术语表,为研究者提供了一个统一的语言。同时,通过元分析提供了对自然语言前缀提示的深入理解。

论文地址:

https://arxiv.org/abs/2406.06608v1

Together AI

《Mixture-of-Agents Enhances Large Language Model Capabilities》

研究团队提出了一种混合智能体(MoA)方法,构建了一个多层MoA架构,每层包含多个LLM智能体,每个智能体将前一层中其他智能体的输出作为辅助信息来生成其响应。该方法在AlpacaEval 2.0、MT-Bench和FLASK上实现了最先进的性能,超过了GPT-4 Omni。仅使用开源LLM的MoA在AlpacaEval 2.0中领先于GPT-4 Omni,达到65.1%的得分。

论文地址:

https://arxiv.org/abs/2406.04692v1

Image