GenAI新世界

3 月 12 日 AI 头条:Midjourney V6 上线"角色参考" 功能,可控制作品风格

Image

划重点:
  • Midjourney V6 上线"角色参考" 功能,可控制作品风格,但不太适合用于真人照片
  • Midjourney 宣布禁止 Stability AI 员工使用其服务
  • 京东推出“AI 全能服务包”,帮助商家免费生成图文、视频和直播
  • Tenstorrent 创始人新公司获 5000 万美元融资,目标为每个 AI 模型定制芯片
  • 微软携手多家医疗机构推出 TRAIN:确保安全、可信赖地开发医疗 AI 应用
  • 阿布扎比建立人工智能投资公司,目标资产管理规模超千亿美元
  • AI 结合汽车,蔚来宣布 NOMI GPT 领航版开启招募

资讯详情:

Midjourney V6 上线"角色参考" 功能,可控制作品风格,但不太适合用于真人照片

据 VentureBeat报道,Midjourney 推出了“角色参考”(Character Reference)功能,为MJ6和Niji6型号用户提供了一项强大的工具,使角色创作更加一致而富有表现力。

该功能的核心概念在于帮助用户根据一张角色的图片创造同一角色内容,强调的是保持角色形象的一致性。

这是Midjourney V6 的新功能。与基于图像提示的方法不同,这个工具更注重捕捉风格和外观。用户可以同时使用图像提示和风格参考,并调整风格权重来控制风格效果。角色一致性功能类似于之前的风格参照功能,但不同之处在于不再是匹配特定风格,而是让角色与给定的角色参照图像相匹配。

Image


Midjourney 宣布禁止 Stability AI 员工使用其服务

据 The Verge 报道,Midjourney 宣布禁止 Stability AI 的员工使用其服务。

MidJourney 同时指责竞争对手生成式 AI 公司的员工在本月早些时候试图窃取 Midjourney 的数据时造成了系统中断。Midjourney 于 3 月 2 日在其 Discord 服务器上发布了一条更新,承认服务器长时间中断导致生成的图片无法出现在用户图库中。

Image


京东推出“AI 全能服务包”,帮助商家免费生成图文、视频和直播

据金融界报道,京东日前宣布推出“AI 全能服务包”,各类 AI 工具免费生成图文、视频和直播,号称“帮助商家节省 50% 运营成本”。

据介绍,京小智支持 7x24 小时自动接待,降低客服成本超 50%。“羚珑”工具可实现秒级免费生成图片,“京点点”支持秒级免费生成文案,支持 AI 生成视频。此外,京东还支持免费数字人“智能代播”,实现 24 小时不间断直播。

Image


微软携手多家医疗机构推出 TRAIN:确保安全、可信赖地开发医疗 AI 应用

据 DoNews 报道,微软近日携手多家健康医疗机构,共同创建了“值得信赖和负责任的人工智能网络”(Trustworthy & Responsible AI Network,缩写为 TRAIN),旨在为医疗行业开发和使用 AI 应用,建立并实施严格的标准。

AI 应用在医疗保健领域发挥着越来越关键的作用,微软表示 TRAIN 的目标是确保这些 AI 应用的质量、安全性和可信度。

Image



阿布扎比建立人工智能投资公司,目标资产管理规模超千亿美元

据 Aletihead 报道,今年早些时候,阿联酋成立了人工智能和先进技术委员会,该委员会于当地时间周一(今日)宣布成立技术投资公司,以推动尖端技术的发展和应用。

据悉,该公司的理念是改善当代人、下一代人的生活,将通过在阿联酋和全球范围内建立世界领先的合作伙伴关系,投资加速人工智能和先进技术的开发和应用。

该公司的投资战略主要集中在以下三个主要领域:人工智能基础设施,包括数据中心、连接等;半导体产业,包括逻辑和存储芯片的设计与制造;人工智能核心技术和应用,包括人工智能模型、软件、数据、生命科学和机器人技术。

Image


AI 结合汽车,蔚来宣布 NOMI GPT 领航版开启招募

蔚来汽车官方宣布,2024 NOMI 焕新,GPT 领航版正式开启招募。经历 132 次版本迭代更新、为用户带来了超 2000 项功能的 NOMI,即将进入体验升级新篇章。

根据官方的说法,中央计算平台 ADAM 可以将过去在不同域(比如智舱与智驾)的功能转移到集中的计算平台,大幅减少控制器的数量,2024 款车型还将支持 NOMI GPT 功能。

蔚来官方表示,NOMI GPT 将是业内首家纯端侧部署的多模态感知大模型,NOMI 可以通过车内摄像头识别数千种物品,无需联网,响应超快,隐私数据不出车更安全。而 NOMI GPT 还将超越通俗的问答、信息检索,用户可以通过对感觉的描述来向 NOMI 发出指令。

Image

今日重点论文:

韩国科学技术院:

《Where Visual Speech Meets Language: VSP-LLM Framework for Efficient and Context-Aware Visual Speech Processing》

本文提出了一种新的框架VSP-LLM,通过自监督的视觉语音模型将输入视频映射到LLM的输入潜空间,利用视觉语音单元提出了一种新的去重方法,并通过Low Rank Adaptors (LoRA)实现了高效的训练。本文在MuAViC基准数据集上进行了实验,证明了VSP-LLM可以在只有15小时标注数据的情况下更有效地识别和翻译唇部运动。此外,本文的去重方法和LoRA可以提高训练效率。


剑桥大学:

《Why do Random Forests Work? Understanding Tree Ensembles as Self-Regularizing Adaptive Smoothers 》

论文提供了一种新的量化决策树集成的平滑度的方法,并对决策树集成的优势进行了进一步的解释。研究表明,决策树集成可以通过三种不同的机制提高性能,即减少噪声引起的预测方差、减少给定固定输入数据时学习函数质量的变异性,以及通过丰富可用的假设空间减少潜在的偏差。

论文地址:

https://arxiv.org/abs/2402.01502v1


巴黎萨克雷大学:

《A Hitchhiker’s Guide to Geometric GNNs for 3D Atomic Systems》

论文提出了一种基于几何图形的神经网络架构,利用3D原子系统的物理对称性和化学属性来学习有信息量的表示。提供了一个系统的分类法,包括不变网络、笛卡尔基础下的等变网络、球基础下的等变网络和无约束网络。同时,论文还介绍了关键数据集和应用领域,并提出了未来的研究方向。

论文地址:

https://arxiv.org/abs/2312.07511v1


新加坡国立大学计算机学院:

《AI and Jobs: Has the Inflection Point Arrived? Evidence from an Online Labor Platform》

本文提出一个三阶段的可视化框架来理解人工智能与就业之间的关系,通过经济模型证明每个职业都存在一个拐点,超过该拐点后人工智能的改进将对人类工作者产生负面影响。使用大量的在线劳动市场数据来验证模型,发现翻译员的工作受到了负面影响,而Web开发人员的工作受到了积极影响。

论文地址:

https://arxiv.org/abs/2312.04180v1


Meta:

《Large Language Models for Software Engineering: Survey and Open Problems》

论文探讨了LLMs在软件工程中的应用,包括编码、设计、需求分析、维护、重构、性能优化、文档编写和分析等方面。同时,论文还指出了LLMs所面临的技术挑战,如错误解决方案的问题。论文提出了一种基于混合技术的解决方案,将传统的软件工程方法与LLMs相结合,以提高LLMs在软件工程中的可靠性和效率。论文还介绍了一些相关的工作和数据集。

论文地址:

https://arxiv.org/abs/2310.03533v4

Image