GenAI新世界

4 月 24 日 AI 头条|AIGC第一股出门问问今日上市,市值达54.89亿港元

Image

划重点:

  • AIGC第一股出门问问今日上市,市值达54.89亿港元

  • 微软解锁 Copilot 特性:字符上限最高调至 1.6 万、支持梳理 PDF 等文件内容

  • Adobe Photoshop 引入全新 Firefly Image 3 图像 AI 模型,Beta 版开放下载

  • TrendForece:AI 推理带动今年企业级 QLC 固态硬盘出货容量增长四倍

  • Midjourney推出新功能Room 用户可在聊天室中一起创作图像

  • 英伟达与越南科技巨头 FPT 达成合作,将投资 2 亿美元共建 AI 工厂

  • 消息人士称,Perplexity 正在为其人工智能搜索平台筹集 2.5 亿美元以上的资金,估值为 2.5B-3B 美元

  • 亚马逊希望托管公司的定制生成人工智能模型

  • 马斯克或将在明年年底前出售特斯拉人形机器人 Optimus

  • EVI正式发布API,提供转录、语音合成服务

  • 微软、谷歌和 OpenAI 等巨头承诺制定生成式 AI 发展措施,妥善保护儿童健康

资讯详情:

AIGC第一股出门问问今日上市,市值达54.89亿港元

被誉为“AIGC第一股”的出门问问于今日在香港交易所正式挂牌上市。截至收盘,出门问问收报3.68港元,跌幅3.16%,港股市值54.89亿港元。 

据配发结果公告显示,此次出门问问全球发售8456.8万股股份,国际发售4228.4万股股份,公开发售4228.4万股股份,其中,公开发售获117.39 倍认购。最终发售价每股3.8港元,全球发售净筹约2.67亿港元。

Image

微软解锁 Copilot 特性:字符上限最高调至 1.6 万、支持梳理 PDF 等文件内容

据ReadHub报道,微软公司近日通过服务器更新,上调了 Windows 10、Windows 11 系统、网页版以及 Edge 浏览器中 Copilot 的字符上限,最高可以达到 1.6 万个;此外微软还支持附加 PDF 等文件以及集成笔记本。

微软最初推出网页版和 Windows 版 Copilot 时,字符上限为 2000 个字符,后来增加到 4000 个字符。而在本次更新之后,Copilot 普通用户在“更有创意”模式下,字符上限调整为 8000 个;而如果订购了 Copilot Pro,字符数可以达到 1.6 万个。

微软除了增加字符上限之后,还支持上传 PDF 等格式文件,然后 Copilot 会自动分析、梳理文档中的关键要点。

此外用户上传 PDF、Word 文档、Excel 表格等文件之后,可以要求 Copilot 总结、解释、扩展或翻译成另一种语言,而且可以调用 Bing Search 检测文档中内容,判断文档内容真实性。

Image


Adobe Photoshop 引入全新 Firefly Image 3 图像 AI 模型,Beta 版开放下载

去年以来,Adobe 一直在其各种软件产品中添加大量基于 AI 的功能,其中包括基于 Firefly AI 的图像生成功能,用于 Photoshop 等 Creative Cloud 应用。

今天,Adobe 宣布推出新版 Photoshop,不仅包含一些新的 AI 图像编辑功能和改进,还包含新的 Firefly Image 3 Foundation Model,用于根据文本提示制作基于 AI 的内容。

Adobe 在官方新闻稿中表示,与之前的版本相比,Firefly Image 3 将能够创建质量更高、种类更多、细节更丰富的图像,它还能更好地理解文本提示。

Image


TrendForece:AI 推理带动今年企业级 QLC 固态硬盘出货容量增长四倍

TrendForece 集邦咨询发布研报,表示今年企业级 QLC 固态硬盘的出货位元将因 AI 推理服务器需求增长四倍,达 30EB(IT之家注:约 3146 万 TB)。

研报表示,AI 推理服务器对存储介质以读取为主,写入不如 AI 训练服务器频繁。企业级的 QLC 固态虽然写入耐久不如 TLC 盘,但在读取方面并不逊色,同时也拥有成本优势。

而对比企业级机械硬盘,企业级 QLC 固态硬盘在速度具有明显优势的同时,运行能耗较低。同时企业级 QLC 固态硬盘已可实现 61.44TB 容量,相较企业级机械硬盘常见的 20~24TB 更大。AI,尤其是 AI 训练是高耗能应用,大型 AI 服务器客户愈来愈看重存储产品的能效。

企业级 QLC 固态硬盘能效优于机械硬盘,又仅需更少物理空间,在整体 TCO 方面具有优势,这推动了 AI 推理服务器对 QLC 固态硬盘的采用。具体来说,主要闪存企业中仅有三星和 Solidigm 的企业级 QLC 固态硬盘通过了验证测试,因此这两家企业将受益于这波趋势,尤以积极推广 QLC 产品的 Solidigm 为大。

Solidigm 下半年将扩大 144 层 QLC 闪存的投产;三星电子方面虽然下半年会开始量产第九代 V-NAND 闪存的 QLC 版本,但仍将以 176 层(第七代 V-NAND)QLC 闪存为主。研报预估,大容量 QLC 产品供应吃紧,将带动企业级固态硬盘合约价在三季度继续上涨,涨幅约 5~10%。

Image


Midjourney推出新功能Room 用户可在聊天室中一起创作图像

Midjourney 近日宣布,推出全新 Room 功能,允许用户共同参与创作。

Midjourney 表示,在 Room 中,用户可以一起创建和分享图像,并参与实时聊天。在Room中,用户可以看到房间中其他人创作的图像,这有助于激发灵感和创意交流。

Room的右侧提供语音和文字聊天功能,用户可以讨论他们的创作过程、分享想法和反馈。左侧生成的图像可以轻松地被引用到聊天中,这促进了用户之间的互动和合作。Room为用户提供了一个协作和社交的空间,使Midjourney的体验更加丰富和多维。

Image

英伟达与越南科技巨头 FPT 达成合作,将投资 2 亿美元共建 AI 工厂

据AASTOCKS报道,越南科技巨头 FPT 与英伟达当地时间周二宣布达成全面战略合作,双方计划投资 2 亿美元、利用英伟达的技术建造一家人工智能工厂。

双方在联合声明中表示,FPT 计划利用英伟达的支持促进 AI 研究,并为越南和全球客户提供服务与解决方案,英伟达还将帮助 FPT 在汽车和数字化转型等领域开发 AI 技术。

据路透社报道,FPT 是越南胡志明市证券交易所市值最高的科技公司,市值达到 55 亿美元,提供各种 AI、云计算和大数据服务,去年总收入超过 20 亿美元。

英伟达 CEO 黄仁勋曾在去年 12 月表示,该公司希望扩大与越南顶尖科技公司的合作,并支持越南培养人工智能和数字基础设施开发人才。目前,英伟达已经在越南投资超过 2.5 亿美元。

Image


消息人士称,Perplexity 正在为其人工智能搜索平台筹集 2.5 亿美元以上的资金,估值为 2.5B-3B 美元

据TheVerge报道,人工智能搜索引擎初创公司Perplexity是目前的热门资产。TechCrunch 获悉,该公司目前正在筹集至少 2.5 亿美元资金,估值在 25 亿至 30 亿美元之间。

在此消息发布之前,该公司在过去四个月内进行了另外两次大规模融资,估值实现了飞跃:1 月份,该公司筹集了近 7400 万美元,估值达到 5.4 亿美元(高于 2023 年 4 月的 1.21 亿美元)。3 月初,该公司完成了估值为 10 亿美元的融资——从那时起,这一融资就一直悄悄公开(在PitchBook 的数据库中,融资金额为 5600 万美元),彭博社今天早些时候强调了这一融资(没有提及融资金额) ),首席执行官 Aravind Srinivas指出为 6270 万美元。

报道的这两轮并不是故事的全部。我们从与该公司关系密切的多个消息来源了解到,该公司实际上还在进一步筹集至少2.5 亿美元的资金,以利用其在市场上获得的关注。据消息人士透露,NEA 和 IVP 都是该公司之前的支持者,他们也希望在这一轮更大规模的投资中进行投资。

一位消息人士称,他们或其他先前的支持者是否参与,可能取决于 Perplexity 是否愿意与现有投资者合作,而不是进行多元化,扩大其上限表以引入新投资者。

“他们的增长非常迅速,”一位现有投资者的合伙人表示。“是的,我们会寻求参与。”

Perplexity 产品的核心是基于人工智能的生成式搜索引擎,它使用聊天机器人风格的界面提供结果。它绝对不是唯一一家追求搜索机会的生成人工智能公司:这实际上是有多少人在使用 ChatGPT 和微软的 Bing(由 OpenAI 提供支持)等产品,而谷歌正在通过其 Gemini LLM 大力推动改善搜索结果。

Image


亚马逊希望托管公司的定制生成人工智能模型

据TheVerge报道,AWS 是亚马逊的云计算业务,希望成为公司托管和微调其定制生成人工智能模型的首选场所。

昨日,AWS 宣布推出自定义模型导入(预览版),这是 AWS 面向企业的生成 AI 服务套件 Bedrock 中的一项新功能。该功能允许组织将其内部生成人工智能模型作为完全托管的 API 导入和访问。

公司的专有模型一旦导入,将受益于与 Bedrock 库中其他生成人工智能模型相同的基础设施(例如 Meta 的 Llama 3 或 Anthropic 的 Claude 3)。他们还将获得工具来扩展他们的知识,对其进行微调并实施保障措施以减轻他们的偏见。

AWS 生成人工智能副总裁 Vasi Philomin 在接受 TechCrunch 采访时表示:“有些 AWS 客户已经在 Bedrock 之外使用其他工具进行微调或构建自己的模型。” “这种自定义模型导入功能使他们能够将自己的专有模型引入 Bedrock,并在 Bedrock 上已有的所有其他模型旁边查看它们,并将它们与 Bedrock 上已有的所有工作流程一起使用”。

Image


马斯克或将在明年年底前出售特斯拉人形机器人 Optimus

据 The Verge 报道,马斯克今天表示,预计会在2025年递签对外销售人形机器人 Optimes。

据悉,特斯拉预计在今年年底前可以拥有完成 Optimus 工厂任务的能力。特斯拉计划今年年底前在其自家工厂率先使用该机器人。

几个月前,特斯拉发布了新一代人形机器人 Optimus Gen 2,旨使其能够接管人类的重复性工作。与之前的版本相比,新原型机器人有着诸多改进。

Image


EVI正式发布API,提供转录、语音合成服务

据 Hume 官方消息,旗下可识别对话客户情感的人工智能 EVI 即日起正式开放 API。

据报道,EVI 的情商影响深远而多样。在医疗保健、教育和客户服务等领域,其潜在应用几乎是无限的。试想一下,当学生遇到困难时,虚拟辅导员可以感知并提供个性化的帮助,或者虚拟治疗师可以为需要帮助的人提供感同身受的支持。有了 EVI,这些场景不再局限于想象,而是触手可及。

Hume 表示,自发布以来,它已经生成了大约10万次的对话,平均每次对话时长为10分钟,总计产生了超过300万条消息。

Image


微软、谷歌和 OpenAI 等巨头承诺制定生成式 AI 发展措施,妥善保护儿童健康

据DoNews报道,微软、谷歌近日发布新闻稿,宣布和 Thorn、All Tech Is Human 机构合作,致力于在其生成人工智能技术中实施强有力的儿童安全措施。 

Thorn 是一家致力于开发保护儿童免受性虐待技术的非营利组织,而 All Tech Is Human 是一家专注于发展和加强负责任的科技生态系统的组织,两家组织宣布和 Amazon、Anthropic、Civitai、Google、Meta、Metaphysical、Microsoft、Mistral AI、OpenAI 和 Stability AI 等科技巨头公司合作,在开发生成 AI 技术过程中,制定强有力的儿童安全承诺。

上述公司承诺,在开发生成式 AI 技术过程中,会阻止生成、传播儿童性虐待材料(AIG-CSAM)以及其它伤害到儿童的内容。

Image

今日重点论文:

牛津大学:

《AutoAD III: The Prequel – Back to the Pixels》

本论文提出了一种基于Q-former的架构,使用预训练的视觉编码器和大型语言模型,从原始视频中生成AD,并提出了新的评估指标以评估AD质量。论文提供了两种构建AD数据集的方法,并公开了这些数据集。实验使用了现有数据集,并开发了新的评估指标来评估AD质量。提出的Q-former-based架构在AD生成方面取得了最新的成果。

论文地址:

https://arxiv.org/abs/2404.14412v1


首尔大学:

《Guess The Unseen: Dynamic 3D Scene Reconstruction from Partial 2D Glimpses 》

本文使用3D高斯点插值(3D-GS)表示法来表示世界和多个人物,通过在规范空间中优化3D-GS表示来融合稀疏的线索,利用预训练的2D扩散模型合成未见过的视图,最终实现高质量的3D人体重建。该方法能够在各种具有挑战性的例子中重建高质量的可动画3D人体,能够在任意时间点渲染场景和编辑3D场景。实验结果表明,该方法的质量和效率优于其他现有方法。

论文地址:

https://arxiv.org/abs/2404.14410v1


莱斯大学:

《SpaceByte: Towards Deleting Tokenization from Large Language Modeling》

本文提出一种新的字节级Transformer模型架构,即SpaceByte,在中间层插入更大的Transformer块,但仅在某些字节,如空格字符之后应用这些更大的块,从而提高性能。论文使用实验验证了SpaceByte模型在固定训练和推理计算预算的情况下,优于其他字节级架构,并且与tokenized Transformer架构的性能大致相当。论文还开源了代码。

论文地址:

https://arxiv.org/abs/2404.14408v1


谷歌:

《LANGUAGEMODELBEATSDIFFUSION—TOKENIZERISKEYTOVISUALGENERATION》

论文的亮点包括:1.提出了一种新的视频分词器MAGVIT-v2,将像素空间输入映射为LLMs学习所需的离散标记;2.通过实验验证了使用MAGVIT-v2的LLMs在ImageNet和Kinetics等标准图像和视频生成基准测试上的优越性;3.在视频压缩和动作识别等任务上,MAGVIT-v2也表现出色;4.论文使用了开源的数据集和代码,值得进一步研究。

论文地址:

https://arxiv.org/abs/2310.05737v3


亚利桑那大学:

《FromWordstoNumbers:YourLargeLanguageModelIsSecretlyACapableRegressorWhenGivenIn-ContextExamples》

大型语言模型(如GPT-4、Claude3等)可以在没有任何额外训练或梯度更新的情况下,执行回归任务,并且性能可以与传统监督学习方法相媲美或超越。论文通过实验发现,大型语言模型在回归任务上的表现非常出色,甚至可以超越传统监督学习方法。研究还探究了大型语言模型在上下文示例数量增加时的性能变化,并表明其具有亚线性的后悔能力。

论文地址:

https://arxiv.org/abs/2404.07544v1

Image