土匪投资日记

谷歌逆袭GPT-4!百度现场改bug!丨ChatGPT&AI 最近信息汇总14

注:体验AI新工具,请直接点击文末阅读原文

本周大新闻:谷歌一雪前耻!全新PaLM 2反超GPT-4,办公全家桶炸裂升级。百度交流会大玩心跳!现场调教大模型,改bug,炸出背后更强底座文心千帆。

热门内容

1

1.谷歌一雪前耻!全新PaLM 2反超GPT-4,办公全家桶炸裂升级,Bard史诗进化

2.AI孙燕姿翻唱爆火,多亏这个开源项目!广西老表带头打造,上手指南已出

3.全面接入:ChatGPT杀进15个商业应用,让AI替你打工

新品发现

2

1.塔罗占卜GPT上线,工作感情运势都能问,几天上万次访问

2.IBM亮王炸!推出大模型Watsonx,7月将开源!

3.视觉中国,上线生成式 AI 创意工具

国内资讯

3

1.百度交流会大玩心跳!现场实时调教大模型,炸出背后更强底座文心千帆

2.真假之争?网友点燃讯飞星火质疑热点,我们深度实测给您答案!

3.北大、西湖大学等开源「裁判大模型」PandaLM:三行代码全自动评估LLM,准确率达ChatGPT的94%

4.阿里达摩院mPLUG-Owl大模型:追赶GPT-4多模态能力

国际资讯

4

1.AI考公考编指日可待!微软华人团队发布全新基准AGIEval,专为人类考试而生

2.游戏建模师直呼失业!OpenAI再放杀器Shap-E:史上最快的文本转3D模型,代码、模型全开源

我和团队持续在关注ChatGPT ,我们会每周统计最近七天左右的信息, 方便大家了解, 也欢迎大家和我们一起交流。

另外,为深入探讨 AI 发展和其机遇,我们联络了相关老师共同创办了知识星球『AI商业观察』,加入者可获 AI最新发展情报、资源 以及 无需翻墙的AI链接 ,还有详细的指导教程哦~

名额有限,对此感兴趣的你,欢迎进来抢先学习和体验!

Image

热门内容

1.谷歌一雪前耻!全新PaLM 2反超GPT-4,办公全家桶炸裂升级,Bard史诗进化

这届I/O大会,谷歌是真的憋出不少大招。

对打GPT-4的PaLM 2登台、Duet AI整进谷歌办公全家桶Workspace、Bard超强进化向所有人开放、谷歌搜索加入AI快照、AI新功能整合进Android 14、AI魔术编辑器加入谷歌相册等等。

目前,PaLM 2已经应用在25种功能和产品中,包括办公全家桶、聊天机器人Bard、搜索等等。

值得称赞的是,PaLM 2最轻量版本Gecko小到可以在手机上运行,每秒可以处理20个token,大约每秒16或17个单词。不过,谷歌没有提及具体用什么硬件来测试这个模型,只是说在「最新的手机上」运行。

Image

显然,这次谷歌在大语言模型的小型化上,取得了非常重要的进步。在云端运行这种AI,往往是很昂贵的,如果能在本地运行,无疑有着许多显著优势,比如隐私保护。

英伟达科学家Jim Fan对此大加赞许——

下一波LLM将是移动原生的。一个离线的、永远在线的LLM不仅可以降低服务成本,而且还为用户体验开辟了全新的途径。

例如,一个元应用程序可以从你的移动工作流程中学习,并为你实现自动化。在小屏幕上节省的生产力,将比在大屏幕上多得多。

Image

此前,谷歌一直被嘲在AI研究上已经落后于微软,PaLM 2,无疑是谷歌的一次重大回击。

2.AI孙燕姿翻唱爆火,多亏这个开源项目!广西老表带头打造,上手指南已出

Image

最近,这波AI翻唱趋势大火,不仅是AI孙燕姿唱的歌越来越多,AI歌手的范围也在扩大,就连制作教程都层出不穷了。

而如果在各大教程中溜达一圈后就会发现,其中的关键秘诀,还是要靠一个名为so-vits-svc的开源项目。

Image

它提供了一种音色替换的办法,项目在今年3月发布。

贡献成员应该大部分都来自国内,其中贡献量最高的还是一位玩明日方舟的广西老表。

Image

这个项目名叫SoftVC VITS Singing Voice Conversion(歌声转换)。

它提供了一种音色转换算法,采用SoftVC内容编码器提取源音频语音特征,然后将矢量直接输入VITS,中间不转换成文本,从而保留了音高和语调。

此外,还将声码器改为NSF HiFiGAN,可以解决声音中断的问题。

具体分为以下几步:

  • 预训练模型

  • 准备数据集

  • 预处理

  • 训练

  • 推理

其中,预训练模型这步是关键之一,因为项目本身不提供任何音色的音频训练模型,所以如果你想要做一个新的AI歌手出来,需要自己训练模型。

而预训练模型的第一步,是准备干声,也就是无音乐的纯人声。

很多博主使用的工具都是UVR_v5.5.0。

推特博主@歸藏介绍说,在处理前最好把声音格式转成WAV格式,因为So-VITS-SVC 4.0只认这个格式,方便后面处理。

想要效果好一些,需要处理两次背景音,每次的设置不同,能最大限度提高干声质量。

得到处理好的音频后,需要进行一些预处理操作。

比如音频太长容易爆显存,需要对音频切片,推荐5-15秒或者再长一点也OK。

然后要重新采样到44100Hz和单声道,并自动将数据集划分为训练集和验证集,生成配置文件。再生成Hubert和f0。

接下来就能开始训练和推理了。

具体的步骤可以移步GitHub项目页查看(指路:https://github.com/svc-develop-team/so-vits-svc)。

3.全面接入:ChatGPT杀进15个商业应用,让AI替你打工

ChatGPT API开放60多天,世界已经不是两个月前的样子了。 

近日,有平台全面梳理了市面可见的类ChatGPT应用,发现在办公软件、社交文娱、营销广告、家庭助理四大方向的15条赛道,AI大模型技术正出现落地的萌芽。 

其中不仅有国民级的Office工具、钉钉等协同办公平台接入大模型,还有来自办公、电商、家居、社交文娱互联网平台推出AIGC功能,甚至以智能汽车、AR眼镜为代表的实体终端也上了大模型,带来新奇体验。 

Image
Image
Image

类ChatGPT技术的落地仍处于早期阶段,但AI大模型应用创业已经热起来了。 

从知名投资团队启明创投的一张统计图可以看到,根据其与100多家企业交流统计,生成式AI创业覆盖的86%是应用领域,具体涉及聊天机器人、智能助手、AI服务、生产力工具、下一代交互等多个方面,追溯下一层具体场景更是门类众多。 

Image

生成式AI创业领域分布图(图源:启明创投)

新品发现

1.塔罗占卜GPT上线,工作感情运势都能问,几天上万次访问

现如今,LLM已经无孔不入,就连玄学领域也在劫难逃。

这款塔罗GPT可以扮演占卜师,为你“指点迷津”。

上线短短几天,在所在平台就已产生万余次交互,仅次于乔布斯机器人。

Image

我们实测发现,无论是询问具体的工作和感情问题,还是直接预测宏观的运势,它都能给出合理的答案。

同时,每个问题我们都询问了两次,以确保它真的是在占卜。

第一个问题关于升职。

这款Copilot给出了详细的分析,燃鹅,重复询问时得到的结果连标点符号都毫无二致。

Image

第二个问题则关于爱情。

这款Copilot象征性地问我是不是想自己抽牌,但马上就直接越俎代庖。

Image

不过这次,总算是没有出现问了两次答案都一模一样的情况。

Image

通过和塔罗牌教程进行对比,我们发现这款Copilot给出的解释基本上符合塔罗牌自身的含义。

需要说明的是,这个机器人本身不是LLM,而是根据提示工程原理,将用户输入的内容进行加工,再调用LLM的产物。

虽然开发者并未介绍究竟调用了哪款API,但我们简单问一下它就露出了鸡脚马脚。

Image

实际上它就是调用了ChatGPT接口,在它出现回答中断的时候就预感到了。

不过和直接使用ChatGPT相比,后者并不能得到答案。

传送门(数据模式):
https://app.copilothub.ai/copilot/create/data
传送门(提示模式):
https://app.copilothub.ai/copilot/create/promot

2.IBM亮王炸!推出大模型Watsonx,7月将开源!

美东时间5月9日,IBM召开“Think”大会,重磅推出了大模型Watsonx,全面深度布局生成式AI领域。(测试申请:https://www.ibm.com/account/reg/cn-zh/signup?formid=urx-52149)

据悉,Watsonx由三大块组成,基础模型watsonx.ai;

基于开放式 Lakehouse 架构构建的专用数据存储平台watsonx.data;

用于AI安全治理的watsonx.governance。

在这三大平台赋能下,可为用户提供一站式安全可靠的生成式AI服务。

此外,IBM宣布成立了一个由1,000多名技术专家组成的生成式AI卓越中心,将帮助客户构建和部署Watsonx大模型。

IBM还与开源社区Hugging Face 进行深度技术合作,为 watsonx平台上的企业带来更好的开源生成式AI模型体验。根据IBM官方介绍,预计7月份,watsonx.ai将在Hugging Face平台上开源。

Image

3.视觉中国,上线生成式 AI 创意工具

5月8日,IT之家从视觉中国官方获悉,视觉中国旗下网站 vcg.com 继上线首个 AIGC 应用产品 ——AI 智能搜索后,再次上线 AIGC 新功能 —— 基于生成式 AI 技术的创意工具。

据介绍,用户可通过使用 AI 创意工具 —— 模特转换、插画转换功能在线对版权图片进行二次创作,从而获得更好的用户体验与更高的工作效率。在客户下载二次创作的图片并确认付费后,原版权图片的创作人依然可以获得相应分成收益。

目前,AI 创意工具仅开放模特转换和插画转换两个功能。在 vcg.com 网站中支持 AI 创意工具的图片,在图片详情页会带有“AI 创意工具”标识。

在模特转换功能中,目前仅支持单个人物的欧美人像摄影作品进行转换;在搜索结果页,图片右下角带有“模特转换”标识的内容即可使用该功能。

在插画转换功能中,只有摄影图片才可转换为插画。视觉中国表示,后续还将解锁更多 AI 创意工具,比如画面扩展、智能修图、灵感绘图、商品背景合成等。

目前,AI 创意工具已在视觉中国旗下 vcg.com 网站上线,仅对部分签约客户开放,仍处于 Beta 版本。

国内资讯

1.百度交流会大玩心跳!现场实时调教大模型,炸出背后更强底座文心千帆

5月9日的百度智能云的文心大模型技术交流活动现场,文心一言先是化身“文心问数”,秀了一把分分钟数据可视化的能力。

Image

但下一分钟,“出bug”的一幕就给逮住了:在面对画折线图的需求时,文心一言压根没懂,来了一句“换个问题试试”。

Image

这是上演直播事故了?台上的程序员小哥,却十分淡定,随即调出了一个新界面——文心千帆大模型平台。

结果下一步操作,直接让现场观众纷纷举起手机录像:现!场!微!调!大!模!型!

只见他当场新建了一个微调数据集。

Image

导入的是这样一份数量在100条左右的标注数据。

Image

一通可视化操作下来,不过10几分钟之后,当文心一言再次被要求:

华北地区2019年3月的销售额,用折线图表示。

它就已经完全不糊涂,能快速给出正确的结果了。

Image

不错,“现场调教”,恰恰是这一次技术交流活动中,文心一言最受关注的升级重头戏。

因为这就意味着,在百度围绕文心一言搭建起的工具链中,仅需少量数据,最快几分钟,大模型就能完成一次“定制化”,这也是国内第一个现场演示如何微调行业专属大模型的全过程。

更重要的是,通过已在内测中的文心千帆大模型平台,这样的训练调优经验和技术,已经可以向第三方输出了。

Image

2.真假之争?网友点燃讯飞星火质疑热点,我们深度实测给您答案!

最近几天,科大讯飞刚刚发布的星火大模型实火。

各种说法甚嚣尘上,有人吐槽称生成结果太「离谱」,甚至还有人说是它是「套壳」OpenAI的ChatGPT!

对此,星火表示:「和OpenAl没有关系,我是由科大讯飞优秀的人工智能科学家工程师和语言学家等组成的团队自主研发的。」

Image

说实话,对网上流传的一些关于星火套壳的图,并不让人意外。毕竟通过特定prompt的引导或者直接在线p图,去调教LLM去生成各种「定制」的答案,不是啥难事。

既然大家都很好奇星火的实力到底如何,模型又已经开放公测,那不如我们来个现场实录。先让它用鲁迅的口吻写一段emo的话。

Image

诶?居然很不错。

在鸡兔同笼等小学数学题上,它表现也还是比较亮眼的。

偷得浮生半日闲。「gap day」的出现像是车辆的刹车踏板,于是我们问了星火关于「gap day」的问题。

Image

职场人要工作与生活平衡,星火还是很懂「gap day」的。

当然,星火除了让人眼前一亮的表现,也有不少翻车的时刻。

Image

对于讯飞星火认知大模型,科大讯飞董事长刘庆峰直言,目前大模型依然存在不少待攻克的技术缺陷。

这些问题具体就包括:

问题1:新知识难以及时更新

问题2:事实类问答容易「张冠李戴」

问题3:史实、传统典籍等容易「编造情节」

网传「套壳」?

现在的大型语言模型,你要是故意去「引导」,就会遇到很多让人「啼笑皆非」的问题。

这不,ChatGPT也「承认」自己是谷歌开发的了。

Image

3.北大、西湖大学等开源「裁判大模型」PandaLM:三行代码全自动评估LLM,准确率达ChatGPT的94%

为了解决「大模型评估问题」,来自北京大学、西湖大学、北卡罗来纳州立大学、卡内基梅隆大学、MSRA的研究人员合作开发了一个全新的语言模型评估框架PandaLM,致力于实现保护隐私、可靠、可复现及廉价的大模型评估方案。

Image

项目链接:

https://github.com/WeOpenML/PandaLM

提供相同的上下文,PandaLM可以比较不同LLM的响应输出,并提供具体的理由。

为了证明该工具的可靠性和一致性,研究人员创建了一个由大约1000个样本组成的多样化的人类标注测试数据集,其中PandaLM-7B的准确率达到了ChatGPT的94%评估能力。

4.阿里达摩院mPLUG-Owl大模型:追赶GPT-4多模态能力

纯文本大模型方兴未艾,多模态领域也开始涌现出多模态大模型工作,地表最强的 GPT-4 具备读图的多模态能力,但是迟迟未向公众开放体验,于是乎研究社区开始在这个方向上发力研究并开源。MiniGPT-4 和 LLaVA 问世不久,阿里达摩院便推出 mPLUG-Owl ,一个基于模块化实现的多模态大模型。

mPLUG-Owl 是阿⾥巴巴达摩院 mPLUG 系列的最新工作,延续了 mPLUG 系列的模块化训练思想,把 LLM 升级为一个多模态大模型。在 mPLUG 系列工作中,之前的 E2E-VLP 、mPLUG 、mPLUG-2 分别被 ACL2021 、EMNLP2022、ICML2023 录用,其中 mPLUG 工作在 VQA 榜单首超人类的成绩。

Image

论文链接:https://arxiv.org/abs/2304.14178

代码链接:https://github.com/X-PLUG/mPLUG-Owl

ModelScope体验地址:

https://modelscope.cn/studios/damo/mPLUG-Owl/summary

HuggingFace体验地址:

https://huggingface.co/spaces/MAGAer13/mPLUG-Owl

国际资讯

1.AI考公考编指日可待!微软华人团队发布全新基准AGIEval,专为人类考试而生

通用人工智能(AGI)的一个重要特点是模型具有处理人类水平任务的泛化能力,而依赖于人工数据集的传统基准测试并不能准确表示人类的能力。

最近,微软的研究人员发布了一个全新基准AGIEval,专门用于评估基础模型在「以人为本」(human-centric)的标准化考试中,如高考、公务员考试、法学院入学考试、数学竞赛和律师资格考试中的表现。

Image

论文链接:https://arxiv.org/pdf/2304.06364.pdf

数据链接:https://github.com/microsoft/AGIEval

研究人员使用AGIEval基准评估了三个最先进的基础模型,包括GPT-4、 ChatGPT和Text-Davinci-003,实验结果发现GPT-4在SAT、 LSAT和数学竞赛中的成绩超过了人类平均水平,SAT数学考试的准确率达到了95% ,中国高考英语考试的准确率达到了92.5% ,表明了目前基础模型的非凡表现。

2.游戏建模师直呼失业!OpenAI再放杀器Shap-E:史上最快的文本转3D模型,代码、模型全开源

去年12月,OpenAI曾发布Point-E模型,只需几秒钟即可根据文本生成3D资产,相比竞品模型DreamFusion提速大约600倍。

最近OpenAI再次发布了一款升级模型Shap-E,相比基于点云的显式生成模型Point-E,Shap-E直接生成隐函数的参数来渲染纹理网格和神经辐射场,收敛速度更快,在更高维的多表示输出空间中实现了更好的样本质量!

Image

代码链接:https://github.com/openai/shap-e

Image

—The end—

声明:以上仅做个人分享,不构成投资建议。