土匪投资日记

一周时间,又多了好几个AI新品丨ChatGPT&AI 最近信息汇总11

具,请直接点击文末阅读原文

本周大新闻:AI大模型ChatGPT取得突破性进展,国内外大模型和AI新品争相发布。技术更迭速度加快,人机交互迅速优化,效率革命要开启了吗?

热门资讯

1

1.真实测评|中文GPT Office来了!不造概念,WPS AI真落地了

2.Stability AI开源类ChatGPT模型,支持文本问答、代码生成,允许商业化!

3.写周报、改代码,连续互动20轮,国产类ChatGPT新玩家「天工」来了

4.微软 Bing Chat 上线 AI 文档聊天功能,真好用!

5.钉钉,把AI“收了”

行业要闻

2

1.当「分割一切」遇上图像修补:无需精细标记,单击物体实现物体移除、内容填补、场景替换

2.人美声甜GPT,数学题哪里不会讲哪里

3.图片+音频秒变视频!西交大开源SadTalker:头、唇运动超自然,中英双语全能,还会唱歌

公司动态

3

1.Adobe「萤火虫」再次炸场:玩转视频制作,或颠覆设计行业

2.重磅!微软为ChatGPT自研AI芯片,台积电5nm,最早明年开用

3.知乎大模型「知海图AI」上线!产品官宣即内测,为4亿用户摘取「热榜摘要」

观点荟萃

4

马斯克着手开发TruthGPT来最大限度寻找真相,以对抗ChatGPT

我和团队持续在关注ChatGPT ,我们会每周统计最近七天左右的信息, 方便大家了解, 也欢迎大家和我们一起交流。

另外,为深入探讨 AI 发展和其机遇,我们联络了相关老师共同创办了知识星球『AI商业观察』,加入者可获 AI最新发展情报、资源 以及 无需翻墙的AI链接 ,还有详细的指导教程哦~

名额有限,对此感兴趣的你,欢迎进来抢先学习和体验!

Image

热门资讯

1.真实测评|中文GPT Office来了!不造概念,WPS AI真落地了

4月18日,金山办公展示了其具备大语言模型能力的生成式AI应用——WPS AI!

据官方介绍,WPS AI是国内协同办公赛道上的首个类ChatGPT式应用。

它的第一站,便是搭载到金山办公新一代在线内容协作编辑产品——轻文档上,而在未来,WPS AI将嵌入金山办公全线产品。

emmm……不会又是PPT演示吧,造概念就完了,老互联网大厂的操作了对不对。

但是金山办公CEO章庆元很快就对外表示,官方发布的实际产品视频和截图,并非PPT概念,大模型由国内合作伙伴MiniMax提供。后续能力预计未来几周陆续可以和用户见面,同时也在推进合规方面的产研工作,争取早日可以公测。

话不多说,直接看演示,前方高能预警。

2.Stability AI开源类ChatGPT模型,支持文本问答、代码生成,允许商业化!

4月19日,Stability AI在官方博客宣布推出全新大语言模型StableLM。

这是一个类ChatGPT模型,支持文本问答、创意写作、代码生成等功能。

据悉,StableLM推出了30亿、70亿参数两种版本,后续还将推出150亿和650亿,1750亿的大参数也在计划中。该模型允许商业化但必须遵守CCBY-SA-4.0许可的条款。

支持中文,但可能会出现偏差,StableLM也在持续优化中。StableLM仅用10个小时github已突破3000颗星,其高性能低资源消耗非常适用于中小型企业和个人开发者,普通笔记本也能运行。

开源地址:https://github.com/stability-AI/stableLM/

测试地址:https://huggingface.co/spaces/stabilityai/stablelm-tuned-alpha-chat

Image

Stability AI是全球知名文本生成图片平台Stable Diffusion的开发商,其主要竞争对手是Midjourney。同时Stability AI也是最早开源扩散模型平台之一,现在通过发布StableLM切入大语言模型领域,这为Stability AI以后推出多模态类似GPT-4模型奠定了基础。

Stability.ai 还把 StableLM 托管在了 HuggingFace 的社区网站上,想抢先体验的朋友可以到以下地址调戏它⬇️ 

https://huggingface.co/spaces/stabilityai/stablelm-tuned-alpha-chat

3.写周报、改代码,连续互动20轮,国产类ChatGPT新玩家「天工」来了

4 月 17 日,新⼀代大语言模型「天工」正式开启邀请测试。

该模型由昆仑万维与奇点智源联合研发,是国内首个对标 ChatGPT 的双千亿级大语言模型。

Image

官网链接:tiangong.kunlun.com

作为一款大语言模型,「天工」拥有强大的自然语言处理和智能交互能力,能够实现智能问答、聊天互动、文本生成等多种应用场景,并且具有丰富的知识储备,涵盖科学、技术、文化、艺术、历史等领域。

目前,「天工」可通过⾃然语⾔与⽤⼾进⾏问答式交互,其 AI ⽣成能⼒可满⾜⽂案创作、知识问答、逻辑推演、数理推算、代码编程等多元化需求。

从目前发布的版本来看,「天工」的完成度已经很高,能够回答多种类型的问题,支持超过一万字的文本对话,接近于「应用级」产品。

而在官宣的公告中,我们还看到这样一句描述:「中国第一个真正实现智能涌现的国产大语言模型」。

4.微软 Bing Chat 上线 AI 文档聊天功能,真好用!

过去一个月,互联网上诞生了无数优质的 AI 文档对话工具,如 ChatPDF、ChatPaper、ChatDoc 等等,它们都无一例外的吸引了大量用户。

AI 文档对话的重要性,由此可见一斑。

现在,Bing 也支持在 Edge 浏览器上跟 AI 进行对话了,你可以让它汇总页面信息,甚至直接与 PDF 对话。

也即是说,通过 Edge,我们可以做到Talk to everything with Bing

这个方法不局限于本地的 PDF 文件。凡是在网页上阅读的 PDF 论文、学术报告、行业调研报告,我们都可以用 Bing Chat 来与其对话。

我随便丢了个 Git 中文教程《Pro Git》进行尝试,发现效果还挺不错。

Image

下面跟大家讲下具体操作方法:

  1. 打开 Microsoft Edge 浏览器;

  2. 登录 Microsoft 账号(需要已经拥有 Bing Chat 权限);

  3. 打开右上角的 Bing Chat 图标,开始对话。

使用过程中,如果提示:

"允许 Microsoft 访问您的浏览器网页内容,以便启用网页相关的聊天响应,选择文本并提供编辑帮助,生成页面摘要等功能。"

输入「打开」或者「Turn on」即可。

据预测,接下来 Bing 还会集成不少 AI 功能,以撼动 Google 在搜索引擎上的霸主地位。

如果 Google 不及时跟进,并实行强有力的应对措施,浏览器这个入口将慢慢被 Edge 蚕食。

5.钉钉,把AI“收了”

新版钉钉表面看起来依然也是没什么大变化,AI能力全被收进这样一道斜杠“/”里。

为什么是一条“/”?

先来看看斜杠在不同场景下都能做到什么,又是如何发挥作用。

首先是最容易想到的文档,在指定位置敲上“/”紧跟所需的内容描述,就能召唤AI生成好内容。

原本是多人在线协作文档,从此增加了人机协作的新维度。人类只需要把握方向搭好骨架,AI来填充血肉。

另外虽然钉钉这次没有展示,但同样的功能用在邮件上想必也没什么问题。

Image

如果说文档、邮件属于人与人之间的非同步沟通,在视频会议这种同步沟通场景上AI同样有用武之地。

实时生成多语字幕属于基本操作了,钉钉这次重点展示的功能是“智能摘要”:

在会议过程中按下“/”,获得一份对目前为止讨论内容的总结。

一方面,如有中途加入会议或暂离后又回来的成员,也可以不用打断会议进程,迅速了解情况。

另一方面,如果会议进行时间较长,也可以通过此功能对之前内容做整体回顾,及时跟上节奏。

Image

当然,斜杠-输入文字,只是新型人机交互的其中一种表现形式,其内核在于将AI与工作流程的有机整合。

过去,当人们需要一段文字会去搜索或去问ChatgpT、需要一张图片会去打开PS又或者Midjourney。

钉钉想做的,是让人们不必打断当前工作流程,在适当的时间适当的地点,用最简单的动作按需调动AI能力。

行业要闻

1.当「分割一切」遇上图像修补:无需精细标记,单击物体实现物体移除、内容填补、场景替换

这次,强大的「分割一切」模型——Segment Anything Model,在图像修补任务上碰撞出了火花。

4 月初,Meta 发布了史上首个图像分割基础模型--SAM(Segment Anything Model)[1]。作为分割模型,SAM 的能力强大,操作使用方式也十分友好,比如用户简单地点击来选择对应物体,物体就会立即被分割出来,且分割结果十分精准。截至 4 月 15 号,SAM 的 GitHub 仓库的 Star 数高达 26k。

Image

如何利用好如此强大的「分割一切」模型,并拓展到更加有实际需求的应用场景至关重要。例如,当 SAM 遇上实用的图像修补(Image Inpainting)任务会碰撞出什么样的火花?

来自中国科学技术大学和东方理工高等研究院的研究团队给出了令人惊艳的答案。基于 SAM,他们提出「修补一切」(Inpaint Anything,简称 IA)模型。区别于传统图像修补模型,IA 模型无需精细化操作生成掩码,支持了一键点击标记选定对象,IA 即可实现移除一切物体(Remove Anything)、填补一切内容(Fill Anything)、替换一切场景(Replace Anything),涵盖了包括目标移除、目标填充、背景替换等在内的多种典型图像修补应用场景。

Image

论文链接:http://arxiv.org/abs/2304.06790

代码库链接:

https://github.com/geekyutao/Inpaint-Anything

2.人美声甜GPT,数学题哪里不会讲哪里

ChatGPT一炮而红,重塑搜索、办公协同等多个场景和行业后,在线教育,被视为最重要的垂直场景——毕竟大语言模型展示出的能力,正是之前在线教育、AI老师所亟需的。

而且这种趋势已经开始,背靠大模型相关的在线教育应用,已经率先在海外火爆。

看过来!让GPT化身二次元美少女AI家教来讲数学题的方案,每步都有解法,再不用担心看见参考答案的“略”字:

Image

基础到某个三角函数的定义,复杂到不同的解题方法与技巧,都能得到答案:

Image

这就是最近在海外火爆的AI解题类应用,背后App已经在App store商店教育分类板块刷榜。

这种火爆在情理之中:背靠LLM,加上二次元画风颇似《原神》——不得不说,真实拿捏住了流量密码。

在这之前,在线教育行业的主流“AI家教”,背后的本质只是推荐算法,换句话说,就是推荐录好的教学视频或解题方法,但无法针对视频和方法中的某些细节给出解答。

而现在,LLM涌现的解题准确性和语言理解能力,开始对之前可望不可即的技术实现带来了突破——不是在线教育面临重塑,是整个教育产业正在面临重塑。

3.图片+音频秒变视频!西交大开源SadTalker:头、唇运动超自然,中英双语全能,还会唱歌

最近来自西安交通大学等的研究人员提出了SadTalker模型,在三维运动场中进行学习从音频中生成3DMM的3D运动系数(头部姿势、表情),并使用一个全新的3D面部渲染器来生成头部运动。

Image

论文链接:https://arxiv.org/pdf/2211.12194.pdf

项目主页:https://sadtalker.github.io/

音频可以是英文、中文、歌曲,视频里的人物还可以控制眨眼频率!

为了学习真实的运动系数,研究人员显式地对音频和不同类型的运动系数之间的联系进行单独建模:通过蒸馏系数和3D渲染的脸部,从音频中学习准确的面部表情;通过条件VAE设计PoseVAE来合成不同风格的头部运动。

最后使用生成的三维运动系数被映射到人脸渲染的无监督三维关键点空间,并合成最终视频。

最后在实验中证明了该方法在运动同步和视频质量方面实现了最先进的性能。

目前stable-diffusion-webui的插件也已经发布!

公司动态

1.Adobe「萤火虫」再次炸场:玩转视频制作,或颠覆设计行业

一个月前,Adobe 发布 Firefly 的消息引起了整个科技领域关注,在 Adobe 全家桶之下,有的产品已经进入了 AIGC 领域。

Image

今天 Adobe 再进一步,宣布将 Adobe Firefly 引入 Adobe 的视频、音频、动画和动态图形设计应用程序。

新版的 Firefly 可以让任何人轻松地编辑视频,说几个字让 AI 自动进行颜色分级,添加背景音乐和声音效果,创建带有动画的字体、图形和徽标。Firefly 也承诺会自动将导演脚本转换为故事板和预可视化动画 —— 直接从草图生成动画。

这就有点可怕了。

据介绍,Adobe Firefly for Video 正在探索的几项能力包括:

文本到颜色增强:可以更改配色方案、一天中的时间,甚至是已录制视频中的季节,立即改变情绪和设置以唤起特定的基调和感觉。通过一个简单的提示,比如你说「让这个场景感到温暖和诱人」,AI 就可以做到改换视频色调。

高级音乐和音效:创作者可以轻松生成免版税的自定义声音和音乐。

令人惊叹的字体、文字效果、图形和徽标:只需几个简单的单词,创作者就可以在几分钟内生成字幕、徽标和标题卡以及自定义上下文动画。

强大的脚本和 B-roll 功能:创作者可以使用脚本到文本的 AI 分析来显著加快预制作、制作和后期制作工作流程。

创意助手和副驾驶:借助个性化的生成式 AI 驱动的 “操作方法”,用户可以掌握新技能并加快从最初构想到创作和编辑的过程。

2.重磅!微软为ChatGPT自研AI芯片,台积电5nm,最早明年开用

4月18日消息,据外媒The Information报道,微软公司正在研发代号为“Athena”(雅典娜)的AI芯片,为ChatGPT等AI聊天机器人提供技术支持。

消息人士称,微软自2019年以来一直在推进Athena芯片研发项目,项目由微软CEO萨蒂亚·纳德拉(Satya Nadella)牵头,专为大语言模型的训练和推理而设计。

Athena目前正由一小群微软和OpenAI员工进行测试,初代芯片可能基于台积电5nm工艺。尚不清楚该芯片是能够部分替代英伟达(NVIDIA)A100、H100等GPU的通用AI加速器,还是用以辅助提升GPU性能的AI芯片,有业内分析师推测可能是前者。

研究公司SemiAnalysis分析师称,微软每年在Athena研发投入可能在1亿美元左右,如果顺利,微软将通过Athena将每颗芯片成本降低三分之一,从而为ChatGPT发展提供重要动力。

ChatGPT掀起AI新竞赛愈演愈烈,包括亚马逊、谷歌在内的其他大型科技公司都布局了AI芯片,现在,微软也正试图将算力这张“底牌”完全握在自己手里。

3.知乎大模型「知海图AI」上线!产品官宣即内测,为4亿用户摘取「热榜摘要」

又一家国内企业大模型产品发布。

不是别的,而是已拥有4亿用户的最大中文问答社区知乎。

而且官宣即内测——

不光有首个大语言模型「知海图AI」,首款产品也将应用于热榜。

Image

这样一来,看热门问题的同时就能获取关键信息,效率直接拉满。

而这背后的大语言模型CPM-Bee,来自当下饱受市场关注的清华系大模型创业公司面壁智能。

据知乎联合创始人、CTO李大海介绍,CPM-Bee是目前视野范围内表现最好的中文大语言模型。

面壁智能联合创始人兼CTO曾国洋,也给出了官方内测表现:

内容聚合场景下,在41个问题中,有28个问题表现持平。与GPT-4相比基本持平。

名人动态

1.马斯克着手开发TruthGPT来最大限度寻找真相,以对抗ChatGPT

当地时间4月17日,根据福克斯新闻频道对埃隆·马斯克的独家专访,马斯克将着手开发ChatGPT的替代品——TruthGPT。

马斯克表示,这主要是因为他认为ChatGPT存在说谎、控制言论等问题,以及如果对人工智能(AI)管理不善,将会对整个人类的生存产生灾难性的影响。

而TruthGPT将是一种最大限度寻求真相的AI,以便理解宇宙(包括我们人类)的本质。马斯克表示,一个专注于认识宇宙的AI将不会对人类造成威胁。

事实上,2月17日,马斯克就在推特上表示,我们需要的是TruthGPT(What we need is TruthGPT)。

2月18日,TruthGPT的官方推特(建于2月17日)上称,为了尽量减少潜在的偏见,AI系统应该依赖来自可靠来源的事实信息,例如科学研究、可信度高的新闻媒体和政府的官方记录;AI系统还应该可以检测并避免误导性信息。

—The end—

声明:以上仅做个人分享,不构成投资建议。