Google Gemini,慢慢追上来了
Google 今年在大模型方面的动作明显快了起来。上周四,圈子里疯传 Gemini 2.0 Flash Experimental 模型的图片生成功能。
今天一早,打开 X,又看到几个有趣的 Gemini 更新,比如 Canvas 和 Audio Overviews。太酷了,我早上到公司,赶紧把账号升级到 Gemini Adavanced,体验了最新的能力。
怎么说呢?我感觉今年过完年之后, Google 像突然醒来一样。最近他们发布的新特性,一个比一个吸引人,并且还充分融合了 Google 的应用生态。我知道很多人还没体验过 Gemini 的新能力,所以今天就给大家做个介绍。
在 OpenAI 如日中天的那段时间,很多人预言 OpenAI 要彻底颠覆 Google。因为 ChatGPT 确实是新一代的搜索引擎。但最近,我体验 Gemini 的系列功能之后,觉得这话为时尚早。是的,OpenAI 在前面领跑,但 Google 在后面追赶的速度也并不慢,并且,肉眼可见,差距越来越小。
Gemini 更新的第一个重磅功能是:Canvas。其实去年 10 月,OpenAI 曾经发布过类似的功能。简单来理解,Canvas 突破了聊天机器人一问一答式的束缚,它可以支持用户在 Chat 应用中进行更丰富的操作,比如写文章,写代码。我做了个演示图,你可以看到具体的操作。
输入提示词:“帮我写一篇文章,总结 Gemini 最近的更新,要求不少于 2000 字。减少使用列表式的表达。文风参考 MacTalk”后,Canvas 会对应生成一篇文章初稿,这时候,我不需要再复制文本到另外一个编辑器里修改,Cavas 提供了简洁的编辑能力。
如果对某段话有疑问,或者希望 AI 二次调整,那选中对应段落,这时候 Gemini Canvas 会弹出几个按钮,右边的三个从上到下分别是:更改长度、更改语气、提出修改建议。国内很多文档产品的 AI 交互参考的都是参考 Notion AI,选中段落后弹出来一串长长的菜单.......我个人比较喜欢 Gemini 的设计。
当然,不只是写文章,Canvas 还能写代码。具体我不再做演示,这类 Vibe Coding 的产品现在太多了。
除此之外,Google 还把之前 NotebookLM 的播客生成功能集成到了 Gemini 中。只要我们上传一个文件,它就能够转换为“两个 AI 主持人之间的播客式讨论”,但目前只支持英文。目前我还没有被灰度到,下面截图是 X 上其他用户发的。
除了今天上线的两个功能外,我盘点了下三月 Gemini 的其他更新: