Geek Savvy

ChatGPT多模态将于两周内上线

AI

BRAIN

人工智能更像是一门人文学科。其本质,在于尝试理解人类的智能与认知。

                ---塞巴斯蒂安·特伦

AI

ChatGPT可以说话、收听、处理图像了

在3月的GPT-4发布会上,OpenAI总裁Greg Brockman做了一个令人惊讶的动作。他在草稿纸上画了个简单的草图,拍了张照后,GPT-4在10秒钟内就生成了这个网站的代码。
Image
这显示出GPT-4已经具备了从图片中提取信息的能力。它可以从用户提供的图片中获取关键信息,并据此进行回答或完成任务。这比ChatGPT的“图片代码解释器”功能更贴近用户的使用场景。
比如用户可以拍张冰箱照,GPT-4就可以推荐今晚的菜单;旅游时拍个景点照片,它就能讲述这个景点的故事;拍数学题照片,它就能帮忙解答。
在示例中,用户给了GPT-4一张自行车照片,询问如何调低座椅高度。GPT-4根据车型,分析可能是快拆杆或螺栓固定,并给出了详细步骤。当用户表示不明白,特意圈出一个螺栓时,GPT-4马上识别它不是快拆杆,需要六角扳手。用户再给出工具箱照片,GPT-4也能正确识别出所需的扳手。
Image
此外,GPT-4还新增了语音交互功能,可以进行语音识别、转录和回复。用户可以用它为小孩讲睡前故事,或在吵架时求助。这利用了Whisper开源语音识别系统,以及新开发的文本转语音模型。GPT-4甚至可以在几秒音频内,合成逼真的语音效果。
Image
当然,语音和图像技术也带来新风险,如身份欺诈和技术误用。因此OpenAI进行了风险评估,并限制使用场景,与合作方共同应对。非英语用户也可能面临语音交互质量不佳的问题。总体来说,GPT-4的图片和语音能力使其更贴近用户,但也需要谨慎对待。

AI

往期文章

生成AI应用并不缺乏使用案例或市场需求。用户渴望AI使工作变简单,产出更出色。这解释了应用的热度,尽管存在初始急躁。

但我们仍需问:用户会长期使用吗?数据显示答案更倾向否定。与知名应用相比,生成AI应用的留存率较低,每日活跃用户占比不高,表明用户没从中获得持久价值。

生成AI目前面临的核心问题不是创造需求,而是证明价值。如何通过这些新工具真正改善用户生活,是需要解答的200亿美元的问题。

成功之道在于提升留存,为用户带来深层次价值,使其成为活跃用户。

我们不应因此绝望。生成AI仍处于初期,成长需要时间。我们看到良好的迹象,而失败通常源于可以识别和修正的原因。解决价值问题是我们当前的中心任务。

通过持续优化模型,以及创新界面与交互形式,我们能逐步提升生成AI的实用性。从早期新奇,到可靠解决问题,从个体工具到整体系统,生成AI正在稳步成长。

AI

第二阶段的路径与建议

当生成AI的新奇感逐渐消退,市场正在从炒作走向真价值。

创始人正在努力优化模型,改进用户体验,将早期的有趣Demo进化为完整的产品。与此同时,基础模型也在不断进步。

一些共识正在形成:

推理技术正在增强模型复杂思考的能力,迁移学习让模型适应特定领域,检索机制为模型提供上下文信息,新的开发工具简化构建AI应用。这些都是缩小期望与现实差距的关键。

与此同时,用户体验也在不断优化:多模式交互、新颖的编辑方式、由个体工具到协作系统,生成AI产品正在从简单走向复杂,从具备潜力到真正用得上。

当炒作平息,共识达成,我们对生成AI的第二阶段保持信心。技术进步和产品优化是驱动发展的双轮。

保持理性,关注产品与用户,这是我们对创始人的建议。技术本身并不足以支撑企业,最终成败在于是否真正解决了用户痛点。客户验证与产品迭代是成功之道。