Geek Savvy

盘点丨12月一些有趣、重磅的AI产品

Image

2024年即将结束,最近的 AI 产品可谓是层出不穷,很多科技公司正竞相在推出自家的 AI 产品,OpenAI、谷歌、Meta、Anthropic、腾讯、月之暗面、字节等国内外科技公司都在做最后的冲刺,年底了,大家都在赶 KPI ,为了回家过个好年,2024 AI 元年在12月变得混沌起来了。

今天,我们就来盘点盘点最近的一些有趣的产品。

由于谷歌、OpenAI最近发布的东西比较多,就分为谷歌、OpenAI、还有一些国内外有趣的AI产品3部分。

沉睡的巨人正在觉醒:谷歌

OpenAI 连续12天的发布会被 Google 狙击了,谷歌发布了以 Gemini 2.0 为中心的版本(数量多得令人惊讶) ,这是谷歌的下一代 AI 模型。 

Flash 1.5 比 Gemini 1.5 Pro 更快、更便宜,但在任何基准测试中都不如 Gemini 1.5 Pro。现在,Gemini 2.0 Flash 几乎在所有指标上都优于 1.5 Pro:

  • 比 1.5 Pro 便宜

  • 速度是 1.5 Pro 的两倍

  • 各项基准测试中的表现均比 1.5 Pro 好得多

简而言之:更便宜、更快、更好,并且加入了Agent。 

谷歌深夜发布Gemini 2.0,Agent+多模态重磅来袭!

01 

Project Mariner 是由 Google DeepMind 开发的一款能够直接导航 Web 界面的原型项目,它基于 Gemini 2.0 技术构建,旨在探索未来人机交互的新方式,特别是从浏览器开始。这个项目的核心能力在于能够理解和推理浏览器屏幕上的信息,包括每个像素点、文本内容、代码、图像和表单等网络元素,然后通过实验性的 Chrome 扩展程序使用这些信息来完成任务。

Project Mariner 现在在执行复杂的 Web 任务时成功率达到 83.5%。Project Astra 可充当真正的 AI 助手,能够记住 10 分钟的对话内容,并与 Google 的生态系统无缝集成。两者都升级了 2.0 Flash,效果有了明显的提升。

02

现在可以使用 Gemini 2.0 Flash 来提升游戏体验。Gemini 2.0 Flash 本身也是多模态的 —— 它可以接收文本、音频、图像和视频。谷歌的多模态能力还是可以的,它已经在理解图像和视频方面做的非常不错,当然,对于中文的理解能力有时候不太行。

Gemini 2.0 不仅能理解图像和视频;它还能实时推理它们——无需等待响应。流式 API 支持并发音频/视频会话(每个会话 15-20 分钟的音频、2-3 分钟的视频)。对于许多开发人员来说,这些都是全新的能力,之后,我们应该可以看到一些我们从未见过的新工具的出现。

03 

Google 还单独发布了 Deep Research,这是一个有用的 Agent AI 工具。给它一个研究主题,它将通过数百个网站进行爬虫,根据学到的内容细化搜索,然后提供一个全面的报告和引用。但也有缺点,写作输出的内容 AI 味还是重了些,但它将三小时的研究任务缩减为三分钟的任务。

Deep Research:

https://blog.google/products/gemini/google-gemini-deep-research/

04 

谷歌推出了一款量子计算芯片 Willow ,它可以在几分钟内完成超级计算机需要数十亿年才能完成的计算。虽然尚未准备好投入商业使用,但这一突破使量子计算更接近实际应用,例如天气预报、药物研发和供应链优化,同时比传统超级计算机消耗更少的能源。

AI独角兽:OpenAI

OpenAI 年底连续12天工作日的发布会,可谓是真正的年货节了,毕竟拿了那么多钱,画了那么多饼,年底了,肯定要有所交代。

12天的直播已经进行了7天,我们来看看者7天的发布了什么。

Day 1

o1、o1pro正式上线,还上了一个 GPT Pro 会员,200刀,Plus 用户只能使用o1模型,并且每周限制50条,Pro 用户使用o1、o1pro 就没有次数限制。

Day1:AI自媒体熬了个寂寞

Day 2

o1强化微调,不过还是一个期货产品,到2025年第一季度才逐步开放,强化微调可以基于少量数据将模型微调成一个邻域专家,这个还是挺实用的。

OpenAI Day2有点惊喜!o1模型将支持用户强化微调!可达博士水平!

Day 3

鸽了快1年的期货产品 Sora 这个是上线。Plus 用户可以生成50个视频,时长为5秒,分辨率最高720p;Pro 用户可以生成500个视频,时长为最高为20秒,分辨率最高1080p。不过经过几天大家的测试,效果一般,可能是之前第一个打出这个概念,又是当时的 AI 老大,大家所报的期望太高了,不过热度还是有的,发布第2天就宕机了。

Day3丨鸽了1年,OpenAI终于把Sora放出来了!

Day 4

ChatGPT 上线 Canvas 画布功能,向所有用户开放,这个功能在文字工作、审稿、编程测试等方面还是挺好用的。

Day4丨Canvas,万物皆可画布!

Day 5

苹果设备接入 ChatGPT ,一键唤醒,不过国内的都用不了。

OpenAI Day5丨Siri一键唤醒ChatGPT

Day 6

GPT 4o 上线实时视频通话和屏幕共享,发布后一周陆续发放,还有一个圣诞老人的语音模式,月底就下架了。

OpenAI Day6丨GPT-4o实时视频通话它真的来了!

Day 7

ChatGPT 上线 Projects 新建文件夹功能,可以将聊天记录、文件、自定义的指令拉到同一个地方,方便协作管理,向Plus、Pro用户开放。

OpenAI Day7丨新增功能:新建文件夹

一些有趣的AI新产品

01 

DeepSeek 发布 V2.5的最终版微调模型 DeepSeek-V2.5-1210,提升了模型各个方面的能力,包括数学、代码、写作、角色扮演等,同时,还支持上传文件和联网搜索。

还有一个视觉模型,DeepSeek-VL2,VL2 采用 MoE 架构配合动态切图,从视觉定位到梗图解析,从 OCR 到故事生成,从3B、16B 再到27B,DeepSeek-VL2 也正式开源。

模型下载:https://huggingface.co/deepseek-ai

GitHub主页:https://github.com/deepseek-ai/DeepSeek-VL2

02

Liblib推出“星流”beta 版 AI 图像生成平台,以帮助创作者进入心流状态而设计。星流 beta 版,上手门槛低,提供多样化的图片生成风格,并拥有无限画布功能,集成了专业工作流和各类编辑工具。目前处于Beta测试阶段,正式版预计明年第一季度上线。

体验地址:https://www.xingliu.art/

03

在 OpenAI 发布 Sora 前几天,腾讯推出了开源 AI 视频生成模型“浑元”。虽然 Sora 擅长照片级真实感,但在捕捉流畅的动作方面却很一般,“混元”是迄今为止最大的公开视频模型,可以更好地捕捉逼真的动作,展示人们冲浪和气球飘走的场景。

https://www.scmp.com/tech/big-tech/article/3289260/tencent-launches-its-answer-openais-sora-text-video-tool

04

Meta 宣布推出 Motivo,这是一种人工智能模型,旨在为数字世界中的数字化身和非玩家角色创建栩栩如生的动作。

https://www.reuters.com/technology/artificial-intelligence/meta-releases-ai-model-enhance-metaverse-experience-2024-12-13/

Meta 还推出了大型概念模型 (LCM),该模型经过训练可以预测下一个抽象的“概念”,而不是预测下一个语义标记。

https://ai.meta.com/blog/meta-fair-updates-agents-robustness-safety-architecture/

05

Midjourney 正在试验 Patchwork, 这是一款协作式故事讲述应用和“世界构建工具”,其中每个“世界”都由自己的无限画布表示,最多可与 100 位创作者共享。Patchwork 仍处于研究阶段,其 AI 生成的角色以及自定义叙事和设置功能可满足游戏设计师、品牌战略家和其他创意专业人士的需求。

https://x.com/midjourney/status/1866964271948763553

https://venturebeat.com/ai/midjourney-is-launching-a-multiplayer-collaborative-worldbuilding-tool/

还有,在最近两起诉讼指控该平台助长未成年人自残行为后, Character.AI为青少年开发了一款新聊天机器人。这款专为青少年设计的聊天机器人将于明年年初推出,更为保守,会过滤掉浪漫内容,并包含自杀预防资源和家长控制等功能。

https://www.theverge.com/2024/12/12/24319050/character-ai-chatbots-teen-model-training-parental-controls

06

Devin和Replit 的Agent均已公开发布。前者是 Cognition Labs 生产的 AI 软件工程助手,而后者是一款 AI 编码工具,仅通过聊天即可实现端到端软件创建。这两款产品代表了两种对未来编码的相互竞争的愿景,Devin 的自动化与 Replit 的互动方式。

https://www.cognition.ai/blog/devin-generally-available

https://blog.replit.com/new-ai-assistant-announcement

07

Friend,这个有争议的AI可穿戴设备,旨在对抗孤独, 额外筹集了540万美元。CEO Avi Schiffman在今年夏天,Friend 推出时声名狼藉,当时他花费了180万美元购买域名,Friend.com,这是其最初的190万美元投资的一部分。从那时起,这款社交应用因其可疑的 AI 聊天机器人角色而受到关注。

https://www.theverge.com/2024/12/9/24315126/friend-pendant-artificial-intelligence-companionship-avi-schiffmann

08

哈佛大学和谷歌计划制作一个包含 100 万本公共领域书籍的开源 AI 训练数据集,其规模是用于训练Meta 的开源 Llama 模型的数据集的五倍。该数据集由哈佛法学院的机构数据计划 (IDI) 支持,该计划是一项让学术研究人员更接近 AI 的研究项目,其目标是为任何想要培训法学硕士的人“提供公平的竞争环境”。

https://www.wired.com/story/harvard-ai-training-dataset-openai-microsoft/

好了,有趣的AI产品就先盘点到这里,有落下的欢迎大家评论区补充。

今晚凌晨2点,是OpenAI直播的第8天,接下来还有5天,有什么值得期待的呢?猎户座模型(GPT5)?Agent?Computer Use?Dalle 4?希望OpenAI能在最后给我们发一个大年货,大家都好回家过个好年。