GenAI新世界

8月14日 AI 头条|谷歌正式发布Pixel 9 系列手机,AI 加持,799美元起售

Image
划重点:
  • 谷歌正式发布Pixel 9 系列手机,AI 加持,799美元起售

  • xAI 发布 Grok-2 测试版,性能超越 Claude 3.5 Sonnet 和 GPT-4-Turbo

  • ChatGPT 低调更新, 已使用最新版本GPT-4o 模型

  • 谷歌发布 Gemini Live 服务,和用户通过语音交互

  • 谷歌发布图片生成应用 Pixel Studio,将预装在 Pixel 9 系列手机上

  • 昆仑万维发布全球首个AI流媒体音乐产品Melodio

  • 快手发布新款 AI 对话应用 飞船,提供全方位 AI 陪伴功能

  • 谷歌推出 Call Notes AI 功能:本地运行,摘录通话内容

资讯详情:
谷歌正式发布Pixel 9 系列手机,AI 加持,799美元起售
谷歌今天凌晨举办新品发布会,正式推出 Pixel 9 系列手机,包括Pixel 9、Pixel 9 Pro和Pixel 9 Pro XL,以及折叠屏手机Pixel 9 Pro Fold四款。
谷歌 Pixel 9 系列全系搭载 Tensor G4 芯片,此外Pixel 9 / Pro 配备 6.3 英寸 OLED 直屏配备6.3英寸直屏,而Pixel 9 Pro XL配备6.8英寸直屏。谷歌还宣布Pixel 9 系列手机全面搭载了自家研发的 AI 技术 Gemini,并推出了一系列全新的 AI 功能。
售价方面,Pixel 9价格为799美元起,而Pixel 9 Pro和Pixel 9 Pro XL的起售价分别为999美元和1099美元。
Image
xAI 发布 Grok-2 测试版,性能超越 Claude 3.5 Sonnet 和 GPT-4-Turbo
品玩8月14日讯,马斯克旗下 AI 公司 xAI 今天宣布,推出Grok-2 测试版。其中包含两款模型,分别是 Grok-2 和 Grok-2 mini。
xAI 表示,Grok-2 是其在前一型号 Grok-1.5 的基础上向前迈出的重要一步,具有聊天、编码和推理等前沿功能。同时,xAI还推出了 Grok-2 mini,它是 Grok-2 的一个小而强大的版本。通过访问 X 上的实时数据,Grok-2 可以总结出当日新闻,同时支持中文以及文生图等功能,其图片生成功能由Flux.1模型提供支持。
Grok-2 的早期版本此前已"sus-column-r"的代号在 LMSYS 排行榜上进行了测试 。测试显示,其性能超过了 Claude 3.5 Sonnet 和 GPT-4-Turbo。
Grok-2 和 Grok-2 mini 目前正在𝕏上进行测试,所有用户均可以体验Grok-2 mini 模型,而付费用户可以提前体验到Grok-2 的效果。xAI还将在本月晚些时候通过企业 API 提供这两种型号。
Image
ChatGPT 低调更新, 已使用最新版本GPT-4o 模型
据 ChatGPT 官方消息,ChatGPT已在上周进行更新,使用最新版本的GPT-4o 模型。
据悉,该版本是OpenAI 根据用户反馈而更新的一个版本。新模型似乎能够进行更细致地分步推理,并给出更详尽的解释。OpenAI 的一位发言人表示,模型的推理过程并没有发生变化,ChatGPT 在描述其推理时主要是响应用户的特定提示。在正式公告之前,很多用户就已经注意到,ChatGPT 的表现似乎有所提升。
OpenAI 表示,他们正在努力寻找更好的方式来衡量和传达模型在行为上的改进。
Image
谷歌发布 Gemini Live 服务,和用户通过语音交互
据 9to5Google 报道,谷歌在 Pixel9 系列手机发布会上宣布,推出一项名为 Gemini Live 的生成式对话服务,允许用户通过语音和大模型交互。
用户可以通过 Gemini 页面右下角进入 live 界面,并通过麦克风进行交流。谷歌为 Gemini 增加了十种声音进行交流。谷歌表示,用户甚至可以按照自己的节奏说话,或在回答中途打断并提出澄清性问题,就像在人类对话中一样。
当前 Gemini Live 服务仅支持英文,且仅面向Gemini Advanced 订阅用户开放。
Image
谷歌发布图片生成应用 Pixel Studio,将预装在 Pixel 9 系列手机上
据 The Verge 报道,谷歌今日凌晨在Pixel 9 发布会上发布了一款新的图像生成应用程序 Pixel Studio,该软件将会预装到每台Pixel 9 设备上。
Pixel Studio 与苹果即将推出的 Image Playground 应用程序非常相似,用户可以根据提示创建图片。用户可以事后编辑图片,使用提示框添加或减少元素,改变图片的感觉或风格。
据悉, Pixel Studio 应用采用本地运行生成,基于谷歌自己的 Imagen 3 模型,主要生成艺术风格的图片。
Image
昆仑万维发布全球首个AI流媒体音乐产品Melodio
据昆仑万维官方消息,昆仑万维正式发布全球首个AI流媒体音乐平台Melodio,并同步推出AI音乐商用创作平台Mureka。
两款产品均搭载昆仑万维新款自研DiT(Diffusion Transformer)架构音乐大模型Skymusic 2.0,这是业内首个能够持续稳定生成特定风格歌曲的AI音乐大模型。相较于上一代模型,Skymusic 2.0支持500字以上的歌词输入,生成长达6分钟双声道立体声歌曲,在伴奏质量与配器丰富度等领域有着大幅提升,成为AIGC音乐大模型领域最新SOTA。
Image
快手发布新款 AI 对话应用 飞船,提供全方位 AI 陪伴功能
据快手官方消息,快手今日推出 AI 对话应用飞船,为用户提供个性化对话体验。
官方介绍称,飞船(Kraft)智能助手 App 是一款基于先进 AI 技术的互动软件,旨在提升用户的生活质量和工作效率。用户可以通过文字或语音与 AI 助手进行交流,解答疑问、获得娱乐、进行创作和角色定制等。
用户在飞船平台上扮演“船长”角色,名为快快的 AI 少女领航员引导用户体验,飞船基于快手自研大模型“快意”,更侧重于虚拟陪伴,拥有快速的回复速度和逼真的语音体验。
Image
谷歌推出 Call Notes AI 功能:本地运行,摘录通话内容
在今天凌晨的发布会上,谷歌正式公布了全新的 Call Notes 功能,该AI功能将会在 Pixel 9 系列手机中实装。
Call Notes 功能隶属于 Call Assist 工具集,可以调用 AI 来摘录用户的通话内容,如果用户在没有纸笔的情况下,想要梳理通话内容或者想要记录某个电话号码,该功能可以非常方便地处理重要信息。用户只需要打开 Google Phone 应用程序,点击联系人,就能看到最近一次的通话摘要,而且可以直接复制相关内容。如果摘要中没有你需要的信息,你可以展开视图,显示完整的通话记录。
谷歌强调, Call Notes 功能均在本地存储和处理,相关数据不会发送至云端。
Image
今日重点论文:
英伟达:
《HybridRAG: Integrating Knowledge Graphs and Vector Retrieval Augmented Generation for Efficient Information Extraction》
本论文旨在解决金融应用中的自然语言处理难题,尤其是从财务文件中提取和解释复杂信息的问题。论文提出了一种新的方法,称为HybridRAG,它结合了基于知识图谱的RAG技术和基于向量的RAG技术,以提高金融文件中的信息提取和问答系统的准确性。论文使用了一组金融收益电话会议记录文档进行实验,证明了HybridRAG在检索和生成阶段的表现优于传统的VectorRAG和GraphRAG。该方法不仅适用于金融领域,还具有更广泛的应用前景。
论文地址:
https://arxiv.org/abs/2408.04948v1
Zyphra:
《Tree Attention: Topology-aware Decoding for Long-Context Attention on GPU clusters》
论文旨在推导出能够计算自注意力块的标量能量函数的梯度,从而阐明自注意力的理论基础,提供一种贝叶斯解释,并将其与基于能量的模型(如Hopfield Networks)紧密联系起来。此外,论文还试图解决自注意力的计算复杂度问题。论文的关键思路是通过推导出能够计算自注意力块的标量能量函数的梯度来解决自注意力的计算复杂度问题,并揭示了通过树形归约可以有效地并行计算序列轴上的约简。
论文地址:
https://arxiv.org/abs/2408.04093v2
谷歌 :
《Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2》
本文旨在通过发布一套开放的JumpReLU SAEs权重,帮助社区更轻松地进行更有雄心的安全性和可解释性研究。主要问题是减少SAEs训练成本。本文的关键思路是在Gemma 2 2B和9B的所有层和子层以及Gemma 2 27B基础模型的选定层上训练SAEs,并在标准指标上评估每个SAE的质量。
论文地址:
https://arxiv.org/abs/2408.05147v1
苹果:
《ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities》
评估工具辅助下的大型语言模型(LLMs)在解决实际问题时的能力,包括状态感知工具执行、工具之间的隐含状态依赖、用户模拟器支持下的在线评估等方面。ToolSandbox评估框架包括动态评估策略和支持状态依赖、规范化和信息不足等复杂任务的评估,揭示了开源和专有模型之间的性能差距。ToolSandbox评估框架支持中间和最终里程碑的评估,实验结果表明,即使是最先进的LLMs在处理复杂任务时也存在一定困难。该框架已在GitHub上开源。
论文地址:
https://arxiv.org/abs/2408.04682v1
Image