GenAI新世界

5月23日 AI 头条 | 腾讯云全面下调大模型价格,混元-lite即日起免费

Image

划重点:

  • 腾讯云全面下调大模型价格,混元-lite即日起免费
  • 字节 Coze 海外版宣布支持 GPT-4o
  • TikTok 推出 Symphony AI 套件,帮助品牌方制作视频
  • 亚马逊计划对 Alexa 进行人工智能改造
  • 阿里国际站旗下OKKI AI升级,普惠体验版即将上线
  • 亚马逊与 AI 公司 Hugging Face 合作:定制芯片低成本运行 AI 模型
  • 微软为 PowerToys 新增AI功能高级粘贴
  • Domo AI 上线唇形同步功能:提升面部对话视频转换效果

资讯详情:

腾讯云全面下调大模型价格,混元-lite即日起免费

腾讯云宣布,对大模型价格进行全面下调,其中混元-lite模型即日起全部免费。

腾讯混元大模型是腾讯全链路自研的万亿参数大模型,在国内率先采用混合专家模型 (MoE) 结构,模型总体性能相比上一代提升50%。

根据沙利文评测结果,腾讯混元处于国内大模型第一梯队,高于国际大模型均线。目前有混元-pro、混元-standard、混元-lite三个不同版本和尺寸的模型以API的形式面向企业和个人开发者开放。

Image

字节 Coze 海外版宣布支持 GPT-4o

据字节跳动旗下 AI 平台 Coze 海外版官方消息,们已经成功集成了 OpenAI 推出的最新 AI 助手 GPT-4o。

Coze 表示,GPT-4o 的推出将为 Coze 用户带来诸多便利,无论是进行日常聊天交流还是寻求帮助与建议,都能得到更智能、更快速的回应。同时,Coze 也将不断优化 GPT-4o 的功能,确保用户能够体验到最先进、最贴心的 AI 聊天功能。

Image

TikTok 推出 Symphony AI 套件,帮助品牌方制作视频

TikTok 今日宣布,推出 AI 套件 Symphony AI ,帮助品牌方编写视频脚本并制作短视频。

TikTok Symphony包含一个名为Symphony Creative Studio的 AI 视频生成器。TikTok 称,该工具只需广告商提供少量信息即可生成适合 TikTok 的视频。这款视频生成器还可根据 TikTok 广告管理器资产或产品信息,为品牌方提供现成的视频。此外还有一款名为 Symphony Assistant 的 AI 助手,可以帮助品牌方生成和优化脚本,并提供建议来提高他们的广告质量。

Image

亚马逊计划对 Alexa 进行人工智能改造

据界面新闻报道,亚马逊正在用人工智能生成技术升级其 Alexa 智能助理,并计划收取月租费以抵消技术成本。

亚马逊将在今年晚些时候推出一个对话性更强的 Alexa 版本,亚马逊将在Alexa升级中使用自己的大型语言模型“Titan”。亚马逊为 Alexa 提供的服务将不包括在每年 139 美元的 Prime 服务中,亚马逊尚未确定价格。

Image

阿里国际站旗下OKKI AI升级,普惠体验版即将上线

据36氪报道,阿里国际站旗下外贸生意智能工作台OKKI举办产品升级发布会,首次对外公开OKKI AI全线能力。

据了解,OKKI AI主打智能营销、客户管理、辅助决策三大核心能力,面向所有中小外贸企业开放。本次OKKI AI还将推出体验版——OKKI Leads AI。据介绍,OKKI Leads AI是一款极简外贸营销工具,覆盖写开发信、聊天沟通、提供营销策略等场景。

Image

亚马逊与 AI 公司 Hugging Face 合作:定制芯片低成本运行 AI 模型

亚马逊公司的云部门宣布,已与人工智能初创公司 Hugging Face 合作,将在亚马逊的定制计算芯片上更低成本地运行数千个 AI 模型。

Hugging Face 已成为 AI 研究人员和开发者分享聊天机器人或其他 AI 软件的中心,并得到了亚马逊、Alphabet 旗下的谷歌和英伟达等公司的支持,它是开发者获取和调整开源 AI 模型的主要平台。

Image

微软为 PowerToys 新增AI功能高级粘贴

据 The Verge 报道,微软正在为 Windows 11 的 PowerToys 添加一项新的高级粘贴功能,该功能可以利用人工智能的强大功能即时转换剪贴板内容。

高级粘贴功能包含在 PowerToys 0.81 版中,一旦启用,可以通过一个特殊的按键命令激活:这将打开一个高级粘贴文本窗口,提供包括纯文本、markdown 和 JSON 在内的粘贴转换选项。

Image

Domo AI 上线唇形同步功能:提升面部对话视频转换效果

据Domo AI 官方消息,Domo AI 近日上线唇形同步功能,为用户带来更自然流畅的面部对话视频转换效果。

目前该功能支持4种画面功能,包括浮世绘、日式动漫、黏土卡通风以及3D卡通风格。DomoAI 表示,唇形同步功能的上线标志着 Domo AI 在视频转换技术上的又一次突破。该功能能够精确同步人物说话时的唇部动作,使转换后的视频更加真实和生动。无论是制作动画还是风格化视频,这一功能都能显著提升最终效果。

Image

今日重点论文:

普渡大学

《Tutorial on Diffusion Models for Imaging and Vision》

本论文旨在探讨扩散模型的基本思想,以及在文本到图像生成和文本到视频生成等领域中的应用。扩散模型采用了一种特殊的采样机制,克服了以往方法中存在的一些困难。论文介绍了扩散模型在文本到图像生成和文本到视频生成中的应用。实验使用了不同的数据集,并探讨了扩散模型与其他模型的比较。论文还提供了开源代码和值得深入研究的方向。

论文地址:

https://arxiv.org/abs/2403.18103v1

清华大学

《D-Bot: Database Diagnosis System using Large Language Models》

Bot是一种基于大型语言模型的数据库诊断系统,旨在解决DBA管理大量数据库的困难,以及现有经验方法的局限性。该系统能够在可接受的时间内自动获取诊断文档中的知识,并生成合理和有根据的诊断报告。D-Bot的关键思路包括离线知识提取、自动生成提示、使用树搜索算法进行根本原因分析以及处理具有多个根本原因的复杂异常的协作机制。D-Bot在六个典型应用程序的539个异常上进行了验证,结果表明D-Bot能够有效地分析未见异常的根本原因,并显着优于传统方法和基准模型,如GPT-4。

论文地址:

https://arxiv.org/abs/2312.01454v2

Meta

《Chameleon: Mixed-Modal Early-Fusion Foundation Models》

Chameleon试图解决如何在任意顺序下理解和生成图像和文本的问题。Chameleon是一种早期融合的基于令牌的混合模态模型,可以在任意顺序下理解和生成图像和文本。它的关键思路是提出了一种适用于早期融合、基于令牌、混合模态设置的稳定训练方法、对齐配方和架构参数化。Chameleon在广泛的任务中进行了评估,包括视觉问答、图像字幕、文本生成、图像生成和长格式混合模态生成。它在图像字幕任务中表现出了最先进的性能,在纯文本任务中优于Llama-2,同时与Mixtral 8x7B和Gemini-Pro等模型竞争,在单个模型中实现了非平凡的图像生成。在新的长格式混合模态生成评估中,它还在人类判断方面匹配或超过了更大的模型,包括Gemini Pro和GPT-4V。Chameleon标志着在全面多模态文档的统一建模方面迈出了重要一步。

论文地址:

https://arxiv.org/abs/2405.09818v1

Apollo Research

《The Local Interaction Basis: Identifying Computationally-Relevant and Sparsely Interacting Features in Neural Networks》

通过将神经网络的激活转换为新的基础(Local Interaction Basis),以识别计算特征并去除不相关的激活和交互。该方法还根据下游计算的重要性对特征进行缩放,产生一个交互图,显示模型中所有相关的计算特征和交互。该方法在模块化加法和CIFAR-10模型上表现良好,可以识别更多的计算特征,并且与主成分分析相比,这些特征之间的交互更加稀疏。但是,该方法在应用于语言模型时没有显著提高可解释性或交互稀疏性。

论文地址:

https://arxiv.org/abs/2405.10928v2

Image