GenAI新世界

5月9日 AI 头条:阿里云:通义千问API日调用量破亿,通义千问 2.5 大模型发布

Image
划重点:
  • 阿里云:通义千问API日调用量破亿,通义千问 2.5 大模型发布

  • OpenAI 推出 Model Spec 拟议框架

  • 谷歌 AlphaFold 3 模型登 Nature 

  • Meta为营销人员提供新的人工智能工具

  • Dreamina正式更名为“即梦” AI绘画和AI视频功能全量上线

  • xAI 最快本周完成融资 估值将约达 180 亿美元

  • 微软发布研究报告:75%的知识工作者在工作中使用AI

  • 摩托罗拉AI 手机 moto X50 Ultra 将于 5 月 16 日发布

资讯详情:
阿里云:通义千问API日调用量破亿,通义千问 2.5 大模型发布
据阿里云官方消息,通义千问的API日调用量已强势突破亿次大关,企业用户数也成功跃过9万家,开源模型下载量更是达到了惊人的700万次。此外,阿里云通义千问 2.5 大模型现已正式发布,号称多项能力赶超 GPT-4。
据阿里云首席技术官周靖人介绍,经过第三方机构的严格测评,通义千问在性能方面已经逐步接近并逼近GPT4,成为了行业的领军者。特别是在中文语境下的知识问答等方面,通义千问展现出了卓越的性能和精准度,为用户提供了更加优质的体验。
通义千问在长文本处理方面也取得了显著的突破。它能够支持单次最长1000万字文档的处理,并且同时能够处理多达100个文档。这一强大的功能使得模型能够迅速地进行文档理解,极大地提高了工作效率。此外,通义千问还支持对PDF、Word、图表等多种不同格式的文档进行处理,满足了用户多样化的需求。
Image
OpenAI 推出 Model Spec 拟议框架
据 OpenAI 官方消息,OpenAI 推出名为 Model Spec 的拟议框架初稿,该协议标明了OpenAI希望模型在 OpenAI API 和 ChatGPT 中的行为方式。
在协议中,OpenAI 提出了三项一般原则--人工智能模型应协助开发者和最终用户做出符合指令的有益响应,在考虑潜在利益和危害的情况下造福人类,并在尊重社会规范和法律的情况下反映出 OpenAI 的良好形象。OpenAI 表示, Model Spec 协议反映了其在 OpenAI 使用的现有文档以及 OpenAI 在设计模型行为方面的研究和经验,以及为未来模型开发提供信息的工作进展。
Image
谷歌 AlphaFold 3 模型登 Nature 
据 Nature 官网显示,谷歌近日推出一款名为 AlphaFold 3 的模型,可通过预测生命分子行为帮助加速医疗进步。
据悉,AlphaFold 3 模型能够对包括蛋白质、核酸、小分子、离子和修饰残基在内的复合物进行联合结构预测。新的 AlphaFold 模型比以前的许多专业工具的准确性有了显著提高:蛋白质-配体相互作用的准确性远高于最先进的对接工具,蛋白质-核酸相互作用的准确性远高于核酸特异性预测工具,抗体-抗原预测的准确性显著高于 AlphaFold-Multimer v2.37,8。这些结果共同表明,在一个统一的深度学习框架内,可以在整个生物分子空间进行高精度建模。
Image
Meta为营销人员提供新的人工智能工具
据 Siliconangle 报道,Meta 宣布推出全新的AI 工具,帮助品牌更轻松地进行广告宣传。
Meta Ad Manager 曾在去年推出一个人工智能生成工具,允许营销人员上传产品图片,并使用自然语言提示更改背景。由于今天的升级,该工具现在不仅可以编辑广告背景,还可以编辑前景中的产品。此外,它还能根据用户提供的自然语言提示创建多个版本的广告设计。另一项新增功能允许营销人员在人工智能生成的图片上叠加文字。去年,Meta 推出了一项单独的人工智能功能,可以根据不同的广告格式和用户设备自动调整照片大小。作为今天更新的一部分,该公司将扩展后一项功能,让营销人员可以调整人工智能生成的图片上文字叠加的大小。
Image
Dreamina正式更名为“即梦” AI绘画和AI视频功能全量上线
据剪映 Dreamina 官方消息,Deramina正式更名为既梦,同时宣布其AI作图和AI视频生成功能已全量上线。
即梦目前提供了6个生图模型,其中最新推出的通用1.4模型在生成效果上表现出色。无论是摄影写真还是插画,该模型都能完美生成,尽管在生成人物手指等细节上偶尔存在小瑕疵,整体而言,用户反馈不错,不过,细节重绘功能还有待提升。此外,即梦不久还会上线一个“故事创作”的新功能。这将进一步丰富即梦的产品线,使用户能够通过AI技术讲述和创作更加生动和个性化的故事。
Image
xAI 最快本周完成融资 估值将约达 180 亿美元
据 Tech In Asia 报道,马斯克旗下的AI公司xAI最快将于本周完成新一轮融资,这将使其估值达到180亿美元左右。
今年 4 月,有报道称xAI希望在本轮融资中筹集高达 60 亿美元的资金,投资者包括红杉资本(Sequoia Capital)。上述人士表示,谈判仍在进行中,时间和公司估值等细节仍悬而未决。凭借名为 "Grok "的聊天机器人,xAI正在竞争激烈的人工智能聊天机器人市场上与OpenAI等竞争对手一争高下。
Image
微软发布研究报告:75%的知识工作者在工作中使用AI
微软近日发布研究报告显示,AI 工具的使用率在过去六个月里几乎翻了一番,达到了知识工作者的75%。
这项研究基于对 31 个国家 31000 人的调查,以及微软 365 的使用情况、LinkedIn 数据和对大公司的研究。这份报告对人工智能对生产力和效率的影响持乐观态度,这也是人们对一家将未来主要押注在知识工作者采用人工智能上的公司的预期。
Image
摩托罗拉AI 手机 moto X50 Ultra 将于 5 月 16 日发布
摩托罗拉今天宣布,将在5月16日举办一场盛大的联想AI PC &AI手机发售体验会。
摩托罗拉将会在本次发布会上推出全新 AI 手机moto X50Ultra。这款手机已经通过了工信部入网认证,型号为XT2401-2。采用曲面屏设计,机身背面左上角配有方形相机岛,内含三个摄像头。moto X50Ultra手机尺寸为161×72.4×8.5(mm),重量为197克,正面配备了一块分辨率为1220×2712的6.67英寸屏幕。
今日重点论文:

新加坡国立大学

《OpenESS: Event-based Semantic Scene Understanding with Open Vocabularies》

论文旨在解决事件相机感知中的事件语义分割(ESS)问题,该问题的困难在于解释和注释事件数据,限制了其可扩展性。该论文提出了一种跨模态的知识迁移方法,通过将图像-文本对中的语义知识迁移到事件流中来实现可扩展的ESS。论文的关键思路是将图像-文本对中的语义知识迁移到事件流中,以实现可扩展的ESS。作者提出了帧到事件对比蒸馏和文本到事件语义一致性正则化来实现更好的跨模态适应。
论文地址:
https://arxiv.org/abs/2405.05259v1

新加坡国立大学

《Multi-Modal Data-Efficient 3D Scene Understanding for Autonomous Driving》

论文旨在解决无人驾驶中的3D场景理解中数据利用不充分的问题,提出了一种利用半监督学习的LiDAR语义分割方法,以提高未标记数据集的效能。论文提出了一种名为LaserMix++的框架,通过多传感器互补和驾驶场景的固有空间先验知识来增强半监督学习的效果,包括多模态LaserMix操作、相机到LiDAR特征蒸馏和语言驱动的知识引导。
论文地址:
https://arxiv.org/abs/2405.05258v1

牛津大学

《THRONE: An Object-based Hallucination Benchmark for the Free-form Generations of Large Vision-Language Models》

本论文旨在解决大型视觉-语言模型(LVLM)中的幻觉问题,特别是自由形式回答中的Type I幻觉。现有的基准测试主要关注Type II幻觉,这些幻觉是针对特定问题格式的多项选择响应,而且这些基准测试通常需要对外部API进行调用。论文提出了一种名为THRONE的自动框架,用于定量评估LVLM自由形式输出中的Type I幻觉。作者使用公共语言模型(LM)来识别LVLM响应中的幻觉,并计算信息度量。最终提供了一种简单而有效的数据增强方法,作为强大的基准线,以减少Type I和Type II幻觉。
论文地址:
https://arxiv.org/abs/2405.05256v1

哈佛大学

《Diffusion-HMC: Parameter Inference with Diffusion Model driven Hamiltonian Monte Carlo》

论文旨在使用扩散生成模型作为冷暗物质密度场的代理模型或仿真器,以及作为解决约束输入场的宇宙学参数的反问题的参数推断模型。使用单个扩散生成模型来模拟与目标分布一致的摘要统计信息,利用扩散生成模型的近似似然来通过使用Hamiltonian Monte Carlo方法对给定测试图像的宇宙学参数的后验进行采样,从而导出宇宙学的严格约束。
论文地址:
https://arxiv.org/abs/2405.05255v1
Image