GenAI新世界

4 月1 日 AI 头条:微软将携手 OpenAI 投入 1000 亿美元开发新 AI 超算

Image

划重点:

  • 微软将携手 OpenAI 投入 1000 亿美元开发新 AI 超算
  • 微软照片应用加入 Copilot 插件
  • OpenAI发布声音克隆技术VoiceEngine
  • Omdia预计今年 AI 笔记本电脑出货量约为 100 万台
  • 谷歌 Deepmind、斯坦福大学研究人员联手推出 AI 事实核查工具
  • 锤子便签开启4.0内测,增加 AI 助手等功能
  • 三星或将为旗下语音助手 Bixby 加入 AI 功能
  • OpenAI 计划于本月在日本东京设立亚洲首个办事处

资讯详情:

微软将携手 OpenAI 投入 1000 亿美元开发新 AI 超算

据 The Information 报道,微软将与 OpenAI 计划联手投资 1000 亿美元,打造一台AI 超级计算机。

据报道,该计算机暂被命名为Stargate,除了超级计算机本体之外,该项目还将配备上百网格专用的服务器芯片,用于为AI 提供动力。Stargate计划在2028年启动。

Image

微软照片应用加入 Copilot 插件

据 Gizmochaina 报道,微软近日对旗下 照片 APP 进行更新,在其中加入了 AI 插件 Copilot。

照片应用中的 Copilot功能还处于早期阶段,仅限部分用户体验。照片中的 Copilot 插件可以帮助用户制作幻灯片,也可以一键制作桌面背景。

Image

OpenAI发布声音克隆技术VoiceEngine

OpenAI 官方消息,OpenAI 现已发布革命性的声音克隆技术VoiceEngine”。

Voice Engine通过文本输入和15秒的音频样本,便能生成与原始说话者声音极为相似、情感丰富且自然逼真的语音。这一技术的研发始于2022年,并已应用于公司现有的文本转语音API和Read Aloud功能中的预设语音。

Image

Omdia预计今年 AI 笔记本电脑出货量约为 100 万台

据 Omdia Mobile PC 研究团队最新报告显示,2024 年 AI 笔记本电脑出货量约为 100 万台,且约 80% 的 AI 笔记本电脑出货为 ARM 芯片架构。

Omdia 表示,2028 年开始将会有微软Win11 操作系统换机需求:推论在 2030 年时,微软将可能停止 Win11 操作系统的支持服务。

谷歌 Deepmind、斯坦福大学研究人员联手推出 AI 事实核查工具

Arxiv 页面显示,谷歌近日联手斯坦福大学推出一款基于大语言模型的工具 SAFE(Search-Augmented Factuality Evaluator)。

据研究显示,SAFE可对聊天机器人生成的长回复进行事实核查。该系统可通过四个步骤对聊天机器人生成的回复进行分析、处理和评估,以验证准确性和真实性:将答案分割成单个待核查内容、对上述内容进行修正、再与谷歌搜索结果进行比较。随后,该系统还会检查各个事实与原始问题的相关性。

Image

锤子便签开启4.0内测,增加 AI 助手等功能

锤子便签近日宣布,现已发布4.0版本内测,新版本中增加了多项会员功能,其中包括 AI 助手。

新增加的 AI 助手包括 AI 写作、 AI 调优和 AI 总结三个核心功能,可以对便签中的内容进行扩写、续写、速记等功能,还可以进行校正、排版、润色和提炼等功能。

Image

三星或将为旗下语音助手 Bixby 加入 AI 功能

三星公司的一位高层管理人员称,三星正在争取让其语音助手 Bixby 拥有人工智能生成功能。

此举旨在完善三星的 Bixby,并有可能拥有与 ChatGPT 等其他顶级聊天机器人相同的功能。随着生成式人工智能和大型语言模型技术的出现,三星移动部门执行副总裁Won-Joon Choi表示,他认为公司需要重新定义 Bixby 的角色,使其在未来具备生成式人工智能的能力,变得更加智能。

Image

OpenAI 计划于本月在日本东京设立亚洲首个办事处

据breakingthenews消息,ChatGPT 开发商 OpenAI 将于本月在东京设立办事处,启动其首个亚洲基地,打算提供定制的企业服务,并参与创建该技术的管理框架。

通过开发者与微软的合作,许多日本公司已经开始利用 OpenAI 的生成式人工智能技术。OpenAI 可能会通过东京办事处开始提供企业服务,包括客户支持。

Image

今日重点论文:

东京大学

《Unsolvable Problem Detection: Evaluating Trustworthiness of Vision Language Models》

本文提出了一个新颖而重要的挑战,即视觉语言模型(VLM)面临无法解决问题时的无解问题检测(UPD)。UPD检查了VLM在视觉问答(VQA)任务的背景下面对无法解决的问题时保留答案的能力。UPD包括三个不同的设置:缺失答案检测(AAD)、不兼容答案集检测(IASD)和不兼容视觉问题检测(IVQD)。通过广泛的实验,深入研究UPD问题,表明大多数VLM,包括GPT-4V和LLaVA-Next-34B,都在不同程度上难以应对我们的基准,突显了改进的重要空间。
论文地址:
https://arxiv.org/abs/2403.20331v1
香港中文大学:

《Are We on the Right Way for Evaluating Large Vision-Language Models?》

论文旨在解决当前多模态评估工作中存在的两个主要问题:1)许多样本不需要视觉内容就能得出答案,这会影响多模态能力的实际评估;2)大规模训练数据中存在意外数据泄漏,这会导致模型记忆到视觉相关问题的答案而不需要视觉内容。为了解决这两个问题,论文提出了一个新的多模态基准数据集MMStar,其中包含1500个人工精选的样本,确保每个样本都需要视觉内容,并且没有数据泄漏。此外,论文还提出了两个度量标准来衡量数据泄漏和实际多模态训练的性能增益。
论文地址:
https://arxiv.org/abs/2403.20330v1

上海期智研究院:

《Learning Visual Quadrupedal Loco-Manipulation from Demonstrations》

虽然在四足机器人上增加机械臂可以实现物体操作,但有时这是多余的,因为四足机器人本质上是一个移动单元,配备有四肢,每个肢体都有3个自由度(DoFs)。因此,我们的目标是使四足机器人仅使用其腿执行现实世界的操作任务。我们将运动操作过程分解为低层强化学习(RL)控制器和高层行为克隆(BC)规划器。通过对操作轨迹进行参数化,我们同步上层和下层的努力,从而利用RL和BC的优势。我们的方法通过模拟和实际实验进行验证,展示了机器人执行需要移动性和高精度的任务的能力,例如在移动时从地面上提起篮子、关闭洗碗机、按按钮和推门。
论文地址:
https://arxiv.org/abs/2403.20328v1
Google:

《Gecko: Versatile Text Embeddings Distilled from Large Language Models》

Gecko,一种紧凑且多用途的文本嵌入模型。Gecko通过利用一个关键思想,在大型语言模型(LLMs)中提取知识以形成检索器,实现了强大的检索性能。研究团队采用的两步蒸馏过程始于使用LLM生成多样化的合成配对数据。研究方法的有效性通过Gecko的紧凑性得到证明。在大规模文本嵌入基准(MTEB)上,具有256嵌入维度的Gecko的表现优于所有现有768嵌入维度的条目。具有768嵌入维度的Gecko实现了平均得分66.31,与7倍更大的模型和5倍更高维度的嵌入竞争。
论文地址:
https://arxiv.org/abs/2403.20327v1
Image