GenAI新世界

6月11日 AI 头条|苹果发布 Apple Intelligence,重新定义AI

Image
划重点:
  • 苹果发布 Apple Intelligence,重新定义AI
  • OpenAI 和苹果公司宣布合作将 ChatGPT 集成到iOS 系统中
  • Copilot Pro 服务将从7月10日起移除GPT Builder
  • OpenAI 任命新任首席财务官和首席产品官
  • 华为与中山大学眼科中心发布 ChatZOC 眼科大模型,服务效率提升 75%
  • 腾讯联合中山大学、港科大推出图生视频模型“Follow-Your-Pose-v2”
  • 极佳科技联合清华大学,发布端侧可用Sora级视频生成大模型
  • OpenAI 语音功能更新,能够以不同角色的声音说话
  • 谷歌推创新框架AGREE 可增强大模型生成内容准确性
资讯详情:
苹果发布 Apple Intelligence,重新定义AI
苹果在今天凌晨的 WWDC 2024开发者大会重磅发布了自己的 AI 系统Apple Intelligence。
库克表示,Apple Intelligence是更懂用户的个人智能系统,通过将强大的生成模型嵌入全平台操作系统中,在个人语境下为用户提供更有帮助和相关的智能服务。它由高性能的大语言模型和扩散模型组成,结合了Apple Silicon的强大处理能力,深度集成于Apple设备和应用程序中。
Image
OpenAI 和苹果公司宣布合作将 ChatGPT 集成到iOS 系统中
据 OpenAI 官方消息,苹果正在将 ChatGPT 集成到 iOS、iPadOS 和 macOS 的体验中,让用户可以访问 ChatGPT 的功能,包括图像和文档理解,而无需在不同工具之间跳转。
Siri 也可以在需要时利用 ChatGPT 的智能功能。苹果用户在向 ChatGPT 发送任何问题以及任何文档或照片之前都会被询问,然后 Siri 会直接给出答案。此外,ChatGPT 还可以在苹果全系统的写作工具中使用,帮助用户为任何写作内容生成内容。用户还可以利用 ChatGPT 图像工具生成各种风格的图像,以补充他们正在撰写的内容。
Image
Copilot Pro 服务将从7月10日起移除GPT Builder
据 mspoweruser 报道,微软宣布将从 2024 年 7 月 10 日起取消通过 Copilot Builder 创建 GPT 的功能。
微软表示,微软希望优先考虑面向普通消费者的核心 Copilot 体验,并将 GPT 的重点转移到商业和企业场景。不仅如此,从 2024 年 7 月 10 日到 2024 年 7 月 14 日,微软还将删除所有 GPT(由微软和客户创建)及其相关 GPT 数据。
Image
OpenAI 任命新任首席财务官和首席产品官
据 OpenAI 官方消息,OpenAI 任命两位新高管,分别担任首席财务官和首席产品官职位。
据悉,Sarah Friar 将担任首席财务官一职。她将带领OpenAI财务团队为OpenAI的核心研究能力提供持续投资,并确保OpenAI能够扩大规模,满足不断增长的客户群和复杂的全球运营环境的需求。Kevin Weil将成为 OpenAI首席产品官,领导一个产品团队,并专注于将OpenAI的研究成果应用到产品和服务中,使消费者、开发者和企业受益。
Image
华为与中山大学眼科中心发布 ChatZOC 眼科大模型,服务效率提升 75%
中山眼科中心官方消息,中山大学中山眼科中心与华为技术有限公司合作构建的ChatZOC 眼科大模型在6月6日正式发布。
2023 年 3 月,中山大学中山眼科中心率先发起 ChatZOC 眼科大模型的国产化研发,同年 12 月,与华为启动联合研发。ChatZOC 眼科大模型,以眼病诊疗知识库为基础,链接中山眼科中心大数据平台,结合最新眼科指南和文献,依托华为基础 AI 计算框架进行训练,在眼科领域任务达国际先进水平。
Image
腾讯联合中山大学、港科大推出图生视频模型“Follow-Your-Pose-v2”
据 Arxiv 页面显示,腾讯混元团队联合中山大学、香港科技大学联合推出全新图生视频模型“Follow-Your-Pose-v2”。
Follow-Your-Pose-v2”只需要输入一张人物图片和一段动作视频,就可以让图片上的人跟随视频上的动作动起来,生成视频长度可达 10 秒。与此前推出的模型相比,“Follow-Your-Pose-v2”可以在推理耗时更少的情况下,支持多人视频动作生成。此外,该模型具备较强的泛化能力,无论输入人物是什么年龄、服装,背景如何杂乱,动作视频的动作如何复杂,都能生成出高质量的视频。
Image
极佳科技联合清华大学,发布端侧可用Sora级视频生成大模型
据 Github 页面显示,极佳科技联合清华大学自动化系近日正式发布超长时长、高性价比、端侧可用的Sora级视频生成大模型视界一粟 YiSu。
据悉,视界一粟 YiSu拥有模型原生的16秒超长时长,并可生成至1分钟以上。同时还拥有超大运动、超强表现力、懂物理世界等特点。相比现有模型,YiSu模型成本更低、速度更快、端侧可用。
Image
OpenAI 语音功能更新,能够以不同角色的声音说话
据 AI business 报道,OpenAI 正在更新 ChatGPT 的语音功能,允许用户使用人工智能生成的各种语音和声音风格与聊天机器人进行交互。
升级后的语音功能可以让 ChatGPT 用户指示人工智能聊天机器人使用任何声音实时回复。OpenAI 发布了一个演示,让人类为故事中的人物配音。ChatGPT 通过生成不同的声音风格做出了回应,比如狮子的声音洪亮粗犷,老鼠的声音高亢温顺。
Image
谷歌推创新框架AGREE 可增强大模型生成内容准确性
据谷歌官方消息,谷歌研究院推出了一个名为AGREE的创新框架,旨在增强大型语言模型生成内容和引用的准确性。
这一框架通过检索文档中的相关段落来增强大模型生成回答的事实基础,并提供相应的引用,从而提高回答的准确性,并为用户提供验证信息真实性的途径。
Image
今日重点论文:
加利福尼亚大学:
《Scalable MatMul-free Language Modeling》
论文试图在保持性能的同时,消除大型语言模型中矩阵乘法的计算成本。这是否是一个新问题?论文提出了一种MatMul-free模型,通过利用轻量级操作完全消除了矩阵乘法操作,同时保持了性能。该模型的GPU-efficient实现在训练期间可以将内存使用量降低高达61%,在推理期间可以将内存消耗降低10倍以上。在FPGA上构建了一个定制的硬件解决方案,将LLMs的效率提高到人类可读吞吐量的13W。这篇论文的关键思路是消除矩阵乘法操作,使用轻量级操作替代,同时保持性能。
论文地址:
https://arxiv.org/abs/2406.02528v1
中国科学院
《Towards Scalable Automated Alignment of LLMs: A Survey》
论文试图解决如何在大型语言模型(LLMs)超越人类能力的情况下实现有效、可扩展的自动对齐的问题。论文系统地回顾了最近出现的自动对齐方法,将现有的自动对齐方法分为四类,并讨论了每种方法的现状和潜在发展。此外,论文探讨了使自动对齐技术可行和有效的基本因素。
论文地址:
https://arxiv.org/abs/2406.01252v1
约翰霍普金斯大学
《The Benefits of a Concise Chain of Thought on Problem-Solving in Large Language Models》
本论文旨在介绍一种简洁的思维链(CCoT)提示方法,以解决使用LLMs解决实际问题时CoT提示方法所面临的问题。作者试图比较标准CoT和CCoT提示对回答长度和正确答案准确性的影响。本论文提出了一种简洁的思维链(CCoT)提示方法,通过减少提示的冗余性来提高LLMs的回答效率。实验结果表明,CCoT可以显著降低回答长度,而对问题解决能力的影响很小。
论文地址:
https://arxiv.org/abs/2401.05618v1
伊利诺伊大学厄巴纳-香槟分校
《Teams of LLM Agents can Exploit Zero-Day Vulnerabilities》
论文提出了一种由计划代理和子代理组成的系统,称为HPTSA,计划代理可以探索系统并确定要调用哪些子代理,从而解决了尝试不同漏洞时的长期规划问题。论文构建了一个包含15个真实世界漏洞的基准,并展示了我们代理团队相比之前的工作提高了多达4.5倍。
论文地址:
https://arxiv.org/abs/2406.01637v1
Image