5月14日 AI 头条|腾讯混元文生图大模型宣布全面开源
划重点:
腾讯混元文生图大模型宣布全面开源 ChatGPT 进行春季功能更新,推出GPT-4o 模型 微软将在法国投资 40 亿欧元,大部分集中在 AI 领域 OpenAI 推出 Mac 版 ChatGPT 应用,年内上架Windows vivo 自研蓝心大模型升级自研 AI 多模态大模型 Anthropic 宣布在欧洲推出 Claude 聊天机器人 TikTok 正在测试使用 AI 生成的搜索结果 阿里开源视频自动化剪辑工具FunClip 支持中文语音识别 锤子便签iOS版更新v4.0:新增AI写作功能
资讯详情:
腾讯混元文生图大模型宣布全面开源
腾讯今天宣布,混元文生图大模型腾讯混元(DiT)宣布全面升级并对外开源。
腾讯混元文生图负责人卢清林表示,此次开源的混元DiT采用了与Sora同样的背后关键技术——DiT架构,还支持256字符中文理解,全链路自研,也是一款原生中文模型。目前腾讯混元文生图大模型已在 Hugging Face平台及 Github上发布,包含模型权重、推理代码、模型算法等完整模型,可供企业与个人开发者免费商用。
ChatGPT 进行春季功能更新,推出GPT-4o 模型
在今天凌晨的直播中,OpenAI 宣布推出全新大语言模型GPT-4o 模型,能够跨音频、视觉和文本进行实时推理。
GPT-4o标志着实现更自然人机交互的重大进步。它能够接收文本、音频和图像的任意组合作为输入,并输出同样多样化的组合。在最短232毫秒内响应音频输入,平均响应时间320毫秒,与人类在对话中的反应时间类似。在处理英语和编程方面与GPT-4 Turbo表现相当,非英语文本处理上则有显著提升。此外,GPT-4o在API中的运行速度更快,成本也降低了50%。在视觉和音频理解能力上,GPT-4o明显优于现有模型。
微软将在法国投资 40 亿欧元,大部分集中在 AI 领域
据界面新闻报道,微软将在法国投资 40 亿欧元,其中大部分集中在人工智能领域,这笔投资将在 2027 年之前完成。
具体投资计划尚未公布,不过微软透露,他们将在法国东北部城市米卢斯(Mulhouse)建立一座数据中心。据微软总裁Brad Smith 表示,这是微软进入法国 41 年以来最大的一笔投资。
OpenAI 推出 Mac 版 ChatGPT 应用,年内上架Windows
在今天的凌晨的直播中,OpenAI 宣布 ChatGPT 桌面版应用程序,首批面向Plus 用户推出 macOS 应用。
ChatGPT 还将拥有经过优化的用户界面。OpenAI 的演示显示,用户可以将处于最小化窗口的 ChatGPT 桌面应用与其他程序并排打开。用户可以通过输入或语音的方式向 ChatGPT 提问屏幕上显示的内容,ChatGPT 则能根据其“所见” 进行回答。OpenAI 计划在今年晚些时候推出 Windows 版本。
vivo 自研蓝心大模型升级自研 AI 多模态大模型
据 vivo 官方消息,vivo 宣布自研蓝心大模型重磅升级自研 AI 多模态大模型。
vivo表示,多模态技术让大模型从最原始的视觉、声音、空间等方面接触、感知、理解世界,让大模型更全面、更聪明、更强大。vivo还发布了多模态大模型技术应用vivo 看见蓝心升级,帮助视障用户更好地看见世界。
Anthropic 宣布在欧洲推出 Claude 聊天机器人
Anthropic 宣布其生成式 AI 助手 Claude 将于当地时间周二在欧洲上线,该公司的基础软件产品已经在欧洲各地的金融和酒店等行业获得了一定的吸引力。
Anthropic 还将提供付费订阅版本,名为 Claude Pro,向用户开放其所有模型(包括最先进的 Claude 3 Opus)。此外,Anthropic 还推出了面向企业的 Claude Team 订阅计划,月费 28 欧元。
TikTok 正在测试使用 AI 生成的搜索结果
据 The Verge 报道,TikTok 目前正在测试一项名为search highlights 的新功能,将借助生成式AI 技术来优化搜索结果。
在该功能中,一些搜索结果页面的顶部会出现人工智能结果的片段,点击进入该部分会打开一个包含完整回复的新页面。TikTok表示,显示的内容由ChatGPT生成,只有在用户搜索相关内容时才会显示。不过目前位置该功能还不够完善,并非所有查询都有人工智能答案。
阿里开源视频自动化剪辑工具FunClip 支持中文语音识别
据魔搭社区页面显示,阿里巴巴通义实验室最近开源了一款名为FunClip的视频自动化剪辑工具,专为精准和便捷的视频切片设计。
FunClip能够自动识别视频中的中文语音,并允许用户根据语音内容裁剪视频,大大提高了视频编辑的效率。该工具使用阿里巴巴的FunASR Paraformer-Large模型,确保了剪辑的精准性。用户可以根据识别的语音内容选择文本片段或说话人进行视频裁剪。
锤子便签iOS版更新v4.0:新增AI写作功能
锤子便签近日宣布,发布4.0版本更新,增加全新的 AI 写作功能。
据悉,锤子便签最新的 AI 写作功能,具备续写、扩写、简写、大纲整理、头脑风暴等能力,还新增调优功能,可以对已有的文本进行校正、排版和润色。更新后的锤子便签还可以对已有的文本进行总结,并提炼出关键内容。
锤子便签的 AI 写作功能需要用户付费订阅,年费为88.8元。
今日重点论文:
Cohere
《Fishing for Magikarp: Automatically Detecting Under-trained Tokens in Large Language Models》
在语言模型中,分词器的创建和模型训练之间的脱节已经被证明会导致某些输入(例如臭名昭著的SolidGoldMagikarp标记)引发意外行为。研究团队对大型语言模型分词器进行了全面的分析,特别是针对检测未经训练和训练不足的标记的问题。通过分词器分析、基于模型权重的指标和提示技术的组合,我们开发出了有效的方法来自动检测这些有问题的标记。我们的研究结果表明,这种标记在各种模型中普遍存在,并提供了提高语言模型效率和安全性的见解。
论文地址:
https://arxiv.org/abs/2405.05417v1
哈佛大学医学院
《A Generalist Learner for Multifaceted Medical Image Interpretation》
MedVersa论文旨在解决医学人工智能系统应用狭窄的问题,提出了一种通用学习器MedVersa,能够灵活学习和任务匹配,适应各种临床场景,实现多方面的医学图像分析。MedVersa使用大型语言模型作为可学习的协调器,从视觉和语言监督中学习,支持多模态输入,实时任务规范,实现多模态生成的医学人工智能,成为综合医学图像分析的多功能系统。
论文地址:
https://arxiv.org/abs/2405.07988v1
纽约州立大学布法罗分校
《SignAvatar: Sign Language 3D Motion Reconstruction and Generation》
论文旨在解决手语单词的3D动作重建和自动生成的问题,通过建立不同语义模态之间的关系,以及采用课程学习策略来增强模型的鲁棒性和泛化性。论文提出了一种基于变分自编码器的Transformer架构,能够有效地建立不同语义模态之间的关系,以实现单词级别的手语重建和生成。此外,论文还贡献了ASL3DWord数据集,包含了独特手语单词的3D关节旋转数据。
论文地址:
https://arxiv.org/abs/2405.07974v1
英特尔实验室
《Investigating the Semantic Robustness of CLIP-based Zero-Shot Anomaly Segmentation》
论文研究如何通过预训练基础模型实现零样本异常分割,并且保证这些方法在各种环境条件下都能够有效地工作并且对分布偏移具有鲁棒性。通过对测试数据进行三种语义转换(角度旋转、饱和度变化和色调变化)来评估WinCLIP零样本异常分割算法的性能,并发现平均性能下降了20%的ROC曲线下面积和40%的区域重叠曲线下面积。
论文地址:
https://arxiv.org/abs/2405.07969v1