4 月 25 日 AI 头条|Meta 今天发布2024年第一季度财报,该季度营收 364.55 亿美元,同比增长 27%。
划重点:
移动版谷歌 Gemini 将迎诸多新特性:分析 PDF 文件内容等
日本横须贺市尝试由“AI 市长”发布英语信息,将用于观光导览
腾讯发布汽车行业大模型“全域智能”方案,与文远知行合作打造智驾
商汤发布日日新 5.0 大模型:推理上下文窗口 200K,号称对标 GPT-4 Turbo
苹果发布 OpenELM,基于开源训练和推理框架的高效语言模型
微信发布桌面效率AI工具小微助手 支持类ChatGPT在线聊天功能
华为开发者大会定档 将发布盘古大模型5.0
人民日报媒体技术公司与华为达成鸿蒙合作 助力超千家党媒单位融入鸿蒙生态
资讯详情:
Meta 一季度净利润 123.69 亿美元,同比暴涨 117%
Meta 今天发布2024年第一季度财报。财报显示,Meta 该季度营收 364.55 亿美元,同比增长 27%。
财报显示,Meta 第一季度净利润为 123.69 亿美元,较去年同期的 57.09 亿美元增长 117%;摊薄后每股收益为 4.71 美元,较去年同期的 2.2 美元增长 114%,超过分析师平均预期的 4.32 美元。应用家族日活跃用户数达32.4亿人,同比增长7%。
按照业务划分,Meta 第一季度广告收入达356.35亿美元,包括Facebook、Instagram等应用在内的应用家族服务收入达360亿美元,显示实验室营收达4.4亿美元,同比增长51%。其他业务收入达3.8亿美元。
总成本和费用为 226.37 亿美元,较去年同期的 214.2 亿美元增长 6%。其中营收成本为 66.4 亿美元,高于上年同期的 61.08 亿美元;研发开支为 99.78 亿美元,超过上年同期的 93.81 亿美元;营销和销售开支为 25.64 亿美元,低于上年同期的 30.44 亿美元;总务与管理支出为 34.55 亿美元,高于上年同期的 28.85 亿美元。截至 2024 年 3 月 31 日,Meta 持有的现金、现金等价物及有价证券总额为 581.2 亿美元,自由现金流为 125.3 亿美元。
移动版谷歌 Gemini 将迎诸多新特性:分析 PDF 文件内容等
消息源 AssembleDebug 近日挖掘安卓版 Gemini 应用程序,发现隐藏了诸多新功能 / 新特性,包括上传 PDF 等文件,引入 Live Prompts、Select text 功能等。
上传并分析 PDF 格式文件:安卓版 Gemini 现阶段仅支持上传图片,而在最新版中相关代码已经出现了上传 PDF 等文件描述,可以分析文档中的内容,只是该功能目前尚未生效。
Select text:安卓版 Gemini 此前提供的回答只能全文复制,用户需要复制粘贴到其它地方再进行优化。而在最新选项中新增了“Select text”功能,用户可以直接抓取想要的部分。
Live Prompts:用户可以安排早上 7:00 进行一系列提示,并让人工智能执行一系列操作,例如总结热门新闻报道、打开智能灯以及搜索股市更新。
日本横须贺市尝试由“AI 市长”发布英语信息,将用于观光导览
据日本共同社报道,日本神奈川县横须贺市于当地时间 23 日宣布,将尝试使用生成式 AI 创建该市市长上地克明的虚拟分身,让其用流利的英语介绍例行记者会概要,发布信息。
上地克明在记者会上表示:“我不会说英语,但通过 AI 就能传达想法。如果能像我本人在说话那样发布信息,将成为很棒的观光导览。”
据悉,这个“虚拟市长”首先需要借助生成式 AI 学习市长真人的表情、音色、动作等,目标是创建与本人“一模一样”的虚拟分身。输出内容方面,将由外籍职员来校对 ChatGPT 概括、翻译的市长记者会内容。在完成文本的输入之后,需要 10 分钟左右时长来生成约 2 分钟视频。
创建该“虚拟市长”分身使用了美国洛杉矶视频生成 AI 新兴企业“HeyGen”提供的工具。在开完记者会约 10 天后,官方将陆续启动上传、发布视频等后续工作。根据规划,今后还将探讨通过“AI 市长”面向海外发布灾害、观光信息以及和平讯息等内容。
腾讯发布汽车行业大模型“全域智能”方案,与文远知行合作打造智驾
据汽车之家报道,腾讯云昨日官宣发布汽车行业大模型“全域智能”方案,并升级“云、图”底座。
官方表示,在汽车产业全面拥抱“智能化”的新阶段,云计算、AI、地图等核心技术,已经成为智能汽车的重要基础设施,推动汽车产业实现“全域智能”。目前,腾讯云已经和长安、一汽丰田、东风岚图、易车等十多家汽车相关企业,开启了汽车行业大模型在汽车研发、生产、营销、服务、企业协同等核心场景的合作。
据介绍,腾讯云基于混元大模型,用汽车行业专业数据做精调,深入五大场景,为用户提供服务。
商汤发布日日新 5.0 大模型:推理上下文窗口 200K,号称对标 GPT-4 Turbo
据SenseTime报道,前日,商汤科技发布了日日新 5.0 大模型。据介绍,该模型采用 MOE 混合专家架构,在知识、数学、推理和代码能力方面大幅提升。
该模型基于超过 10TB tokens 训练,具备 200K 推理上下文窗口,推理时上下文窗口达到 200K 左右,更号称“全面对标 GPT-4 Turbo”。其提供自然语言处理、图片生成、自动化数据标注、自定义模型训练等多种大模型及能力。
文科能力方面,其在创意写作、推理总结等方面能力均有提升,可为教育、内容产业等垂直应用场景提供辅助;理科能力方面,其数理、代码及推理等方面能力也进行了增强,官方表示可为金融、数据分析等场景落地提供基础。
目前,日日新 5.0 大模型已经正式面向全网用户开放。商汤方面表示,在小米汽车 SU7 的智能座舱内也应用了商汤大模型技术,小爱同学采用了基于商汤端云大模型的解决方案,可为车主提供智能化交互体验。
苹果发布 OpenELM,基于开源训练和推理框架的高效语言模型
据Readhub报道,在 WWDC24 之前,苹果在 Hugging Face 平台上发布了一个“具有开源训练和推理框架的高效语言模型”,名为 OpenELM。
这是一项开源语言模型,其源码及预训练的模型权重和训练配方可在苹果 Github 库中获取。
OpenELM 使用分层缩放策略,可以有效地分配 Transformer 模型每一层的参数,从而提高准确率。例如,在参数量约为 10 亿的情况下,OpenELM 与 OLMo 相比准确率提升了 2.36%,同时所需的预训练 tokens 数量仅有原来的 50%。
微信发布桌面效率AI工具小微助手 支持类ChatGPT在线聊天功能
微信近日宣布,推出桌面AI效率工具小微助手,旨在通过自然语言处理技术,提升用户在电脑上的工作效率。
小微助手内置了多种工具,以增强其作为日常助手的功能,包括微信翻译:支持自动识别语言并翻译选中文本;剪贴板管理:自动记录并管理剪贴板内容,支持内容的长期保存和分类;JSON魔方:提供JSON数据的即时解析和编辑功能;闪念胶囊:快速记录灵感和信息的图文方式;其他工具:包括时间戳转换、进制转换、Base64编码和密码生成等。
此外,小微助手还支持AI搜索、在线聊天问答、指尖助手、圈子、对话服务等多项功能。
华为开发者大会定档 将发布盘古大模型5.0
华为开发者大会定于6月21日至23日在东莞松山湖盛大举行,届时将见证盘古大模型5.0与HarmonyOSNEXT鸿蒙星河版的首次同台展示。
盘古大模型系列,作为华为精心打造的一系列预训练大模型,涵盖了自然语言处理(NLP)、计算机视觉(CV)以及科学计算等多个领域。这些模型通过大规模数据的训练,展现出了卓越的语言理解和生成能力,可广泛应用于文本生成、问答系统、机器翻译等自然语言处理任务中。
在之前的华为分析师大会上,华为副董事长、轮值董事长徐直军坦诚地表示,鸿蒙的生态建设面临着巨大的挑战。他强调,构建鸿蒙的原生应用生态将成为华为在2024年最为关键的任务。
4月25日,人民日报媒体技术股份有限公司(简称“人民日报媒体技术公司”)与华为正式签署鸿蒙合作协议,将共同打造适应全媒体时代需求的融媒体应用,为广大用户带来更加智能、便捷的信息服务。这标志着双方在科技创新和内容传播领域的深度合作进入新阶段。
人民日报媒体技术公司是人民日报社社属一级企业,以建设人民日报全媒体新闻平台、全国党媒信息公共平台和打造各类媒体融合发展平台为核心业务。其中,全国党媒信息公共平台集内容聚合与智能分发、“融合号”内容生态、短视频直播等核心功能于一体,为全国超过1000家各级党媒、企事业单位提供“内容+技术+渠道”全方位支持。
在本次合作中,人民日报媒体技术公司将以承建的各类融媒体平台为载体,整合优质资源,推动媒体深度融合发展;华为则基于鸿蒙系统的技术优势,提供强大的技术支持和生态保障。
人民日报媒体技术公司此前已完成HarmonyOS开发服务商认证,本次将加速其开发的300多个客户端鸿蒙原生应用的开发进度,借助HarmonyOS NEXT鸿蒙星河版原生智能、原生互联、原生流畅等特性,为用户在手机、平板、车机、智慧屏等多终端提供更加流畅、高效、安全的新闻资讯服务与体验。另一方面,全国党媒信息公共平台则基于HarmonyOS NEXT 全场景分布式架构、原生智能、原生安全等技术优势,面向覆盖的1000余家党媒单位,实现更高效的内容分发和更优质的用户体验,也为鸿蒙生态提供更多权威、优质内容。
双方还将在未来进一步加强合作,探索更多基于鸿蒙系统的创新应用场景,共同推动媒体融合发展和数字化转型。目前,已有超4000家应用加入鸿蒙生态,其中北京已有超500款应用加入。随着更多伙伴的加入,鸿蒙将携手千行百业共建万物互联新生态。
今日重点论文:
中国科学技术大学:
《ID-Animator: Zero-Shot Identity-Preserving Human Video Generation 》
该论文的亮点包括ID-Animator的ID-oriented数据集构建流程和随机脸部参考训练方法,可以精确地从参考图像中捕获与身份相关的嵌入,从而提高了模型的保真度和泛化能力。实验表明,ID-Animator在生成个性化人类视频方面优于以前的模型。此外,该方法与流行的预训练T2V模型(如animatediff)和各种社区骨干模型高度兼容,显示出在需要高度保留身份的视频生成的实际应用中的高扩展性。
论文地址:
https://arxiv.org/abs/2404.15275v1
莱斯大学:
《Metric-guided Image Reconstruction Bounds via Conformal Prediction》
论文使用了稀疏视图CT数据集进行实验,并且开源了代码。实验结果表明,使用度量引导的上下界具有有效的下游指标覆盖率,而传统的基于像素的界限则没有。使用基于度量的界限而不是传统的基于像素的界限,以获得更准确的下游指标覆盖率,并且可以显示出度量引导和像素导向方法之间的解剖差异。
论文地址:
https://arxiv.org/abs/2404.15274v1
阿里巴巴:
《CT-GLIP: 3D Grounded Language-Image Pretraining with CT Scans and Radiology Reports for Full-Body Scenarios》
本文提出了一种名为CT-GLIP的新方法,通过构建器官级图像-文本对来增强多模态对比学习,将基于地面的视觉特征与精确的诊断文本对齐,以识别自然语言中的器官和异常,其性能优于标准的CLIP框架。本文使用44,011个器官级视觉-文本对来训练模型,并开发了一个异常词典来增强对比学习。实验结果表明,该模型在使用自然语言进行零样本学习时具有优越的性能。此外,本文还在1,130个患者的测试集上验证了模型的性能,证明了其在零样本和微调场景下的优越性能。
论文地址:
https://arxiv.org/abs/2404.15272v1
伊利诺伊大学厄巴纳-香槟分校:
《X FT: Unlocking the Power of Code Instruction Tuning by Simply Merging Upcycled Mixture-of-Experts》
论文在1.3B模型上应用了XFT,创造出了新的最先进的小型代码LLM,其HumanEval和HumanEval+的pass@1分别为67.1和64.6。在相同的数据和模型架构下,XFT在HumanEval+上提高了13%的监督微调(SFT),并在MBPP+,MultiPL-E和DS-1000等方面持续提高2%至13%,证明了其通用性。此外,XFT与现有技术如Evol-Instruct和OSS-Instruct完全正交,为提高代码指令调整开辟了新的维度。
论文地址:
https://arxiv.org/abs/2404.15247v1
华为诺亚方舟实验室:
《Multi-view Content-aware Indexing for Long Document Retrieval》
论文提出多视角内容感知索引(MC-indexing)方法,将长文档分成内容块,并用原始文本、关键词和摘要视角表示每个内容块,从而提高检索效果。MC-indexing方法无需训练或微调,可与任何检索器无缝集成;论文提出了包括文档结构和答案范围在内的长文档问答数据集;实验结果表明,MC-indexing方法相比现有的分块方案,在top k=1.5、3、5和10的情况下,召回率分别提高了42.8%、30.0%、23.9%和16.3%。
论文地址:
https://arxiv.org/abs/2404.15103v1