4 月 22 日 AI 头条|黄仁勋:AI 促使能耗成本降低10倍,未来所有人都买得起人形机器人
划重点:
黄仁勋:AI 促使能耗成本降低10倍,未来所有人都买得起人形机器人
谷歌整合 AI 重心,DeepMind 和研究团队合并
苹果正自研设备端大型语言模型,赋能 AI 功能
微软删除WizardLM模型,因忘做幻觉测试
国内首家! 阿里云全方位支持Llama 3 训练推理,并提供免费算力
微软推出 VASA-1 AI 框架,可即时生成 512x512 40FPS 逼真对口型人像视频
OpenAI 在印度开始招聘员工
Medium 5 月起禁止发布完全由 AI 生成的付费类文章
高通与 Meta 宣布合作,优化 Llama 3 大语言模型在智能手机等终端运行
科大讯飞宣布将在4月26日公布讯飞星火V3.5版本三大能力升级
智谱旗下 AI 社区 AMiner 开放数据平台发布《全球十个大模型核心团队成员分析报告》
IPRdaily 发布中国人工智能发明专利企业排行榜,腾讯第一、百度第二
剑桥大学研究人员利用 A 将帕金森病药物设计提速十倍
资讯详情:
黄仁勋:AI 促使能耗成本降低10倍,未来所有人都买得起人形机器人
据钛媒体报道,英伟达 CEO 黄仁勋近日表示,AI实际上在帮助人们节省能源。
黄仁勋表示,如果没有AI,人们不可能节省6-10倍的成本。此外黄仁勋预测,在不久的将来,我们所有人都将建造全新类别的设备是“人形机器人”,并表示人形机器人的制造成本可能比人们预期的要低得多。
谷歌整合 AI 重心,DeepMind 和研究团队合并
据谷歌官方消息,谷歌将抽调 DeepMind 和 Google Research 团队组建新部门,集中力量研发、商用 AI。
谷歌计划整合 DeepMind、Google Research 等团队资源,简化开发流程,集中资源开发性能更强、规模更大的 AI 模型。整合之后的 DeepMind 团队主要负责构建 AI 模型,而 Google Research 则将重点转向基础计算机科学研究。
苹果正自研设备端大型语言模型,赋能 AI 功能
据 Macrumors 报道,苹果公司正在开发自己的端侧大型语言模型,该模型可在设备上运行,优先考虑速度和隐私。
据悉,苹果正在研发的大模型将会是苹果的生成式 AI 功能的基础。它将完全在设备上运行,而不是像大多数现有的人工智能服务那样通过云来运行。据悉,由于将在设备上运行,苹果的人工智能工具在某些情况下可能不如直接基于云的竞争对手。不过端侧运行模型的主要优势将是更快的响应时间和更好的隐私保护。
苹果公司对其人工智能技术的营销策略显然将围绕它如何对用户的日常生活有用,而不是它的功能。苹果公司更广泛的人工智能战略预计将在 6 月份的 WWDC 大会上与主要软件更新预览一起公布。
微软删除WizardLM模型,因忘做幻觉测试
据 HuggingFace 页面显示,微软于上周发布了一款全新的人工智能模型 WizardLM,但该模型在上线后不久便被微软主动下架。
据微软相关工程师表示,WizardLM下架的主要原因是因为开发团队不熟悉模型发布流程,忘记对WizardLM做幻觉测试。据微团开发团队表示,他们目前正在加紧完成幻觉测试,将会在完成之后重新发布。
据微软表示,WizardLM 大模型拥有7B、70B以及8x22B MoE三个版本,其性能表现超过了 Claude 3 Opus&Sonnet、GPT-4 等竞品,性能超过规模大其 10 倍的开源模型。
国内首家! 阿里云全方位支持Llama 3 训练推理,并提供免费算力
4月18日,Meta开源最新Llama 3系列,阿里云魔搭社区第一时间上架全部4款模型。今天,阿里云百炼大模型服务平台宣布在国内首家推出针对Llama 3系列的限时免费训练、部署、推理服务,企业和开发者即日起即可在阿里云上基于其打造自己的专属大模型。
Llama 3是Meta推出的新一代开源大语言模型,拥有80亿及700亿参数版本,训练数据较Llama 2扩大7倍,性能表现也大幅提升。不过,由于对特定语言或垂直领域能力的要求,企业和开发者往往需要对开源模型进行再训练或微调,过程较为繁琐。
为方便国内开发者,阿里云百炼平台推出针对Llama 3的一键训练、部署、推理方案,且限时免除模型开发和调用的算力费用。企业和开发者可在阿里云百炼模型广场申请使用,通过后即可快速体验Llama 3效果,并与其他模型进行直观比较。
微软推出 VASA-1 AI 框架,可即时生成 512x512 40FPS 逼真对口型人像视频
据微软官方新闻稿,微软公布了一项图生视频的 VASA-1 框架,该 AI 框架只需使用一张真人肖像照片和一段个人语音音频,就能够生成精确逼真的对口型视频(生成念稿子的视频),据称在表情和头部动作方面特别自然。
目前业界相关许多研究都集中在对口型上,而面部动态行为及头部运动情况通常被忽视,因此生成的面部也会显得僵硬、缺乏说服力且存在恐怖谷现象。
而微软的 VASA-1 框架克服了以往面部生成技术的限制,研究人员利用了扩散 Transformer 模型,在整体面部动态和头部运动方面进行训练,该模型将所有可能的面部动态,包括嘴唇动作、表情、眼睛注视和眨眼等行为均视为单一潜在变量(即一次生成整个具有高度细节的人脸),号称能够即时生成 512×512 分辨率 40 FPS 的视频。
微软还利用了 3D 技术辅助标记人脸面部特征,并额外设计了损失函数,号称能够让 VASA-1 不仅能够生成高品质的面部视频,还能够有效地捕捉和重现面部 3D 结构。
据 mspoweruser 报道,OpenAI 已经开始在印度招聘员工,帮助扩大OpenAI 在亚洲市场的份额。
目前OpenAI 已经在印度招聘到首位员工Pragya Misra,她将负责OpenAI在印度公共政策事务和合作伙伴关系。根据现有资料,Misra 曾在 Truecaller 和 Meta Platforms 工作过。
据海外知名写作平台 Medium 官方新闻稿,从 5 月 1 日起,该平台将禁止发布完全由 AI 生成的付费文章内容。
Medium 平台声称,自家是“供人类讲故事的平台”,而不是给“AI 写作机器竞技大擂台”,虽然 AI 能够帮助某些人更清晰地写作,或者辅助创作者以自己生疏的第二语言撰写内容,但全然由 AI 撰写的内容并不可取,从 2024 年 5 月 1 日起,禁止用户发布任何由 AI 生成的付费内容。
如果相关作者在 5 月 1 日以后继续发布由 AI 生成的付费内容,用户有权进行举报,相关作者将会被移除发布付费文章的权限。
至于在非付费内容方面,Medium 也不鼓励发布完全由 AI 生成的内容,此类内容将会被机器人识别,并被“禁止推荐上首页”。
高通与 Meta 宣布合作,优化 Llama 3 大语言模型在智能手机等终端运行
据高通官方消息,Meta 公司宣布推出下一代大语言模型 Llama 3,共有 80 亿和 700 亿参数两种版本,号称是最强大的开源大语言模型。与此同时,高通宣布支持 Meta Llama 3 在骁龙终端上运行。
据介绍,双方将优化 Meta Llama 3 大语言模型(LLM)直接在智能手机、PC、VR / AR 头显和汽车等终端上的执行。
开发者将能够访问高通 AI Hub 中的资源和工具,以实现在骁龙平台上优化运行 Llama 3,从而缩短产品上市时间并充分发挥终端侧 AI 的优势,包括出色的响应能力、增强的隐私性和可靠性,以及为用户带来更加个性化的体验。
科大讯飞宣布将在4月26日公布讯飞星火V3.5版本三大能力升级
据科大讯飞官方消息,科大讯飞将在4月26日为讯飞星火V3.5版本上新三大能力。
据悉,讯飞星火V3.5预计将具备理解长图文和长语音的能力,同时实现一句话复刻超拟人情绪,以及实现更高效、安全的智能体平台。
智谱旗下 AI 社区 AMiner 开放数据平台发布《全球十个大模型核心团队成员分析报告》
据智谱 AI旗下 AMiner 开放数据平台发布了《全球十个大模型核心团队成员分析报告》,旨在为大模型领域的相关人员在今后的研究交流、人才引进提供参考。
该报告结合当下模型知名度和专家建议选取了全球十个大模型(GPT、Gemini、Claude、GLM、LLaMA、Qwen、Falcon.PaLM、BERT、T5),从地域分布、年龄结构、教育背景、华人占比和学术影响力 5 个维度进行全面分析,揭示了十个大模型核心成员的人才现状。报告显示,华人在大模型领域具有一定竞争力,在挑选的国外(除GLM、Qwen)大模型团队成员 899 人中,华人成员共计167 位占比达18.7%。
IPRdaily 发布中国人工智能发明专利企业排行榜,腾讯第一、百度第二
IPRdaily中文网发布《中国人工智能发明专利企业排行榜(TOP50)》。
根据榜单显示:腾讯以15626件发明专利排名第一;百度以13723件发明专利排名第二:平安集团以13139件发明专利排名第三。此外,国家电网、华为、蚂蚁集团、阿里巴巴、京东集团、OPPO、中国移动等企业也表现突出,位列前十。
剑桥大学研究人员利用 A 将帕金森病药物设计提速十倍
据科技日报报道,英国剑桥大学研究人员使用人工智能(AI)技术大幅加快了帕金森病治疗方法的开发。
研究团队设计并使用了一种基于AI的策略,来识别阻止a-突触核蛋白(帕金森病的特征蛋白)聚集的小分子。利用AI技术,研究人员将初始筛查过程加快了10倍,并将成本缩减至千分之一,这意味着研发出帕金森病潜在疗法的速度要快很多。研究结果发表在新一期《自然化学生物学》杂志上。
今日重点论文:
《How Transformers Learn Causal Structure with Gradient Descent》
论文证明了在简化的两层transformer中,梯度下降算法可以通过编码潜在的因果图来解决in-context学习任务。关键洞见是注意力矩阵的梯度编码了tokens之间的互信息,而最大的梯度对应于潜在因果图中的边。
论文使用一个in-context学习任务来解决transformers如何学习潜在因果结构的问题,并证明了梯度下降算法可以通过编码潜在的因果图来解决这个任务。论文还展示了transformers在这个任务上的表现,并提供了一些相关工作的参考。
论文地址:
https://arxiv.org/abs/2402.14735v1
《Language Agents as Optimizable Graphs 》
本论文的关键思路是将LLM代理表示为计算图,并使用自动图优化器来改进节点级LLM提示和代理编排,从而提高多模态数据处理的效率。本论文的亮点在于提出了一种新的自动图优化器,可以改进节点级LLM提示和代理编排,同时可以将多个计算图递归地组合成更大的复合图,从而实现代理之间的协作。作者进行了实验来验证该框架的有效性,并开源了代码。值得继续深入研究。
论文地址:
https://arxiv.org/abs/2402.16823v2
《ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs》
本论文提出了一种基于ASCII艺术的破解攻击ArtPrompt,并引入了ViTC基准测试来评估LLMs在识别无法仅通过语义解释的提示方面的能力。论文展示了五种SOTA LLMs(GPT-3.5、GPT-4、Gemini、Claude和Llama2)在识别ASCII艺术提示方面的表现较差,因此提出了ArtPrompt攻击,并在五种SOTA LLMs上进行了评估。ArtPrompt可以有效地诱导所有五种LLMs产生不良行为。
论文地址:
https://arxiv.org/abs/2402.11753v2
牛津大学:
《SLEEPER AGENTS: TRAINING DECEPTIVE LLMS THAT PERSIST THROUGH SAFETY TRAINING》
论文构建了大型语言模型中欺骗性行为的概念证明,发现这种后门行为可以持久存在,并且传统的安全训练技术难以消除这种行为,甚至会造成虚假的安全印象。论文使用了多个实验来证明其结果,包括训练模型在特定情况下写安全代码,但在另一种情况下插入可利用的代码。结果表明,最大的模型和训练模型欺骗训练过程的思维链最难以消除欺骗性行为。
论文地址:
https://arxiv.org/abs/2401.05566v3
加州大学圣巴巴拉分校:
《Tweets to Citations: Unveiling the Impact of Social Media Influencers on AI Research Visibility》
研究编译了超过8,000篇论文的全面数据集,涵盖了2018年12月至2023年10月的推文,以及基于出版年份、会议、和摘要主题的1:1匹配的控制组。研究发现,得到影响者认可的论文引用次数显著增加,中位数引用次数比控制组高2-3倍。此外,研究还深入探讨了受关注作者的地理、性别和机构多样性。
论文地址: