GenAI新世界

3 月 15 日 AI 头条:苹果公布多模态大模型 MM1 ,具备300亿参数

Image

划重点:

  • 苹果公布多模态大模型 MM1 ,具备300亿参数

  • 英伟达将推出生成式AI专业认证

  • 智谱 AI 完成新一轮融资:北京市人工智能产业投资基金参投,具体金额不便透露

  • 李开复旗下 AI 模型“零一万物 API”上线,支持文档理解、图片问答等

  • 云安全公司Zscaler 收购 Avalor,将更多 AI 引入其安全工具

  • 腾讯联合清华大学、香港科技大学推出全新图生视频模型“Follow-Your-Click”:用户指哪动哪

  • AI 芯片初创公司 Cerebras 发布号称最强大 AI 芯片 WSE-3 ,4 万亿晶体管 5nm 工艺制程

资讯详情:

苹果公布多模态大模型 MM1 ,具备300亿参数

Arxiv 页面显示,苹果正式公布了自研多模态大模型 MM1,其参数最高可达 300 亿。

论文显示,MM1多模态大模型由密集模型和混合专家(MoE)变体组成,不仅在预训练指标中实现 SOTA,在一系列已有多模态基准上监督微调后也能保持有竞争力的性能。

MM1 在上下文预测、多图像和思维链推理等方面具有不错的表现。同样,MM1 在指令调优后展现出了强大的少样本学习能力。

Image

英伟达将推出生成式AI专业认证

据36氪报道,英伟达官微消息,英伟达将在GTC大会上正式推出生成式AI专业认证,能够使开发者、职场人士和其他相关人员证明和展示自己在生成式AI方面的技能和专业实力。

目前新推出的专业认证计划包含两项入门级(associate-level)生成式AI认证,这两项认证专注于考察对大语言模型和多模态工作流技能的掌握程度。GTC2024大会将于3月18日至21日在美国加州圣何塞举行。

Image


智谱 AI 完成新一轮融资:北京市人工智能产业投资基金参投,具体金额不便透露
据腾讯科技报道,“清华系”大模型公司智谱 AI 据悉已于今年年初完成新一轮融资,北京市人工智能产业投资基金参与融资。对此,智谱 AI 表示本次“不方便透露”具体投资金额,但智谱 AI 是该基金成立以来投资的第一家人工智能大模型公司。
智谱 AI 表示,本次融资将持续用于基座大模型的进一步研发,与各家产业龙头企业合作,一同在千行百业打造蓬勃繁荣的大模型生态,共同赋能落实市政府产业战略,助力北京国际科技创新中心建设,加速迈向通用人工智能的时代。

Image


李开复旗下 AI 模型“零一万物 API”上线,支持文档理解、图片问答等

李开复旗下零一万物日前上线官方API ,用户可以体验 Yi 系列 AI 大模型,其中包含 yi-34b-chat-0205、yi-34b-chat-200k、yi-vl-plus。

据介绍,Yi-34B-Chat 系列 API 具备较快的推理速度,这不仅缩短了处理时间,同时也保持了出色的模型效果。此外,优化的 API 接口显著降低了模型回复的延迟,进一步提高了用户体验的流畅性和响应速度。

此外,Yi Model API 与 OpenAI API 完全兼容,用户只需修改少量代码,可以平滑迁移。

Image

云安全公司Zscaler 收购 Avalor,将更多 AI 引入其安全工具

据 TechCrunch 报道云安全公司Zscaler在网络安全初创公司Avalor成立 26 个月后以 3.1 亿美元现金和股权收购了该公司。

Zscaler 创始人兼首席执行官 Jay Chaudhry 在宣布这一消息的新闻稿中表示,此次交易将扩展 Zscaler 的平台,其功能包括简化安全事件报告、事件缓解、资产发现、数据分类、安全策略生成等。Avalor 充当网络安全资产、控制、身份、漏洞、错误和其他数据点的真实来源,使安全团队能够聚合、规范化、消除重复和跟踪从发现到补救的风险数据。

Image



腾讯联合清华大学、香港科技大学推出全新图生视频模型“Follow-Your-Click”:用户指哪动哪

据环球网报道,腾讯和清华大学、香港科技大学联合推出全新图生视频模型 “Follow-Your-Click”,目前已经上架  GitHub(代码四月公开),同时还发表了一篇研究论文。

这款图生视频模型主要功能包括局部动画生成和多对象动画,支持多种动作表达,如头部调整、翅膀拍动等。

据介绍, Follow-Your-Click 可以通过用户的点击和简短动作提示生成局部图像动画。用户只需点击对应区域,加上少量提示词,就可以让图片中原本静态的区域动起来,一键转换成视频,比如让物体微笑、跳舞或飘动。

Image


AI 芯片初创公司 Cerebras 发布号称最强大 AI 芯片 WSE-3 ,4 万亿晶体管 5nm 工艺制程

据澎湃新闻报道,AI 芯片初创公司 Cerebras 重磅发布了 AI 芯片 WSE-3 ,4 万亿晶体管 5nm 工艺制程。更厉害的是,WSE-3 打造的单个超算可训出 24 万亿参数模型,相当于 GPT-4 / Gemini 的十倍大。

性能上,WSE-3 是上一代 WSE-2 的两倍,且功耗依旧保持不变。采用90 万个 AI 核心,44GB 的片上 SRAM 存储,让 WSE-3 的峰值性能达到了 125 FP16 PetaFLOPS。相当于 52 块英伟达 H100 GPU。

Image

今日重点论文:

利哈伊大学:

《TRUSTLLM: TRUSTWORTHINESS IN LARGE LANGUAGE MODELS》

提出了8个不同维度的可信度原则,并在6个维度上建立了基准,包括真实性、安全性、公平性、鲁棒性、隐私和机器伦理。评估了16个主流LLMs的可信度,并发现可信度和实用性呈正相关关系。同时发现专有LLMs在可信度方面通常优于大部分开源LLMs。实验使用了30个数据集,并提出了一些开放性挑战和未来方向。同时发现有些LLMs过于校准以展示可信度,导致误将良性提示视为有害。

论文地址:

https://arxiv.org/abs/2401.05561v2


谷歌:

《Distilling Vision-Language Models on Millions of Videos 》
论文使用合成的指导数据fine-tuning一个强的图像-语言基线模型来解决视频-语言模型中数据不足的问题,并生成高质量的视频标题。本论文的亮点在于使用合成的指导数据fine-tuning视频-语言模型,提高了模型的性能,并且在多个视频-语言基准测试中表现出色,同时也提供了更好的文本监督。论文还介绍了实验设计和数据集,并提供了开源代码。值得进一步研究的是使用自动生成的标题进行对比训练的视频-语言双编码器模型的表现优于当前最强的基线模型。
论文地址:
https://arxiv.org/abs/2401.06129v1

Meta:

《Self-Rewarding Language Models》

论文使用LLM-as-a-Judge提示自我奖励的语言模型,可以在训练过程中提供高质量的奖励信号,从而提高指令遵循能力和自我奖励能力。通过三次迭代的DPO训练Fine-tuning Llama 2 70B,可以得到一个在AlpacaEval 2.0排行榜上表现优异的模型。论文的亮点包括使用自我奖励的语言模型进行训练、提供高质量的奖励信号、在AlpacaEval 2.0排行榜上表现优异。实验使用了Fine-tuning Llama 2 70B模型和三次迭代的DPO训练。论文开放了代码,值得进一步研究。
论文地址:
https://arxiv.org/abs/2401.10020v1

哈佛大学:

《Tokenization Is More Than Compression》
论文通过引入一种新的tokenizer PathPiece,将文本分割为给定词汇表的最少数量的token,并进行广泛的实验,发现使用更少的token并不会提高下游性能,同时强调了预分词和使用BPE初始化词汇表构建的重要性。论文训练了64个语言模型,使用了不同的tokenization方法,并公开了这些模型。实验结果表明,使用更少的token并不一定会提高性能,同时预分词和使用BPE初始化词汇表构建对性能有积极影响。
论文地址:
https://arxiv.org/abs/2402.18376v1

澳大利亚吉朗应用人工智能研究院:

《Seven Failure Points When Engineering a Retrieval Augmented Generation System 》
本文通过三个案例研究,探讨了RAG系统的失效点和解决方法,提出了7个失效点,并给出了解决方法。实验设计详细,使用了三个不同领域的数据集。文章总结了RAG系统的优点和局限性,并提出了未来研究方向。其中两个关键点是:只有在操作过程中才能验证RAG系统的有效性,RAG系统的健壮性是逐步形成而非一开始就设计好的。
论文地址:
https://arxiv.org/abs/2401.05856v1

Image