GenAI新世界

6月27日 AI 头条 | 阿里Qwen-2在全球开源大模型排行榜中夺得榜首

Image
划重点:
  • 阿里Qwen-2在全球开源大模型排行榜中夺得榜首

  • 英伟达 CEO 黄仁勋:重工业在下一波 AI 浪潮中实现自动化的时机已经成熟

  • 科大讯飞发布讯飞星火大模型 V4.0,整体超越 GPT-4 Turbo

  • 微信输入法上线一键 AI 问答功能

  • 字节跳动发布“豆包MarsCode”智能开发工具,面向国内开发者免费

  • 微软推出最新视觉基础模型Florence-2 可在浏览器中本地运行

  • Captions 发布 AI 编辑功能,可自动为视频添加特效

  • Etched 发布专为 Transformer 模型研发的 AI 芯片 Sohu

  • 美国 NBC 广播公司将在巴黎奥运会期间启用 AI 解说

资讯详情:
阿里Qwen-2在全球开源大模型排行榜中夺得榜首
据 HuggingFace CEO Clement Delangue 在X上宣布,他们已经发布了全新的大模型排行榜,并表示阿里的Qwen-2模型成为开源大模型榜首。
Delangue 表示,他们使用了300块 H100 对MMLU-pro 等主流开源模型进行了测试,其中阿里巴巴的 Qwen 72B 表现最好,而整个榜单上,中国开源模型也占据了主导地位。此外有迹象表明,人工智能建设者开始过于关注主要评估,而忽略了其他方面的模型表现。而且规模越大的模型并不一定表现得越聪明。
Image
英伟达 CEO 黄仁勋:重工业在下一波 AI 浪潮中实现自动化的时机已经成熟
据财联社报道,英伟达于当地时间 6 月 26 日召开了约半小时的股东大会,股东批准了所有 12 名董事提名人选,并通过了高管薪酬计划。
文件显示,英伟达 CEO 黄仁勋 2024 财年薪酬方案包括99.65 万美元的基本工资(Salary),以及 2667.6 万美元的股权激励等,总薪酬 3416.8 万美元,相比上一年上涨约 60%。黄仁勋此次并未透露新产品相关信息。他表示,在英伟达先进芯片的推动下,“重工业在下一波人工智能浪潮中实现自动化的时机已经成熟”,价值 50 万亿美元的重工业将因此获益。“很快,机器人工厂将使用机器人来制造机器人。”
Image
科大讯飞发布讯飞星火大模型 V4.0,整体超越 GPT-4 Turbo
科大讯飞今天举办发布会,正式推出讯飞星火大模型 V4.0,以及在医疗、教育、商业等多个领域的人工智能应用。
讯飞星火大模型 V4.0 基于全国首个国产万卡算力集群“飞星一号”训练而成,全面提升了大模型底座的七大核心能力。在国内外中英文 12 项主流测试集中,星火 V4.0 在 8 个测试集中排名第一,领先国内大模型,并在文本生成、语言理解、知识问答、逻辑推理、数学能力等方面实现对 GPT-4 Turbo 的整体超越。
Image
微信输入法上线一键 AI 问答功能
据微信派官方消息,微信输入法正式上线了“一键AI问答”功能。
据微信表示,该功能基于腾讯混元大模型打造。用户在在微信内聊天框中输入内容后加一个符号“=”,即可获取AI回答。点击右下角“复制为图片”提示自动生成图片,保存使用,让AI帮帮聊。目前,该功能Win端、Mac端均已上线,移动端也在路上了。
Image
字节跳动发布“豆包MarsCode”智能开发工具,面向国内开发者免费
字节跳动在北京发布了基于豆包大模型打造的智能开发工具 - 豆包MarsCode ,面向国内开发者免费开放。
豆包MarsCode 产品拥有两种形态 - 编程助手和 Cloud IDE,同时通过需求开发、修复Bug、开源项目学习三个实际场景,详细演示了豆包MarsCode 的项目问答、代码补全、单测生成、Bug Fix等功能。通过完整场景演示串联各功能的使用配合,展示出豆包MarsCode 在日常工作中的优秀落地能力,无论是新手程序员还是经验丰富的开发者,都能体验到豆包MarsCode 带来的助力和效率提升。
Image
微软推出最新视觉基础模型Florence-2 可在浏览器中本地运行
据微软官方消息,微软推出视觉基础模型Florence-2,该模型现已能够在支持WebGPU的浏览器中100%本地运行。
Florence-2-base-ft是一个拥有2.3亿参数的视觉基础模型,采用基于提示的方法来处理广泛的视觉和视觉语言任务。该模型支持多种功能,可用于生成图像、识别字符、分割图像、检测物体等等。
Image
Captions 发布 AI 编辑功能,可自动为视频添加特效
据 TechCrunch 报道,视频编辑应用 Captions 推出了一项新功能,它可以获取现有的未经编辑的视频,并根据内容添加自定义图形、缩放、音乐、音效、转场和动态背景。
用户可以对视频进行编辑,借助Captions 的 AI 角色创建一个带有简短提示的视频,然后将该视频输入 AI 编辑功能,以在几分钟内获得具有不同转场和效果的完整编辑视频。目前还该功能还只能对单人出镜的竖屏视频进行编辑。
Image
Etched 发布专为 Transformer 模型研发的 AI 芯片 Sohu
据 TechCrunch 报道,芯片初创公司 Etched 宣布推出首款 AI 芯片Sohu,专门用于Transformer 架构。
据悉,Sohu采用台积电的4纳米工艺制造,与GPU和其他通用人工智能芯片相比,Sohu的推理性能大幅提升,同时能耗更低。Etched 公司首席执行官Uberti表示,在运行大型模型时,sohu甚至比英伟达的新一代Blackwell GB200 GPU更快、更便宜。
Image
美国 NBC 广播公司将在巴黎奥运会期间启用 AI 解说
据 The Verge 报道,美国NBC电视台表示将会在巴黎奥运会期间推出一项新功能,利用 AI 语音进行播报和解说。
据悉,NBC 将利用流媒体平台来直播和讲解奥运赛事,并启用AI 生成语音,用于每日赛事回顾的播报和解说。AI 语音功能将会采用NBC体育主播 Al Michaels 的声音,NBC 编辑团队将事先审查所有内容,以确保质量和准确性。
Image
今日重点论文:
牛津大学:
《Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs》
本文提出了一种简单的方法SEPs,可以直接从单个生成模型的隐藏状态中近似估算语义熵(SE),避免了计算SE的高代价,同时保持了高效的幻觉检测表现。实验结果表明,SEPs可以有效地检测幻觉,并且在推广到超出分布的数据方面表现更好。此外,本文还通过消融实验探讨了哪些令牌位置和模型层次对于捕捉语义熵是有效的。
论文地址:
https://arxiv.org/abs/2406.15927v1
加州大学:
《Probing the Decision Boundaries of In-context Learning in Large Language Models》
本文旨在探索和理解大型语言模型(LLMs)中的上下文学习机制,以及如何提高其决策边界的鲁棒性和泛化能力。本文提出了一种新的机制来探索和理解在上下文二元分类中的决策边界,研究了影响这些决策边界的因素,并探索了提高其泛化能力的方法。
论文地址:
https://arxiv.org/abs/2406.11233v1
谷歌:
《WARP: On the Benefits of Weight Averaged Rewarded Policies》
本文旨在通过引入一种新的对齐策略Weight Averaged Rewarded Policies(WARP),解决强化学习从人类反馈中学习的问题,即如何在保留预训练知识的同时提高奖励。WARP通过在权重空间中合并策略,将三个不同阶段的模型融合在一起,逐步改进KL-reward Pareto前沿,从而在固定KL的情况下获得更高的奖励。
论文地址:
https://arxiv.org/abs/2406.16768v1
纽约大学:
《Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs》
本论文旨在通过设计一种基于视觉中心的方法,解决多模态语言模型(MLLMs)中视觉组件的不足问题,以实现准确的感性基础。此外,论文还试图解决现有MLLM基准测试中的问题,并提出了一种新的基于视觉的基准测试CV-Bench。该论文的目标是为指令调整的MLLM提供一个全面的开源解决方案,以加速多模态系统和视觉表示学习的发展。
论文地址:
https://arxiv.org/abs/2406.16860v1
Image