GenAI新世界

5月8日 AI 头条:苹果发布新款iPad Pro,搭载 M4 芯片

Image
划重点:
  • 苹果发布新款iPad Pro,搭载 M4 芯片

  • 零一万物正式官宣一站式AI工作平台“万知”

  • 三星或正组建百人工程师团队,争夺英伟达下一代人工智能芯片订单

  • OpenAI 推出专用 AI 工具:能识别 DALL・E 3 生成的图片

  • 微软暂停 Copilot 人工智能功能推进,将根据用户反馈改进 Windows 11 体验

  • OpenAI 将推出新工具Media Manager,帮助创造者标识作品

  • Hugging Face开源机器人代码库LeRobot

  • 幻方DeepSeek-V2系列模型已在魔搭社区开源

  • 三星Medison斥资9270万美元收购AI超声初创公司Sonio

资讯详情:
苹果发布新款iPad Pro,搭载 M4 芯片
在5月7日晚的新品发布会上,苹果正式发布了搭载 M4 芯片的新款iPad Pro,拥有11寸和13寸两个款式。
新款 iPad Pro 搭载了采用tOLED 的新技术的 OLED屏幕,和传统屏幕相比,新的屏幕采用双层结构设计,能在保持高对比度和广色域的同时,进一步提升屏幕亮度和耐用性。除此之外,新款 iPad Pro 搭载 的M4芯片基于全新的架构设计,可以说是一块专为 AI 性能推出的全新处理器。它拥有4个性能核心和6个能效核心,支持光线追踪和硬件加速功能,专业渲染性能相较于M2快4倍的同时,处理相同工作的能耗却只有M2的一半。
Image
零一万物正式官宣一站式AI工作平台“万知”
据36氪报道,零一万物正式官宣一站式AI工作平台 ——万知。
据介绍,零一万物团队利用自研的大模型基础平台与RAG检索增强生成技术,针对AI问答、读文档、PPT等场景进行了专门的加速和优化,万知可在10秒内完成数十万字超长文档阅读、2分钟内完成PPT图文制作,在PC端进行极速解读中英文专业图表。
Image
三星或正组建百人工程师团队,争夺英伟达下一代人工智能芯片订单
据KED Global 报道,三星电子为了拿下英伟达下一代人工智能图形处理器 (AI GPU) 的高端内存 (HBM) 订单,组建了一支由约 100 名顶尖工程师组成的团队。
据悉,该团队的主要目的是提高制造产量和质量,首要目标是通过英伟达的测试。据悉,英伟达首席执行官黄仁勋对三星目前提供的 8 层和 12 层 HBM3E 内存的良品率和质量并不满意,要求三星进行改进。消息人士表示,三星的目标是通过快速增加对英伟达的供应,占据更高的市场份额。预计三星将在第三季度加快供货速度。
Image
OpenAI 推出专用 AI 工具:能识别 DALL・E 3 生成的图片
据 OpenAI 官方消息,OpenAI 推出专用的 AI 检测工具,能够识别某张图片是否由 DALL・E 3 模型生成,且准确率高达 98%。
OpenAI 表示,希望通过这款工具帮助研究人员研究内容真实性。OpenAI 表示该工具在区分非 AI 生成图像与 DALL・E 3 生成的图像方面成功率很高,成功率能够接近 98%,同时只有少于 0.5% 的非 AI 图像被错误地标记来自 DALL・E 3。
Image
微软暂停 Copilot 人工智能功能推进,将根据用户反馈改进 Windows 11 体验
据 windowscentral 报道,微软目前正在暂停推进Win11 的 Copilot 功能。
据悉,微软在最近发布的 Win11 Insider预览版中表示,在过去的几个月中,微软一直在与 Windows Insiders 在 Canary、Dev 和 Beta 频道尝试不同的 Windows 中 Copilot(预览版)体验。其中一些体验包括:Windows 中的 Copilot 可以像普通应用程序窗口一样运行,任务栏图标会以动画形式显示 Copilot 可以在用户复制文本或图像时提供帮助。微软已决定暂停推出这些体验,以便根据用户反馈进一步完善它们。在微软继续与 Windows Insiders 一起发展新想法的同时,Windows 中的 Copilot 将继续按预期运行。
Image
OpenAI 将推出新工具Media Manager,帮助创造者标识作品
据 TechCrunch 报道,OpenAI 正在开发一款新的 AI 工具,将帮助创作者更好地控制他们的内容如何用于训练生成式人工智能。
这款新工具名为Media Manager,将允许创作者和内容所有者向 OpenAI 标识他们的作品,并说明他们希望这些作品如何被纳入或排除在人工智能研究和训练之外。OpenAI表示,公司的目标是在2025年之前将该工具投入使用,同时与 "创作者、内容所有者和监管机构 "合作制定一项标准--也许是通过公司最近加入的行业指导委员会。
Image
Hugging Face开源机器人代码库LeRobot
Hugging Face今日宣布,将开源其机器人工具包LeRobot,帮助更多的AI机器人研发者进行研究。
LeRobot基于迄今为止最大规模的众包机器人数据集开发,旨在促进AI机器人技术的研究与开发。该项目包括用于共享、可视化数据和训练最先进模型(SOTA)的库。用户可以访问大量预训练模型,快速启动项目。
Image
幻方DeepSeek-V2系列模型已在魔搭社区开源
据魔搭ModelScope社区宣布,DeepSeek-V2系列模型现已在魔搭ModelScope社区开源。
幻方公司在5月6日推出了第二代 MoE 模型 DeepSeek-V2,并开源了技术报告和模型权重,该模型引入了 MLA 架构和自研 Sparse 结构 DeepSeekMoE,以236B 总参数、21B 激活,实际部署在8卡 H800机器上,输入吞吐量超过每秒10万 tokens 输出超过每秒5万 tokens。
Image
三星Medison斥资9270万美元收购AI超声初创公司Sonio
TechCrunch 报道,三星旗下医疗设备部门Medison计划以约9270万美元的价格收购总部位于巴黎的初创公司Sonio,后者是一家为超声波工作流程开发人工智能软件的公司。
Sonio的人工智能助手旨在帮助妇产科医生评估和记录超声波检查,它还获得了美国监管部门(FDA 510(k))对 Sonio Detect 的许可,该产品利用深度学习算法实时提高超声波扫描的图像质量。
Image
今日重点论文:
密歇根大学
《Tactile-Augmented Radiance Fields》
论文提出一种名为TaRF的场景表示方法,将视觉和触觉融合到共享的三维空间中,以便于生成对应的视觉和触觉信号。该方法是否能够准确地生成视觉和触觉信号,以及在下游任务中的应用是否有效,是论文试图解决的问题。论文的关键思路是将普通相机上的触觉传感器与图像进行注册,以及利用场景中视觉和结构相似的区域共享相同的触觉特征。通过这种方法,训练条件扩散模型,生成对应的触觉信号。相比当前领域的研究,该方法的新意在于将视觉和触觉信息融合到共享的三维空间中,并使用条件扩散模型生成触觉信号。
论文地址:
https://arxiv.org/abs/2405.04534v1
马克斯·普朗克智能系统研究所
《ChatHuman: Language-driven 3D Human Understanding with Retrieval-Augmented Tool Reasoning》
论文旨在构建一个语言驱动的人类理解系统 ChatHuman,将多种不同的方法结合起来,以更准确地解决人类相关的问题。论文地址:论文中的关键思路是使用大型语言模型(LLM)来选择和使用各种现有工具,从而结合信息以更准确地解决问题,并利用工具输出来改善 ChatHuman 对人类的推理能力。
https://arxiv.org/abs/2405.04533v1
巴黎第九大学
《Comparing Ways of Obtaining Candidate Orderings from Approval Ballots》
本文试图通过社会选择的方法比较五种不同的轴选择规则,以找到最优轴,解决在二元评估数据中选择轴的问题。本文提出了一种通过最大化形成区间的投票数量来选择轴的规则,并使用投票单调性和抵抗克隆的公理来证明其在评分规则类中的唯一性。
论文地址:
https://arxiv.org/abs/2405.04525v1
智谱科技
《NaturalCodeBench: Examining Coding Performance Mismatch on HumanEval and Natural User Prompts》
论文旨在解决当前代码合成基准测试任务(如HumanEval、MBPP和DS-1000)无法满足实际编码需求的问题,提出了一个名为NaturalCodeBench(NCB)的具有挑战性的代码基准测试任务。该任务包含402个Python和Java问题,涵盖了6个不同领域,从在线编码服务的自然用户查询中精选而来。论文提出了一种半自动化的测试用例构建流程,提高了测试用例构建的效率,同时通过对39个LLMs的实验发现,即使HumanEval得分相近的模型之间在NCB上的表现差距仍然显著,表明当前模型在实际代码合成场景下的表现仍有待提高。
论文地址:
https://arxiv.org/abs/2405.04520v1
Image