GenAI新世界

8月27日 AI 头条|苹果新品发布会定档 9 月 10 日

Image
划重点:
  • 苹果新品发布会定档 9 月 10 日
  • 谷歌 Photos 测试 AI 新功能,AI 搜索功能将升级
  • Anthropic 公开 Claude AI 模型的系统提示词
  • 英伟达公布 Blackwell 架构细节
  • 字节跳动或正筹备成立大模型研究院
  • 比尔盖茨研制AI 新工具,利用AI 消灭蚊子
  • 字节跳动开源FLUX Dev的Hyper SD Lora 生图步数减至8步
  • OpenAI 招聘新职位,将调查自家员工行为
  • 全新 AI 工具SuperCraft上线,草图一键变成3D模型
  • 亚马逊计划在今年10月推出新版 AI语音助手 Alexa
资讯详情:
苹果新品发布会定档 9 月 10 日
苹果官网今天宣布,将在北京时间9月10日凌晨1点举办新品发布会,届时将带来iPhone 16等全新苹果设备。
根据此前爆料,iPhone 16 系列将采用全新的拍摄按钮,并支持全新的AI 系统Apple Intelligence 系统。不出意外的话,Apple Intelligence将会是本次发布会重点内容。
除此之外,苹果还将会在此次发布会上带来更多的硬件产品。
Image
谷歌 Photos 测试 AI 新功能,AI 搜索功能将升级
据 android police 报道,谷歌将会为谷歌 Photos 推出一项全新的 AI 功能Ask Photos,将帮助用户和图片互动。
据悉,谷歌已经开始测试其 Gemini AI 模型的Ask Photos 功能,Ask Photos 允许用户使用自然语言命令与他们的谷歌照片库进行交互,例如 ”向我展示我去过的每个国家公园的最佳照片 “或 ”我的车牌号是什么来着?"使你的照片和视频成为你生活的视觉数据库,Gemini 可以从中智能地提取信息和上下文。
虽然 “Ask Photos ”还没有正式发布,但据报道,在最新版的谷歌 Android 应用程序代码中已经开始出现有关该功能的文字。
Image
Anthropic 公开 Claude AI 模型的系统提示词
据 TechCrunch 报道,Anthropic 近日在Claude iOS 和、Android 应用程序以及网络上公布了其最新机型(Claude 3.5 Opus、Sonnet 和 Haiku)的系统提示词。
截至7 月 12 日的最新提示词非常清楚地列出了Claude 3.5 Opus模型不能做的事情,例如 “Claude 3.不能打开 URL、链接或视频”。此外人脸识别也是一个大禁区;Claude 3.5 Opus 的系统提示告诉模型 始终以完全看不见人脸的方式做出反应,并避免识别或命名 [图像] 中的任何人类。
系统提示词是大语言模型的基础指令,由系统生成的提示,通常用于设定对话的背景、提供指导或给定规则。Anthropic开发者关系负责人Alex Albert在X上发文表示,Anthropic计划在更新和微调系统提示时定期公布此类信息。
Image
英伟达公布 Blackwell 架构细节
英伟达在今日举办的Hot Chips 2024 大会正式公布了Blackwell 的架构细节。据悉,英伟达 Blackwell 平台涵盖了从 CPU 和 GPU 计算到用于互连的不同类型的网络,并不是在谈论单个 GPU,而是在谈论 AI 的集群级别。
Blackwell GPU 是英伟达性能最高的一款,使用 NVIDIA 高带宽接口 (NV-HBI) 在两个 GPU 芯片之间提供 10TB/s 的带宽。GPU 通过 NVLink-C2C 互联技术和 Grace CPU 进行连接。
Blackwell 支持新的 FP4 和 FP6 精度,通过降低计算精度来提高性能。NVIDIA Quasar Quantization 用于找出可以使用较低精度的内容,从而减少计算和存储。英伟达表示,用于推理的 FP4 在某些情况下可以接近 BF16 性能。
据介绍,Blackwell 架构是通用计算全栈矩阵的终极解决方案,由多个英伟达芯片组成,包括 Blackwell GPU、Grace CPU、BlueField 数据处理单元、ConnectX 网络接口卡、NVLink 交换机、Spectrum 以太网交换机和 Quantum InfiniBand 交换机。
Image
字节跳动或正筹备成立大模型研究院
据 AI 大模型工场消息,字节跳动正在秘密筹备成立一家大模型研究院目前正处于人才招揽阶段。
据悉,该研究院已经有非字节跳动的 AI 大牛加盟直接向张一鸣汇报。此外,原面壁智能核心成员秦禹嘉、原零一万物核心成员黄文灏已加入字节大模型团队,目前暂不清楚是否归属在大模型研究院。
从去年开始,字节才陆续对外公布关于大模型的相关工作进展。
Image
比尔盖茨研制AI 新工具,利用AI 消灭蚊子
比尔盖茨近日在官网宣布,他们正在研发两项新的 AI 技术 VectorCam 和 HumBug,用于消灭蚊子。
VectorCam 是一款创新的手机应用,用户只需拍摄蚊子照片,便能快速识别蚊子的种类、性别及其是否吸食血液。这项技术采用了专门为蚊子识别训练的 AI 模型 ——VectorBrain,其识别准确率在资源受限环境中超过90%。
另有一项被称为 HumBug 的前沿技术,可以利用智能手机捕捉蚊子的飞行音调,通过分析声音特征识别蚊子种类。不同种类的蚊子因个体差异和环境影响,翅膀拍打的声音各不相同,这一特性使得 HumBug 能够实现更自动化的监测。
Image
字节跳动开源FLUX Dev的Hyper SD Lora 生图步数减至8步
据 Huggingface 页面显示,字节跳动近日开源FLUX Dev的Hyper SD Lora,以其高效的图片生成能力,将AI绘图推向了一个全新的速度纪元。
传统的AI绘图过程往往步骤繁多,耗时较长。但Hyper SD Lora的问世,以其仅需8步或16步的操作流程,大幅缩短了图片生成时间,让创意实现变得更加迅速。
尽管8步模型在效果上相较于原始版本有所折损,但这种折损在实际应用中是可以接受的。对于大多数用户来说,这种折损并不会明显影响到最终的视觉效果。
Image
OpenAI 招聘新职位,将调查自家员工行为
据 business insider 报道,OpenAI 最近发布招聘启事,招聘一名内部风险技术调查员,以 强化其组织,抵御内部安全威胁。
招聘启事称,该职位的职责包括分析异常活动、检测和减轻内部威胁,以及与人力资源和法律部门合作 “对可疑活动进行调查”。换句话该职位可能会涉及对OpenAI 自家员工行为的调查。
OpenAI 已经处于一场关于人工智能和安全的激烈辩论的中心。OpenAI 的员工和美国立法者对该公司是否采取了足够措施来确保其强大的技术不会被用于造成伤害表示担忧。
Image
全新 AI 工具SuperCraft上线,草图一键变成3D模型
SuperCraft 官方宣布推出全新 AI 工具SuperCraft,这是一款 AI 设计工具,可以把手绘的草图转换为不同的产品图像。
据悉,SuperCraft提供了一个无限大的协作画布,这里没有边界,没有限制,只有无限的创造空间。设计师们可以在这里手绘草图。利用生成式 AI 技术,草图将被转化为高质量的2D图像和3D渲染模型。
这个平台的节点式流程设计,进一步简化了设计过程。设计师们可以在这个流程中轻松地组织和简化他们的设计思路,使得整个设计过程更加高效和有序。
Image
亚马逊计划在今年10月推出新版 AI语音助手 Alexa
据 gigazine报道, 亚马逊正准备在 10 月份推出其推出的个人语音助手 Alexa 的升级版
据悉新版 Alexa 将包括一个新的 智能简报 功能,每天提供根据客户偏好选择的人工智能生成的新闻文章摘要。亚马逊的文件称,帮助客户策划、总结和探索时事的人工智能功能也被评为客户的首要需求之一。根据内部通信,新闻摘要可以培养一种日常习惯,用于在产品发布前跟踪进展。
使用升级版助手需要付费订阅,订阅费用可能高达每月10美元,而经典版Alexa将继续免费提供。
Image
今日重点论文:
加利福尼亚大学圣迭戈分校:
《GPT-4 is judged more human than humans in displaced and inverted Turing tests》
人们在非正式的在线对话中很难区分人类和AI,本文旨在解决这一问题并提供更准确的工具来检测对话中的AI。通过修改图灵测试的形式,评估人类和大型语言模型在区分人类和AI方面的表现,并发现所有评判者都难以在非互动情况下区分人类和AI。本文使用了两种修改版的图灵测试来评估人类和大型语言模型的表现,发现所有评判者的准确率都低于50%。同时,最好的GPT-4见证人被认为更可能是人类,这表明当前的工具难以在非互动情况下准确检测AI。
论文地址:
https://arxiv.org/abs/2407.08853v1
Waymo:
《Pano2Room: Novel View Synthesis from a Single Indoor Panorama》
Transfusion论文试图解决的问题是如何训练一个能够处理离散和连续数据的多模态模型。这个问题是一个新问题。Transfusion的关键思路是将语言建模损失函数(下一个标记预测)与扩散相结合,训练一个单一的Transformer模型来处理混合模态序列。通过引入模态特定的编码和解码层,可以进一步提高Transfusion模型的性能。通过将Transfusion模型扩展到7B参数和2T多模态标记,可以生成与类似规模的扩散模型和语言模型相当的图像和文本。
论文地址:
https://arxiv.org/abs/2408.11039v1
北京大学:
《An Evaluation of Deep Learning Models for Stock Market Trend Prediction》
论文旨在解决从单个全景图像中自动重建高质量的室内3D场景的问题。这是一个新问题。论文提出了一种名为Pano2Room的新方法,通过使用全景RGBD修复器从单个位置的全景图像中生成3D场景。关键思路是使用初始网格和全景RGBD修复器迭代地细化网格,并使用收集到的照片级3D一致的伪新视图将细化的网格转换为3D高斯喷洒场。
论文地址:
https://arxiv.org/abs/2408.11413v1
蒙特利尔大学:
《Cell-ontology guided transcriptome foundation model》
本论文旨在通过在单细胞基因表达数据上进行自监督学习,利用细胞本体图中的分类学关系来提高转录组基础模型(TFMs)的学习效果,以揭示人类疾病的复杂机制。论文提出了一种单细胞基因表达数据上的细胞本体引导的TFM(scCello),通过细胞类型一致性损失和本体对齐损失来指导模型学习细胞类型特异性表示和细胞类型之间的结构关系。
论文地址:
https://arxiv.org/abs/2408.12373v1
Image