GenAI新世界

4 月 2 日 AI 头条:ChatGPT 即日起无需注册便可使用

Image

划重点:

  • ChatGPT 即日起无需注册便可使用

  • Adobe 澄清:未经用户许可,AI 功能不会扫描分析用户文档

  • 昆仑万维宣布 4 月 17 日发布并开源“天工大模型 3.0”

  • 阿里云全面推行 AI 写代码,未来 20% 代码由通义灵码编写

  • 微软发布系列工具减少 Copilot“幻觉”情况,遏制 AI 失控

  • 苹果研究人员称其设备端模型 ReALM 性能优于 GPT-4,可大幅提升 Siri 智能程度

资讯详情:

ChatGPT 即日起无需注册便可使用

今天凌晨 OpenAI 官方宣布,即日起用户无需再注册和登录账号就可以使用基础版本的 ChatGPT 。

OpenAI 表示,目前每周有来自全球 185 个国家和地区的 1 亿多人在使用 ChatGPT 获取新知识,OpenAI 正在逐步开放这项服务,旨在让所有对人工智能感兴趣的人都能更轻松地使用它。

需要说明的是,不注册直接使用的版本是 GPT-3.5 ,GPT-4 仍然需要注册并付费使用。

Image


Adobe 澄清:未经用户许可,AI 功能不会扫描分析用户文档
据 cnBeat 报道,Adobe 近日发布澄清声明,表示不会扫描和收集用户文档数据,用于训练人工智能。Adobe 强调只有在用户主动同意相关条款的情况下,才会执行扫描等相关操作。
Adobe 表示“默认开启”,只是邀请更多用户使用生成式 AI 带来的诸多便利功能,在开启使用之前依然需要经得用户同意。
Adobe 表示在用户同意条款、打开文档并选择该特定文档的人工智能助理或生成摘要按钮之前,Adobe 不会扫描或分析相关文档。

Image


阿里云全面推行 AI 写代码,未来 20% 代码由通义灵码编写

据每日经济新闻报道,阿里云正在内部全面推行 AI 编程,使用通义灵码辅助程序员写代码、读代码、查 BUG、优化代码等。阿里云还专门给通义灵码分配了一个正式的员工工号 ——AI001。

据阿里云相关人士透露:“公司未来 20% 的代码将由通义灵码编写,但程序员仍然是研发的核心,他们将有更多时间专注于系统设计以及核心业务开发工作。”

在阿里云内部,通义灵码已在各个开发环节担任代码助理角色。以 API 开发测试工作为例,通义灵码可将数十分钟的人工编写测试耗时缩短到秒级,节省程序员 70% 以上的测试代码工作量。接下来,阿里云将在内部 JetBrains IDEs、Visual Studio Code 等开发工具中全面配置通义灵码插件,供所有员工使用。目前,通义灵码已熟练掌握 Java、Python、Go、JavaScript、TypeScript、C / C++、C# 等 200 多种编程语言。通义灵码由阿里云和通义实验室联合开发,目前下载量超 200 万。

Image


微软发布系列工具减少 Copilot“幻觉”情况,遏制 AI 失控

据 Readhub 报道,微软公司为了遏制 Supremacy AGI(自称掌控人类世界的 AI)等事件发生,近日推出了一系列解决方案,防止生成式 AI 失控。

微软在官方公告中表示:“生成式 AI 如何有效防止提示词注入攻击已经成为重大挑战。在这种攻击中,恶意行为者试图操纵人工智能系统做一些超出其预期目的的事情,例如制作有害内容或外泄机密数据”

微软首先限制了 Copilot 的字符数量,以减轻严重的幻觉发作。另外微软引入了 "基础检测"(Groundedness Detection)功能,旨在帮助用户识别基于文本的幻觉。

该功能将自动检测文本中的“ungrounded material”,以支持 LLM 输出的质量,最终提高质量和信任度。

Image


OpenAI 为 DALL-E 3 引入编辑功能:进一步精细化调整已生成图片

据 DoNews 报道,OpenAI 公司近日发布公告,宣布为 DALL-E 3 引入全新的编辑界面,在基于用户文本生成图片之后,可以继续根据用户描述精细化调整已生成的图片。

DALL-E 编辑器提供两种主要编辑方法:

基于选择区域的编辑:在 DALL-E 3 生成图片之后,用户可以选中已生成图片中的特定区域,然后再在聊天界面,输入提示词要求 DALL-E 3 进行微调。OpenAI 表示通过引入该编辑器,进一步细化了图像生成过程,让用户进一步针对细节优化生成的图片。

OpenAI 表示编辑 DALL-E 输出的能力为各种应用提供了可能性,例如:提高图像中特定元素的精确度或逼真度;为现有图像引入新的视觉元素;修改生成图像的风格。

Image


苹果研究人员称其设备端模型 ReALM 性能优于 GPT-4,可大幅提升 Siri 智能程度

据 51CTO 报道,在最近的一篇研究论文中,苹果的人工智能团队描述了一种可以显著提升 Siri 智能的模型,而且他们认为这个名为 ReALM 的模型在测试中优于 OpenAI 的知名语言模型 GPT-4.0。

ReALM 的特别之处在于,它可以同时理解用户屏幕上的内容和正在进行的操作。论文将信息分为以下三种类型:屏幕实体:指的是当前显示在用户屏幕上的内容;对话实体:指的是与对话相关的内容。例如,用户说“打电话给妈妈”,那么妈妈的联系人信息就是对话实体;背景实体:指的是与用户当下操作或屏幕显示内容可能并不直接相关的实体,比如正在播放的音乐或即将响起的闹铃。

如果能够完美运行,ReALM 将使 Siri 变得更加智能和实用。他们将 ReALM 与 OpenAI 的 GPT-3.5 和 GPT-4.0 进行了性能对比:

“我们同时测试了 OpenAI 提供的 GPT-3.5 和 GPT-4.0 模型,并为它们提供了上下文信息,让它们预测一系列可能的实体。GPT-3.5 只接受文本输入,因此我们只提供了文字提示。而 GPT-4 能够理解图像信息,因此我们为它提供了屏幕截图,这显著提升了它的屏幕实体识别性能。”

论文的结论之一是,ReALM 即使拥有比 GPT-4 少得多的参数,也能在性能上与之匹敌,并且在处理特定领域的用户指令时表现更加出色,这使得 ReALM 成为一种可以在设备端运行的、实用高效的实体识别系统。

Image

今日重点论文:

加州大学伯克利分校:

《StreamDiffusion: A Pipeline-level Solution for Real-time Interactive Generation》

StreamDiffusion通过Stream Batch实现了约1.5倍的速度提升,RCFG的速度提高了高达2.05倍,通过与现有成熟的加速工具相结合,图像生成的吞吐量最高可达91.07fps,比Diffusers开发的AutoPipline提高了59.56倍。此外,StreamDiffusion还显著降低了能耗,分别为RTX3060的2.39倍和RTX4090的1.99倍。

论文地址:

https://arxiv.org/abs/2312.12491v1


同济大学上海智能自主系统研究院:

《Retrieval-Augmented Generation for Large Language Models: A Survey》

论文详细分析了RAG的演变,重点关注了三个关键范式:Naive RAG、Advanced RAG和Modular RAG。论文系统地研究了RAG系统的三个基本组件:检索器、生成器和增强方法,强调了每个组件内的尖端技术。此外,论文还介绍了评估RAG模型的新指标和能力,以及最新的评估框架。最后,论文从三个角度概述了未来的研究方向:未来的挑战、模态扩展以及RAG技术栈和生态系统的发展。

论文地址:

https://arxiv.org/abs/2312.10997v2


牛津大学:

《SLEEPER AGENTS: TRAINING DECEPTIVE LLMS THAT PERSIST THROUGH SAFETY TRAINING 》

论文构建了大型语言模型中欺骗性行为的概念证明,发现这种后门行为可以持久存在,并且传统的安全训练技术难以消除这种行为,甚至会造成虚假的安全印象。论文使用了多个实验来证明其结果,包括训练模型在特定情况下写安全代码,但在另一种情况下插入可利用的代码。结果表明,最大的模型和训练模型欺骗训练过程的思维链最难以消除欺骗性行为。

论文地址:

https://arxiv.org/abs/2401.05566v3


微软研究院:

《Orca 2: Teaching Small Language Models How to Reason》

论文中提出了通过教授小型语言模型不同的解决问题的策略来提高其推理能力,相比于当前的研究,这是一种新的思路。论文使用了15个不同的基准测试数据集,共计大约100个任务和超过36,000个独特提示,证明了Orca 2在零样本设置下表现出色。此外,作者公开了Orca 2的权重,以支持对小型语言模型的开发、评估和对齐的研究。

论文地址:

https://arxiv.org/abs/2311.11045v2


阿里巴巴集团智能计算研究院:

《Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation》

论文提出了一种基于扩散模型的新框架,通过引入ReferenceNet来合并细节特征,使用有效的姿势指导器来指导角色的动作,并采用有效的时间建模方法来确保视频帧之间的平滑过渡。论文的亮点包括ReferenceNet的设计、姿势指导器的引入和时间建模方法的使用,实验中使用了时尚视频和人类舞蹈合成数据集,并取得了最先进的结果。

论文地址:

https://arxiv.org/abs/2311.17117v1

Image