GenAI新世界

7月16日 AI 头条|谷歌 Gemini 被曝将推出多项新功能,包含记忆、定制GPT等

Image
划重点:
  • 谷歌 Gemini 被曝将推出多项新功能,包含记忆、定制GPT等
  • 豆包文生图功能优化,网页端上线多项新功能
  • 阶跃星辰启动繁星计划,为开发者提供支持
  • YouTube 推出新规:用户可要求下架模仿自己面部、声音的 AI 合成内容
  • 微软 Word 增强 Draft AI 功能:改写、扩写内容,自动优化排版等
  • Anysphere获得A16z新一轮投资,估值达4亿美元
  • 微软发布论文,或将为 Excel等工具推出全新 AI 模型
  • Youtube Music 测试全新 AI 功能对话式广播
  • 新型验证码破解工具GPT4o Captcha Bypass问世
资讯详情:
谷歌 Gemini 被曝将推出多项新功能,包含记忆、定制GPT等
据 testingcatalog 爆料,谷歌将会在近期为其 AI 大模型 Gemini 推出多项全新功能。
据报道,新上线的功能包括文生图工具 Imagen 3,帮助用户生成喜欢的图片。该项功能将会向 AI Labs 的 alpha 测试人员提供。此外,还有可以定制GPT 的 GEM 功能。用户可以查看、编辑和复制 Gem,帮助用户解决不同领域的问题。Gemini 还会推出记忆功能,可以根据以往的交流经验来为用户提供更具个性化的回答。,此外 Gemini 还会推出录音、Google Photos 直连等新功能,但具体功能上线时间尚未确定。
Image
豆包文生图功能优化,网页端上线多项新功能
豆包近日宣布,正在对其文生图功能进行优化,当前网页端已经支持参考图、比例调整等多个功能。
据悉,网页端豆包现在可以根据参考图片生成指定内容,此外用户还可以调整生成画面的比例,或者制定其图片的整体风格。
Image
阶跃星辰启动繁星计划,为开发者提供支持
据阶跃星辰官方消息,阶跃星辰旗下开放平台繁星计划第一期现已正式启动,寻找多模态大模型领域的初创企业和优秀独立开发者团队合作。
据悉,繁星计划将会为合作伙伴提供免费 Tokens、产品曝光、对接合作、技术支持、RPM/TPM 支持等多方面支持,而对方需要向用户介绍、推广阶跃星辰,并提供模型的使用反馈。
用户可通过阶跃星辰官方公众号加入繁星计划。
Image
YouTube 推出新规:用户可要求下架模仿自己面部、声音的 AI 合成内容
据 PhoneArena 报道,用户可以要求 YouTube 删除人工智能生成的、试图模拟其面部或声音的内容。
这一请求将根据 YouTube 的隐私请求流程提出,而不是像 Deepfake 那样因为具有误导性而要求删除。根据 YouTube 最新的隐私保护指南,只有第一方提出的请求才会被考虑删除,但也有一些例外情况。
第一方索赔的例外情况包括当受人工智能内容影响的个人是未成年人、已故或无法使用电脑时提出的删除请求。请求删除此类内容并不能保证内容一定会被删除,即使人工智能内容模仿的是你的外表或声音。YouTube 警告说,它将根据各种因素自行决定是否删除内容。
Image
微软 Word 增强 Draft AI 功能:改写、扩写内容,自动优化排版等
据 微软官方消息,微软增加了根据 Word 文档中的特定选项使用 Copilot 起草的功能。
据悉,该项功能被称为Draft with Copilot ,可以完善、改写或转述现有选文 ,还可以详细阐述、扩展或解释所选内容  并用用统计数据和附加信息来充实内容。 微软表示,该项功能将会在未来几个月内持续加强,增加更多的新功能。
Image
Anysphere获得A16z新一轮投资,估值达4亿美元
据 businessinsider 报道,AI 编程初创公司 Anysphere 宣布从 A16z 获得新一轮融资,公司估值达到4亿美元。
Anysphere 主营 AI 代码编辑器,其主要产品 Cursor 受到包括 OpenAI 和 Perplexity 等多家公司的关注。Anysphere 的目标是通过这款 AI 编辑器来帮助开发者提高工作效率,简化编码过程。
Image
微软发布论文,或将为 Excel等工具推出全新 AI 模型
据 Arxiv 页面显示,微软正研发一款全新大语言模型SpreadsheetLLM,将为Excel 等表格工具提供AI 能力。
论文显示,SpreadsheetLLM专门为电子表格应用设计,可以帮助用户更好的处理电子表格中的数据。该模型主要由 3 个模块组成:基于结构锚的压缩、反向索引转换和数据格式感知聚合。研究显示,SpreadsheetLLM 大大提高了电子表格表检测任务的性能,在 GPT4 的情境学习设置中,比普通方法高出 25.6%;使用token的成本降低了 96%,并能提供更好的处理结果。
Image
Youtube Music 测试全新 AI 功能对话式广播
据 9to5Google 报道,YouTube Music 近日推出了全新的声音搜索功能,同时该公司宣布,他们正在测试全新的 AI 功能对话式广播。
对话式广播功能可以让用户通过描述他们想听的内容来创建自定义的电台。功能上线后,用户可以主Feed中看到一个“以任意方式寻求音乐”的新卡片。进入之后将会打开一个聊天界面,让用户可以通过文字来创建属于自己的个性化电台。
Image
新型验证码破解工具GPT4o Captcha Bypass问世
据 Github页面显示,有开发者发布了一款名为GPT4o Captcha Bypass的CLI 工具,用于使用 Python 和 Selenium 破解各种类型的验证码,包括拼图、文本、复杂文本和 reCAPTCHA。
GPT4o Captcha Bypass工具通过AI辅助来解决复杂的验证码问题。采用Python编程语言开发,便于扩展和定制。同时利用Selenium框架实现对网页元素的自动化操作,提高测试效率。该工具还使用 OpenAI GPT-4 来帮助解决验证码问题。
Image
今日重点论文:
波形智能:
《Symbolic Learning Enables Self-Evolving Agents》
论文旨在解决当前语言代理研究中的一个基本限制,即模型中心化或工程中心化的问题,通过引入代理符号学习框架,使语言代理能够在数据中心化的方式下自主学习和进化,从而可能实现人工通用智能。
论文地址:
https://arxiv.org/abs/2406.18532v1
ARC:
《Reactor Mk.1 performances: MMLU, HumanEval and BBH test results》
这篇论文通过基准测试分析,介绍了ARC旗舰大语言模型Reactor Mk.1的性能结果。该模型采用了荔枝AI引擎,参数少于1000亿,具有高效和强大的组合特点。Reactor Mk.1在MMLU数据集上获得了92%的分数,在HumanEval数据集上获得了91%的分数,在BBH数据集上获得了88%的分数,超越了GPT-4o、Claude Opus和Llama 3等模型。它在处理困难任务和推理方面表现出色,成为当今尖端人工智能技术中杰出的解决方案。
论文地址:
https://arxiv.org/abs/2406.10515v1
Illuin Technology:
《ColPali: Efficient Document Retrieval with Vision Language Models》
本论文旨在解决现有文档检索系统无法高效利用视觉线索的问题,提出了一种新的检索模型 ColPali,通过图像生成文档的上下文化嵌入,从而提高文档检索的效率。ColPali 模型利用最近的视觉语言模型,仅从文档页面的图像中生成高质量的上下文化嵌入,并与后期交互匹配机制相结合,从而在速度和性能方面大大优于现代文档检索管道。
论文地址:
https://arxiv.org/abs/2407.01449v2
卡内基梅隆大学:
《A Rate-Distortion View of Uncertainty Quantification》
论文旨在解决深度神经网络缺乏理解输入与训练数据之间接近程度的问题,提出一种新的方法DAB来丰富深度神经网络的特性。DAB方法学习一个代码本,存储训练过程中所有输入的压缩表示,新样本与代码本之间的距离可作为样本的不确定性估计,通过单次前向传递实现确定性的不确定性估计。
论文地址:
https://arxiv.org/abs/2406.10775v2
Image