GenAI新世界

8月13日 AI 头条|AI 初创公司发布“全球最强”AI 编程助手 Genie,击败Devin和GPT-4

Image
划重点:
  • AI 初创公司发布“全球最强”AI 编程助手 Genie,击败Devin和GPT-4

  • 我国完成备案并上线、能为公众提供服务的生成式 AI 服务大模型达 180 多个

  • X 因获取欧盟用户数据用于训练 Grok 而遭到一系列隐私投诉

  • AMD 完成收购欧洲最大私人 AI 实验室 Silo AI

  • 阿里通义开源音频语言模型Qwen2-Audio,相关论文入选顶会ACL 2024

  • IBM 推出生成式 AI 网络安全助手

  • 梅赛德斯-奔驰与火山引擎达成合作 涉及大模型、生成式AI等领域

  • 微软Face Check人脸识别技术正式上线 提升企业身份认证安全性

资讯详情:
AI 初创公司发布“全球最强”AI 编程助手 Genie,击败Devin和GPT-4
AI 初创公司Cosine 今天宣布,他们已经打造出世界上最强的 AI 编程助手 Genie,并在权威榜单 SWE-Bench 中获得了30.08%的好成绩,超过了Devin和GPT-4。
Cosine 表示,Genie 可以完全自主的与用户进行沟通,并完成解决 Bug、构建功能、重构代码等任务。Cosine采用特殊数据集和自我改进机制,使Genie在复杂编码中表现出色。
目前Genie已开放申请试用,未来将推出更多惊喜功能。
Image
我国完成备案并上线、能为公众提供服务的生成式 AI 服务大模型达 180 多个
据工信微报消息,截至目前,我国已经完成备案并上线、能为公众提供服务的生成式人工智能服务大模型达 180 多个,注册用户数已突破 5.64 亿。
据介绍,近年来我国人工智能发展取得显著成效。一方面,初步构建了较为全面的人工智能技术产业体系,相关企业超过 4500 家,产业规模持续扩大;另一方面,人工智能与实体经济融合不断深化,人工智能应用加速探索,建成 2500 多个数字化车间和智能工厂,经过人工智能改造,研发周期平均缩短 20%,生产效率提升 35%。
同时,人工智能也在加速政务、金融、能源等领域的数字化进程。
Image
X 因获取欧盟用户数据用于训练 Grok 而遭到一系列隐私投诉
据 cnbeta 报道,马斯克旗下的社交媒体平台 X 在未征得用户同意的情况下,擅自将欧盟用户的数据用于训练人工智能模型,从而引发了一系列隐私投诉。
上月底,一位眼尖的社交媒体用户发现了一个设置,显示 X 已经悄悄开始处理地区用户的发帖数据,以训练其 Grok 人工智能聊天机器人。这一发现引起了爱尔兰数据保护委员会(DPC)的「惊讶」,该委员会是负责监督 X 公司遵守集团《通用数据保护条例》(GDPR)的监督机构。
GDPR 规定,所有个人数据的使用都必须有有效的法律依据。奥地利、比利时、法国、希腊、爱尔兰、意大利、荷兰、波兰和西班牙的数据保护机构收到了针对 X 公司的九项投诉,指控其在未征得欧洲人同意的情况下处理他们的职位以训练人工智能,从而违反了这一规定。
Image
AMD 完成收购欧洲最大私人 AI 实验室 Silo AI
据AMD 官方消息,已完成对欧洲最大私人 AI 实验室 Silo AI 的收购,交易金额约为 6.65 亿美元,采用全现金支付。至此,Silo AI 的科学家和工程师正式加入 AMD 大家庭。
AMD 对 AI 领域的重视不言而喻,此次收购是其战略布局的重要一步,旨在进一步强化公司在 AI 及相关技术领域的领导地位。与谷歌、Meta、苹果等科技巨头一样,AMD 也在积极向 AI 转型,但与之不同的是,AMD 在这一领域的投入相对较晚。
Silo AI 的客户包括安联保险、飞利浦、劳斯莱斯和联合利华等行业巨头。此次收购不仅确保 Silo AI 继续使用 AMD 芯片和技术,还将助力 AMD 推进开源生成式 AI 训练和应用软件的开发。
Image
阿里通义开源音频语言模型Qwen2-Audio,相关论文入选顶会ACL 2024
阿里通义大模型继续开源,Qwen2系列开源家族新增音频语言模型Qwen2-Audio。
Qwen2-Audio可以不需文本输入,直接进行语音问答,理解并分析用户输入的音频信号,包括人声、自然音、音乐等。该模型在多个权威测评中都显著超越先前的最佳模型。通义团队还同步推出了一套全新的音频理解模型测评基准,相关论文已入选本周正在举办的国际顶会ACL 2024。
Image
IBM 推出生成式 AI 网络安全助手
据IBM 官方消息,IBM 将在其托管威胁检测和响应服务中引入生成式 AI 功能,供 IBM Consulting (IBM 咨询)的分析人员使用,从而协作客户推进和简化安全运营。
全新的IBM Consulting Cybersecurity Assistant 基于 IBM 的数据和 AI 平台 watsonx 构建,旨在加快和改进对关键安全威胁的识别、调查和响应。
除了被纳入 IBM Consulting 的威胁检测和响应服务,Cybersecurity Assistant 还将成为 IBM Consulting Advantage 的一部分,后者是一个 AI 服务平台,包含为 IBM 咨询顾问量身定制的 AI 资产。
Image
梅赛德斯-奔驰与火山引擎达成合作 涉及大模型、生成式AI等领域
据火山引擎官方消息,梅赛德斯-奔驰(中国)投资有限公司与北京火山引擎科技有限公司近日签署了战略合作备忘录,宣布将在大模型、生成式人工智能和大数据技术领域展开深入合作与探索。
这一战略合作标志着梅赛德斯-奔驰在中国数字化创新的进一步提速,旨在通过AI科技提升智能座舱体验,为中国客户带来更便捷、个性化的数字豪华体验。
梅赛德斯-奔驰正不断加大在中国的研发投入,特别是在智能网联汽车领域,致力于以“中国速度”为客户提供超越期待的体验。此次合作将深化与火山引擎等中国科技公司的合作,利用火山引擎在云计算、大模型、人工智能等领域的技术实力,共同探索智能座舱等领域的创新可能。
Image
微软Face Check人脸识别技术正式上线 提升企业身份认证安全性
微软今日正式宣布,其人脸识别技术Face Check已全面向所有企业客户开放。这项技术通过结合用户手机自拍和已验证的身份照片,为企业提供更安全可靠的身份认证服务。
Face Check技术首次亮相于今年2月,并已整合至微软的Entra数字身份服务中。微软指出,网络犯罪分子65%的攻击路径都涉及不安全的身份验证方式。随着生成式AI的迅速发展,传统数字身份系统面临的威胁日益增加。不法分子可以轻易绕过常见的验证方法,如CAPTCHA验证码或个人信息问题,从而增加了身份验证的重要性。
Face Check通过将用户的手机自拍与已验证的身份照片(如护照照片)进行比对,有效解决了这一问题。微软特别强调,Face Check技术只共享匹配结果,不涉及敏感身份数据,在保护用户隐私的同时,提升了企业的身份验证能力。此外,该技术还能够有效抵御包括深度伪造在内的各种欺骗手段,全方位保障用户身份安全。
Image
今日重点论文:
岛根大学:
《Transformers are Universal In-context Learners》
本文旨在研究深度transformer架构处理任意数量上下文标记的能力。同时,考虑到这些映射是基于表示上下文的概率分布的,作者试图通过数学方法来统一地描述这些架构的表达能力。本文证明了深度transformer是通用的,可以在任意精度下均匀地逼近连续的上下文映射,而且对于固定精度,单个transformer可以处理任意数量的标记,且标记嵌入维度和头数是固定的。
论文地址:
https://arxiv.org/abs/2408.01367v1
谷歌:
《Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters》
论文研究如何在LLMs中使用更多的测试时间计算来提高性能,特别是针对具有挑战性的提示问题。研究试图回答一个问题:如果一个LLM被允许使用固定但非微不足道的推理时间计算量,它在挑战性提示问题上的性能会有多大提高?论文分析了两种主要机制来扩展测试时间计算:(1)针对密集的基于过程的验证器奖励模型进行搜索;(2)在测试时间根据提示自适应地更新模型对响应的分布。研究发现,不同的测试时间计算方法的效果在很大程度上取决于提示的难度,因此提出了一种“计算最优”的扩展策略,根据提示自适应地分配测试时间计算,从而提高测试时间计算的效率。
论文地址:
https://arxiv.org/abs/2408.03314v1
Meta:
《Self-Taught Evaluators》
使用合成数据自我训练评估器,以替代人类评估,提高模型评估的效率和准确性。通过迭代的自我训练方法,使用合成数据训练Llama3-70B-Instruct模型作为评估器,无需人类标注数据即可提高评估器的准确性。
论文地址:
https://arxiv.org/abs/2408.02666v2
Appier :
《Let Me Speak Freely? A Study on the Impact of Format Restrictions on Performance of Large Language Models》
本论文旨在研究结构化生成对大语言模型的推理和领域知识理解能力的影响。通过限制生成空间,将大语言模型约束为遵循结构化格式,研究其推理能力和领域知识理解能力的表现。研究发现,将大语言模型限制为遵循结构化格式会导致其推理能力显著下降。同时,更严格的格式限制通常会导致推理任务的性能下降更多。
论文地址:
https://arxiv.org/abs/2408.02442v1
Image