GenAI新世界

8月15日 AI 头条|OpenAI 推出 SWE-bench Verified 基准,更准确评估 AI 模型代码生成表现

Image
划重点:
  • OpenAI 推出 SWE-bench Verified 基准,更准确评估 AI 模型代码生成表现

  • Apple Intelligence被曝存在重大安全隐患

  • 苹果或将在2026年推出搭载 AI 系统的桌面机器人

  • 阿里团队推新框架UniPortrait:支持多角色一致性和风格参考

  • AI网络安全初创公司 Abnormal Security完成2.5亿美元融资

  • 我国研发具备共情能力导诊大模型:有望用于术前谈话,减少医患冲突

  • 软银放弃与英特尔合作开发 AI 芯片计划

资讯详情:
OpenAI 推出 SWE-bench Verified 基准,更准确评估 AI 模型代码生成表现
据OpenAI 官方消息,OpenAI 宣布推出 SWE-bench Verified 代码生成评估基准,解决了此前的局限性问题,能够更准确地评估人工智能模型在软件工程任务中的表现。
SWE-Bench 是一个用于评估 LLM 解决 GitHub 上真实软件问题能力的基准测试数据集。它收集了来自 12 个流行的 Python 仓库的 2294 个 Issue-Pull Request 对。在测试时,LLM 会拿到一个代码库和 issue 描述,然后生成一个补丁来解决 issue 描述的问题。
该基准使用两种类型的测试:
  • FAIL_TO_PASS 测试用于检查问题是否已得到解决

  • PASS_TO_PASS 测试用于确保代码更改不会破坏现有功能。

Image
Apple Intelligence被曝存在重大安全隐患
海外用户 Evan Zhou 爆料,苹果的 AI 系统Apple Intelligence存在重大安全隐患,可被黑客所利用。
Evan Zhou自称使用提示注入成功操纵了 Apple Intelligence,绕过了预期指令让 AI 能对任意提示做出响应。提示词注入攻击(Prompt Injection Attack)是一种新型的攻击方式,具有有不同的形式,包括提示词注入、提示词泄露和提示词越狱。当攻击者通过操纵人工智能,导致模型执行非预期操作或泄露敏感信息时,这种攻击就会发生。这种操纵可以使人工智能将恶意输入误解为合法命令或查询。
Image
苹果或将在2026年推出搭载 AI 系统的桌面机器人
据 Macrumors 报道,苹果计划在2026年推出一款桌面机器人产品,该设备售价约1000美元,将配备Apple Intelligence 技术。
据悉,该设备将配备一个类似 iPad 的大型显示屏,安装在一个机械臂上,允许显示屏上下左右倾斜和 360 度旋转。该设备可用作 “智能家居指挥中心”、FaceTime 通话等视频会议设备和家庭安全监控工具。这款桌面机器人将搭载 Siri 和Apple Intelligence,使其能够响应一系列口头命令,识别不同的声音,并自动调整显示屏的方向以面向房间里的用户。
苹果公司目前希望在 2026 年或 2027 年推出这款设备,并希望将价格维持在 1000 美元左右。
Image
阿里团队推新框架UniPortrait:支持多角色一致性和风格参考
据huggingface页面显示,阿里巴巴集团的研究团队发布了一种名为 UniPortrait 的全新框架,专注于人像图像的个性化处理,实现了单角色一致性、多角色一致性和风格参考。
这个框架不仅可以处理单一身份的图像,还可以在多角色的场景中进行高质量的个性化定制。UniPortrait 的特点是能够保持面部特征的高度逼真,并且支持广泛的面部编辑功能,用户甚至可以使用自由形式的文本描述来生成他们想要的图像,而不需要固定的布局。
UniPortrait 的核心由两个模块组成:ID 嵌入模块和 ID 路由模块。ID 嵌入模块负责提取每个身份的可编辑面部特征,并将这些特征以解耦的方式嵌入到扩散模型的上下文空间中。接着,ID 路由模块会根据图像合成中的不同区域自适应地组合和分配这些特征,从而实现单一和多个身份的个性化定制。
Image
AI网络安全初创公司 Abnormal Security完成2.5亿美元融资
Abnormal Security 近日宣布,公司已完成一比价值2.5亿美元的 D轮融资。这笔资金将被用于扩展其基于人工智能的网络安全平台,并加速全球的增长。
此次由波士顿的投资公司 Wellington Management 领投,Greylock Partners、Menlo Ventures 和 Insight Partners 等公司也参与了其中。此外,CrowdStrike 的 Falcon Fund 也对 Abnormal Security 进行了支持。通过这轮 D 轮融资,Abnormal Security 的总融资额达到了5.46亿美元,估值也提升至51亿美元。
Abnormal Security 专注于企业提供 AI 驱动的安全解决方案帮助他们抵御各种电子邮件攻击,包括勒索软件和高管冒充。
Image
我国研发具备共情能力导诊大模型:有望用于术前谈话,减少医患冲突
据《北京日报》报道,中国医学科学院基础医学研究所团队研发的导诊大模型 ——“特定场景提示增强对话机器人”,近日通过临床试验。
据悉,该大模型的构建以不同医学场景全方位采集的真实导诊对话为基础,以提取对话信息形成的知识库作为训练数据,能够解决不同医学场景中出现的各种特定问题。研究团队为采集原始医患对话记录,成立了“真实医学对话语料联盟”,建立了语音采集 > 自动文字转化 > 人工校对的标准化流程。截至 2024 年 6 月,该团队已在 24 个不同医学场景收集整理了超过 120 万例真实医患对话。
报道称,该模型兼具专业性和共情能力,不仅能够应用于导诊工作,未来也有望用于患者健康教育、术前谈话等更多复杂场景。
Image
软银放弃与英特尔合作开发 AI 芯片计划
据 Investing 报道,软银已经放弃了与英特尔合作生产 AI 芯片以与英伟达竞争的计划。
据报道,由于美国芯片制造商难以满足软银的要求,双方的合作未能实现。软银将谈判破裂归咎于英特尔,称英特尔无法满足其对产量和速度的要求。
据悉,在英特尔大幅削减成本计划之前,此次谈判便已宣布失败。
Image
今日重点论文:
Sakana AI:
《The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery》
论文旨在提出一种全自动的科学发现框架,使得前沿的大型语言模型能够独立进行研究并传达其发现。该框架的实现能够使得AI代理人像人类科学界一样,迭代地开发想法,从而在机器学习领域实现全自动科学发现。该框架引入了AI Scientist,能够生成新的研究思路,编写代码,执行实验,可视化结果,并编写完整的科学论文,然后运行模拟审核过程进行评估。这一过程可以重复进行,以开放式的方式迭代开发想法,从而像人类科学界一样。
论文地址:
https://arxiv.org/abs/2408.04948v1
埃尔朗根-纽伦堡大学:
《FruitNeRF: A Unified Neural Radiance Field based Fruit Counting Framework》
本篇论文旨在提出一种新的水果计数框架,通过利用最先进的视图合成方法,直接在3D中计数任何水果类型。同时,该框架可以独立于水果类型,利用基础模型生成任何水果的二进制分割掩模。该论文的关键思路是利用神经辐射场,通过对隐式Fruit Field的均匀体积采样,获得仅包含水果的点云,并在提取的点云上应用级联聚类,从而实现精确的水果计数。
论文地址:
https://arxiv.org/abs/2408.06190v1
加州大学伯克利分校 :
《Body Transformer: Leveraging Robot Embodiment for Policy Learning》
论文提出了Body Transformer(BoT)架构,旨在利用机器人体现来提高机器人学习的效果。BoT将机器人身体表示为传感器和执行器的图形,并利用掩码注意力在整个架构中汇集信息,从而提供了一个归纳偏差来指导学习过程。相比于当前的机器学习算法,BoT架构在任务完成、扩展性和计算效率方面表现更好。
论文地址:
https://arxiv.org/abs/2408.05147v1
斯坦福大学:
《Social Intelligence Data Infrastructure: Structuring the Present and Navigating the Future》
建立社交人工智能数据基础设施,以促进社交智能领域的研究和发展。建立包含全面社交人工智能分类和480个NLP数据集的社交人工智能数据基础设施,以分析现有数据集和评估语言模型在不同社交智能方面的表现。该基础设施有助于深入了解当前数据地图,并为未来数据集开发提供整体视角。研究表明未来社交智能数据集需要多方面的数据集、更多语言和文化的多样性、更多长尾社交情境以及更多交互式数据。
论文地址:
https://arxiv.org/abs/2403.14659v1
Image