GenAI新世界

7月26日 AI 头条|OpenAI即将为ChatGPT Plus用户推出语音功能

Image 
划重点:
  • OpenAI即将为ChatGPT Plus用户推出语音功能

  • 智谱 AI 发布视频生成工具清影
  • OpenAI 宣布旗下AI搜索引擎 SearchGPT 开启内测
  • 何小鹏:端到端 + 大模型可以真正实现智驾全球化
  • OpenAI 年度亏损或达50亿美元
  • 我国团队开发糖尿病诊疗多模态大模型 DeepDR-LLM
  • 商汤大模型技术将用于巴黎奥运会赛事转播、竞技分析等领域
  • 谷歌旗下两款大模型在国际数学奥林匹克竞赛难题方面达到银牌标准  
资讯详情:
OpenAI即将为ChatGPT Plus用户推出语音功能         
Sam Altman最新披露,ChatGPT Plus订阅用户将于下周获得备受期待的语音功能。这一重大更新预示着人工智能交互体验即将迎来革命性的变革。
早在今年5月,OpenAI就首次展示了ChatGPT的语音功能原型。当时,这项技术因其逼真的语音质量引起广泛关注,甚至被比作科幻电影《她》中由斯嘉丽·约翰逊配音的AI助手。尽管最终决定不使用那个特定的语音选项,但即将推出的语音功能仍然令业界和用户充满期待。   
语音功能的加入将显著提升ChatGPT的交互体验。用户可以通过语音与AI助手进行更自然、更便捷的对话,特别是在移动设备上的使用场景。这不仅扩展了ChatGPT的应用范围,还为语言学习、听力训练等领域开辟了新的可能性。
Image
智谱 AI 发布视频生成工具清影
据 智谱 AI 官方消息,智谱宣布推出视频生成工具清影,根据智谱视频生成模型CogVideoX 打造。
据悉,清影可以在30秒内生成一段6秒的视频,而且生成的视频能够较好地还原物理世界中的运动过程。清影同时可以高效处理用户的指令,即使是复杂的 prompt,清影也能准确理解并执行。
此外,智谱大模型开放平台bigmodel.cn 也部署了清影。企业和开发者可通过 API 调用方式,体验并使用「清影」的文本生成视频和图像生成视频功能。   
Image
OpenAI 宣布旗下AI搜索引擎 SearchGPT 开启内测
据 OpenAI 官方消息,此前曝光的搜索引擎SearchGPT 现已开放内测,仅限10000名用户参与。
据 OpenAI 表示,内测版SearchGPT使其 AI 搜索产品的原型产品,OpenAI 将会在正式开放时将其最受欢迎的功能放入到正式版之中。据悉,SearchGPT 的整体界面与Perplexity差不多。用户在对话框中输入查询,SearchGPT实时搜索网络后总结出一份结构化的答案,包含图片和视频信息,同时列出相关信息来源。用户可以继续追问或在侧边栏中探索更多相关搜索。
OpenAI强调 ,SearchGPT 是与多个新闻合作伙伴共同开发的,包括《华尔街日报》、美联社和Vox Media 等。这些出版商将有一种方式来“管理他们在 OpenAI 搜索功能中的展示方式。   
Image
何小鹏:端到端 + 大模型可以真正实现智驾全球化
据小鹏汽车官方消息,小鹏汽车 AI 智驾技术发布会将于 7 月 30 日 19:30 举行。
在为活动预热时,创始人何小鹏表示,到端 + 大模型的组合,可以解决 L2-L4 的软件架构,但是也的确需要更大算力和相关硬件的变化配合。而且端到端是真正可以全球化的,是真正可以到小区和所有内部道路自动驾驶的最优解决方案。
何小鹏透露,7 月 30 日发布会将不光发布中国的智驾能力变化,还第一次同步发布全球更多国家的智驾。   
Image
OpenAI 年度亏损或达50亿美元
据 The Information 报道,OpenAI 的内部财务数据和相关人员分析显示,这家公司今年很可能损失 50 亿美元。
据悉,OpenAI 花费大量资金租用 Microsoft 的服务器来为 ChatGPT 及其底层大型语言模型提供支持。截至 3 月份,该公司预计今年将在这些推理成本上花费近 40 亿美元。OpenAI 也在 AI 训练和数据上的花费可能高达 30 亿美元,据悉 OpenAI 对新 AI 的训练速度比最初计划要更快,导致支出进一步增加。人工成本方面,OpenAI 目前拥有约 1500 名员工,随着公司不断发展,人工成本可能会达到 15 亿美元。
在收入方面,OpenAI 大概能从 ChatGPT 和大语言模型收费访问中获得大概 30 亿美元的年收入,而 OpenAI 最近的月收入为 2.83 亿美元左右,年收入预计在 35 亿至 45 亿美元之间,这意味着 OpenAI 今年或面临着 50 亿美元的缺口。   
Image
我国团队开发糖尿病诊疗多模态大模型 DeepDR-LLM
据上海市第六人民医院官方公众号消息,上海交通大学医学院附属第六人民医院贾伟平教授和李华婷教授团队与上海交通大学电院计算机系 / 教育部人工智能重点实验室盛斌教授团队,携手清华大学黄天荫教授团队与新加坡国立大学覃宇宗教授团队,通过医工交叉合作研究,构建了全球首个面向糖尿病诊疗的视觉-大语言模型的多模态集成智能系统 DeepDR-LLM,成果于 2024 年 7 月 19 日在 Nature Medicine 发表
据介绍,DeepDR-LLM 系统融合了大语言模型和深度学习技术优势,实现了医学影像诊断与诊疗意见的多模态生成功能,能提供糖尿病视网膜病变辅助诊断结果及个性化糖尿病综合管理意见。
该系统在覆盖亚非欧三大区域七个国家的多中心队列中进行了回顾性验证,以及针对中国基层医疗实际开展了前瞻性真实世界验证,首次向全球提供了面向糖尿病医疗垂直领域的多模态大模型应用成效的高质量循证证据。研究团队表示,研究证明 DeepDR-LLM 系统可有效改善 DR 筛查和基层糖尿病管理水平,为未来全球糖尿病治理提供了革命性的数字解决方案。   
Image
商汤大模型技术将用于巴黎奥运会赛事转播、竞技分析等领域
据36氪报道,巴黎奥运会期间,商汤AI智慧篮球产品将全程参与中国国家篮球队的赛事征程,提供运动数据分析及竞技策略优化支持等。
据介绍,基于商汤与SMT合作开发的InnoMotion赛事转播方案,可利用商汤3D无感知运动捕捉技术,在完全无穿戴设备的情况下,实现多人、大范围、多角度的多元场景覆盖,实时获得空间运动姿态信息。
此外,商汤智慧赛事转播技术将用于乒乓球、射箭两个项目的全程赛事转播。   
Image
谷歌旗下两款大模型在国际数学奥林匹克竞赛难题方面达到银牌标准
据谷歌 Deepmind 官方消息,正规数学推理模型 AlphaProof 和改进版几何求解模型 AlphaGeometry 2共同解决了今年国际数学奥林匹克六道难题中的四道,首次达到了与银牌获得者相同的水平。
AlphaProof 通过确定答案并证明其正确性,解决了两个代数问题和一个数论问题。这其中包括比赛中最难的问题,在今年的 IMO 中只有五名选手解决了这一问题。AlphaGeometry 2 证明了几何问题,而两个组合问题仍未解决。
据悉,这两个 AI 系统最终获得了 28 分,每个问题都得到了满分,相当于银牌组的最高分。   
Image
今日重点论文:
哈佛大学:
《Reactor Mk.1 performances: MMLU, HumanEval and BBH test results》
Reacto Mk.1是一种大型语言模型,本文试图评估其性能并与其他模型进行比较。本文介绍了Reacto Mk.1的性能结果,并强调其在效率和效能方面的优势。Reacto Mk.1在MMLU数据集上获得了92%的得分,在HumanEval数据集上获得了91%的得分,在BBH数据集上获得了88%的得分。该模型在处理复杂任务和推理方面表现出色。此外,本文还介绍了使用的Lychee AI引擎以及模型的参数数量少于1000亿,使其成为当前领先的人工智能解决方案之一。
论文地址:
https://arxiv.org/abs/2407.14679v1
索尼 AI :   
《Stretching Each Dollar: Diffusion Training from Scratch on a Micro-Budget》
本论文试图通过降低计算成本,解决大规模文本到图像生成模型的开发集中在具备大量计算资源的人群的问题。论文提出了一种低成本的大规模文本到图像扩散变换器模型训练方法,其中通过在训练期间随机屏蔽高达75%的图像块,来降低变换器的计算成本。论文使用预处理的图像块混合器和专家混合层来提高性能,同时证明了使用合成图像进行微预算训练的关键优势。
论文地址:
https://arxiv.org/abs/2407.15811v1
Meta
《Discrete Flow Matching》
本论文试图解决离散数据生成中的问题,提出了一种新的离散流匹配模型。论文提出了一种离散流匹配模型,可以生成高质量的离散数据,且不需要使用自回归模型。该模型使用一般的概率路径来插值源和目标分布,通过学习后验概率和噪声预测来采样这些概率路径,从而实现生成离散数据。
关键优势。
论文地址:
https://arxiv.org/abs/2407.15595v1
新加坡国立大学:
《KAN or MLP: A Fairer Comparison》
比较KAN和MLP模型在不同任务上的性能,控制参数数量和FLOPs进行公正全面的比较,研究KAN的优劣和存在的问题。通过对KAN和MLP模型在各种任务上的比较,发现除了符号公式表示任务外,MLP通常优于KAN。同时,通过对KAN的剖析,发现其优势主要在于B-spline激活函数,将其应用到MLP上可以显著提高符号公式表示的性能。此外,在标准的增量连续学习设置中,KAN的遗忘问题比MLP更严重。   
论文地址:
https://arxiv.org/abs/2407.16674v1    
Image