OpenAI让模型“张嘴”,你要注意:辱骂AI,很贵的
01
会“想”的语音助手
GPT‑Realtime‑2的设计目标是让语音模型在保持对话流利度的同时,具备处理复杂事务所需的推理与行动能力。02
不唠闲嗑
03
实时翻译与转录
除GPT‑Realtime‑2之外,OpenAI同期发布的两款专用模型各自面向明确的场景需求。 GPT‑Realtime‑Translate专注于实时多语言翻译,支持超过70种输入语言, 可实时输出至13种目标语言,并同步提供转录文本。其目标应用场景包括客户支持、跨境销售、教育、活动以及面向全球受众的创作者平台。 视频平台Vimeo的AI负责人阿尔贝托·帕拉维奇尼(Alberto Parravicini)分享了他们的应用场景:在视频播放时嵌入GPT‑Realtime‑Translate,使创作者能够在上线瞬间就与全球观众进行跨语言沟通。04
安全与定价
在安全层面,Realtime API部署了多层护栏——系统 内置的主动分类器能够对会话进行实时监控,一旦识别出违反有害内容指南的交互,即可终止会话。 开发者还可借助Agents SDK方便地叠加自定义安全护栏。 OpenAI的使用政策明确禁止将输出内容用于垃圾信息、欺诈或其他有害目的。 根据官方的指引,除非交互情境已清楚表明对话对象为AI,否则开发者必须向最终用户清晰地披露其正在与人工智能互动(提示用户:现在发言的是AI)。此外,该API已全面支持面向欧盟客户的欧盟数据驻留,并受企业隐私承诺保护。 三款模型现已通过Realtime API向开发者开放。 定价方面,GPT‑Realtime‑2按语音token计费,每100万输入token价格为32美元(缓存输入为每100万token 0.40美元),每100万输出token价格为64美元。GPT‑Realtime‑Translate按使用时长计费,每分钟0.034美元。GPT‑Realtime‑Whisper同样按时长计费,每分钟0.017美元。推荐阅读