StepAudio 3 是阶跃星辰开放平台上的语音模型系列,官方文档目前列出五个模型:StepAudio 3 Realtime(面向实时互动的全双工语音模型,支持自然打断、附和识别与话权协调,内置语音识别、语音活动检测、联网搜索与知识库检索,可用 Chat Completions 或 Realtime WebSocket API 接入)、StepAudio 3 TTS(模型 ID stepaudio-3-tts,输入文本与音频,流式超低时延合成并支持音色克隆)、StepAudio 3 Gen(用自然语言统一生成并编排人声、音效、环境音与背景音乐)、StepAudio 3 Music(歌词成歌、纯音乐、翻唱与干声智能配乐)和 StepAudio 3 ASR(ASR Max,以语言模型为语义底座)。
计费口径明确:ASR Max 2.8 元/小时,TTS 2.5 元/万字符、音色克隆 9.9 元/音色,Gen 与 Music 目前限时免费(模型名带 preview,限免结束后预览版下线并新增付费正式版),Realtime 与 Chat 版本同样限时免费。官方还给出可核验的效果口径:ASR Max 的上下文推理错误率 0.57%,比上一代 2.5 ASR 的 1.59% 降低 64.2%,覆盖 20 多个垂类专名,并能处理中英混说、方言、悄悄话、歌唱等复杂音频;Realtime 强调「边想边说」与 Voice Agent 工具调用。适合会议纪要、视频字幕、智能客服、智能硬件语音交互与有声内容生产。
- 五个模型分工:Realtime 全双工对话/TTS 流式合成/Gen 综合音频/Music 音乐/ASR Max 识别
- ASR Max 按 2.8 元/小时、TTS 按 2.5 元/万字符计费,音色克隆 9.9 元/音色
- 官方数据:ASR Max 上下文推理错误率 0.57%,较上一代降低 64.2%;Gen 与 Music 限时免费
数据统计
数据评估
本站AI之旅导航提供的StepAudio 3(阶跃语音模型系列)都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由AI之旅导航实际控制,在2026年9月21日 上午5:05收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,AI之旅导航不承担任何责任。
