Grok Voice Transcribe 2.0 是 xAI 于 2026 年 9 月 18 日发布的语音转文字模型,官方称其为目前最准的转写模型之一,在自家真实场景评测中准确率是 1.0 版本的两倍而价格不变,并在 Artificial Analysis 的流式转写榜单上位列 32 个模型的准确率第一。它建立在 Grok Voice 的音频基础模型之上,训练数据包含真实嘈杂环境下的多语言现场音频,重点解决电话线路差、多人抢话、口音、电话号码与邮箱地址这类难例。
多语言是它相对上一代提升最大的部分:自动检测语种,并能在一次转写中跟随中途切换的语言,覆盖数十种语言。价格与 1.0 完全一致:批量转写 $0.10 每音频小时,流式 $0.20 每音频小时,包含说话人分离、时间戳与关键词表。官方表示 2.0 很快会成为 Speech-to-Text API 的默认模型,1.0 将在未来数周内下线,过渡期若要继续用旧版需固定 grok-voice-transcribe-1.0。适合会议记录、客服电话质检、视频字幕与语音助手等场景。
- 2026 年 9 月 18 日发布,官方称准确率为 1.0 的两倍,Artificial Analysis 流式榜准确率第一
- 自动语种检测并支持录制中途切换语言,批量 $0.10/小时、流式 $0.20/小时(含说话人分离与时间戳)
- 即将成为 Speech-to-Text API 默认模型,1.0 数周内下线,可固定 grok-voice-transcribe-1.0 过渡
数据统计
数据评估
关于Grok Voice Transcribe 2.0(语音转写 API)特别声明
本站AI之旅导航提供的Grok Voice Transcribe 2.0(语音转写 API)都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由AI之旅导航实际控制,在2026年9月21日 上午5:05收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,AI之旅导航不承担任何责任。
相关导航
暂无评论...
