fangchao711 发表于 2023-8-26 11:26

强大的自媒体搬运短视频,文字转语音、语音转文字!视频翻译 一键轻松解决!

Whisper 模型是由 Alec Radford、Jong Wook Kim、Tao Xu、Greg Brockman、Christine McLeavey、Ilya Sutskever在《通过大规模弱监督实现的鲁棒语音识别》中提出的。

论文摘要如下:

我们研究了经过简单训练来预测互联网上大量音频转录的语音处理系统的能力。当扩展到 680,000 小时的多语言和多任务监督时,生成的模型可以很好地推广到标准基准,并且通常可以与之前的完全监督结果竞争,但在零样本迁移设置中无需任何微调。与人类相比,模型的准确性和稳健性接近人类。我们正在发布模型和推理代码,作为进一步开展鲁棒语音处理工作的基础。

尖端:

该模型通常表现良好,无需任何微调。
该架构遵循经典的编码器-解码器架构,这意味着它依赖于generate()函数进行推理。
目前仅针对短格式实现推理,即音频被预先分割成 <= 30 秒的片段。长格式(包括时间戳)将在未来版本中实现。
人们可以使用WhisperProcessor为模型准备音频,并将预测的 ID 解码回文本。
链接:https://pan.baidu.com/s/13u1P70HBSfX9fP4H6FieKw
提取码:0711

zz8122529 发表于 2023-8-26 11:26

多谢楼主分享

蛊惑江湖 发表于 2023-8-26 11:30


感谢楼主的分享

温书先生 发表于 2023-8-26 11:43

6666666666

jwyy 发表于 2023-8-26 11:50

谢谢分享!

2760888521 发表于 2023-8-26 12:39

谢谢@Thanks!

decs2723 发表于 2023-8-26 12:50

感谢楼主分享!大牛有你更精彩!

被风吹过 发表于 2023-8-26 13:28

谢谢大佬

tedagold 发表于 2023-8-26 13:29

666666

zxcyou8888 发表于 2023-8-26 13:29

谢谢大佬分享
页: [1] 2 3 4 5 6 7 8 9
查看完整版本: 强大的自媒体搬运短视频,文字转语音、语音转文字!视频翻译 一键轻松解决!