首页 > Ai工具箱 > Ai开源项目 > Whisper语音识别模型

Whisper语音识别模型

Whisper 是一种通用的语音识别模型。它在不同音频的大型数据集上进行训练，也是一个多任务模型，可以执行多语言语音识别以及语音翻译和语言识别。

# Ai开源项目

访问 Whisper语音识别模型直接访问手机查看

Whisper语音识别模型简介

Whisper 是Openai 开源音频转文字的语音识别模型。它在不同音频的大型数据集上进行训练，也是一个多任务模型，可以执行多语言语音识别以及语音翻译和语言识别。

Whisper有五种模型尺寸，提供速度和准确性的平衡，其中English-only模型提供了四种选择。下面是可用模型的名称、大致内存需求和相对速度。

FaceChain AIdea

易魔声EmotiVoice是一个强大的开源TTS引擎，支持中英文双语，包含2000多种不同的音色，以及特色的情感合成功能，支持合成包含快乐、兴奋、悲伤、愤怒等广泛情感的语音。

一个面部图像精准恢复和个性编辑技术工具，不仅能复原受损图像细节，同时能精准捕捉和重现个人独特的面部特征。同时它还支持换脸。

一个由清华大学、阿里巴巴和华中科大共同开发的一个基于扩散模型可以让人物照片说话，支持包括歌曲、多种语言的语音、嘈杂的音频在内的各种声音匹配让人物头像说话的框架。