Advertisement

很快完成了语音转文字任务,并且用简短的代码实现了

阅读量:

尽管当前的操作流程已相对简化,但对于程序员而言仍显繁琐,毕竟程序员普遍倾向于追求高效便捷的解决方案。Whisper 虽然在安装与调用方面已较为便捷,但仍需单独配置 PyTorch、ffmpeg 乃至 Rust 等依赖项。

将音视频文件中的音频内容转化为文字,在两年前尚属较为困难的任务,而如今只需几分钟便可轻松完成。

据悉,一些企业为获取训练数据,已对抖音、快手等短视频平台上的大量视频内容进行了全面采集,并从中提取音频信息转化为文本,作为大型数据模型的训练资料。

若你有将视频或音频文件转换为文字的需求,不妨尝试今日介绍的这一开源方案。例如可用于查找影视台词出现的具体时间点。

接下来直接进入主题。

Whisper

这一解决方案源自 OpenAI 开源的 Whisper 项目,其开发语言为 Python。用户仅需安装少量依赖库,随后通过编写数行代码即可完成操作。根据设备性能及音视频文件长度的不同,系统将自动进行处理,稍作等待后即可获取最终的文本输出结果,整个过程操作简便高效。

GitHub 仓库地址:https://github.com/openai/whisper

Fast-Whisper模型性能评估

尽管当前版本已较为简易,但对于程序员而言仍显繁琐,毕竟程序员普遍倾向于高效便捷的解决方案。Whisper 虽然在安装与调用方面已简化至较低门槛,但仍需单

全部评论 (0)

还没有任何评论哟~