媒体播放器通用框架 FFmpeg 推出 AI 语音识别功能，可自动生成字幕-28资讯网—

媒体播放器通用框架 FFmpeg 推出 AI 语音识别功能，可自动生成字幕

2025-08-14 10:19:58 知识百科 203观看

摘要 8 月 13 日消息，FFmpeg 是一个流行的开源媒体播放器通用框架，现在包含了一个新的 af_whisper 音频工具，可以直接在 FFmpeg 生态系统中实现自动语音识别（ASR）。该工具使用了 whisper.cpp 库，为媒体处理工作流程添加

8 月 13 日消息，FFmpeg 是一个流行的开源媒体播放器通用框架，现在包含了一个新的 af_whisper 音频工具，可以直接在 FFmpeg 生态系统中实现自动语音识别（ASR）。

该工具使用了 whisper.cpp 库，为媒体处理工作流程添加了一个 AI 模型，允许进行灵活的音频转译文本，包括选择 AI 模型、指定语言以及设置输出格式，如文本、SRT 或 JSON。

该工具可以处理预录制的文件和实时音频流，用户还可以使用语音激活检测（VAD）来提高转写的准确性和效率。

注意到，该工具还支持 GPU 加速，可以显著加快转写过程。对于用户来说，这一功能取代了对外部、多步骤转写过程的需求，将任务整合到一个高效的单命令行工作流程中。

本文链接：http://www.28at.com/showinfo-119-177253-0.html媒体播放器通用框架 FFmpeg 推出 AI 语音识别功能，可自动生成字幕

声明：本网页内容旨在传播知识，不代表本站观点，若有侵权等问题请及时与本网联系，我们将在第一时间删除处理。

显示全文

最新热点