找采访里的一句话,最费时间的常常是反复拖进度条。我会先要一份带时间位置的文字,找到大概段落,再回去听语气、看表情。
faster-whisper 是基于 Whisper 的语音转写库,支持输出分段文字与时间信息,也有词级时间戳选项。使用方式见 SYSTRAN 项目说明。
文字先帮忙找位置
采访和长口播可以先转写,再按话题整理。看文字时,我会标出能独立讲清一件事的段落;真正决定留不留,还是要回到视频。
一句话在纸上读着完整,现场说出来可能犹豫、带笑,或在回答前面一个问题。只按文字剪,会丢掉这些关系。
字幕还要再过一遍
品牌名、产品型号、人名和数字,我会对照资料逐项看。有人说话很轻、两个人重叠讲话,或背景音乐比较响的地方,要回听原音。
转写出的长句也不适合直接铺到画面上。字幕要按语意断开,留出阅读时间,再检查有没有挡住产品和人物。
使用前知道这件事
它是需要配置的 Python 工具,并非打开网页就能上传文件的字幕应用。选择模型和运行方式,要结合音频长度和电脑条件。拿到文字稿之后,建议保留对应的音视频文件,让每一条修改都能找到原来的位置。