视频取字幕
怎么从视频里截字幕
逐句暂停再截图是最慢的做法。取字幕有三种方式,其中一种完全不需要截图。
方法一 —— 暂停再截
播放,在每一句上暂停,截图,往后拖,重复。Windows 上是 Win + Shift + S,macOS 上是 Cmd + Shift + 4,安卓和 iOS 用电源键加音量键。
到处都能用,也不用装软件。但它最慢,而且最容易产生尺寸不一致的帧:中途调了一次窗口,或者播放器中途全屏了,帧就对不齐了。
有两个办法能减轻痛苦。截图前先让播放器全屏,让界面元素不进画面;在截第一张之前把窗口尺寸定下来,别中途改。
方法二 —— 先录屏,再取帧
把片段录下来,再用剪辑软件或 ffmpeg 从录像里取静帧。因为所有静帧来自同一段录像,尺寸天然一致。
但每一帧仍然要你手动挑,每一句仍然要你找到准确的时刻。一场长戏意味着大量的来回拖拽。
方法三 —— 交给工具抽帧
QuoteStitch 可以直接吃视频文件。拖入 MP4、MOV 或 WEBM,它在整段里最多采样 320 个点,找出横向边缘密集的行,每句台词保留一帧。你不用暂停、不用截图、也不用对齐任何东西。
它处理的是画面,不是文字。烧进画面的字幕是锐利的近竖笔画,所以承载字幕的那些行即使不认字也能被找出来。两句不同的台词亮度分布相似但笔画形状不同,所以由笔画的形状判断哪一句变成下一句。镜头移动骗不过它。
全程不做文字识别。工具从不知道字幕写了什么 —— 只知道它在哪、什么时候变。
- 视频输入MP4、MOV、WEBM —— 浏览器能播的都行
- 图片输入PNG、JPG、WEBP
- 长图输出PNG,1x 或 2x,原始宽度或 720 / 1080 / 1440 px
- 采样整段最多采样 320 个点,保证定位耗时可控
- 张数限制没有固定上限,实际限制来自设备内存
- 前提字幕要烧在画面里,不是独立的 .srt 文件
它做不到的事
- 字幕在独立文件里。如果字幕是
.srt或.vtt文件而不是烧在画面里,屏幕上就没有东西可识别。请用字幕文件工具。 - 流媒体平台。浏览器工具只能读你给它的视频文件。它无法抓取在另一个标签页里播放的受保护流,也无法绕过 DRM。
- 可复制的文字。输出是图片,不是文本。如果你要的是台词文稿,这个工具产出的东西不对 —— 你要的是语音转文字,不是抽帧。
- 一字不漏。整段采样 320 个点,意味着语速极快的台词可能被漏掉;位置相同、笔画形状相似的两句也可能被当成一句。拿到结果后请对着片子核一遍。
常见问题
怎么从视频里截字幕?
在每一句上暂停,用系统截图快捷键;或者让工具替你抽帧。QuoteStitch 直接接受视频文件:它找出字幕条,每句台词保留一帧,不需要暂停,也不需要手动截图。
字幕必须烧在画面里吗?
是。识别基于像素,所以字幕必须是画面的一部分。独立的 .srt 或 .vtt 文件不会被识别 —— 那是另一件事,要用另一个工具。
能从 Netflix、YouTube 这类平台截字幕吗?
不能。浏览器工具只能读你给它的视频文件。它无法抓取在另一个标签页播放的受保护流,也不绕过 DRM。如果你有使用权利,请先把片段下载下来。
它会读字幕文字吗?
不会。工具里没有任何文字识别。它找的是横向边缘密集的行,再比较帧与帧之间的笔画形状,判断哪一句变成下一句。
支持哪些视频格式?
MP4、MOV、WEBM —— 浏览器本身能播的都行。因为不上传,格式只需要你自己的浏览器支持即可。